2026. június 29., hétfő · Kutatás

A Sina háromparaméteres VibeThinker-3B modellje a százszor nagyobb modellek szintjén teljesít matekban és kódolásban

A kínai Sina (Weibo anyavállalata) kiadta VibeThinker-3B modelljét, amely mindössze 3 milliárd paraméterrel egyes matematikai és kódolási benchmarkokon – a cég technikai jelentése szerint – a 200-333-szor nagyobb modellekkel, például a DeepSeek V3.2-vel és a Kimi K2.5-tel vetekszik. A modell az Alibaba Qwen2.5-Coder-3B alapmodelljére épül, a teljesítményt többlépcsős utóképzéssel érik el. A LeetCode-versenyeken (2026 április–május) 128-ból 123 feladatot elsőre megoldott, megelőzve a GPT-5.2-t és a Claude Opus 4.6-ot – állítja a Sina. Ugyanakkor a széles tárgyi tudást igénylő GPQA-Diamond benchmarkon a modell jelentősen elmarad nagyobb riválisaitól. A kutatók következtetése szerint a strukturált logikai gondolkodás jól tömöríthető kis modellekbe, de a faktikus világtudás továbbra is nagy paraméterszámot igényel.

Miért fontos?

A kutatás arra utal, hogy a logikai képességek kis modellekben is elérik a csúcsszintet, míg a tényszerű tudáshoz továbbra is nagy modellek kellenek.

Benchmark-tolmács

Mit mond a hírben szereplő pontszám?

GPQA Diamond

Szakértők által írt, doktori szintű biológiai, fizikai és kémiai feleletválasztós kérdéseken méri a nehéz tudományos következtetést.

Pontszám
Pontosság százalékban a Diamond részhalmazon; magasabb jobb. A gondolkodási keret, eszközhasználat és többszöri mintavétel jelentősen módosíthatja.
Frissesség
Korosodó
Szivárgás
Magas kockázat
Hétköznapi jel
Gyenge kapcsolat
Az öt szempont részletesen

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. június 29., hétfő napi AI összefoglaló része.

Kapcsolódó hírek

Kis brit startup AI-ügynöke állítása szerint lekörözte az OpenAI-t és az Anthropicot

Az Inherent nevű londoni AI-labor, amelyet volt Google DeepMind-kutatók alapítottak, saját közlése szerint Faraday nevű AI-ügynöke felülmúlta az Anthropic Claude Opus 4.8 és az OpenAI GPT-5.5 modelljeit egy konkrét feladatban: publikált tudományos cikkek eredményeinek önálló, előzetes válasz nélküli reprodukálásában. A cég állítása szerint a Faraday ehhez a jóval kisebb, 27 milliárd paraméteres Qwen 3.6 modellt használja a frontier-méretű riválisok helyett, és megerősítéses tanulással próbálja megtanítani neki a „kutatói érzéket” is, vagyis hogy mely kísérletek érdemesek elvégzésre. A startup nemrég 50 millió dolláros seed-körrel lépett ki a stealth módból. Az eredmények kizárólag a vállalat saját közléséből származnak, független megerősítés egyelőre nincs.

Kutatás: az AI-biztonsági tesztek megjátszhatók és félrevezetőek

Egy brit UK AI Security Institute kutatóit is tartalmazó csapat pszichológiai tesztelésből ismert módszerekkel vizsgált meg nyolc népszerű nyelvimodell-biztonsági benchmarkot, 192 modell több mint 5000 kérdésre adott válaszát elemezve. A tanulmány szerint az egyetlen „biztonsági pontszám” valójában három, egymástól nagyrészt független tulajdonságot kever össze: a kérések elutasításának szigorát, a válaszok igazmondását és a kontextustól függő ártalmas tartalmak kezelését. A HarmBench és az OR-Bench-Hard benchmark ellentétes irányba mozdítja a pontszámot, így egy modell puszta elutasítási hajlandósággal is javíthatja összesített értékelését, miközben kevésbé hasznossá válik. A kutatók szerint a kérdéseknek mindössze kevesebb mint 2 százaléka hordoz tényleges mérési információt.

Kutatók: az AI világmodelleknek az emberi hiedelmeket is figyelembe kellene venniük

Egy friss, még nem lektorált tanulmány szerint a mai AI világmodellek – például a Sora, a Genie 3, a JEPA vagy a Marble – csak a fizikai világot írják le: tárgyakat, mozgást, pozíciókat, de nem azt, mit hisznek vagy akarnak az emberek. A szerzők példája szerint ha valakinek úgy mozdítják el a bögréjét, hogy nem látja, egy tisztán fizikai modell helyesen ábrázolja a jelenetet, mégis rossz cselekvést jósol, mert nem tudja, hogy az illető a régi helyen keresi a tárgyat. Ezért egy „Mental World Modeling” nevű keretrendszert és annak MENTIS nevű referencia-implementációját javasolják, amely hiedelmeket, szándékokat és normákat is beépít. A szerzők – a preprintben – azt állítják, hogy ez jelentősen javította a nyelvi modellek emberi viselkedés-előrejelzési pontosságát, de hangsúlyozzák, hogy nem tudatosságot szimulálnak, csak viselkedésből levezetett hipotéziseket.

Ágensalapú keretrendszer szigorítaná az AI tudományos elemzéseit

Kutatók bemutatták a Brain Researcher nevű ágensalapú keretrendszert, amely neuroimaging-adatelemzés során kényszeríti ki a módszertani fegyelmet: rögzíti a megengedett elemzéseket, a kötelező ellenőrzéseket és az állítások érvényességi körét. Az eredmény egy nem lektorált arXiv-preprintben jelent meg, amelyben a szerzők állítása szerint hét modell esetén az eszközválasztási pontosság 23,3 százalékról 93,6 százalékra nőtt, az ellenőrizhető megalapozottság pedig 4,6-ról 22,0 százalékra emelkedett. A rendszer multiverzum-elemzésekkel tárja fel az eredmények módszertani érzékenységét, a tudományos felülvizsgálat pedig elfogadott, feltételes, felülvizsgált, blokkolt, elutasított vagy elhalasztott kategóriákba sorolja az állításokat, hogy az ítélőképesség már munka közben érvényesüljön.