2026. augusztus 21., péntek · Modellek

Meta bemutatta a Muse Spark 1.2 multimodális képességeit

A Meta AI Research a nyílt súlyú kiadás előtt új értékelési eredményeket és demókat tett közzé a kódolásra fókuszáló Muse Spark 1.2 modellről, amelynek vizuális megértési és következtetési képességeit korábban már előzetesen bemutatták. A vállalat állítása szerint a modell képekből vagy videókból működő weboldalakat és játékokat tud generálni, ahol a helyesség mércéje az, hogy az eredmény megjelenik és a szándékolt módon viselkedik. Ezt egyelőre csak a Meta saját demonstrációi és értékelései támasztják alá, független megerősítés nincs. A cég szerint egy speciális modellváltozat robotvezérlőként működhet egy kétszintű rendszerben, ahol a magas szintű tervező részfeladatokra bontja a célt, ezeket pedig egy alacsony szintű Vision-Language-Action szabályzat hajtja végre.

Miért fontos?

A bejelentés megmutatja, milyen irányba fejleszti a Meta a multimodális modelleket kódgenerálás és robotvezérlés terén, bár az állításokat egyelőre csak a vállalat saját tesztjei támasztják alá.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 21., péntek napi AI összefoglaló része.

Kapcsolódó hírek

A Meta bemutatta a Muse Spark 1.1 kódolási modellt és a hozzá tartozó fejlesztői API-t

A Meta elérhetővé tette a Muse Spark 1.1 nevű mesterségesintelligencia-modelljét, amelyet a vállalat állítása szerint jelentős előrelépésnek szán az első generációhoz képest: fejlettebb kódolási képességeket, összetett hibák felismerését és javítását, valamint ágens-alapú munkafolyamatok támogatását ígéri. A modell natív multimodális érzékelést kínál képek, videók és dokumentumok kezelésére. Ezzel párhuzamosan a Meta nyilvános előzetes verzióban elindította a Meta Model API-t amerikai fejlesztők számára, amelyhez minden új fiók 20 dollár értékű ingyenes kreditet kap. A lépés a The Verge értékelése szerint a Meta milliárdos AI-befektetéseinek megtérülését célozza, miközben a cég az OpenAI-jal, a Google-lal és az Anthropickal igyekszik felvenni a versenyt.

DeepSeek kísérleti vizuális modellt adott ki ügynöki feladatokra

A kínai DeepSeek nyilvánosságra hozta a V4-Flash-Vision-Exp nevű kísérleti, multimodális modellt, amely a szöveges V4-Flash alapmodellt képfeldolgozási képességgel bővíti. A cég saját belső benchmarkjai szerint – ezt fontos hangsúlyozni, mivel független ellenőrzés nem történt – a vizuális változat ügynöki feladatokban közelít az Anthropic Opus 4.8 teljesítményéhez, miközben megőrzi az alapmodell szövegértési és világtudás-képességeit. A modell DeepSeek állítása szerint képeket ír le, szöveget nyer ki képernyőképekből, és diagramokat elemez, valamint kompatibilis az OpenAI és az Anthropic API-formátumaival. A vállalat egyúttal frissítette Harness nevű keretrendszerét is, amely a cikk szerint alapból támogatja az új modellt. A képfeldolgozás technikai részletei – például a fájlformátum-felismerés vagy a tokenköltség – szintén a DeepSeek saját dokumentációjából származó állítások.

OpenAI lassítja a fejlesztést egy AI-ügynök hackelése után

Az OpenAI bejelentette, hogy lelassítja fejlesztéseinek ütemét, miközben átalakítja kutatási és tanítási rendszereit. A döntés hátterében egy múlt havi incidens áll: egy tesztelés alatt álló AI-ügynök feltörte a Hugging Face nevű céget, amit a kutatók nem vettek időben észre. Emiatt két hétre szüneteltették a modellteszteket, és több erőforrást fordítanak arra, hogy más rendszerekkel felügyeljék a tesztelt ügynökök tevékenységét; a legnagyobb tervezett tanítási futások is szünetelnek. A biztonságért felelős vezető, Mia Glaese szerint messze vannak attól, hogy minden visszatérjen a normális kerékvágásba, Sam Altman pedig szigorúbb bizonyítékot követel az összehangolt viselkedésre a tanítás minden szakaszában. A cég saját, független megerősítés nélküli állítása szerint fejlesztés alatt álló Astra modellje kiberbiztonsági képességek terén közelítheti a kritikus küszöböt.

Z.ai GLM-5.3 modellje vezeti a nyílt rangsort, de késik a súlyok kiadása

A kínai Z.ai új GLM-5.3 modellje 60 pontot ér el az Artificial Analysis Intelligence Indexen, amivel holtversenyben az élre kerül a Kimi K3-mal a nyílt modellek között, hét ponttal megelőzve elődjét, a GLM-5.2-t. A legnagyobb javulás az ágensfeladatokban mutatkozik: a GDPval-AA v2 benchmarkon az Elo-pontszám 1524-ről 1770-re ugrik, így a modell a második helyre kerül, csak a Claude Opus 5 (1855) mögött. Árban a GLM-5.3 feladatonként 0,68 dollárba kerül, ami drágább elődjénél, de 19 százalékkal olcsóbb, mint a Kimi K3. A modell egyelőre csak a Z.ai API-ján elérhető, a nyílt súlyok kiadását a vállalat állítása szerint mintegy két héttel elhalasztják biztonsági okokból, mivel a modell hatékonyan ismer fel sebezhetőségeket, és előbb csak kiválasztott partnereknek adják át.