2026. augusztus 22., szombat · Kutatás
Nvidia: a szoftveres keret dönti el az AI-ügynök sikerét, nem a modell
Az Nvidia péntek óta ismert kutatása szerint hosszú távú, sok lépésből álló feladatoknál nem a modell, hanem a köré épített szoftveres keret (harness) a döntő tényező. A cég állítása szerint egy egyedi, memóriakezelésre optimalizált és „felügyelő” komponenssel ellátott keretben a Claude Opus 5 modell 100%-os eredményt ért el az ARC-AGI-3 benchmarkon, amely instrukció nélküli 2D-s játékokból áll. Ugyanez a modell harness nélkül csak 30%-ot ért el, ami így is a legjobb eredmény volt a tesztelt modellek között. Az Nvidia szakembere szerint az ügynök valójában nem csak a modellből áll, hanem az eszközökből, a futásidőből és a hozzáférhető könyvtárakból is, amelyek együtt adják a tényleges teljesítményt. A cikk kontrasztként megemlíti a Microsoft áprilisi kutatását is, amely szerint 19 nagy nyelvi modell mindegyike hibázott hosszú dokumentumszerkesztési feladatoknál.
Miért fontos?
A vállalati kutatás rávilágít, hogy az AI-ügynökök fejlesztésénél a modell köré épített szoftveres réteg legalább annyira meghatározó lehet, mint a modell maga.
Benchmark-tolmács
Mit mond a hírben szereplő pontszám?
ARC-AGI-3
Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.
- Pontszám
- A környezetek szintjein elért normalizált teljesítmény; magasabb jobb. A Public Demo és a Semi-Private eredmény, valamint a gondolkodási és költségkeret külön kezelendő.
- Frissesség
- Folyamatosan frissül
- Szivárgás
- Alacsony kockázat
- Hétköznapi jel
- Csak közvetett jel
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 22., szombat napi AI összefoglaló része.