2026. augusztus 22., szombat · Kutatás

Nvidia: a szoftveres keret dönti el az AI-ügynök sikerét, nem a modell

Az Nvidia péntek óta ismert kutatása szerint hosszú távú, sok lépésből álló feladatoknál nem a modell, hanem a köré épített szoftveres keret (harness) a döntő tényező. A cég állítása szerint egy egyedi, memóriakezelésre optimalizált és „felügyelő” komponenssel ellátott keretben a Claude Opus 5 modell 100%-os eredményt ért el az ARC-AGI-3 benchmarkon, amely instrukció nélküli 2D-s játékokból áll. Ugyanez a modell harness nélkül csak 30%-ot ért el, ami így is a legjobb eredmény volt a tesztelt modellek között. Az Nvidia szakembere szerint az ügynök valójában nem csak a modellből áll, hanem az eszközökből, a futásidőből és a hozzáférhető könyvtárakból is, amelyek együtt adják a tényleges teljesítményt. A cikk kontrasztként megemlíti a Microsoft áprilisi kutatását is, amely szerint 19 nagy nyelvi modell mindegyike hibázott hosszú dokumentumszerkesztési feladatoknál.

Miért fontos?

A vállalati kutatás rávilágít, hogy az AI-ügynökök fejlesztésénél a modell köré épített szoftveres réteg legalább annyira meghatározó lehet, mint a modell maga.

Benchmark-tolmács

Mit mond a hírben szereplő pontszám?

ARC-AGI-3

Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.

Pontszám
A környezetek szintjein elért normalizált teljesítmény; magasabb jobb. A Public Demo és a Semi-Private eredmény, valamint a gondolkodási és költségkeret külön kezelendő.
Frissesség
Folyamatosan frissül
Szivárgás
Alacsony kockázat
Hétköznapi jel
Csak közvetett jel
Az öt szempont részletesen

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 22., szombat napi AI összefoglaló része.

Kapcsolódó hírek

NVIDIA RoboLab: új értékelési platform az általános célú robotirányítási modellek tesztelésére

Az NVIDIA Research bemutatta a RoboLab nevű platformot, amely a robotikában használt általános célú irányítási modellek (policy-k) szisztematikus értékelésére szolgál szimulált környezetben. A rendszer az NVIDIA szerint megoldja a korábbi benchmarkok fő problémáit: a vizuális és feladatbeli átfedést a tréning- és tesztadatok között, a benchmarkok telítődését, valamint a magas beállítási költséget, miközben robotfüggetlen, gyorsan skálázható feladat- és jelenetgenerálást kínál. A platform részletes diagnosztikai eszközöket integrál, köztük részleges pontszámítást, SPARC-alapú mozgásminőség-elemzést és hibaeseménynaplózást. Az NVIDIA tervei szerint a RoboLab funkcionalitása 2026 augusztusától beépül az NVIDIA Isaac Lab-Arena rendszerébe.

Az NVIDIA nemegyenletes tenzorpárhuzamossága csökkenti a GPU-kiesések hatását az LLM-tréningben

Az NVIDIA műszaki blogján bemutatott Nonuniform Tensor Parallelism (NTP) keretrendszer lehetővé teszi, hogy nagy léptékű LLM-tréningek dinamikusan alkalmazkodjanak az átmenetileg elérhetetlenné váló GPU-khoz. Az NVIDIA állítása szerint az NTP az aktív GPU-k órajelének ideiglenes növelésével (dinamikus teljesítménynöveléssel) kompenzálja a kiesést, miközben a tenzor-újrafelosztás okozta többletterhelés 1% alatt marad. A módszer a Blackwell és Blackwell Ultra rendszerek NVLink összeköttetésein akár 72 GPU-s tartományokra is skálázható. Az NTP kísérleti jellegű megközelítés, amely a meglévő rugalmas skálázási technikákat – mint az adatreplikák eldobása vagy gyors ellenőrzőpont-újraindítás – egészíti ki azzal, hogy az áteresztőképesség-veszteséget minimalizálja a csökkentett rendelkezésre állás időszakában.

Kis brit startup AI-ügynöke állítása szerint lekörözte az OpenAI-t és az Anthropicot

Az Inherent nevű londoni AI-labor, amelyet volt Google DeepMind-kutatók alapítottak, saját közlése szerint Faraday nevű AI-ügynöke felülmúlta az Anthropic Claude Opus 4.8 és az OpenAI GPT-5.5 modelljeit egy konkrét feladatban: publikált tudományos cikkek eredményeinek önálló, előzetes válasz nélküli reprodukálásában. A cég állítása szerint a Faraday ehhez a jóval kisebb, 27 milliárd paraméteres Qwen 3.6 modellt használja a frontier-méretű riválisok helyett, és megerősítéses tanulással próbálja megtanítani neki a „kutatói érzéket” is, vagyis hogy mely kísérletek érdemesek elvégzésre. A startup nemrég 50 millió dolláros seed-körrel lépett ki a stealth módból. Az eredmények kizárólag a vállalat saját közléséből származnak, független megerősítés egyelőre nincs.

Kutatás: az AI-biztonsági tesztek megjátszhatók és félrevezetőek

Egy brit UK AI Security Institute kutatóit is tartalmazó csapat pszichológiai tesztelésből ismert módszerekkel vizsgált meg nyolc népszerű nyelvimodell-biztonsági benchmarkot, 192 modell több mint 5000 kérdésre adott válaszát elemezve. A tanulmány szerint az egyetlen „biztonsági pontszám” valójában három, egymástól nagyrészt független tulajdonságot kever össze: a kérések elutasításának szigorát, a válaszok igazmondását és a kontextustól függő ártalmas tartalmak kezelését. A HarmBench és az OR-Bench-Hard benchmark ellentétes irányba mozdítja a pontszámot, így egy modell puszta elutasítási hajlandósággal is javíthatja összesített értékelését, miközben kevésbé hasznossá válik. A kutatók szerint a kérdéseknek mindössze kevesebb mint 2 százaléka hordoz tényleges mérési információt.