2026. július 23., csütörtök · Kutatás

Szemantikus kooperatív játékok: új módszer az ágensek hozzájárulásának mérésére többágenses LLM-rendszerekben

Kutatók egy új keretrendszert javasolnak, amely LLM-alapú többágenses rendszerekben méri az egyes ágensek hozzájárulását a végső kimenethez. A még nem lektorált tanulmány bevezeti a szemantikus Shapley-értéket (SSV) és a SLIC algoritmust, amely egyetlen futtatásból, az ágensek ismételt újrahívása nélkül építi fel a szemantikus hipergráfot és számítja ki az attribúciós értékeket. A szerzők szerint klasszikus feltételek mellett az SSV visszavezethető a hagyományos Shapley-értékre, a SLIC pedig egy orvosi benchmarkon 93,3%-kal csökkentette a számítási költséget a Monte Carlo Shapley-alapvonalhoz képest, nagyfokú konzisztencia mellett. Összetettebb munkafolyamatokban a módszer feltárhatja, hol tér el a szemantikus hozzájárulás és a hibák hatása.

Miért fontos?

A módszer lényegesen olcsóbbá és átláthatóbbá teheti a többágenses LLM-rendszerek attribúcióját, ami skálázhatósági szempontból kulcskérdés.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. július 23., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

RELIC: adatvédelmet megőrző, kombinálható készségek többágenses tervezéshez

A RELIC keretrendszer a többágenses tervezés egy kevéssé vizsgált problémájára kínál megoldást: hogyan fejleszthetik az ágensek saját képességeiket úgy, hogy belső megvalósításuk titkos marad. A korábbi megközelítések központi optimalizálást vagy megosztott házirendeket feltételeztek, ami adatvédelmi szempontból problémás. A még nem lektorált kutatásban bemutatott rendszerben minden ágens nagy nyelvi modell vezérelte kereséssel finomítja készségeit, míg egy megbízható vezénylő kizárólag csapatszintű teljesítmény alapján értékeli a frissítéseket. A sikeres viselkedéseket nem kódként osztják meg, hanem hordozható elvekké alakítják, amelyeket más ágensek saját felületükön alkalmazhatnak. A szerzők szerint ez szétválasztja az összehangolást a megvalósítás megosztásától.

Kis brit startup AI-ügynöke állítása szerint lekörözte az OpenAI-t és az Anthropicot

Az Inherent nevű londoni AI-labor, amelyet volt Google DeepMind-kutatók alapítottak, saját közlése szerint Faraday nevű AI-ügynöke felülmúlta az Anthropic Claude Opus 4.8 és az OpenAI GPT-5.5 modelljeit egy konkrét feladatban: publikált tudományos cikkek eredményeinek önálló, előzetes válasz nélküli reprodukálásában. A cég állítása szerint a Faraday ehhez a jóval kisebb, 27 milliárd paraméteres Qwen 3.6 modellt használja a frontier-méretű riválisok helyett, és megerősítéses tanulással próbálja megtanítani neki a „kutatói érzéket” is, vagyis hogy mely kísérletek érdemesek elvégzésre. A startup nemrég 50 millió dolláros seed-körrel lépett ki a stealth módból. Az eredmények kizárólag a vállalat saját közléséből származnak, független megerősítés egyelőre nincs.

Kutatás: az AI-biztonsági tesztek megjátszhatók és félrevezetőek

Egy brit UK AI Security Institute kutatóit is tartalmazó csapat pszichológiai tesztelésből ismert módszerekkel vizsgált meg nyolc népszerű nyelvimodell-biztonsági benchmarkot, 192 modell több mint 5000 kérdésre adott válaszát elemezve. A tanulmány szerint az egyetlen „biztonsági pontszám” valójában három, egymástól nagyrészt független tulajdonságot kever össze: a kérések elutasításának szigorát, a válaszok igazmondását és a kontextustól függő ártalmas tartalmak kezelését. A HarmBench és az OR-Bench-Hard benchmark ellentétes irányba mozdítja a pontszámot, így egy modell puszta elutasítási hajlandósággal is javíthatja összesített értékelését, miközben kevésbé hasznossá válik. A kutatók szerint a kérdéseknek mindössze kevesebb mint 2 százaléka hordoz tényleges mérési információt.