2026. augusztus 20., csütörtök · Eszközök

NVIDIA nyílt eszközzel méri, mennyit javítanak az AI-ügynökökön a beépített skillek

Az NVIDIA saját közlése szerint nyílt forráskódú SkillEvaluator eszközt épített, amely három lépésben – statikus ellenőrzés, megkülönböztethetőségi elemzés és élő feladatvégrehajtás izolált környezetben – méri, hogy az úgynevezett verified skillek mennyit javítanak az AI-ügynökök teljesítményén. A vállalat állítása szerint több mint 300 hitelesített skillt teszteltek 30-nál több NVIDIA terméken, két ügynök-keretrendszerben, és a skillek használatával átlagosan 31 pontos javulást mértek a helyesség, felfedezhetőség, hatékonyság és eredményesség terén, a biztonsági kategóriát kihagyva pedig 39 pontosat. Az NVIDIA szerint a javulást inkább a termékdomén és az értékelési módszertan befolyásolja, mint az ügynök-keretrendszer. Az eredmények kizárólag a vállalat saját méréséből származnak, független validálásról a közlemény nem szól.

Miért fontos?

Konkrét, mérhető módszertant ad ahhoz, hogy eldönthető legyen, egy AI-ügynöknek szánt „skill” valóban javítja-e a teljesítményt, nem csak marketingígéret.

Források

Említve a tudásbázisban

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 20., csütörtök napi AI összefoglaló része.

Kapcsolódó hírek

DeepSeek megnyitotta AI-ügynök keretrendszerét, a Harnesst

A DeepSeek nyílt forráskódúvá tette a DeepSeek Harness (dsh) nevű futtatókörnyezetet, amely MIT licenc alatt, fejlesztői előzetes verzióként érhető el autonóm AI-ügynökök építéséhez. A cég bejelentése és a GitHub-tárhely szerint a rendszer a Cordis meta-keretrendszerre épül, mikrokernel-architektúrát alkalmaz, így a modellillesztők, eszközregiszterek, sandbox-környezetek és felhasználói felületek egymástól független, cserélhető modulokként működnek, és deklaratív YAML vagy JSON konfigurációval válthatók a mag logika módosítása nélkül. Egy folyamatos eseménynaplózó alrendszer minden üzenetet, eszközhívást és tokenmetrikát rögzít visszajátszás és hibakeresés céljából. A 0.1-es előzetes verzió négy alapkonfigurációt kínál: Standard, Code, Minimal és Creator módot.

Cloudflare nyomkövetést vezet be az AI-ügynökök hibakereséséhez

A Cloudflare elindította az agent tracing funkciót, a Cloudflare Agents platform első elemét, amely egy irányítópulton gyűjti össze a telepített ügynökök munkameneteit. A vállalat szerint a cél, hogy láthatóvá váljon az az ügynöki viselkedés, amelyet a hagyományos telemetria elrejt: egy ügynök HTTP 200-as választ adhat úgy is, hogy rossz eszközt választott vagy felesleges token-pazarló ismétlésbe kezdett. Az új nyomkövetés a meglévő Workers-szintű span-eket (fetch-hívások, KV- és D1-műveletek) egészíti ki ügynökhívásokkal, modellhívásokkal, eszközfuttatással és jóváhagyási lépésekkel, modell- és tokenhasználati metaadatokkal. A dokumentáció szerint a rendszer nem méri az emberi jóváhagyásra várakozás valós idejét, csak a Worker-hívások közötti életciklus-eseményeket. A funkció bétaidőszakban ingyenes, 2026. október 1-től a Workers Observability árazás alá kerül.

Cloudflare ügynök-nyomkövetést vezet be Workers platformjára

A Cloudflare elindította az agent tracing funkciót, a Cloudflare Agents műszerfal első elemét, amely egy helyen gyűjti össze a telepített AI-ügynökök munkameneteit. A cég szerint egy ügynök HTTP 200-as választ adhat úgy is, hogy közben rossz eszközt választott vagy felesleges tokeneket égetett el egy ismétlődő ciklusban, amit a hagyományos infrastruktúra-nyomkövetés nem mutat meg. Az új rendszer az ügynökhívásokhoz, modellhívásokhoz, eszközfuttatásokhoz és jóváhagyásokhoz is spanokat rendel, így az alügynökök munkája beágyazódik a szülő-ügynök folyamatába. A dokumentáció szerint a jóváhagyási span csak a Worker-hívásokon belüli eseményeket méri, az emberi jóváhagyásra várakozás tényleges idejét nem. A funkció a béta alatt ingyenes, 2026. október 1-től a Workers Observability díjszabása alá kerül.

NVIDIA NeMo Switchyard: modellek közötti terheléselosztó AI-ügynökökhöz

Az NVIDIA a NeMo Switchyard nevű eszközt ismertette, amely az AI-ügynökök feladatait dinamikusan osztja el különböző méretű és képességű nyelvi modellek között, a feladat jellege, a költség és az infrastruktúra alapján. A vállalat közlése szerint a rendszer szolgáltatófüggetlen SDK-t biztosít, automatikus és testre szabható útválasztási algoritmusokat támogat, és elválasztja az útválasztási logikát a konkrét modellszolgáltatóktól. Az NVIDIA saját tesztjei és a LangChain, illetve a Cognition partnerekkel végzett kipróbálás szerint az útválasztás jelentősen csökkentheti a költségeket a pontosság megtartása mellett, ám ezek az adatok a vállalat saját közléséből származnak, független megerősítés nélkül. A cél, hogy egyetlen nagy, drága modell helyett feladatonként a legmegfelelőbb modellt használják.