2026. augusztus 25., kedd · Kutatás
Új módszer mobilos AI-ügynökök teljesítményének és biztonságának értékelésére
Kutatók CRATE néven új, kétlépcsős értékelési keretrendszert mutattak be nyelvi utasításokkal irányított mobilalkalmazás-ügynökök automatikus minősítésére. A módszer lényege, hogy a teljes műveletsort egyben elemző korábbi megoldásokkal szemben lépésenként vizsgálja a releváns vizuális jeleket és az egyes akciók által kiváltott állapotváltozásokat, majd ezeket az eredményeket trajektóriaszinten összesíti. A szerzők állítása szerint – a cikk egy nem lektorált arXiv-preprintben jelent meg – a Qwen2.5-VL-72B-Instruct modellel futtatott CRATE 0,833-as F1-értéket ért el az AndroidWorld benchmarkon, ami 20 százalékkal jobb, mint a SPA-Bench módszeré. A biztonsági kockázatok értékelésére kiterjesztett CRATE-S változat a MobileRisk adathalmazon 0,697-es F1-értéket mutatott. A kutatók szerint az eredmények erős egyezést mutatnak a benchmarkok referenciaértékeivel, a kód nyilvánosan elérhető.
Miért fontos?
A mobil AI-ügynökök megbízható és biztonsági szempontú automatikus tesztelése kulcskérdés, mielőtt ezek a rendszerek széles körben, emberi felügyelet nélkül futnának telefonokon.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 25., kedd napi AI összefoglaló része.