Egy arXiv-on közzétett, egyelőre nem lektorált dolgozat egy több nagy nyelvi modell alapú ügynökből álló keretrendszert mutat be, amely automatizálja az úgynevezett „Lines and Ladders” árazási taxonómiák felépítését milliós tételszámú kiskereskedelmi katalógusokban. A szerzők állítása szerint a rendszert valós vállalati adatokon tesztelték és éles termelési környezetben is bevezették. A háromügynökös elrendezés 0,83-as F1-értéket ért el a „Lines” kategóriában, felülmúlva az egyetlen ügynökös alapmodelleket, mert a feladatok szétosztásával csökkenti az egyes ügynökök kognitív túlterhelését. Élelmiszer és fogyasztási cikkek esetén 90% feletti pontosságot és 75% feletti fedést, a kevésbé strukturált általános kereskedelmi katalógusban 80,2%-os besorolási pontosságot mértek. Ezek a számok a szerzők saját méréseiből származnak, független megerősítésük egyelőre nem ismert.
Alexander Panfilov vezette biztonsági kutatók állítása szerint az OpenAI, az Anthropic és a Google API-jaiban olyan hiba van, amely lehetővé teszi a modellek titkosított belső gondolkodási lépéseinek kiolvasását. Jailbreak-technikával kisebb modellek, például az Anthropic Haiku 4.5, rávehetők, hogy szó szerint leírják a nagyobb modellek, például az Opus 4.8, nyers gondolatmenetét. A nyilvánosan megosztott munkamenetekben jelszavakat és API-kulcsokat is találtak. A kutatók szerint a kinyert tokenek száma többnyire megegyezik a lekönyvelt gondolkodási tokenekkel, ami a teljes belső folyamat megszerzésére utal. A hibát már májusban jelezte Matthew Green kriptográfus, de a szolgáltatók akkor nem láttak benne biztonsági kockázatot.
Jacob Tsimerman, Fields-érmes matematikus a Torontói Egyetemről, csatlakozik az OpenAI mesterségesintelligencia-biztonsági csapatához. Korábban egy tanulmányban „omnicídium-eseményekkel” foglalkozott, azaz olyan forgatókönyvekkel, amelyekben az AI hozzájárulhat az emberiség kihalásához – ez az álláspont a szakértők körében vitatott. Szerinte a pánik nem indokolt, de a kockázatokat őszintén fel kell mérni, mert az AI-rendszerek működése nagyrészt empirikus, kevés garanciával a mechanizmusaikra. Meggyőződése, hogy az AI hamarosan felülmúlja az embereket a matematikai kutatásban. Demis Hassabis, a DeepMind korábbi vezérigazgatója szerint az AI legújabb matematikai eredményei fejlődést jelentenek, de nem áttörést, mert az igazi próbát a Millenniumi-díj problémái jelentenék, amelyeken az OpenAI Astra modellje egyelőre elbukott.
Egy nem lektorált arXiv-tanulmány szerint a nagy nyelvi modellek gondolatmenetének (chain-of-thought) megfigyelése kevésbé hatékony, ha a modellt burkoltan, egy mellékes megjegyzéssel befolyásolják, nem kifejezett utasítással. A szerzők hét élvonalbeli, hosszú gondolkodású modellt teszteltek négy feladattípuson: explicit befolyásolásnál a figyelő rendszer a viselkedésváltozások 60-94 százalékát észleli, mert a modell az elrejtésre kapott utasítást is beleírja a gondolatmenetébe. Implicit befolyásnál a detektálási arány 41-46 százalékponttal esik, és a fejlesztők jóhiszemű, torzítás-csökkentő systemprompt-kiegészítései tovább rontják ezt, akár 5 százalékra. A kutatók szerint ez azt jelzi, hogy a korábbi, explicit forgatókönyveken alapuló megfigyelhetőségi becslések túlbecsülhetik a valós biztonsági garanciát.