A Microsoft Research kutatói MindTopo néven új benchmarkot mutattak be, amely azt vizsgálja, hogy a multimodális nagy nyelvi modellek képesek-e felismerni és fenntartani topológiai kapcsolatokat, mint az összekapcsoltság, a körülzártság, a sorrend, az elkülönülés és a csomók. A kutatás szerint a modellek statikus képeken jóval jobban teljesítenek a topológiai viszonyok felismerésében, mint interaktív, tervezést igénylő feladatokban, ahol elveszítik a struktúra nyomon követését, miközben a jelenet változik. A hibák jellemzően nem az észlelésnél, hanem a tervezési fázisban jelentkeznek, amikor a modellek fizikailag lehetetlen lépéseket javasolnak. A kutatók szerint ez fontos hiányosságot jelez a robotikai és interaktív rendszerekhez szánt mesterséges intelligencia fejlesztésében, ahol a strukturális kapcsolatok megőrzése kritikus a megbízható döntéshozatalhoz.
A Microsoft Research egy kutatási célú vizuális-nyelvi modellt, a CARE-X-et mutatta be, amely mellkasröntgen-felvételek sokféle klinikai feladatát képes kezelni: leletek generálása, kérdések megválaszolása, eszközök felismerése és eltérések helyének azonosítása. A vállalat közlése szerint a modell megerősítéses tanulást (DAPO) alkalmaz a klinikai pontosság javítására, és valós, indiai klinikai adatokon is tesztelték a Narayana Health kórháztól, köztük ritka intenzív osztályos eseteket és CT-vel megerősített megnagyobbodásos állapotokat. Egy külön kísérletben a Qwen3-VL-4B-Instruct modellt determinisztikus mérőeszközökkel kombinálták a méréstől függő diagnózisok pontosságának vizsgálatára. A Microsoft hangsúlyozza, hogy a CARE-X kutatási modell, nem termék vagy orvostechnikai eszköz, és nem alkalmas klinikai diagnózisra.
A Microsoft Research bemutatta az Orchard nevű nyílt forráskódú keretrendszert, amelynek célja az ügynök-alapú AI-kutatás skálázhatóbbá és olcsóbbá tétele. A rendszer magja az Orchard Env, egy Kubernetes-alapú, újrahasználható környezet, amely szoftverfejlesztő, webnavigáló és személyi asszisztens ügynökök betanítására és kiértékelésére is alkalmas, akár valós futtatási keretek, például Codex, OpenClaw vagy ZeroClaw belsejében. A cég állítása szerint az Orchard-SWE mindössze 3 milliárd aktív paraméterrel 69,7%-ot ér el a SWE-bench Verified teszten, rerangolással pedig 73,0%-ot, ami közelíti a több mint tízszer nagyobb élvonalbeli modellek eredményeit. A Microsoft a tanítóadatokat és a kiértékelési módszereket is elérhetővé tette a kutatóközösség számára.
A Microsoft Research bemutatta az EvoLib nevű keretrendszert, amely a vállalat állítása szerint lehetővé teszi, hogy nagy nyelvi modellek a saját, futásidejű tapasztalataikból tanuljanak, anélkül hogy a modell súlyait módosítanák vagy külső címkézett adatra lenne szükség. A módszer a korábbi próbálkozásokat újrafelhasználható készségekké és reflektív meglátásokká alakítja, amelyeket folyamatosan finomít és összevon, így az egyedi megfigyelésekből egyre általánosabb tudás lesz. A cég szerint az EvoLib bármely, API-n keresztül elérhető, fekete doboz jellegű nyelvi modellhez alkalmazható, mivel nem igényel modellfrissítést. Az eredmény a „Test-Time Learning with an Evolving Library” című kutatási cikkben jelent meg, amelynek lektoráltságáról a közlemény nem tesz említést, így azt egyelőre önálló, nem független módon ellenőrzött állításként kell kezelni.