2026. augusztus 5., szerda · Kutatás

Nem egyenlő eséllyel fenyegeti a betegeket az orvosi AI-modellek adatszivárgása

A Nature-ben megjelent szakértői elemzés szerint az orvosi AI-fejlesztés eddigi alapfeltevése – hogy az anonimizált betegadatokból nem lehet visszakövetkeztetni az egyénekre – gyakran nem igaz. A cikk Knolle és szerzőtársai Nature-ben publikált kutatására hivatkozik, amely kimutatta, hogy erős gépi tanulási modellek esetén bizonyos betegcsoportok tagságára vonatkozó információ kikövethető a modellből, és ez a kockázat nem egyenletesen oszlik el a populációkon belül. Zhang és Ghassemi, az MIT kutatói ezt az eredményt kommentálva hangsúlyozzák, hogy az adatmegosztás és az orvosi AI-fejlesztés közötti implicit „alku” – amely a de-identifikáció biztonságára épül – felülvizsgálatra szorul. Az elemzés szerint a probléma különösen sürgető, mert eltérő mértékben veszélyezteti a különböző alcsoportokat, ami új etikai és adatvédelmi kérdéseket vet fel az egészségügyi AI-rendszerek tervezésénél.

Miért fontos?

A kutatás megkérdőjelezi azt az alapfeltevést, amelyre az orvosi AI-fejlesztéshez szükséges betegadat-megosztás jogi és etikai gyakorlata épül.

Források

Kapcsolódó témák

Napi összefoglaló

Ez a hír a 2026. augusztus 5., szerda napi AI összefoglaló része.

Kapcsolódó hírek

Új teszt mutatja: az AI-modellek elbuknak gyógyszerbiztonsági döntéseknél

Kutatók MedPIC-Bench néven 467 kérdésből álló tesztet mutattak be, amely azt vizsgálja, hogy a nyelvi modellek valóban figyelembe veszik-e a beteg egyéni adatait egy gyógyszerbiztonsági szabály alkalmazásakor, nem csak egy rögzített gyógyszer-kockázat párost idéznek fel. A szerzők állítása szerint 28 orvosi célú, általános és zárt modellt teszteltek: amikor a beteg adatait megváltoztatták, az átlagos pontosság 63,6%-ról 45,1%-ra esett. A modellek jól kezelik, ha egy beteg-jellemző közvetlenül ismert ellenjavallatra utal, de nehezen boldogulnak, ha az adatok éppen kizárnak egy figyelmeztetést. A nem lektorált preprint szerint a modellek indoklása gyakran felismeri a megváltozott adatot, mégis a korábbi ítéletet tartják meg, és ez a hiba az orvosi célú modelleknél is fennáll, sőt átlagosan rosszabbul teljesítenek, mint az általánosak.

Multimodális nyelvi modell automatizálja a gyomortükrözés diagnosztikáját és leletezését

A Nature Communications-ben közölt, korai hozzáférésű tanulmány szerint kínai kutatók orvosi szaktudással megerősített multimodális nagy nyelvi modellt (MLLM-EDR) fejlesztettek gyomortükrözési képek automatikus diagnosztizálására és leletgenerálásra. A több központból származó adathalmaz 4461 beteg 203 838 endoszkópos képét tartalmazta. A szerzők szerint a modell 0,882-es átlagos diagnosztikus pontosságot ért el tizenkilenc betegségre, felülmúlva a korábbi AI-modelleket (0,720) és a kevésbé tapasztalt endoszkóposokat (0,784). A generált leletek minőségét a tapasztalt endoszkóposokéval egyenértékűnek találták, a leletezési idő pedig hét percről mintegy 13,5 másodpercre csökkent.

Kis brit startup AI-ügynöke állítása szerint lekörözte az OpenAI-t és az Anthropicot

Az Inherent nevű londoni AI-labor, amelyet volt Google DeepMind-kutatók alapítottak, saját közlése szerint Faraday nevű AI-ügynöke felülmúlta az Anthropic Claude Opus 4.8 és az OpenAI GPT-5.5 modelljeit egy konkrét feladatban: publikált tudományos cikkek eredményeinek önálló, előzetes válasz nélküli reprodukálásában. A cég állítása szerint a Faraday ehhez a jóval kisebb, 27 milliárd paraméteres Qwen 3.6 modellt használja a frontier-méretű riválisok helyett, és megerősítéses tanulással próbálja megtanítani neki a „kutatói érzéket” is, vagyis hogy mely kísérletek érdemesek elvégzésre. A startup nemrég 50 millió dolláros seed-körrel lépett ki a stealth módból. Az eredmények kizárólag a vállalat saját közléséből származnak, független megerősítés egyelőre nincs.

Kutatás: az AI-biztonsági tesztek megjátszhatók és félrevezetőek

Egy brit UK AI Security Institute kutatóit is tartalmazó csapat pszichológiai tesztelésből ismert módszerekkel vizsgált meg nyolc népszerű nyelvimodell-biztonsági benchmarkot, 192 modell több mint 5000 kérdésre adott válaszát elemezve. A tanulmány szerint az egyetlen „biztonsági pontszám” valójában három, egymástól nagyrészt független tulajdonságot kever össze: a kérések elutasításának szigorát, a válaszok igazmondását és a kontextustól függő ártalmas tartalmak kezelését. A HarmBench és az OR-Bench-Hard benchmark ellentétes irányba mozdítja a pontszámot, így egy modell puszta elutasítási hajlandósággal is javíthatja összesített értékelését, miközben kevésbé hasznossá válik. A kutatók szerint a kérdéseknek mindössze kevesebb mint 2 százaléka hordoz tényleges mérési információt.