2026. augusztus 11., kedd · Kutatás
Új benchmark: az AI-modellek még messze nem elég megbízhatóak valódi tudományos felfedezéshez
Egy friss, egyelőre nem lektorált kutatás bemutatja a Science Edge Evaluation (SEE) nevű benchmarkot, amely szakértők által összeállított, kémiai, biológiai és anyagtudományi szakirodalomra és kísérleti gyakorlatra épülő kérdésekből áll. A szerzők 19 multimodális nagy nyelvi modellt teszteltek, és a legjobban teljesítő modell is csak 48,7 százalékos pontosságot ért el, miközben az általános célú modellek átlagosan felülmúlták a tudományra specializált társaikat. Amikor a modellek eszközöket (vizuális ágens módban) is használhattak, a legjobb pontosság 52,7 százalékra nőtt, de a szerzők szerint a több elérhető információ önmagában nem javítja a következtetések megbízhatóságát. A kutatók szerint a fő probléma az, hogy a modellek nem tudják megbízhatóan az eredeti kísérleti bizonyítékok határain belül tartani a tovább feldolgozott információt.
Miért fontos?
A benchmark konkrét, mérhető bizonyítékot ad arra, hogy a jelenlegi AI-modellek még nem képesek megbízható, bizonyítékokra alapozott tudományos következtetésekre.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 11., kedd napi AI összefoglaló része.