2026. augusztus 12., szerda · Kutatás
Preprint: azonosság-torzítás az AI-bírák pontozásában, blokklánc a megoldásra
Egy nem lektorált arXiv-tanulmány szerint hét nagynyelvi modellt – köztük a GPT-OSS 120B-t, a Llama 3.3 70B-t és a DeepSeek V4 Pro-t – bíráló szerepben teszteltek: ezek pontozták három elsődleges modell válaszait 58 tényszerű, gondolkodási, politikai és preferenciaalapú kérdésen, anonim és azonosítóval ellátott formában is. A szerzők állítása szerint az azonosság felfedése enyhén torzítja a tényszerű kérdések pontszámát, közepesen a nehéz gondolkodási feladatokét, és nagymértékben a geopolitikailag érzékeny témákét; a GLM 5.1 pontszáma 7 ponttal, a Llama 3.3 70B-é 1,56 ponttal emelkedett szignifikánsan. A torzítás orvoslására a kutatók egy Ethereum-kompatibilis, kétfázisú „commit-reveal” blokkláncprotokollt javasolnak, amely a bírák pontszámát hash formában rögzíti, mielőtt a modellek azonossága kiderülne.
Miért fontos?
A kutatás azt jelzi, hogy az AI-modellek értékelésére használt bírálómodellek torzíthatók, ami megkérdőjelezi a benchmarkeredmények megbízhatóságát és a rájuk épülő üzleti döntéseket.
Források
Említve a tudásbázisban
Kapcsolódó témák
Napi összefoglaló
Ez a hír a 2026. augusztus 12., szerda napi AI összefoglaló része.