Benchmark-tolmács · ellenőrizve 26 napja

Mit mond valójában egy AI-pontszám?

Egy magas szám önmagában nem bizonyítja, hogy a modell jobb lesz neked. Megmutatjuk, mit mér a teszt, mit hagy ki, mennyire friss, szivároghatott-e a tesztadat, és mennyi köze van a hétköznapi használathoz.

AI-ügynökök Folyamatosan frissül

ARC-AGI-3

Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.

Adatszivárgás
Alacsony kockázat
Hétköznapi jel
Csak közvetett jel
Emberi preferencia Folyamatosan frissül

Chatbot Arena

Vak, páros emberi szavazásokból rangsorolja, melyik chatbot válaszát kedvelik jobban a felhasználók valós promptokon.

Adatszivárgás
Alacsony kockázat
Hétköznapi jel
Erős kapcsolat
Matematika és tudomány Korosodó

GPQA Diamond

Szakértők által írt, doktori szintű biológiai, fizikai és kémiai feleletválasztós kérdéseken méri a nehéz tudományos következtetést.

Adatszivárgás
Magas kockázat
Hétköznapi jel
Gyenge kapcsolat
Általános tudás Örökölt mérce

MMLU

57 tantárgy feleletválasztós kérdéseivel méri az angol nyelvű modellek széles körű tanult tudását és feladatmegoldását.

Adatszivárgás
Magas kockázat
Hétköznapi jel
Csak közvetett jel
Multimodális Friss

MMMU-Pro

Egyetemi szintű, képet és szöveget együtt igénylő feladatokkal méri a multimodális modellek szakmai látását és következtetését.

Adatszivárgás
Közepes kockázat
Hétköznapi jel
Részleges kapcsolat
Kódolás Korosodó

SWE-bench Verified

Valódi GitHub-hibajegyek alapján méri, hogy egy kódoló ügynök képes-e működő javítást készíteni meglévő Python-projektekben.

Adatszivárgás
Magas kockázat
Hétköznapi jel
Részleges kapcsolat