ARC-AGI-3
Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.
- Adatszivárgás
- Alacsony kockázat
- Hétköznapi jel
- Csak közvetett jel
Benchmark-tolmács · ellenőrizve 26 napja
Egy magas szám önmagában nem bizonyítja, hogy a modell jobb lesz neked. Megmutatjuk, mit mér a teszt, mit hagy ki, mennyire friss, szivároghatott-e a tesztadat, és mennyi köze van a hétköznapi használathoz.
Ismeretlen, interaktív játékszerű környezetekben méri, hogy egy AI-ügynök képes-e felfedezni a szabályokat, alkalmazkodni és célt elérni.
Vak, páros emberi szavazásokból rangsorolja, melyik chatbot válaszát kedvelik jobban a felhasználók valós promptokon.
Szakértők által írt, doktori szintű biológiai, fizikai és kémiai feleletválasztós kérdéseken méri a nehéz tudományos következtetést.
57 tantárgy feleletválasztós kérdéseivel méri az angol nyelvű modellek széles körű tanult tudását és feladatmegoldását.
Egyetemi szintű, képet és szöveget együtt igénylő feladatokkal méri a multimodális modellek szakmai látását és következtetését.
Valódi GitHub-hibajegyek alapján méri, hogy egy kódoló ügynök képes-e működő javítást készíteni meglévő Python-projektekben.