Späť na rubriku
Výskum ⭐ Dôležité

ARC-AGI-3 leaderboard: Claude Opus 5 vedie s 30,2 %, GPT-5.6 Sol v top výsledkoch na ARC-AGI-2

Sobota 25. júla 2026 Zdroj: ARC Prize

Čo sa stalo

ARC Prize zverejnil výsledky na novom ARC-AGI-3 benchmarku, ktorý testuje schopnosť AI agentov adaptovať sa za behu na nové interaktívne prostredia — čo je kvalitatívne nový typ hodnotenia oproti predchádzajúcim verziám.

Kontext a dopad

ARC-AGI je považovaný za jeden z najdôveryhodnejších meradiel pokroku k AGI. Nízke skóre (30 %) aj u najlepšieho modelu naznačuje, že adaptívna inteligencia zostáva zásadnou výzvou aj pre frontier modely.

Detaily

  • ARC-AGI-3: Claude Opus 5 = 30,2 % (1. miesto z 4 hodnotených modelov)
  • ARC-AGI-2: GPT-5.5 = 85 % (leader); Gemini 3.1 Pro = 77,1 % (najlacnejší do 10 % od lídra)
  • ARC-AGI-1: GPT-5.5 = 95 % (leader)
  • GPT-5.6 Sol pri maximálnom reasoning: 13,33 % na Public, 7,78 % na Semi-Private ARC-AGI-2
  • ARC-AGI-3 hodnotí 'adaptáciu za behu v nových interaktívnych prostrediach', nie len statické úlohy
  • Celkom 4 modely hodnotené na ARC-AGI-3 k dátumu publikácie
Otvoriť pôvodný zdroj ARC Prize