2026-07-27 · 4 min čtení
Nový model Claude Opus 5 dosáhl na benchmarku ARC-AGI-3 skóre 30,2 %, čímž téměř čtyřnásobně překonal dosavadní rekord. Vývojáři testu jsou překvapeni — model se choval způsobem, který u žádné jiné AI dosud neviděli.
Výzkumná laboratoř Anthropic zveřejnila výsledky svého nejnovějšího modelu Claude Opus 5 na benchmarku ARC-AGI-3 — a čísla jsou přinejmenším překvapivá. Model dosáhl skóre 30,2 %, zatímco dosavadní rekord držel GPT-5.6 Sol od OpenAI s pouhými 7,8 %. To znamená, že Opus 5 je v tomto testu téměř čtyřikrát lepší než jeho nejbližší konkurent.
ARC-AGI je sada úloh, kterou navrhl výzkumník François Chollet s cílem měřit něco jiného než jen zapamatované znalosti. Jde o test schopnosti obecného uvažování — tedy zda model dokáže řešit problémy, se kterými se nikdy předtím nesetkal, podobně jako to dělá člověk.
Zatímco běžné testy AI (například znalostní kvízy nebo programátorské úlohy) lze zvládnout „naučením se" správných odpovědí z tréninkových dat, ARC-AGI-3 klade důraz na skutečné odvozování z pravidel a vzorů. Jsou to v podstatě vizuální hádanky s logikou, které vyžadují pochopení, ne memorování.
Skóre 30,2 % proto neznamená, že model „selhal na 70 % úloh" — znamená to, že překonal dosud nejlepší výsledky o velký kus a ukázal schopnosti, které zatím nebyly u AI pozorovány.
Snad ještě zajímavější než samotné skóre je to, co vývojáři benchmarku u Opusu 5 pozorovali. Model samostatně formuloval rovnice odrazu (tzv. reflection equations) — to je přístup k řešení určitých typů logických úloh, který žádný jiný model předtím nepoužil bez přímého návodu.
Jinými slovy: Opus 5 si sám „vymyslel" metodu řešení, místo aby se opíral o vzory z tréninku. Vývojáři testu to přisuzují silnějšímu logickému uvažování modelu, nikoli pouhé větší výpočetní síle.
Pokud Claude Opus 5 používáš nebo plánuješ používat, v praxi to znamená, že model by měl být spolehlivější při řešení složitějších úkolů, kde nestačí jen „zopakovat, co ví". Typické příklady:
Výsledky z ARC-AGI-3 nezaručují, že model bude lepší ve všem — jde o specifický typ testu. Ale naznačují, že Anthropic udělal krok směrem ke skutečně flexibilnějšímu uvažování, nikoli jen k většímu objemu naučených informací.
Claude Opus 5 je v době publikace tohoto článku dostupný přes platformu Claude.ai a Anthropic API. Přesné ceny za vstupní a výstupní tokeny pro Opus 5 Anthropic zatím plně nezveřejnil — sledujte aktuální ceník na stránkách Anthropicu.
ARC-AGI-3 benchmark spravuje organizace ARC Prize. Skóre 30,2 % pro Opus 5 a 7,8 % pro GPT-5.6 Sol jsou oficiálně zveřejněné výsledky z leaderboardu tohoto benchmarku. Pro srovnání: průměrný člověk dosahuje na starší verzi ARC-AGI skóre okolo 85 %, takže stále existuje velký prostor pro zlepšení — i přesto jsou výsledky Opusu 5 v kontextu AI výzkumu mimořádné.
Zda podobné schopnosti přinesou i levnější verze modelů (jako je Claude Sonnet nebo Haiku), zatím nebylo potvrzeno.
Zdroj informací: The Decoder (https://the-decoder.com/anthropics-opus-5-blows-past-fable-5-and-gpt-5-6-sol-on-the-benchmark-designed-to-measure-real-intelligence/)