Späť na blog
AI modely a nástroje25. júla 202613 min

Claude Opus 5: čo naozaj ukazujú benchmarky

Anthropic vydal 24. júla 2026 Claude Opus 5 za nezmenenú cenu 5 a 25 dolárov za milión tokenov. Model dosiahol 96 % na SWE-bench Verified, 30,16 % na ARC-AGI-3 (štvornásobok predchádzajúceho rekordu) a 70,6 % na OSWorld 2.0. Prechádzame všetky čísla priamo zo systémovej karty vrátane benchmarkov, kde Opus 5 prehráva.

Claude Opus 5: benchmarky, cena a porovnanie s Opus 4.8, Fable 5 a GPT-5.6 Sol

TL;DR Anthropic vydal 24. júla 2026 Claude Opus 5. Cena zostáva na úrovni Opus 4.8, teda 5 $ za milión vstupných a 25 $ za milión výstupných tokenov, pri kontextovom okne 1 milión tokenov. Podľa systémovej karty model dosiahol 96,0 % na SWE-bench Verified, 70,6 % na OSWorld 2.0 a 43,3 % na FrontierBench v0.1, čo je viac než dvojnásobok výsledku Opus 4.8. Najväčší skok priniesol ARC-AGI-3: overených 30,16 % oproti 7,78 % pre GPT-5.6 Sol a 1,52 % pre Opus 4.8. Na niekoľkých benchmarkoch (SWE-bench Pro, DeepSWE, ARC-AGI-2) však Opus 5 zaostáva za drahšou Fable 5 alebo za GPT-5.6 Sol.

Anthropic uvádza nové modely rýchlo. Ešte 9. júna 2026 predstavil Fable 5 a Mythos 5 a o šesť týždňov neskôr prichádza Claude Opus 5, nástupca Claude Opus 4.8. Tento článok nie je zhrnutie tlačovej správy. Prešiel som 193-stranovú systémovú kartu, tabuľku 8.1.A a jednotlivé sekcie s metodikou, a vypisujem tu iba čísla, ktoré si viete overiť v primárnom zdroji. Vrátane tých, ktoré pre Opus 5 nevyznievajú dobre.

Špecifikácie a cena Claude Opus 5

Podstatná správa nie je len výkon, ale cenovka. Opus 5 stojí presne toľko ako Opus 4.8, teda polovicu ceny Fable 5, pri výrazne lepších výsledkoch na väčšine benchmarkov.

ParameterClaude Opus 5Claude Fable 5Claude Opus 4.8
API model IDclaude-opus-5claude-fable-5claude-opus-4-8
Cena, vstup5 $ / M tokenov10 $ / M tokenov5 $ / M tokenov
Cena, výstup25 $ / M tokenov50 $ / M tokenov25 $ / M tokenov
Kontextové okno1 000 000 tokenov1 000 000 tokenov1 000 000 tokenov
Max. výstup128 000 tokenov128 000 tokenov128 000 tokenov
Spoľahlivý knowledge cutoffmáj 2026január 2026január 2026
Adaptívne uvažovanieánoáno (vždy zapnuté)áno

Zdrojom týchto hodnôt je oficiálny prehľad modelov Anthropic. Za zmienku stoja tri detaily, ktoré sa v tlačových správach strácajú:

  • Knowledge cutoff máj 2026 je najčerstvejší z celej rady. Opus 5 pozná dianie o štyri mesiace novšie než Fable 5, čo je pri práci s aktuálnymi témami rozdiel.
  • Batch API zvláda 300-tisíc výstupných tokenov cez beta hlavičku output-300k-2026-03-24, teda viac než dvojnásobok synchrónneho limitu.
  • Fast mode beží približne 2,5-násobnou rýchlosťou oproti štandardu, za dvojnásobok základnej ceny Opus 5.

Kompletná tabuľka benchmarkov zo systémovej karty

Nasledujúca tabuľka je prepis tabuľky 8.1.A zo systémovej karty Claude Opus 5. Ak nie je uvedené inak, výsledky Opus 5 používajú adaptívne uvažovanie na max effort, štandardné sampling nastavenia a priemer z 5 pokusov. Čísla konkurencie Anthropic preberá z ich vlastných systémových kariet a leaderboardov.

BenchmarkOpus 5Opus 4.8Fable 5GPT-5.6 Sol
SWE-bench Verified96,0n/an/an/a
SWE-bench Pro79,269,280,064,6
SWE-bench Multilingual89,584,486,6n/a
SWE-bench Multimodal59,438,454,1n/a
DeepSWE v1.168,859,069,772,7
FrontierCode 1.1 (Main)53,446,553,547,5
FrontierBench v0.143,318,733,737,5
BrowseComp90,884,387,490,4
Humanity's Last Exam (bez nástrojov)56,349,856,5n/a
Humanity's Last Exam (s nástrojmi)64,757,963,9n/a
OSWorld 2.070,655,766,162,6
GDPval-AA v2 (ELO)1861159317471736
AA-Briefcase (ELO)1720134615741505
AutomationBench26,017,017,418,1
ARC-AGI-197,592,5n/a97,5 (xhigh)
ARC-AGI-290,472,1n/a92,5
ARC-AGI-330,2 (high)1,5n/a7,8

Prvý pohľad na tabuľku hovorí jasne: Opus 5 vedie v 12 zo 17 riadkov a v žiadnom neprepadá. Zaujímavejšie je ale to, čo tabuľka nehovorí, a k tomu sa dostaneme nižšie.

Kódovanie: SWE-bench a FrontierBench

SWE-bench testuje modely na reálnych problémoch zo softvérového inžinierstva, konkrétne na uzavretých GitHub issue z open-source repozitárov. Anthropic reportuje štyri varianty, každú ako priemer z piatich pokusov:

  • SWE-bench Verified: 96,0 %. Ide o 500 úloh, ktoré ľudskí inžinieri overili ako riešiteľné. Toto je najcitovanejšie číslo z celého vydania a v praxi znamená, že benchmark sa blíži k saturácii.
  • SWE-bench Pro: 79,2 %. Ťažšia varianta z aktívne udržiavaných repozitárov, s viacsúborovými diffmi a menším únikom ground truth do tréningových dát. Tu Opus 5 tesne prehráva s Fable 5 (80,0 %).
  • SWE-bench Multilingual: 89,5 %. 300 úloh v 9 programovacích jazykoch.
  • SWE-bench Multimodal: 59,4 %. Zadania doplnené o screenshoty a dizajnové návrhy. Oproti Opus 4.8 (38,4 %) ide o skok o 21 percentuálnych bodov, najväčší relatívny posun v celej rodine SWE-bench.

FrontierBench v0.1 je nástupca Terminal-Bench 2.1 od toho istého tímu: 74 ťažších úloh s dôrazom na výpočtovú biológiu, fyzikálne simulácie, CAD, formálne dôkazy a optimalizáciu GPU. Systémová karta uvádza podrobnejšie čísla než súhrnná tabuľka:

Kľúčový fakt: Na FrontierBench v0.1 dosiahol Opus 5 44,4 % priemernej odmeny pri xhigh effort, čo je jeho najlepší výsledok. Max effort skončil v rámci šumu na 43 %. High effort dal 39 % pri v priemere o 19 % menej výstupných tokenov, low effort 25 % pri o 64 % menej tokenov. Fable 5 dosiahla 33,7 %, Opus 4.8 18,7 % a Claude Sonnet 5 17 %.

Tá posledná veta je dôležitejšia, než sa zdá. Rozdiel medzi low a xhigh effort je 19 percentuálnych bodov výkonu za takmer trojnásobok tokenov. Pri produkčnom nasadení sa teda oplatí effort ladiť podľa úlohy, nie ho nechať natvrdo na maxime.

ARC-AGI-3: najväčší skok celého vydania

ARC-AGI od ARC Prize Foundation meria fluidnú inteligenciu, teda schopnosť odvodiť pravidlo z troch príkladov. ARC-AGI-3 je najnovšia a najťažšia verzia: interaktívne, ťahové herné prostredia bez inštrukcií, bez pravidiel a bez zadaného cieľa. Model musí sám zistiť, ako prostredie funguje a čo znamená vyhrať.

ModelARC-AGI-1ARC-AGI-2ARC-AGI-3
Claude Opus 597,50 %90,42 %30,16 % (high effort)
GPT-5.6 Sol97,5 % (xhigh)92,5 %7,78 % (max effort)
Claude Opus 4.892,5 %72,1 %1,52 % (high effort)
Claude Opus 4.7n/a75,83 % (max)n/a

Skóre 30,16 % je približne štvornásobok najlepšieho predtým reportovaného výsledku na oficiálnom leaderboarde a dvadsaťnásobok toho, čo zvládol Opus 4.8. Dôležité je, že tieto čísla nepochádzajú od Anthropic, ale sú overené priamo ARC Prize Foundation na semi-privátnej sade, takže nejde o marketingový self-report.

Jedno upozornenie k porovnateľnosti: výsledok 30,16 % bol nastavený pri high effort, nie max. Anthropic v systémovej karte uvádza, že výsledky pri max effort neboli v čase vydania k dispozícii, keďže testovacie okno bolo krátke. Reálny strop teda môže byť ešte vyšší.

ARC Prize zverejnila aj rozbor jednej hry. Opus 5 dokončil prostredie Axis Reflect (ar25) so skóre 100 a prešiel všetkých osem úrovní za 294 akcií. Podľa hodnotiteľa bola jeho hlavnou silou schopnosť premeniť vizuálnu hádanku na explicitnú algebru: do druhej úrovne odvodil rovnicu odrazu a do ôsmej ju zovšeobecnil na dvojrozmerné odrazy, rozdelil 60 cieľov na zrkadlené kvadranty a dopredu vypočítal cieľovú pozíciu každého kusu.

Práca s počítačom a agentické workflow

OSWorld 2.0 testuje agentov na živom Ubuntu virtuálnom stroji, kde ovládajú myš a klávesnicu. Anthropic použil predvolené nastavenia, rozlíšenie 1080p a maximálne 500 akčných krokov na úlohu. Výsledok 70,57 % (first-attempt success rate, priemer z piatich behov) je podľa systémovej karty state of the art na tomto novom benchmarku, oproti 55,7 % pre Opus 4.8 a 66,1 % pre Fable 5.

AutomationBench od Zapieru meria, či agent dokáže dokončiť realistický firemný workflow. Úloha ho vhodí do simulovanej firmy s desiatkami REST endpointov naprieč 47 aplikáciami (CRM, Slack, Google Workspace), pričom musí sám nájsť správne endpointy, urobiť desiatky navzájom závislých volaní, riadiť sa vrstvenými firemnými smernicami a obísť zámerne nastražené rušivé prvky.

Ekonomika nad surovým skóre: Opus 5 na max effort dosiahol 26,0 %, kým Opus 4.8 mal 17,0 % a Fable 5 iba 17,4 %. Zaujímavejší je ale výsledok pri medium effort: 24 % pri cene 0,89 $ za úlohu, teda lepšie než Opus 4.8 aj Fable 5 za menej než polovicu ich nákladov.

Na Toolathlon Verified, ktorý meria prácu s nástrojmi cez 108 úloh, dosiahol Opus 5 80,6 % Pass@1 oproti 79,9 % pre Opus 4.8 a 74,7 % pre Claude Sonnet 5. Tu je posun malý, čo je samo o sebe užitočná informácia: nie každá kategória úloh dostane skokové zlepšenie.

Kde Claude Opus 5 prehráva

Marketingové zhrnutia tieto riadky vynechávajú, ale pri rozhodovaní o modeli sú najdôležitejšie. Z 17 riadkov tabuľky 8.1.A vedie Opus 5 v dvanástich, no v piatich prípadoch je druhý:

  • SWE-bench Pro: 79,2 % oproti 80,0 % pre Fable 5. Rozdiel je v rámci šumu, ale Fable 5 vedie.
  • DeepSWE v1.1: 68,8 % oproti 69,7 % pre Fable 5 a 72,7 % pre GPT-5.6 Sol. Toto je jediný benchmark v tabuľke, kde model OpenAI vedie s výraznejším odstupom.
  • FrontierCode 1.1 (Main): 53,4 % oproti 53,5 % pre Fable 5. Opus 5 je celkovo druhý, pričom svoj najlepší výsledok dosahuje pri medium effort, nie pri maxime.
  • Humanity's Last Exam bez nástrojov: 56,3 % oproti 56,5 % pre Fable 5. S nástrojmi sa poradie otáča v prospech Opus 5 (64,7 % oproti 63,9 %).
  • ARC-AGI-2: 90,42 % oproti 92,5 % pre GPT-5.6 Sol.

Systémová karta ide ešte ďalej a popisuje dve konkrétne slabiny správania, ktoré Anthropic pozoroval pri testovaní v prírodovedných úlohách:

  • Neproduktívna sebakontrola. Model má sklon prepadnúť sa do vyčerpávajúcich kontrol správnosti a stavať rozsiahle verifikačné pipeline, ktoré odvádzajú pozornosť od hlavnej úlohy. V niekoľkých prípadoch nedokončil úlohu v pridelenom čase, lebo hodiny ladil verifikačnú pipeline ešte predtým, než vôbec dorazili výsledky.
  • Zlé odhadnutie rozsahu úlohy. Model proaktívne nachádza chybové stavy a hraničné prípady v existujúcich codebase, no zároveň má tendenciu preinžinierovať a prikladať váhu okrajovým zmenám, ktoré celkovú kvalitu kódu neovplyvnia.

Ak model nasadzujete na dlhé autonómne úlohy, toto sú presne tie vzorce, ktoré vám spália rozpočet na tokeny bez viditeľného výstupu. Riešením býva tvrdší časový alebo tokenový strop a explicitná inštrukcia, kedy sa má overovanie zastaviť.

Effort parameter: koľko platíte za koľko výkonu

Opus 5 používa adaptívne uvažovanie s parametrom effort, ktorý má päť úrovní. Podľa dokumentácie Anthropic je predvolená hodnota na Claude API a v Claude Code nastavená na high. Dáta z FrontierBench ukazujú, čo tie úrovne reálne stoja:

EffortFrontierBench v0.1Spotreba výstupných tokenov
xhigh44,4 % (najlepší výsledok)referenčná úroveň
max43 % (v rámci šumu)najvyššia
high39 %o 19 % menej než xhigh
low25 %o 64 % menej než xhigh

Praktický záver: max effort tu nie je najlepšou voľbou ani z hľadiska výkonu, nieto ceny. Na FrontierCode dokonca Opus 5 dosiahol svoj najlepší výsledok pri medium effort (53,4 % na hlavnej sade, 63,6 % na rozšírenej). Ak model voláte cez API vo veľkom, testovanie effort úrovní na vašich vlastných úlohách sa zaplatí rýchlo.

Bezpečnosť a klasifikátory

Anthropic zaraďuje Opus 5 pod rovnaké ASL-3 ochrany ako Opus 4.8. Podľa exekutívneho zhrnutia systémovej karty model neprekračuje prah automatizovaného AI R&D podľa Responsible Scaling Policy a v oblasti chemických a biologických rizík ho Anthropic hodnotí ako CB-1 (syntéza nie nových zbraní), no nie CB-2. Celkové riziko nesúladu (misalignment) hodnotí ako veľmi nízke.

Z praktického hľadiska je najzaujímavejšie porovnanie miery odmietnutí. Počas testovania na FrontierBench bezpečnostné klasifikátory Opus 5 označili a odmietli 5 % API volaní v 4 % pokusov, kým klasifikátory Fable 5 označili 42 % volaní v 26 % pokusov. Obidva modely v takom prípade padajú späť na Opus 4.8.

Pre firmy, ktoré modely integrujú do produkčných systémov, je to hmatateľný rozdiel: Opus 5 potrebuje fallback rádovo menej často než Fable 5, čo zjednodušuje architektúru aj predvídateľnosť odpovedí.

Jedna zmena oproti Fable 5 stojí za zmienku pre bezpečnostné tímy: Opus 5 povoľuje hľadanie zraniteľností v zdrojovom kóde na všetkých úrovniach prístupu, no naďalej blokuje hľadanie zraniteľností v skompilovaných binárkach, ktoré sa častejšie používa ofenzívne.

Čo to znamená pre viditeľnosť vášho webu v AI vyhľadávačoch

Prečo o vydaní modelu píšeme na blogu o AI optimalizácii? Pretože Claude je jeden z piatich AI vyhľadávačov, ktorých citácie meriame, popri Perplexity, ChatGPT, Google AIO a Gemini. Skok v schopnostiach základného modelu sa premieta priamo do toho, ako sa vaša značka dostáva do AI odpovedí.

Lepšie agentické vyhľadávanie znamená viac zdrojov v jednej odpovedi. Skóre 90,8 % na BrowseComp (oproti 84,3 % pre Opus 4.8) meria presne to, čo robí AI vyhľadávač: nájsť, prečítať a skombinovať informácie z webu. Model, ktorý si vie overiť tvrdenie vo viacerých zdrojoch, si skôr vyberie ten, ktorý má číslo podložené odkazom na primárny zdroj, než ten, ktorý ho iba tvrdí.

Silnejšie uvažovanie zvyšuje latku na kvalitu obsahu. Čím lepšie model rozlišuje hĺbkový zdroj od plytkého prepisu, tým dôležitejšie sú signály dôveryhodnosti (E-E-A-T), presné čísla s citáciami a jasná entitná identita značky. Toto sú piliere Generative Engine Optimization a s každou generáciou modelov ich váha rastie, nie klesá.

Kontext 1 milión tokenov mení ekonomiku citácie. Model dokáže pri jednej odpovedi zvážiť rádovo viac obsahu, takže sa už nesúťaží len o prvé tri odkazy. Súťaží sa o to, či je váš obsah dosť dobre štruktúrovaný a chunkovateľný na to, aby si z neho model vytiahol práve tú pasáž, ktorá odpovedá na otázku.

Praktický záver. Vydanie Opus 5 nie je len technická novinka pre vývojárov. Je to signál, že konkurencia o citáciu v AI odpovediach bude tvrdšia, lebo modely majú čoraz lepší filter na kvalitu. Ak chcete vedieť, ako na tom váš web aktuálne je, začnite meraním Share of Voice a pozrite si porovnanie AI vyhľadávačov.

Zistite, ako vás citujú Claude, ChatGPT, Perplexity, Gemini a Google AIO. Merajte viditeľnosť svojej značky naprieč všetkými AI vyhľadávačmi na jednom mieste.

Vyskúšajte Optimalizáciu pre AI zadarmo

Často kladené otázky

Kedy vyšiel Claude Opus 5?

Anthropic vydal Claude Opus 5 dňa 24. júla 2026. Model je dostupný v Claude.ai, Claude Code, Claude Cowork, cez Claude Platform API, na Amazon Bedrock, Google Cloud aj Microsoft Foundry.

Koľko stojí Claude Opus 5?

Cena je 5 dolárov za milión vstupných tokenov a 25 dolárov za milión výstupných tokenov, čo je rovnaká cena ako pri Claude Opus 4.8 a polovica ceny Claude Fable 5. Fast mode stojí dvojnásobok základnej ceny a beží približne 2,5-krát rýchlejšie.

Aké skóre má Claude Opus 5 na SWE-bench Verified?

Claude Opus 5 dosiahol 96,0 percenta na SWE-bench Verified, čo je priemer z piatich pokusov na 500 úlohách overených ľudskými inžiniermi. Na ťažšej variante SWE-bench Pro dosiahol 79,2 percenta a na SWE-bench Multimodal 59,4 percenta.

Je Claude Opus 5 lepší než Claude Fable 5?

Na väčšine benchmarkov áno a za polovičnú cenu. Fable 5 však stále vedie na SWE-bench Pro (80,0 oproti 79,2 percenta), na FrontierCode Main (53,5 oproti 53,4 percenta) a na Humanity's Last Exam bez nástrojov (56,5 oproti 56,3 percenta). Vo všetkých troch prípadoch je rozdiel v rámci štatistického šumu.

Čo je ARC-AGI-3 a prečo je výsledok Opus 5 dôležitý?

ARC-AGI-3 je interaktívny benchmark od ARC Prize Foundation, postavený z ťahových herných prostredí bez inštrukcií, pravidiel a zadaného cieľa. Model musí sám zistiť, ako prostredie funguje. Claude Opus 5 dosiahol overených 30,16 percenta pri high effort, čo je približne štvornásobok predchádzajúceho rekordu a dvadsaťnásobok výsledku Opus 4.8.

Aké má Claude Opus 5 kontextové okno?

Kontextové okno má 1 milión tokenov, čo zodpovedá približne 555-tisíc slovám. Maximálny výstup na jednu požiadavku je 128-tisíc tokenov cez synchrónne Messages API, alebo až 300-tisíc tokenov cez Message Batches API s beta hlavičkou.

Aké sú známe slabiny Claude Opus 5?

Systémová karta Anthropic uvádza dve. Prvá je neproduktívna sebakontrola, keď model stavia rozsiahle verifikačné pipeline a nedokončí hlavnú úlohu v pridelenom čase. Druhá je zlé odhadnutie rozsahu úlohy, teda tendencia preinžinierovať a klásť dôraz na okrajové zmeny, ktoré celkovú kvalitu neovplyvnia.

Ovplyvní Claude Opus 5 viditeľnosť môjho webu v AI vyhľadávačoch?

Nepriamo áno. Claude je jeden z hlavných AI vyhľadávačov a schopnejší model dokáže spracovať viac zdrojov naraz a lepšie rozlišovať kvalitu obsahu. Weby s hĺbkovým, dobre štruktúrovaným obsahom a číslami podloženými odkazmi na primárne zdroje majú väčšiu šancu byť v AI odpovediach citované.

I

Tím Optimalizácia pre AI pomáha firmám zvyšovať viditeľnosť v AI vyhľadávačoch. Monitorujeme Perplexity, ChatGPT, Google AIO, Gemini a Claude pre desiatky domén.

Zdieľať článok

Sledujte, ako AI vyhľadávače citujú váš web

Vyskúšajte Optimalizáciu pre AI zadarmo