Koľko stojí milión tokenov v roku 2026: cenník hlavných AI modelov a reálne prepočty
Kompletná cenová tabuľka Claude, GPT, DeepSeek, Qwen, Kimi a GLM k augustu 2026. Plus tri modelové scenáre s prepočtom mesačných nákladov a štyri spôsoby, ako účet znížiť.

TL;DR Rozdiel medzi najdrahším a najlacnejším rozumne použiteľným modelom je dnes viac než stonásobný. Milión výstupných tokenov stojí 50 $ pri Claude Fable 5 a 0,28 $ pri DeepSeek V4 Flash. Na modelovom chatbote s 10-tisíc konverzáciami mesačne to je rozdiel medzi 380 $ a 7,28 $. Pri správnom nastavení cache a dávkového spracovania sa účet dá znížiť ešte o 50 až 90 % bez zmeny modelu. Tento článok obsahuje kompletnú tabuľku cien k 11. augustu 2026, tri prepočítané scenáre a zoznam skrytých položiek, ktoré účet nafukujú.
Cenníky jazykových modelov vyzerajú jednoducho: zaplatíte za vstupné a výstupné tokeny. V praxi sa účet líši od odhadu často trojnásobne, pretože sa zabudne na dlhý kontext, na cache, na uvažovacie tokeny alebo na to, že vyhľadávanie na webe sa účtuje zvlášť.
Nasledujúci prehľad je prepis oficiálnych cenníkov k 11. augustu 2026 doplnený o prepočty na scenáre, ktoré rieši bežná firma.
Čo je token a prečo sa platí za milión
Token je kúsok textu, s ktorým model pracuje ako s jednotkou. V angličtine zodpovedá jeden token približne štyrom znakom alebo troch štvrtinám slova. V slovenčine je pomer horší, pretože tokenizéry sú trénované prevažne na anglických dátach a slovenské slová sa rozpadajú na viac častí. Praktický dôsledok: rovnaký text v slovenčine spotrebuje o desiatky percent viac tokenov než jeho anglická verzia.
Účtuje sa oddelene vstup a výstup, pričom výstup je vždy niekoľkonásobne drahší. Pri Claude Opus 5 je to 5 $ za milión vstupných a 25 $ za milión výstupných tokenov, teda päťnásobok. Preto sa oplatí venovať pozornosť tomu, ako dlhé odpovede model generuje.
Tretia položka, na ktorú sa zabúda, sú uvažovacie tokeny. Modely s adaptívnym uvažovaním generujú pred odpoveďou interný text, ktorý používateľ nevidí, ale platí zaň ako za výstup. Pri nastavení vysokého úsilia môže byť tento skrytý text niekoľkonásobne dlhší než samotná odpoveď.
Kompletná cenová tabuľka
Ceny v dolároch za milión tokenov. Stĺpec cache je cena za vstupné tokeny, ktoré poskytovateľ už má uložené z predchádzajúceho dopytu.
| Model | Vstup | Cache | Výstup |
|---|---|---|---|
| Claude Fable 5 | 10,00 $ | 1,00 $ | 50,00 $ |
| GPT-5.6 Sol | 5,00 $ | 0,50 $ | 30,00 $ |
| Claude Opus 5 | 5,00 $ | 0,50 $ | 25,00 $ |
| Kimi K3 | 3,00 $ | 0,30 $ | 15,00 $ |
| GPT-5.6 Terra | 2,00 $ | 0,20 $ | 12,00 $ |
| Claude Sonnet 5 | 2,00 $ | 0,20 $ | 10,00 $ |
| Qwen3.8-Max | 2,00 $ | 0,25 $ | 6,00 $ |
| Claude Haiku 4.5 | 1,00 $ | 0,10 $ | 5,00 $ |
| GLM-5.2 | 1,40 $ | 0,26 $ | 4,40 $ |
| GLM-5 | 1,00 $ | 0,20 $ | 3,20 $ |
| GPT-5.6 Luna | 0,20 $ | 0,02 $ | 1,20 $ |
| MiniMax M3 | 0,30 $ | 0,06 $ | 1,20 $ |
| DeepSeek V4 Pro | 0,435 $ | 0,003625 $ | 0,87 $ |
| DeepSeek V4 Flash | 0,14 $ | 0,0028 $ | 0,28 $ |
Pri Claude Sonnet 5 platí jeden termín, ktorý sa oplatí poznamenať do kalendára. Uvedená cena 2 $ a 10 $ je zavádzacia a platí do 31. augusta 2026. Od 1. septembra 2026 sa mení na 3 $ a 15 $, teda o 50 % vyššie. Kto na Sonnete 5 stavia rozpočet, mal by rátať s vyššou sadzbou.
Ceny modelov OpenAI zodpovedajú stavu po zlacnení z 30. júla, ktoré sme rozoberali v článku o novej cenotvorbe GPT-5.6. Pri všetkých troch platí, že čítanie z cache stojí desatinu ceny vstupu, rovnako ako u Anthropicu.
Opačným smerom ide DeepSeek. V cenníkovej dokumentácii priamo píše, že plánuje ceny API v blízkej dobe zvýšiť, a to výrazne. Dnešné sadzby 0,14 a 0,28 dolára teda neberte ako trvalý stav.
Tri scenáre s prepočtom
Tabuľka cien je abstraktná, kým si ju nepreložíte na svoj objem. Nasledujúce tri scenáre používajú konzervatívne odhady spotreby a počítajú s plnou cenou bez cache a bez dávkových zliav.
Scenár 1: chatbot zákazníckej podpory
Predpoklad: 10 000 konverzácií mesačne, v každej 4 000 vstupných tokenov (systémový prompt, história, kontext z dokumentácie) a 600 výstupných tokenov. Spolu 40 miliónov vstupných a 6 miliónov výstupných tokenov mesačne.
| Model | Vstup | Výstup | Mesačne spolu |
|---|---|---|---|
| GPT-5.6 Sol | 200,00 $ | 180,00 $ | 380,00 $ |
| Claude Opus 5 | 200,00 $ | 150,00 $ | 350,00 $ |
| Kimi K3 | 120,00 $ | 90,00 $ | 210,00 $ |
| GPT-5.6 Terra | 80,00 $ | 72,00 $ | 152,00 $ |
| Claude Sonnet 5 | 80,00 $ | 60,00 $ | 140,00 $ |
| Qwen3.8-Max | 80,00 $ | 36,00 $ | 116,00 $ |
| GLM-5.2 | 56,00 $ | 26,40 $ | 82,40 $ |
| Claude Haiku 4.5 | 40,00 $ | 30,00 $ | 70,00 $ |
| MiniMax M3 | 12,00 $ | 7,20 $ | 19,20 $ |
| GPT-5.6 Luna | 8,00 $ | 7,20 $ | 15,20 $ |
| DeepSeek V4 Flash | 5,60 $ | 1,68 $ | 7,28 $ |
Rozdiel medzi najdrahšou a najlacnejšou možnosťou je 52-násobný. Pre kontext: chatbot na podporu zvyčajne nepotrebuje najsilnejší model, pretože pracuje s pripravenou dokumentáciou a odpovede sú krátke. Toto je typický prípad, kde sa oplatí lacnejší model a ušetrené peniaze investovať do kvality podkladov.
Scenár 2: extrakcia dát z dokumentov
Predpoklad: 50 000 faktúr alebo zmlúv mesačne, každá 2 000 vstupných tokenov a 300 výstupných tokenov štruktúrovaného výstupu. Spolu 100 miliónov vstupných a 15 miliónov výstupných tokenov.
| Model | Mesačne spolu | Náklad na dokument |
|---|---|---|
| Claude Opus 5 | 875,00 $ | 1,75 centa |
| GLM-5.2 | 206,00 $ | 0,41 centa |
| Claude Haiku 4.5 | 175,00 $ | 0,35 centa |
| MiniMax M3 | 48,00 $ | 0,10 centa |
| GPT-5.6 Luna | 38,00 $ | 0,08 centa |
| DeepSeek V4 Flash | 18,20 $ | 0,04 centa |
Extrakcia štruktúrovaných dát je úloha, kde je odstup medzi špičkovým a priemerným modelom najmenší. Ak model dostane jasnú schému výstupu a validujete výsledok, rozdiel v presnosti medzi 875 $ a 18 $ mesačne býva v jednotkách percent.
Scenár 3: generovanie obsahu
Predpoklad: 100 článkov mesačne, každý s výskumnou fázou. Na článok 60 000 vstupných tokenov (podklady, zdroje, predchádzajúce verzie) a 8 000 výstupných tokenov. Spolu 6 miliónov vstupných a 800-tisíc výstupných tokenov.
| Model | Mesačne spolu | Náklad na článok |
|---|---|---|
| Claude Fable 5 | 100,00 $ | 1,00 $ |
| Claude Opus 5 | 50,00 $ | 0,50 $ |
| Kimi K3 | 30,00 $ | 0,30 $ |
| Claude Sonnet 5 | 20,00 $ | 0,20 $ |
| Qwen3.8-Max | 16,80 $ | 0,17 $ |
| GLM-5.2 | 11,92 $ | 0,12 $ |
| DeepSeek V4 Flash | 1,06 $ | 0,01 $ |
Pri obsahu je situácia opačná než pri extrakcii. Sto článkov za dolár znie lákavo, ale rozdiel v kvalite textu je tu najviditeľnejší zo všetkých troch scenárov, a náklad na model je aj tak zanedbateľný oproti času človeka, ktorý text kontroluje. Šetriť na modeli pri obsahu je najmenej výhodná úspora.
Štyri spôsoby, ako znížiť účet
Zmena modelu je len jedna páka a väčšinou nie tá prvá, po ktorej treba siahnuť.
Cache na opakovaný kontext
Ak posielate v každom dopyte rovnaký systémový prompt alebo rovnakú dokumentáciu, platíte za to isté znova a znova. Cache to rieši: obsah sa uloží a ďalšie dopyty zaň platia zlomok ceny.
Úspora sa medzi poskytovateľmi výrazne líši. U Anthropicu stojí čítanie z cache 10 % ceny vstupu, pričom zápis do päťminútovej cache stojí 1,25-násobok. To znamená, že sa vám cache vyplatí už po prvom opakovanom čítaní. DeepSeek ide ešte ďalej: cache hit stojí 0,0028 $ oproti 0,14 $, teda 2 % bežnej ceny vstupu.
Cena čítania z cache ako percento bežnej ceny vstupu. Nižšie je lepšie.
Že to nie je len teória, vidno na produkčných dátach. OpenRouter zverejňuje pri každom modeli okrem cenníkovej sadzby aj cenu, ktorú zákazníci reálne zaplatia. Pri Qwen3.8-Max je cenníková cena vstupu 2 doláre, ale vážený priemer skutočne zaplatenej ceny je 0,4948 dolára, teda o 75 % menej. Dôvod je jediný: 85,9 % vstupných tokenov ide cez cache.
Dávkové spracovanie
Ak výsledok nepotrebujete okamžite, dávkové rozhranie je najjednoduchšia úspora vôbec. Anthropic dáva 50 % zľavu na vstup aj výstup a zľava sa dá kombinovať s cache. Claude Opus 5 tak z 25 $ na výstupe klesne na 12,50 $. Pre nočné spracovanie dát alebo hromadnú klasifikáciu je to bezplatná polovica účtu.
Smerovanie podľa náročnosti
Väčšina reálnych dopytov je jednoduchá. Ak pred model postavíte lacný klasifikátor, ktorý rozhodne, či dopyt potrebuje najsilnejší model alebo stačí menší, pri typickom rozdelení 80 ku 20 klesne účet o viac než polovicu. Rozdiel v kvalite pritom používateľ nezaznamená, pretože ťažké dopyty stále dostane silný model.
Kratšie odpovede a nižšie úsilie
Keďže výstup stojí päť- až šesťnásobok vstupu, každá zbytočná veta v odpovedi sa počíta. Inštrukcia na stručnosť v systémovom prompte a rozumne nastavené uvažovacie úsilie sú úprava na desať minút s okamžitým efektom.
Skryté položky, ktoré účet nafukujú
- Dlhý kontext. Pri GPT-5.6 sa nad určitou dĺžkou zdvojnásobí sadzba: Sol z 5 $ a 30 $ na 10 $ a 45 $. MiniMax M3 účtuje nad 512-tisíc vstupných tokenov dvojnásobok, a to na celú požiadavku vrátane výstupu. Anthropic naopak účtuje plné milióntokenové okno v štandardnej sadzbe, čo je pri práci s veľkými dokumentmi podstatný rozdiel.
- Vyhľadávanie na webe. Účtuje sa zvlášť. U Anthropicu je to 10 $ za tisíc vyhľadaní plus tokeny za nájdený obsah. Pri asistentovi, ktorý hľadá pri každej odpovedi, to je položka porovnateľná s cenou samotných tokenov.
- Uvažovacie tokeny. Pri vysokom nastavení úsilia model vygeneruje interný text, ktorý neuvidíte, ale zaplatíte zaň ako za výstup.
- Zmena tokenizéra. Anthropic upozorňuje, že modely Claude 4.7 a novšie používajú nový tokenizér, ktorý pre rovnaký text vyprodukuje približne o 30 % viac tokenov. Pri migrácii zo staršieho modelu narastie účet aj pri nezmenenej sadzbe.
- Regionálne príplatky. Vynútenie spracovania v konkrétnom regióne stojí u Anthropicu 1,1-násobok štandardnej ceny. Pri požiadavkách na lokalitu dát s tým treba rátať.
Čo z toho pre viditeľnosť značky
Pokles ceny za token nie je len účtovná položka. Keď odpoveď stojí stotinu toho, čo pred rokom, oplatí sa generovať mnohonásobne viac odpovedí. Prakticky to znamená viac AI asistentov vo firmách, viac interných nástrojov a viac miest, kde niekto dostane odporúčanie dodávateľa bez toho, aby otvoril vyhľadávač.
Pre značku z toho plynie, že klasické sledovanie pozícií prestáva stačiť. Ak vás asistent nespomenie, nedozviete sa to z analytiky, pretože žiadna návšteva nevznikla. Rozdiely medzi modelmi v tom, koho citujú, sú pritom veľké, takže meranie má zmysel naprieč viacerými enginmi naraz. Podrobnejšie to rozoberáme v článku o čínskych modeloch a ich výkone a v texte o meraní Share of Voice.
Merajte, či vás AI odporúča
Sledovanie citácií vašej domény v ChatGPT, Perplexity, Gemini, Claude a Google AI Overviews. Audit domény je súčasťou registrácie.
Vyskúšať zadarmo →Metodika
Ceny sú prepísané z oficiálnych cenníkov k 11. augustu 2026 a v tabuľkách sú prelinkované na zdroj. Výnimkou sú modely OpenAI, kde oficiálna stránka neumožňuje automatizované načítanie a hodnoty pochádzajú zo sekundárnych prehľadov; tie sú v texte označené.
Prepočty v scenároch používajú plnú sadzbu bez cache a bez dávkovej zľavy, aby boli medzi modelmi porovnateľné. Reálny účet býva pri dobre nastavenej cache o 30 až 70 % nižší. Objemy tokenov v scenároch sú konzervatívne odhady typických nasadení, nie namerané hodnoty z konkrétnej firmy. Vlastnú spotrebu si zmerajte na vzorke niekoľkých stoviek dopytov, pretože sa medzi nasadeniami líši aj rádovo.
Často kladené otázky
Koľko stojí milión tokenov v roku 2026?
Podľa modelu od 0,28 dolára do 50 dolárov za milión výstupných tokenov. Najlacnejšou rozumnou voľbou je DeepSeek V4 Flash za 0,14 dolára na vstupe a 0,28 dolára na výstupe, najdrahšou Claude Fable 5 za 10 a 50 dolárov. Vstupné tokeny sú vždy lacnejšie než výstupné, obvykle päťkrát až šesťkrát.
Koľko tokenov je jedna normostrana textu?
Normostrana má 1800 znakov, čo v angličtine zodpovedá približne 450 tokenom. V slovenčine je to viac, obvykle 550 až 700 tokenov, pretože tokenizéry sú trénované prevažne na anglických dátach a slovenské slová sa rozpadajú na viac častí.
Prečo je výstup drahší než vstup?
Vstupné tokeny sa dajú spracovať naraz a paralelne, výstupné vznikajú postupne, jeden po druhom, a každý vyžaduje samostatný priechod modelom. Generovanie je preto výpočtovo náročnejšie. Pomer je u väčšiny poskytovateľov päť ku jednej, u OpenAI šesť ku jednej, u DeepSeeku len dva ku jednej.
Ako najrýchlejšie znížim účet za AI?
Zapnite cache na opakovaný kontext, čo pri Claude znamená desatinu ceny vstupu a pri DeepSeeku dve percentá. Ak výsledok nepotrebujete okamžite, použite dávkové spracovanie s 50-percentnou zľavou. Až potom riešte zmenu modelu, ktorá je najviditeľnejšia, ale nesie riziko zhoršenia kvality.
Oplatí sa prejsť z Claude alebo GPT na lacnejší model?
Závisí od úlohy. Pri klasifikácii, extrakcii dát a sumarizácii je rozdiel v kvalite malý a úspora môže byť päťdesiatnásobná. Pri generovaní obsahu a náročnom programovaní je odstup stále citeľný a náklad na model býva aj tak menší než čas človeka, ktorý výstup kontroluje. Rozhodnite podľa testu na vlastných dátach, nie podľa benchmarkov.
Zdražie Claude Sonnet 5?
Áno. Cena 2 doláre na vstupe a 10 dolárov na výstupe je podľa oficiálnej dokumentácie Anthropicu zavádzacia a platí do 31. augusta 2026. Od 1. septembra 2026 sa mení na 3 a 15 dolárov, teda o 50 percent vyššie.
Odporúčame prečítať
Sledujte, ako AI vyhľadávače citujú váš web
Vyskúšajte Optimalizáciu pre AI zadarmo