Ve zkratce
  • Fable 5.1 a Mythos 5.1 vyšly 1. září. Cena modelu se nezměnila — vstup 10, výstup 50 USD za milion tokenů.
  • Zlevnila jediná položka: čtení z cache, o 75 % na 0,25 USD za milion tokenů.
  • Podle Anthropicu to sníží běžný účet o ~25 % a účet výrazně agentických nasazení až o 45 % — jsou to jeho odhady, ne nezávislé měření.
  • Nejvíc to pocítí AI asistenti a agenti nad firemní znalostní bází. Jednorázové dotazy nezlevnily vůbec.

Anthropic vydal 1. září nové verze svých nejvyšších modelů — Fable 5.1 a Mythos 5.1. Titulky hlásí levnější AI a čísla jako 45 % vypadají lákavě. Než ale přepočítáte rozpočet, vyplatí se rozumět tomu, co přesně zlevnilo — protože to není model.

Co se doopravdy změnilo

Ceník modelu zůstal, jaký byl: 10 dolarů za milion vstupních a 50 dolarů za milion výstupních tokenů. Kdo posílá modelu otázky a čte odpovědi, platí přesně tolik, co minulý týden.

Klesla jedna jediná položka — čtení z cache, z 1 dolaru na 0,25 dolaru za milion tokenů. Cache je mechanismus, kterým si model „pamatuje“ kontext, který jste mu už jednou poslali: systémové instrukce, popisy nástrojů, firemní dokumenty. Místo toho, abyste je při každém požadavku platili znovu v plné ceně, platíte za jejich opětovné načtení zlomek.

A právě tady je celý příběh. U jednorázové otázky neušetříte ani cent. U systému, který dokola pracuje nad stejným kontextem, je to největší položka účtu.

Proč to nejvíc pocítí agenti

Agentická úloha znamená, že AI neudělá jednu odpověď, ale posloupnost kroků — načte e-mail, vytáhne z něj údaje o faktuře, ověří je proti objednávce, zapíše výsledek a připraví odpověď. Při každém z těch kroků potřebuje znovu celý svůj kontext: instrukce, popisy nástrojů, dosavadní průběh práce.

V praxi to znamená, že agent čte stejný kontext desítky krát za jednu úlohu. Proto Anthropic odhaduje, že běžná nasazení zlevní kolem 25 % a ta výrazně agentická až o 45 % — čím víc kroků nad stejným kontextem, tím větší podíl účtu tvořilo čtení cache.

Jedno upozornění k těm číslům: jsou to odhady Anthropicu z jeho vlastního srpnového provozu, ne nezávislé měření. První externí testy se zatím neshodují v tom, jestli cena za jednu celou úlohu reálně klesla. Řádově ta čísla sedí, ale při vlastním nasazení si spotřebu přepočítejte.

Co to znamená v penězích pro běžnou firmu

Vezměme si asistenta na webu, který odpovídá zákazníkům z firemní znalostní báze — ceník, služby, podmínky, návody. Ta báze se posílá s každou otázkou. Dosud tvořilo její opakované načítání podstatnou část měsíčního účtu; nově stojí čtvrtinu.

Stejná logika platí pro AI agenty, kteří zpracovávají doklady, třídí e-maily nebo pracují nad interními daty. Nasazení, která před půl rokem vycházela na desítky eur měsíčně za samotné API, se posouvají k jednotkám eur — a ta, která se kvůli ceně odkládala, se vyplatí přepočítat znovu.

Do třetice připomeňme srpnový vývoj cen: tlak jde ze všech stran najednou. Google tlačí cenu rychlých modelů, Anthropic zlevňuje provoz agentů. Pro firmy to znamená jediné — provozní náklady na AI klesají rychleji, než většina rozpočtů počítá.

Kdy vás to nezajímá

  • Používáte AI přes chat (ChatGPT, Claude.ai a podobně) — předplatné se nemění, tohle je o API cenách.
  • Máte jednorázové dotazy bez sdíleného kontextu — překlad, souhrn, ad hoc otázka. Tam se za cache neplatí a nezměnilo se nic.
  • Běží vám řešení na levnějším modelu a stačí — přechod na Fable kvůli levnější cache by účet naopak zvýšil. Fable má smysl tam, kde je potřeba jeho kvalita.

Nevíte, do které skupiny patříte? Napište nám dvě věty o tom, co chcete automatizovat, a do 24 hodin řekneme, jestli a kolik by to při dnešních cenách stálo. Zdarma a bez telefonátů.

Co s tím udělat tento měsíc

  • Pokud jste AI nasazení odložili kvůli ceně — přepočítejte ho. Hlavně chatboty nad znalostní bází a zpracování dokladů vycházejí citelně jinak než na jaře.
  • Pokud už asistenta nebo agenta provozujete — podívejte se, jestli využívá cache. Překvapivě mnoho nasazení posílá celý kontext při každém požadavku v plné ceně, a to i před tímto zlevněním zbytečně.
  • Pokud odpověď není potřeba okamžitě — dávkové zpracování je za polovinu. U nočního zpracování dokladů je to dalších 50 % dolů.

Časté otázky

Zlevnila tedy AI, nebo ne?
Cena za nové tokeny — tedy za to, co modelu pošlete poprvé, a za to, co vám odpoví — se nezměnila vůbec. Zůstává na 10 a 50 dolarech za milion. Levnější je jen opakované čtení už jednou poslaného kontextu z cache, o 75 %. U jednorázového dotazu tedy neušetříte nic, u asistenta, který dokola pracuje nad stejnou znalostní bází, výrazně.
Co je agentická úloha?
AI, která místo jedné odpovědi udělá posloupnost kroků — načte dokument, vytáhne z něj údaje, ověří je v jiném systému, zapíše výsledek. Při každém kroku potřebuje znovu stejný kontext: instrukce, popisy nástrojů a dosavadní průběh. Právě proto tvoří opakované čtení u agentů velkou část účtu.
Jsou ta čísla 25 a 45 procent spolehlivá?
Jsou to odhady Anthropicu z jeho vlastního provozu za čtyři srpnové týdny, ne nezávislé měření. Nezávislé testy se zatím neshodují, jestli cena za jednu úlohu reálně klesla. Berte ta čísla jako řádovou indicii a při vlastním nasazení si přepočítejte skutečnou spotřebu.
Vyplatí se kvůli tomu měnit model, který už používáme?
Ne automaticky. Pokud vaše řešení běží na levnějším modelu a kvalita stačí, změna vám účet nesníží. Přepočítat se vyplatí tam, kde jste nasazení odložili kvůli ceně, nebo kde běží asistent nad velkou firemní bází a měsíční náklady vás trápí.
Dá se ušetřit i jinak než změnou modelu?
Ano a často výrazněji. Velká část nákladů bývá v tom, že se modelu při každém dotazu posílá zbytečně mnoho kontextu, nebo že se dotazy nezpracovávají dávkově. Dávkové zpracování je u Anthropicu za polovinu ceny, ale hodí se jen tam, kde odpověď není potřeba okamžitě.

Závěr

Fable 5.1 není revoluční model — je to změna účtování, která zvýhodňuje přesně ten typ nasazení, jaký firmy reálně potřebují: asistenty a agenty nad vlastními daty. Pokud jste si na jaře řekli, že se to ještě nevyplatí, čísla se mezitím změnila. Stavíme AI řešení pro firmy včetně napojení na existující systémy — napište nám a přepočítáme to na vašem případě.

Autor Ondrej Remeselník

Zakladatel a vývojář DataStorm. Ve vývoji softwaru od roku 1999 — weby, aplikace a systémy pro firmy jako IAD Investments, DPD či SME. Píše z praxe, ne z doslechu.