OpenAI nedávno představila nový model GPT-6 Astra, kterému se povedlo už dlouho neviděné. Na platformě OpenRouter se totiž po dlouhé době povedlo firmě OpenAI předehnat Anthropic.
LLM si můžete spustit mnoha různými způsoby. Většina z nás používá webové rozhraní s chatboty, kdy můžeme zdarma nebo za předplatné přistupovat k nejmodernějším modelům s biliony parametrů. Rozmáhají se ale i jiné způsoby. Jedním z nich je lokální běh modelů na GPU, nicméně tady je velkým limitem VRAM a třeba taková 16GB paměť s výraznějšími kvantizacemi dovolí rozběhnout modely tak do těch 30-35 mld. parametrů, pokud to má aspoň trochu fungovat (tzn. nebýt pekelně pomalé přetokem do pomalé RAM).
Kdo ale chce a trochu si spočítá náklady na běh takových lokálních LLM, asi rychle zjistí, že pokud nepotřebuje mít 100% jistotu ohledně ochrany dat, může být mnohem výhodnější to spustit přes API na externích platformách, jako je OpenRouter. Tady sice platíte za každý token na vstupu i výstupu, nicméně můžete mít přístup k méně agresivní kvantizaci, výsledky dostanete rychleji a můžete využít i výkonnější modely s větším množstvím parametrů. V mnoha případech vás volání vyjde levněji, než spálená elektřina na doma běžícím modelu, jehož rychlost je mnohdy zlomková.
A právě na této platformě se stala pozoruhodná změna. V boji Anthropicu proti OpenAI to už 2,5 roku bez přestávky vyhrávaly modely od Anthropicu. Např. letos od ledna do května si v tomto duelu obvykle držely 70-80 %, pro OpenAI tak zbývalo 20-30 %. Od června se to s GPT-5.6 začalo docela měnit a OpenAI se začal pohybovat spíše okolo 35-40 %. Na začátku září se ale s uvedením GPT-6 Astra povedlo překonat 2,5letou nadvládu Anthropicu a duel těchto dvou velikánů po dlouhé době vyhrálo OpenAI. Astra sama si vzala 19 %.
Pro představu, Astra chce za milion vstupních tokenů 10 USD, u výstupu je to dokonce 50 USD. V případě cache (shoda vstupu při dalším volání, typické např. při klasifikačních úlohách s dlouhým systémovým promptem, agentních smyčkách, dlouhých kontextech…) je to pak 1 USD. Toto platí pro běh na serverech Azure i OpenAI. Zatímco Azure si nenechává prompty a nepoužívá nic k trénování, OpenAI si po omezenou dobu prompty ukládá, ale netrénuje na nich. K dispozici je i režim Flex (5/25/0,5 USD) a Fast (20/100/2 USD) s různými prioritami.
Pokud se povídáme k Anthropicu, jeho Claude Fable 5.1 má sice stejný vstup za 10 USD na milion vstupních tokenů a 50 USD na milion výstupních, jeho využití cache je ale podstatně levnější jen za 0,25 USD.





















