Cena Claude Haiku 5.5 pretvara kontrolu konteksta u produkcioni zahtev
Anthropicov novi mali model dovoljno je jeftin i brz za ozbiljan produkcioni pilot, ali petostruki skok cene iznad 100.000 tokena kažnjava neuredan kontekst.
Šta je lansirano
Anthropic je 7. oktobra objavio Claude Haiku 5.5, sa kontekstom od milion tokena, izlazom do 128.000 tokena i podesivim nivoom napora. Model je dostupan kroz Claude API, Amazon Bedrock, Google Cloud i Microsoft Foundry. U Anthropicovoj tabeli evaluacija beleži 39,2% na Terminal-Bench 4.0 i 72,4% na offline podskupu OSWorld 2.1; Sonnet 5.5 je i dalje znatno jači na zahtevnijem testu programiranja.
Skrivena granica
Početna cena je 0,10 dolara za milion ulaznih i 0,50 dolara za milion izlaznih tokena, ali samo za promptove do 100.000 tokena. Iznad te granice obe cene rastu pet puta, a dokumentacija navodi da novi tokenizer isti tekst računa kao približno 30% više tokena nego Haiku 4.5.
Kako bismo ga pustili
Virtual Arc bi ga najpre testirao kao radni model iza rutera: za klasifikaciju, ekstrakciju, sažimanje konteksta, kratke preglede i uske podagente, a ne kao vodeći model za duge i nejasne tokove rada. U produkciju bi ušao samo tamo gde na stvarnim tragovima smanjuje trošak po uspešno završenom zadatku uz prihvatljiv kvalitet i p95 latenciju.
Claude Haiku 5.5 je retko izdanje malog modela koje treba odmah da promeni rutiranje produkcionog saobraćaja, a ne tek plan za sledeći kvartal. Virtual Arc ga ne bi postavio kao vodeći model za složeno rezonovanje ili programiranje; stavili bismo ga iza rutera za jasno ograničene zadatke velikog obima — klasifikaciju, ekstrakciju, sažimanje konteksta, kratke preglede i uske podagente — i merili trošak po uspešno završenom zadatku i p95 vreme izvršenja. Oglašena cena od 0,10/0,50 dolara za milion ulaznih/izlaznih tokena važi samo dok prompt ne pređe 100.000 tokena; iznad te granice obe cene rastu pet puta, dok Anthropic navodi da novi tokenizer isti tekst računa kao približno 30% više tokena nego Haiku 4.5. Zato kontrola konteksta nije fusnota na računu već deo arhitekture. Uradili bismo nedelju dana paralelnih testova na stvarnim tragovima, bez uticaja na korisnike, ograničili kontekst i nivo napora, pa model pustili samo tamo gde kvalitet ostaje stabilan. Za duge i neuredne agentske petlje zadržali bismo jači model i ne bismo od jeftinog radnika pravili skupog generalistu.