Claude Fable 5.1 spušta cenu agentskih zadataka, ali prelazak prvo mora da prođe produkcioni test
Novi Anthropic model donosi jače agentske rezultate, 75% jeftinije čitanje iz keša i široku dostupnost preko cloud platformi.
Šta je lansirano
Anthropic je 1. septembra objavio Claude Fable 5.1. Osnovna cena ostaje 10 dolara za milion ulaznih i 50 dolara za milion izlaznih tokena, dok je čitanje iz keša pojeftinilo 75%, na 0,25 dolara za milion tokena.
Prema Anthropicovim rezultatima, model postiže 55,8% na Terminal-Bench 4.0 naspram 42,0% za Fable 5, kao i 52,6% naspram 24,7% na Terminal-Bench-Science 0.1. Model je odmah dostupan preko Anthropic API-ja i velikih cloud platformi.
Zašto je bitno
Kod dugotrajnih agenata najveći račun često ne pravi jedan upit, već stalno ponovno učitavanje repozitorijuma, dokumentacije, istorije i izlaza alata. Zato niža cena keširanog konteksta može biti važnija od nepromenjene osnovne cene tokena.
Anthropic procenjuje oko 25% niži trošak tipičnih opterećenja i uštedu do približno 45% kod izrazito agentskih poslova. To su procene dobavljača, pa ih treba potvrditi na sopstvenim tokovima rada.
Šta bismo uradili
Mi bismo pustili Fable 5.1 paralelno sa postojećim modelom na stvarnim, prethodno zabeleženim zadacima i merili cenu po prihvaćenom rezultatu, latenciju i stopu intervencija. Prelazak ima smisla za dugotrajno programiranje i analizu samo ako smanjuje ukupan broj pokušaja i ljudskih ispravki.
Jednostavne upite bismo i dalje slali jeftinijem modelu. Posebno bismo testirali bezbednosne tokove, jer zaštitna pravila i dalje preusmeravaju penetraciono testiranje, generisanje exploit-a i analizu binarnih ranjivosti.
Naš stav u Virtual Arc-u je da Fable 5.1 treba odmah uvesti u ozbiljan produkcioni test, ali ga ne treba automatski postaviti kao podrazumevani model. Najvažnija promena nije pobeda na još jednom benchmarku, već 75% niža cena čitanja iz keša, jer dugotrajni agenti neprestano ponovo koriste isti kontekst, dokumentaciju i rezultate alata. To može primetno spustiti cenu po završenom zadatku, ali samo ako model zaista isporučuje prihvatljiv rezultat uz manje ponavljanja i ljudskih ispravki. Mi bismo ga paralelno testirali na sačuvanim produkcionim zahtevima, merili cenu po prihvaćenom rezultatu, p95 latenciju, stopu neuspeha i intervencije zaštitnih mehanizama. Zadržali bismo jeftiniji model za jednostavne upite, a Fable 5.1 uključili za višesatno programiranje, analizu incidenata i složene tokove rada samo tamo gde podaci pokažu stvarnu operativnu prednost. Za bezbednosne procese ne bismo ga menjali bez dodatne provere, pošto određeni zadaci i dalje mogu biti preusmereni ili zaustavljeni.