Gemini 3.8 Flash: Merite cenu zadatka pre migracije
Googleov novi stabilni Flash model donosi bolje agentske rezultate bez veće promotivne cene tokena, ali nezavisna merenja pokazuju da režim visokog rezonovanja troši više po završenom zadatku.
Šta je stiglo
Google je 2. septembra pustio Gemini 3.8 Flash kao stabilan, produkciono dostupan API model. Podržava kontekst do milion tokena, izlaz do 64 hiljade tokena, rad sa alatima i nizak, srednji ili visok nivo rezonovanja.
Promotivna globalna cena ostaje 0,75 dolara za milion ulaznih i 3,75 dolara za milion izlaznih tokena do 31. decembra 2026. Od 1. januara 2027. obe cene se udvostručuju.
Skriveni račun
Google otvoreno navodi da 3.8 na složenim zadacima pravi više koraka, češće poziva alate i proverava sopstveni rad. Artificial Analysis je izmerio bolji rezultat od verzije 3.7, ali i 30% više izlaznih tokena u režimu visokog rezonovanja.
Zato je procenjena cena zadatka porasla oko 40%, sa 0,40 na 0,58 dolara, dok je prosečno vreme zadatka poraslo sa 2,2 na 2,5 minuta. Ista cena tokena, dakle, ne znači isti produkcioni trošak.
Naš potez
Ne bismo menjali model u celoj aplikaciji jednim potezom. Najpre bismo usmerili reprezentativan uzorak dugih programerskih i agentskih poslova ka verziji 3.8, uz iste alate, ograničenja i kriterijume prihvatanja koje koristi postojeći sistem.
Merili bismo cenu uspešno završenog zadatka, p95 latenciju, broj poziva alata, ponovne pokušaje i vreme ljudske dorade. Model 3.8 postao bi podrazumevani samo u rutama gde dodatno rezonovanje dokazano smanjuje ukupan trošak.
Gemini 3.8 Flash vredi odmah testirati, ali ga ne bismo automatski postavili kao podrazumevani model samo zato što je Google zadržao istu promotivnu cenu tokena kao za verziju 3.7. Za tim koji vodi produkciju tokeni su ulazni trošak, dok je završen zadatak stvarna jedinica vrednosti. Nezavisno testiranje pokazuje da režim visokog rezonovanja podiže Intelligence Index sa 56 na 59, ali uz 30% više izlaznih tokena, rast cene prosečnog zadatka sa 0,40 na 0,58 dolara i produženje vremena zadatka sa 2,2 na 2,5 minuta. To i dalje može biti odlična razmena ako bolji prvi rezultat uklanja ponovne pokušaje, ručne ispravke i neuspele petlje sa alatima, ali tu računicu ne može da potvrdi dobavljačev zbirni benchmark. Mi u Virtual Arcu bismo model 3.8 postavili iza rutera, paralelno ga merili na dugim programerskim i agentskim poslovima, koristili srednji ili niski nivo rezonovanja kao početnu tačku i zadržali 3.7 za brz povratak. Prebacili bismo produkcioni saobraćaj samo tamo gde stopa završenih zadataka i vreme popravke opravdavaju veći račun, uz budžet zasnovan na standardnoj ceni od 1. januara 2027, a ne na privremenom popustu. Naša odluka je jasna: testirati sada, migrirati selektivno i ne mešati nepromenjenu cenu tokena sa nepromenjenom cenom produkcije.