Gemini 3.8 Live čini glasovne agente vrednim produkcionog pilota
Google je pustio glasovne modele koji razgovaraju dok u pozadini pozivaju alate i obrađuju složene zadatke. Tehnologija je spremna za ograničen produkcioni pilot, ali ekonomika dugih sesija i dalje zahteva pažljivo merenje.
Šta je isporučeno
Google je 15. septembra pustio Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking u opštu dostupnost kroz Gemini API. Osnovni model je namenjen razgovoru sa malim kašnjenjem, dok Extended Thinking može da rezonuje i poziva alate u pozadini bez prekidanja razgovora.
Jak, ne i gotov
Google za Extended Thinking navodi rezultat 82,6 i prvo mesto na Artificial Analysis Speech to Speech indeksu, kao i 68,6% na testu τ-Voice. To je dovoljno da opravda testiranje, ali rezultat od 35,1% na bankarskoj varijanti Sierra testa pokazuje da složeni tokovi još nisu rešena stvar.
Cena sesije
Objavljene cene iznose 0,005 dolara po minutu ulaznog zvuka i 0,018 dolara po minutu izlaznog zvuka. Međutim, Live API ponovo obrađuje zadržani kontekst pri narednim potezima, dok je proaktivno slušanje na modelima 3.8 stalno uključeno, pa duga sesija može imati znatno drugačiju ekonomiku od kratkog demo razgovora.
Naš potez
Virtual Arc bi počeo jednim jasno ograničenim tokom, sa ljudskom eskalacijom i merljivim završnim stanjem. Osnovni model bismo koristili za rutinske poteze, Extended Thinking samo za složene grane, a odluku o širenju donosili tek prema ceni i pouzdanosti kompletno završenog zadatka.
U Virtual Arcu smatramo da je Gemini 3.8 Live dovoljan razlog da glasovni agent uđe u kontrolisan produkcioni pilot, ali ne i da zbog njega prepravljamo celu platformu. Najvažnija promena nije prijatniji glas, već to što sesija može da nastavi razgovor dok se alati izvršavaju, a Extended Thinking da paralelno vodi rezonovanje kroz više koraka. Time nestaje deo neprijatne tišine zbog koje glasovni sistemi sa alatima deluju pokvareno. Ipak, istaknuta cena po minutu ne opisuje stvarni trošak: zadržani kontekst se ponovo obrađuje u narednim potezima, proaktivno slušanje je stalno uključeno, a tokeni razmišljanja ulaze u izlaznu potrošnju. Mi bismo jednostavne poteze usmerili na osnovni model, samo stvarno složene zahteve prebacivali na Extended Thinking, agresivno sažimali kontekst i pilot ocenjivali prema ceni po tačno završenom zadatku, oporavku posle prekidanja, pogrešnim pozivima alata i kvalitetu predaje čoveku. Zadržali bismo i tanak adapterski sloj iznad Live API-ja. Pobeda na rang-listi nije dovoljan razlog za vezivanje proizvoda za jednog dobavljača.