GPT-6 Sol i Luna čine rutiranje modela podrazumevanom arhitekturom
Najvažnija promena nije novi apsolutni pobednik benchmarka, već znatno jeftiniji niži nivo koji timovi mogu da koriste kao prvi prolaz — ako mere cenu završenog zadatka, a ne samo cenu tokena.
Šta je lansirano
OpenAI je 22. septembra lansirao GPT-6 Sol i GPT-6 Luna kroz API. Za zahteve do 272.000 ulaznih tokena Sol košta 2 dolara po milionu ulaznih i 10 dolara po milionu izlaznih tokena, dok Luna košta 0,10 i 0,50 dolara. Oba modela imaju kontekst od 1,05 miliona tokena i maksimalni izlaz od 128.000 tokena.
Benchmark koči euforiju
Na AutomationBench testu, koji strogo proverava konačno stanje poslovnog procesa, GPT-6 Sol sa xhigh nivoom rezonovanja ostvario je 33,2% uz prosečnu cenu od 0,27 dolara po zadatku. To je privlačna operativna tačka, ali i jasno upozorenje: jeftiniji pokušaj nije isto što i pouzdano izvršenje.
Šta bismo pustili
Mi bismo Lunu postavili kao prvi izbor samo za jasno ograničene i lako proverljive korake, uz automatsko prebacivanje težih ili neuspešnih zahteva na Sol. Posebno bismo pratili dugačke promptove: iznad 272.000 ulaznih tokena ulaz i keš postaju dvostruko skuplji, a izlaz poskupljuje 50%, pa loše upravljanje kontekstom lako pojede deo uštede.
Stav Virtual Arc-a je da je GPT-6 Luna važniji deo ovog lansiranja od skupljeg modela Sol. Cena od 0,10 dolara za milion ulaznih i 0,50 dolara za milion izlaznih tokena dovoljno je niska da menja arhitekturu sistema: više nema mnogo smisla slati svaki zahtev istom jakom modelu. Ipak, niska cena tokena nije isto što i niska cena uspešno završenog zadatka. AutomationBench pokazuje da čak i Sol na xhigh nivou završava 33,2% strogo ocenjenih tokova rada, pa ovo nije trenutak da agentima prepustimo poslovne procese bez kontrole. Mi bismo odmah testirali Lunu u shadow režimu za klasifikaciju, ekstrakciju, rutinske izmene koda i ograničene pozive alata, dok bi Sol ili postojeći provereni model ostao putanja za izuzetke. Odluku o prelasku donosili bismo tek na osnovu cene po završenom zadatku, P95 latencije, broja ponovljenih poziva i tačnosti konačnog stanja. Drugim rečima: vredi početi sada, ali kroz sloj za rutiranje, a ne kroz masovnu migraciju.