Qwen3.8-Flash obara cenu AI obrade dugog konteksta
Novi Qwen model kombinuje kontekst od milion tokena sa cenom od 0,15 dolara za ulaz i 0,47 za izlaz po milionu tokena, dok otvorene težine nude put ka sopstvenom hostingu pod posebnom licencom.
Šta je stiglo
Qwen je 26. avgusta objavio težine modela Qwen3.8-Flash-Next, eksperimentalnog pregleda arhitekture planirane za Qwen4. Produkciona API varijanta Qwen3.8-Flash nudi kontekst od milion tokena, kompatibilnost sa OpenAI i Anthropic protokolima i cenu od 0,15 dolara za ulaz i 0,47 dolara za izlaz po milionu tokena.
Pravi test
Najvažniji rezultat nije bilo koji pojedinačni benchmark, već dovoljno velika razlika u ceni da postojeće usmeravanje zahteva mora ponovo da se proveri. Interni rezultati proizvođača i testovi na novom hardveru još ne dokazuju pouzdanost na našim podacima, alatima i obrascima grešaka.
Naš potez
Virtual Arc bi odmah dodao model u evaluacioni sistem, ali ne i u podrazumevanu produkcionu putanju. Prvo bismo koristili preslikani saobraćaj i ograničen skup reverzibilnih poslova, a zatim širili upotrebu samo ako ukupni trošak, latencija i stopa uspeha nadmaše postojeću opciju.
Otvorene težine smanjuju zavisnost od jednog API dobavljača, ali licenca zahteva posebnu dozvolu za određene MaaS proizvode i AI asistente za kodiranje ili kancelarijski rad. Provera licence mora prethoditi svakoj odluci o sopstvenom hostingu.
Qwen3.8-Flash nije razlog da ove nedelje preselimo produkcioni stek; jeste razlog da više ne prihvatamo cenovnike vodećih modela bez direktnog testa. Sa cenom od 0,15 dolara po milionu ulaznih tokena i 0,47 dolara za izlazne, ovaj model može bitno promeniti računicu za obimne i ponovljive poslove. Virtual Arc bi ga prvo postavio iza postojećeg modelskog prolaza i proverio na stvarnim zadacima niskog rizika: obradi dokumenata, klasifikaciji, pretrazi repozitorijuma i analizi koda. Merili bismo trošak po prihvaćenom rezultatu, P95 latenciju, neuspešne pozive alata, broj ponovljenih pokušaja i tačnost pri dugom kontekstu, a ne samo cenu tokena. Ako prođe pragove, dobio bi kontrolisani deo saobraćaja; poslovi okrenuti korisnicima i zadaci sa velikim posledicama ostali bi na dokazanim modelima. Ne bismo olako birali sopstveni hosting: glavni model od 125 milijardi parametara, dodatnih 51 milijarda parametara u embedding sloju i posebna Qwen Community License 1.0 pretvaraju tu odluku u infrastrukturni i pravni projekat. Jeftini tokeni su poziv na merenje, ne dokaz jeftino završenog rada.