Virtual Arc Dnevnik
28. avgust 2026.

Qwen3.8-Flash obara cenu AI obrade dugog konteksta

Novi Qwen model kombinuje kontekst od milion tokena sa cenom od 0,15 dolara za ulaz i 0,47 za izlaz po milionu tokena, dok otvorene težine nude put ka sopstvenom hostingu pod posebnom licencom.

Virtual Arc · Urednička fotografija

Šta je stiglo

Qwen je 26. avgusta objavio težine modela Qwen3.8-Flash-Next, eksperimentalnog pregleda arhitekture planirane za Qwen4. Produkciona API varijanta Qwen3.8-Flash nudi kontekst od milion tokena, kompatibilnost sa OpenAI i Anthropic protokolima i cenu od 0,15 dolara za ulaz i 0,47 dolara za izlaz po milionu tokena.

Pravi test

Najvažniji rezultat nije bilo koji pojedinačni benchmark, već dovoljno velika razlika u ceni da postojeće usmeravanje zahteva mora ponovo da se proveri. Interni rezultati proizvođača i testovi na novom hardveru još ne dokazuju pouzdanost na našim podacima, alatima i obrascima grešaka.

Naš potez

Virtual Arc bi odmah dodao model u evaluacioni sistem, ali ne i u podrazumevanu produkcionu putanju. Prvo bismo koristili preslikani saobraćaj i ograničen skup reverzibilnih poslova, a zatim širili upotrebu samo ako ukupni trošak, latencija i stopa uspeha nadmaše postojeću opciju.

Otvorene težine smanjuju zavisnost od jednog API dobavljača, ali licenca zahteva posebnu dozvolu za određene MaaS proizvode i AI asistente za kodiranje ili kancelarijski rad. Provera licence mora prethoditi svakoj odluci o sopstvenom hostingu.

Naš stav

Qwen3.8-Flash nije razlog da ove nedelje preselimo produkcioni stek; jeste razlog da više ne prihvatamo cenovnike vodećih modela bez direktnog testa. Sa cenom od 0,15 dolara po milionu ulaznih tokena i 0,47 dolara za izlazne, ovaj model može bitno promeniti računicu za obimne i ponovljive poslove. Virtual Arc bi ga prvo postavio iza postojećeg modelskog prolaza i proverio na stvarnim zadacima niskog rizika: obradi dokumenata, klasifikaciji, pretrazi repozitorijuma i analizi koda. Merili bismo trošak po prihvaćenom rezultatu, P95 latenciju, neuspešne pozive alata, broj ponovljenih pokušaja i tačnost pri dugom kontekstu, a ne samo cenu tokena. Ako prođe pragove, dobio bi kontrolisani deo saobraćaja; poslovi okrenuti korisnicima i zadaci sa velikim posledicama ostali bi na dokazanim modelima. Ne bismo olako birali sopstveni hosting: glavni model od 125 milijardi parametara, dodatnih 51 milijarda parametara u embedding sloju i posebna Qwen Community License 1.0 pretvaraju tu odluku u infrastrukturni i pravni projekat. Jeftini tokeni su poziv na merenje, ne dokaz jeftino završenog rada.

Izvori
  1. Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency
  2. Qwen3.8-Flash model, pricing and API availability
  3. Qwen3.8-Flash-Next model card and weights
  4. Qwen Community License 1.0
  5. Qwen3.8-Flash-Next repository and deployment instructions
  6. NVIDIA deployment testing for Qwen3.8-Flash-Next

← Sve objave