Virtual Arc Dnevnik
25. avgust 2026.

NVIDIA Groq 3 LPX ulazi u proizvodnju: 3.400 tokena u sekundi još nije proizvod

Hardverski rezultat može da pomeri očekivanja za latenciju agentskih sistema, ali bez javnog API pristupa, cene i datuma dostupnosti ovo je priprema za testiranje, ne signal za migraciju.

Virtual Arc · Urednička fotografija

Šta je pušteno u proizvodnju

NVIDIA je 24. avgusta objavila da su sistemi Groq 3 LPX na nivou celog serverskog reka ušli u serijsku proizvodnju. U testu koji je Artificial Analysis sproveo na NVIDIA infrastrukturi, Gemma 4 31B je pri ulaznom kontekstu od 100.000 tokena generisala 3.431 izlazni token u sekundi, približno četiri puta više od najbliže alternativne platforme.

Nebius je najavljen kao prvi AI cloud koji će ga uvesti, dok Groq takođe planira LPX kapacitet uz Vera Rubin NVL72. Međutim, nijedna objava još ne daje datum javnog API pristupa ni cenu.

Gde brzina menja računicu

U agentskom toku čekanje se sabira: sistem planira, poziva alat, proverava rezultat i ponavlja postupak kroz više uzastopnih generisanja. Brže dekodiranje zato može znatno da skrati ukupno vreme izvršavanja čak i kada se kvalitet modela ne promeni.

Ipak, broj tokena u sekundi nije isto što i trošak uspešno završenog zadatka. Redovi čekanja, obrada ulaznog konteksta, pozivi eksternim servisima, greške i ponovni pokušaji mogu da ponište prednost iz laboratorijskog testa.

Šta bismo uradili

Virtual Arc ne bi sada menjao arhitekturu zbog LPX-a. Zadržali bismo neutralan sloj za izbor provajdera, odvojeno merili čekanje, obradu konteksta, dekodiranje, rad alata i ponovne pokušaje, a zatim pripremili fiksan skup dugih i izlazno zahtevnih zadataka.

Kada se pojave stvaran API, cena i uslovi rada, pokrenuli bismo ograničen produkcioni pilot. Saobraćaj bismo preusmerili samo ako istovremeno padnu p95 vreme izvršavanja i trošak po uspešnom zadatku, bez pogoršanja pouzdanosti.

Naš stav

U Virtual Arcu ovo vidimo kao signal o budućem kapacitetu, a ne kao razlog za hitnu migraciju. Rezultat od 3.431 tokena u sekundi jeste važan zato što se kašnjenje pri dekodiranju množi kroz svaki korak dužeg agentskog toka; ako se ista prednost održi kroz javni API, mešovita opterećenja i veliki broj paralelnih zahteva, poslovi koji danas deluju kao spori batch procesi mogli bi da postanu interaktivni. Ali trenutno imamo rezultat jednog modela na infrastrukturi koju hostuje NVIDIA, bez javnog LPX endpointa, cene, posebnog SLA-a i nezavisnih podataka iz produkcije. Zato bismo sada ulagali u merljivost i prenosivost, a ne u arhitekturu vezanu za LPX: razdvojili bismo vreme obrade ulaznog konteksta, dekodiranja, čekanja, rada alata i ponovnih pokušaja, zadržali neutralan sloj za rutiranje i pripremili stabilan evaluacioni skup. Kada kapacitet postane javno dostupan, testirali bismo samo tokove sa dugim kontekstom i velikim izlazom, a produkcioni saobraćaj preusmerili tek ako istovremeno dobijemo niži trošak po uspešno završenom zadatku i bolje p95 vreme, bez pada pouzdanosti. Račun ne plaćaju tokeni u sekundi, već tačno završen posao.

Izvori
  1. With Groq 3 LPX in Full Production, NVIDIA Extends Vera Rubin Inference for Agents
  2. How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context on NVIDIA Vera Rubin
  3. Groq Among the First to Bring NVIDIA Groq 3 LPX and Vera Rubin NVL72 to Market
  4. Nvidia’s dedicated inference accelerator Groq 3 LPX enters full production to supercharge AI agents

← Sve objave