Virtual Arc Dnevnik
23. avgust 2026.

Nvidia AVO pokazuje da arhitektura agenta može biti važnija od modela

Savršen rezultat na javnom ARC-AGI-3 skupu nije razlog za zamenu modela, ali jeste razlog da orkestracioni sloj merimo kao deo proizvoda.

Virtual Arc · Urednička fotografija

Šta se promenilo

Nvidia je 21. avgusta objavila da je AVO, koristeći Claude Opus 5, završio svih 183 nivoa u 25 okruženja javnog ARC-AGI-3 skupa. Sistem je ostvario 100 RHAE poena sa 6.624 akcije, oko 12% manje od VISTA sistema sa istom porodicom modela.

Šta rezultat govori

ARC Prize za Claude Opus 5 kao model navodi 30,16%, ali Nvidia naglašava da postavke nisu direktno uporedive. VISTA i Tycho su takođe ranije stigli do 100 poena, pa prava vest nije prvi savršen rezultat, već dodatni dokaz da memorija, nadzor, alatke i oporavak mogu presudno promeniti ponašanje dugotrajnih agenata.

Šta bismo uradili

Ne bismo pokretali migraciju modela na osnovu ovog rezultata. Zadržali bismo postojeći model i odvojeno testirali trajnu memoriju, nadzor i verifikaciju na sopstvenim zadacima, sa tvrdim ograničenjima troška i ovlašćenja. U produkciju bismo pustili samo varijantu koja smanjuje cenu završenog zadatka, broj ponavljanja i potrebu za ljudskim spasavanjem procesa.

Naš stav

Za tim koji gradi i održava produkcioni softver, najvažnija poruka nije da je još jedan sistem dobio savršen rezultat na javnom benchmarku. Važnije je to što rezultat dodatno ruši pretpostavku da se kvalitet agenta prvenstveno kupuje zamenom modela. Nvidia je oko Claude Opus 5 izgradila AVO sa trajnom memorijom, nadzorom, alatima i petljom za oporavak; kompletan sistem je ostvario 100 poena, dok ARC Prize za sam model, u drugačijoj postavci, navodi 30,16%. Pošto su i VISTA i Tycho već rešili isti javni skup, ovo nije dokaz da je Nvidia „rešila inteligenciju“, niti kontrolisana izolacija doprinosa pojedinačnih komponenti. Ipak, smer je dovoljno jasan da promeni naš plan rada. Virtual Arc ne bi sada menjao model. Prvo bismo oko postojećeg modela zasebno testirali trajno stanje, nadzorni agent, verifikaciju i oporavak, uz merenje cene po završenom zadatku, latencije, broja ponovljenih pokušaja i potrebe za ljudskom intervencijom. Ako taj sloj ne smanji ukupan trošak i operativni rizik, savršen benchmark nam nije dovoljan razlog da ga pustimo u produkciju.

Izvori
  1. NVIDIA AVO Reaches 100% on ARC-AGI-3, Demonstrating a Frontier-Level General-Purpose Architecture for Long-Horizon Autonomous Agents
  2. Claude Opus 5 - ARC-AGI Results
  3. VISTA: A Visual Harness for Reasoning in an Interactive World
  4. Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

← Sve objave