13. septembar 2026.

Claude Code evaluacije pretvaraju agent veštine u softver koji može da se proveri

Anthropic je dodao testove ponašanja, poređenje bez dodatka i CI pragove. To agent veštine čini merljivijim, ali uvodi novi trošak i novu tačku vezivanja za dobavljača.

Virtual Arc · Urednička fotografija

Šta je objavljeno

Anthropic je 11. septembra u Claude Code 2.1.269 dodao komandu za evaluaciju dodataka. Ona pokreće realistične zahteve, ocenjuje odgovor pomoću šest vrsta provera i pravi JSON i HTML izveštaje koji mogu da se koriste kao uslov u CI procesu.

Zašto je važno

Svaki slučaj može da se izvrši i sa dodatkom i bez njega. Razlika između rezultata pokazuje da li je veština zaista poboljšala ishod ili bi Claude rešio zadatak i bez nje, što olakšava otkrivanje regresija posle izmene dodatka ili modela.

Kako bismo ga koristili

Svako izvršavanje agenta i svako ocenjivanje drugim modelom troši raspoloživi paket ili API budžet. Mi bismo zato blokirali spajanje koda samo malim skupom stabilnih testova, dok bi se kompletna evaluacija izvršavala periodično i uz unapred zadato ograničenje troška.

Naš stav

U Virtual Arc-u smatramo da su evaluacije dodataka važnije za produkcione agente od još jedne male prednosti na benčmarku. Agent koji dobro radi tokom demonstracije, a zatim prestane da aktivira pravu veštinu posle izmene opisa ili promene modela, nije proizvod već skriven operativni rizik. Poređenje sa izvršavanjem bez dodatka konačno razdvaja stvarnu vrednost veštine od onoga što bi osnovni model ionako uradio. Mi bismo ovu mogućnost odmah uveli za kritične Claude Code dodatke, ali ne bismo prebacili celu strategiju testiranja u Anthropicov format. Držali bismo mali, obavezni skup stabilnih testova u svakom pull requestu, a širi i skuplji paket pokretali periodično. Fiksirali bismo verziju, model i ograničenje troška, pratili varijabilnost rezultata i čuvali iste ulaze i očekivane ishode u prenosivom formatu. Vredi koristiti alat sada, ali ne i dozvoliti da testovi koji treba da smanje rizik postanu novi izvor vezivanja za jednog dobavljača.

Izvori
  1. Test plugins with evals — Claude Code Docs
  2. Claude Code changelog
  3. Claude Code CHANGELOG.md — GitHub
  4. Anthropic Adds Plugin Evals to Claude Code — MarkTechPost
  5. Anthropic adds plugin evals to Claude Code 2.1.269 — AIBriefs

← Sve objave