4. oktobar 2026.

Kolibri-1 vredi testirati na sopstvenoj infrastrukturi, ali ne i odmah migrirati

Aleph Alpha je objavio otvorene težine za dvojezični MoE model sa kontekstom do milion tokena. Za operatere je važnije što 78 milijardi parametara i poseban vLLM dodatak i dalje nose ozbiljan infrastrukturni račun.

Virtual Arc · Urednička fotografija

Šta je objavljeno

Aleph Alpha je 3. oktobra objavio težine i konfiguraciju modela Kolibri-1 pod licencom Apache 2.0. Dvojezični MoE model ima 78,1 milijardu ukupnih i 3,46 milijardi aktivnih parametara po tokenu, kontrolisano rezonovanje i pozivanje alata.

Kontekst je validiran do 1.048.576 tokena, ali proizvođač za efikasno posluživanje i složene zadatke preporučuje najviše 262.144. Tu preporuku, a ne naslovni milion, treba koristiti za planiranje kapaciteta.

Račun za operatere

MoE arhitektura smanjuje računanje po tokenu, ali ne uklanja obavezu da ceo model stane u memoriju. BF16 težine zauzimaju približno 156 GB, dok zvanični runtime zahteva poseban Aleph Alpha dodatak za vLLM, trenutno usklađen sa verzijom 0.29.

To nije obična zamena API adrese. Tim preuzima planiranje GPU kapaciteta, nadogradnje runtime-a, dostupnost servisa i trošak neiskorišćene infrastrukture.

Naš potez

Virtual Arc bi prvo pokrenuo ograničen shadow test nad stvarnim nemačko-engleskim dokumentima, RAG upitima i pozivima alata. Postojeći hostovani model ostao bi kontrolna grupa, bez menjanja produkcijske rute.

Prelazak ima smisla samo ako Kolibri-1 pobedi po ceni uspešno završenog zadatka, P95 latenciji i pouzdanosti, ili ako kontrola podataka opravdava infrastrukturnu premiju. U suprotnom bismo sačekali zreliji runtime i širu podršku za hostovanje.

Naš stav

Stav Virtual Arca je da je Kolibri-1 dovoljno zanimljiv da uđe u kontrolisani produkcijski test, ali ne i da automatski zameni hostovane modele. Broj od 3,46 milijardi aktivnih parametara zvuči kao mali račun za inferencu, ali svih 78,1 milijardi težina i dalje mora da bude u memoriji; BF16 izdanje zauzima oko 156 GB, a zvanični put posluživanja zavisi od posebnog vLLM dodatka koji je trenutno vezan za jednu manju verziju. Trošak zato nije nestao, već je prešao sa računa dobavljača na GPU kapacitet, dežurstvo, nadogradnje i rizik slabe iskorišćenosti. Mi bismo ga dve nedelje pustili u shadow režimu samo za obimne nemačko-engleske RAG tokove i pozivanje alata, tamo gde kontrola podataka zaista vredi novca. Kontekst bismo ograničili na preporučenih 262 hiljade tokena i merili cenu po prihvaćenom rezultatu, P95 latenciju, ispravnost poziva alata, uzdržavanje kada odgovor nije potkrepljen i iskorišćenost GPU-a. Bez jasne pobede na tim merama, ne bismo migrirali.

Izvori
  1. Kolibri Has Landed: A Sovereign Open-Weight Model
  2. Aleph Alpha Kolibri-1-BF16 Model Card
  3. Aleph Alpha Inference vLLM Plugin
  4. Heidelberg AI company launches Kolibri language model

← Sve objave