Preskoči na sadržaj

Kriptovalute • AI • Blockchain • Digitalna ekonomija

Hugging Face i Microsoft objavili ThinkingBox: benchmark koji mjeri što AI agenti zaista ostave u bazama podataka

Autor: ·

Hugging Face i Microsoft objavili ThinkingBox: benchmark koji mjeri što AI agenti zaista ostave u bazama podataka — ilustracija COIN.BA

Hugging Face i Microsoft predstavili su ThinkingBox, novi benchmark i sandbox koji ocjenjuje AI agente prema stvarnom stanju koje ostave u backend bazama podataka i pojašnjavajućim sporednim efektima, umjesto da se oslanja samo na konačne odgovore ili pozive alata. Benchmark obuhvaća 507 poslovnih radnih tokova, svaki pokrenut 20 puta iz identične početne baze, kako bi se mjerila dosljednost modela u izvođenju stvarnih izmjena zapisa.

Autori ističu da su ispravno izvedeni pozivi alata i lijep završni odgovor samo proxy-metričke veličine: prava provjera je izvršiti automatske provjere konačnog stanja baze. U primjeru zadatka za korisničku podršku agent je napravio devet poziva alata i zatvorio ticket kao riješen, iako je polje statusa ostalo na “exception” — baza je “složila” priču koju je agent ispisao. U ablacijskoj studiji od 121.680 pokušaja, izvršni provjeri su zabilježili 79.853 neuspjela pokušaja; među njima su česti bili pogrešno upisani podaci, nepoželjni sporedni efekti i nedostajući obavezni učinci.

ThinkingBox izračunava tri glavna pokazatelja: pass@1 (postotak uspjeha po jednom pokušaju), pass@20 (koliko zadataka uspije barem jednom u 20 pokušaja) i observed 20/20 (broj zadataka koji uspiju u svih 20 ponavljanja). Rezultati pokazuju veliku razliku između sposobnosti modela da uspije jednom i njegove sposobnosti da to ponovi dosljedno: neki modeli postižu visok pass@1 ali nisku observed 20/20, dok drugi nude veću pouzdanost. Studija također računa procijenjeni trošak po uspješnom i po pouzdanom zadatku kako bi ilustrirala ekonomsku cijenu dosljednosti — jeftin model koji često pogriješi neće nužno biti najjeftinija opcija za zadatke koji zahtijevaju pouzdanost.

Autori su također analizirali potpise neuspjeha: oko 80% kvarova povezano je s rukovanjem alatima (tool usage), dok su pogrešne nadopune stanja, nepotpuna rješenja korisničkog zahtjeva i nedostatak akcija bile rjeđe. Zaključak je praktičan: problemi su često u oporavku od grešaka alata i upravljanju ponovnim pokušajima, više nego u samom modelu. ThinkingBox i prateći kod omogućuju organizacijama da reproduciraju testove i mjere dosljednost prije produkcijskog uvođenja.

ŠTA OVO ZNAČI?

ThinkingBox naglašava da provjera samo poziva alata ili modelovog teksta nije dovoljna — obavezno treba automatizirano provjeriti terminalno stanje backend sustava prije potvrde izmjena. Organizacije koje koriste agente za rad s pravim zapisima trebaju dizajnirati provjere konačnog stanja, klasificirati greške alata radi ciljane ponovne obrade te ograničiti pristup alatima na nužne funkcije kako bi smanjile rizik od nepoželjnih sporednih efekata.


Izvor: Hugging Face · 2026-10-03
Ilustracija: COIN.BA

Teme:

Povezani članci

Ostavite komentar

Vaša adresa e-pošte neće biti objavljena. Obavezna polja označena su sa *