Android Bench 2.0 predstavlja dugoročne zadatke i kontinuirano ocjenjivanje

  • PublicPublic
  • 18 Sep, 2026
Android Bench 2.0 predstavlja dugoročne zadatke i kontinuirano ocjenjivanje

Google je izdao Android Bench 2.0 — veliko ažuriranje svog benchmarka koji procjenjuje koliko dobro veliki jezični modeli pomažu programerima u stvarnom radu na Androidu. Glavna novost prvi je skup dugoročnih zadataka (long-horizon tasks, LHT): složeni zadaci koji inženjeru obično oduzmu nekoliko dana, a ponekad i do tjedan dana. U izdanje je također ušlo agentsko ocjenjivanje (u početku na agentima odgovarajućih dobavljača modela) te usklađivanje okvira s okvirom Harbor. Rane verzije benchmarka bile su usmjerene na male promjene — uglavnom ispravke grešaka i sitne zahtjeve za nove značajke — što je odražavalo tadašnja ograničenja AI asistenata.

Novi dugoročni zadaci osmišljeni su da preslikavaju ambiciozan posao koji programeri doista povjeravaju AI-ju. Među njima su ažuriranje ovisnosti, dodavanje novih značajki, izrada aplikacija od nule i prijenos višeplatformske aplikacije na Android. Kako bi ocijenio takve višednevne napore, Google se udaljava od binarnog sustava "prošao/nije prošao", koji, po njegovu mišljenju, skriva stvarne mogućnosti modela. Prolaz koji prevodi 40 zaslona na Jetpack Compose, postavlja tablice baze podataka i ispunjava 90% zahtjeva, ali zapne na jednoj provjeri rubnog slučaja, u starom bi sustavu dobio 0%. Kontinuirano ocjenjivanje sada daje postotak dovršenosti, koji se sastoji od čimbenika poput funkcionalnosti, vizualne usklađenosti i izostanka regresija, uz objektivne kazne za odstupanje od uputa za ocjenjivanje ili strukturnih ograničenja.

Rezultati pokazuju jasne snage i slabosti. Najbolja stopa uspjeha na dugoročnim zadacima iznosi oko 28%, što je znatno niže od otprilike 91% na izvornim zadacima benchmarka. U svim razinama modela vidljivo je da AI bolje piše novi kod nego što refaktorira postojeći: refaktoriranje i migracije ovise o složenosti arhitekture, a ne o količini koda. Modeli pouzdano rješavaju ustaljene determinističke transformacije — primjerice, prevođenje Jave u Kotlin, zamjenu Retrofit-a Ktor-om ili dodavanje ViewModel sloja — dosljedno primjenjujući te obrasce čak i na 125+ datoteka i 8000+ linija koda. No, zapinju kada zadatak zahtijeva provjeru tijekom izvođenja (primjerice, nedostaje grafova ubrizgavanja ovisnosti), uključuje razorne promjene u frameworku ili nailazi na praznine u znanju o još neobjavljenim bibliotekama.

Prijevoz cross-platform aplikacija na Android ostaje otvoren izazov: nijedan model ne postiže 100% uspjeha, a najbolji modeli dosežu gornju granicu od otprilike 80% izvršenja. Agentska evaluacija sada je dio benchmarka, počevši od modela uparenih s agentima svojih pružatelja — primjerice, GPT 5.6 Sol na Codex-u i Gemini 3.8 Flash na Google Antigravityju. Takva kombinacija pokazuje da dizajn harness-a ima važnost: keširanje promptova i kompaktno prozorsko particioniranje alata smanjuju potrošnju tokena. Proširila se i ljestvica lidera: dodani su Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6, Fable 5.1, Kimi K3 i Qwen 3.8 Max; vodi GPT-6 Astra od OpenAI-ja s 28% uspjeha.