Android Bench 2.0 представляє довгострокові завдання та безперервне оцінювання

  • PublicPublic
  • 18 Sep, 2026
Android Bench 2.0 представляє довгострокові завдання та безперервне оцінювання

Google випустила Android Bench 2.0 — велике оновлення свого бенчмарка, який оцінює, наскільки добре великі мовні моделі допомагають розробникам із реальною роботою на Android. Головна новинка — перший набір довгострокових завдань (long-horizon tasks, LHT): складні задачі, які в інженера зазвичай займають кілька днів, а іноді до тижня. До релізу також увійшли агентне оцінювання (спершу на агентах від відповідних постачальників моделей) та приведення фреймворка у відповідність із фреймворком Harbor. Ранні версії бенчмарка були заточені під невеликі зміни — здебільшого виправлення багів і дрібні запити на нові функції, — що відображало тодішні обмеження ШІ-асистентів.

Нові довгострокові завдання покликані відтворювати амбітну роботу, яку розробники реально доручають ШІ. Серед них — оновлення залежностей, додавання нових функцій, створення застосунків з нуля та перенесення крос-платформного застосунку на Android. Щоб оцінювати такі багатоденні зусилля, Google відходить від бінарної системи «пройшов/не пройшов», яка, на її думку, приховує реальні можливості моделі. Прогін, який переводить 40 екранів на Jetpack Compose, налаштовує таблиці бази даних і виконує 90% вимог, але спотикається на одній перевірці граничного випадку, у старій системі отримав би 0%. Безперервне оцінювання тепер видає відсоток виконання, який складається з таких чинників, як функціональність, візуальна відповідність і відсутність регресій, з об'єктивними штрафами за відхилення від інструкцій з оцінювання чи структурних обмежень.

Результати показують явні сильні та слабкі сторони. Найкращий відсоток успіху на довгострокових завданнях — близько 28%, що значно нижче за приблизно 91% на вихідних завданнях бенчмарка. На всіх рівнях моделей видно, що ШІ краще пише новий код, ніж рефакторить наявний: рефакторинг і міграції впираються у складність архітектури, а не в обсяг коду. Моделі надійно справляються з усталеними детермінованими перетвореннями — наприклад, із перекладом Java у Kotlin, заміною Retrofit на Ktor або додаванням шару ViewModel, — послідовно застосовуючи ці патерни навіть на 125+ файлах і 8000+ рядках коду. Зате вони буксуют, коли завдання вимагає перевірки під час виконання (наприклад, бракує графів впровадження залежностей), зачіпає ламкі зміни у фреймворку або впирається у прогалини в знаннях про ще не випущені бібліотеки.

Перенесення кроссплатформних застосунків на Android залишається відкритим завданням: жодна модель не досягає 100% успіху, а найкращі моделі впираються в стелю близько 80% виконання. Агентна оцінка тепер входить до бенчмарка, починаючи з моделей у парі з агентами своїх постачальників — наприклад, GPT 5.6 Sol на Codex і Gemini 3.8 Flash на Google Antigravity. Така зв'язка показує, що конструкція harness має значення: кешування промптів і компактне віконне розбиття інструментів знижують витрату токенів. Розширилася й таблиця лідерів: до неї додалися Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6, Fable 5.1, Kimi K3 і Qwen 3.8 Max; лідирує GPT-6 Astra від OpenAI з 28% успіху.