Android Bench 2.0 представляет долгосрочные задачи и непрерывную оценку
Public- 18 Sep, 2026

Google выпустила Android Bench 2.0 — крупное обновление своего бенчмарка, который оценивает, насколько хорошо большие языковые модели помогают разработчикам с реальной работой на Android. Главная новинка — первый набор долгосрочных задач (long-horizon tasks, LHT): сложные задания, которые у инженера обычно занимают несколько дней, а иногда до недели. В релиз также вошла агентная оценка (поначалу на агентах от соответствующих поставщиков моделей) и приведение фреймворка в соответствие с фреймворком Harbor. Ранние версии бенчмарка затачивались под небольшие изменения — в основном исправления багов и мелкие запросы на новые функции, — что отражало тогдашние ограничения ИИ-ассистентов.
Новые долгосрочные задачи призваны повторять амбициозную работу, которую разработчики реально поручают ИИ. Среди них — обновление зависимостей, добавление новых функций, создание приложений с нуля и перенос кроссплатформенного приложения на Android. Чтобы оценивать такие многодневные усилия, Google отходит от бинарной системы «прошёл/не прошёл», которая, по её мнению, скрывает реальные возможности модели. Прогон, который переводит 40 экранов на Jetpack Compose, настраивает таблицы базы данных и выполняет 90% требований, но спотыкается на одной проверке граничного случая, в старой системе получил бы 0%. Непрерывная оценка теперь выдаёт процент выполнения, который складывается из таких факторов, как функциональность, визуальное соответствие и отсутствие регрессий, с объективными штрафами за отклонение от инструкций по оценке или структурных ограничений.

Результаты показывают явные сильные и слабые стороны. Лучший процент успеха на долгосрочных задачах — около 28%, что гораздо ниже примерно 91% на исходных задачах бенчмарка. По всем уровням моделей видно, что ИИ лучше пишет новый код, чем рефакторит существующий: рефакторинг и миграции упираются в сложность архитектуры, а не в объём кода. Модели надёжно справляются с устоявшимися детерминированными преобразованиями — например, с переводом Java в Kotlin, заменой Retrofit на Ktor или добавлением слоя ViewModel, — последовательно применяя эти паттерны даже на 125+ файлах и 8000+ строках кода. Зато они буксуют, когда задача требует проверки во время выполнения (например, не хватает графов внедрения зависимостей), затрагивает ломающие изменения во фреймворке или упирается в пробелы в знаниях о ещё не выпущенных библиотеках.

Перенос кроссплатформенных приложений на Android остаётся открытой задачей: ни одна модель не достигает 100% успеха, а лучшие модели упираются в потолок около 80% выполнения. Агентная оценка теперь входит в бенчмарк, начиная с моделей в паре с агентами своих поставщиков — например, GPT 5.6 Sol на Codex и Gemini 3.8 Flash на Google Antigravity. Такая связка показывает, что конструкция harness имеет значение: кэширование промптов и компактное оконное разбиение инструментов снижают расход токенов. Расширилась и таблица лидеров: в неё добавились Gemini 3.8 Flash, Gemini 3.7 Flash, GPT-6, Fable 5.1, Kimi K3 и Qwen 3.8 Max; лидирует GPT-6 Astra от OpenAI с 28% успеха.