Google запустила Android Bench 2.0 для проверки ИИ в сложных задачах разработки Android

Google представила Android Bench 2.0 — обновленную версию своего бенчмарка для оценки того, как крупные языковые модели (LLM) и агенты на базе ИИ справляются со сложными задачами по разработке Android-приложений. Первая версия Android Bench была создана для измерения того, насколько эффективно модели помогают в реальной работе разработчиков Android, но новая версия повышает планку и расширяет спектр задач.

Главное нововведение Android Bench 2.0 — введение так называемых long-horizon tasks (LHT), то есть долгосрочных задач разработки. Такие задачи существенно сложнее и по трудозатратам: на их выполнение у человека-инженера могут уходить несколько дней или даже неделя. В отличие от ранних бенчмарков, которые в основном фокусировались на небольших по объему инкрементальных изменениях, Android Bench 2.0 включает задания уровня обновления зависимостей, добавления крупных новых функций и даже создания Android-приложений с нуля.

Google также изменила систему оценки моделей. Вместо полностью бинарной схемы «прошел/не прошел» Android Bench 2.0 использует «непрерывное шкалирование» (continuous scoring). По словам компании, такой подход дает более содержательное представление о том, как модель справилась с задачей, даже если она не смогла довести её до полного завершения.

Google уже протестировала на новом бенчмарке несколько современных моделей, включая Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol и Claude Opus 5. По опубликованным результатам, лидером сейчас является GPT-6 Astra с показателем прохождения задач в 28%. Модель Gemini 3.8 Flash показала всего 8% прохождения.

Компания отмечает, что тестирование моделей на наборе LHT дает лучшее понимание их сильных и слабых сторон и обеспечивает разработчиков более практическими рекомендациями о том, какие модели лучше подходят для разных видов задач в Android-разработке. Обновленный рейтинг Android Bench 2.0 уже доступен; Google планирует продолжать его пополнять, включая больше моделей и результатов в будущем.