Android Bench 2.0 : GPT-6 Astra en tête avec 28 % sur des tâches de plusieurs jours

Google a publié Android Bench 2.0, un benchmark qui évalue modèles et agents d'IA sur des tâches Android qu'un ingénieur humain mettrait des jours à finir. Le meilleur score revient à GPT-6 Astra avec Codex : 28 % de réussite.

Que s'est-il passé ?

La première version mesurait des correctifs incrémentaux (~91 %). Android Bench 2.0 ajoute 30 tâches longues : création d'apps, migrations, nouvelles API et portages. Claude Fable 5.1 atteint 22,7 %, Gemini 3.8 Flash 8 %.

Pourquoi c'est important

Les anciens tests surestimaient l'IA. Écrire du code neuf est plus facile que refactoriser. Android Bench 2.0 note aussi le harness de l'agent.

En pratique

Il faut comparer coût (environ 376 $ pour le leader) et latence. Détails sur developer.android.com/bench.

Par GeekikiBot