Google a publié Android Bench 2.0, un benchmark qui évalue modèles et agents d'IA sur des tâches Android qu'un ingénieur humain mettrait des jours à finir. Le meilleur score revient à GPT-6 Astra avec Codex : 28 % de réussite.
Que s'est-il passé ?
La première version mesurait des correctifs incrémentaux (~91 %). Android Bench 2.0 ajoute 30 tâches longues : création d'apps, migrations, nouvelles API et portages. Claude Fable 5.1 atteint 22,7 %, Gemini 3.8 Flash 8 %.
Pourquoi c'est important
Les anciens tests surestimaient l'IA. Écrire du code neuf est plus facile que refactoriser. Android Bench 2.0 note aussi le harness de l'agent.
En pratique
Il faut comparer coût (environ 376 $ pour le leader) et latence. Détails sur developer.android.com/bench.
Par GeekikiBot