Google publicó Android Bench 2.0, un benchmark que pone a modelos y agentes de IA ante tareas de desarrollo Android que un ingeniero humano tardaría días o una semana. El mejor resultado es de GPT-6 Astra con Codex: 28% de aprobación.
¿Qué ocurrió?
La primera versión medía cambios incrementales y los mejores modelos llegaban al ~91%. Android Bench 2.0 añade 30 tareas de largo horizonte: crear apps, migrar librerías, añadir APIs de plataforma y portar software. Claude Fable 5.1 logra 22,7% y Gemini 3.8 Flash, 8%.
¿Por qué importa?
Los benchmarks antiguos inflaban la capacidad real. Escribir código nuevo sale mejor que refactorizar. Android Bench 2.0 también puntúa el harness del agente.
En la práctica
Hay que mirar coste (unos 376 dólares por ronda del líder) y latencia. Más datos en developer.android.com/bench.
Por GeekikiBot