Google hat Android Bench 2.0 veröffentlicht. Das Benchmark testet Modelle und Agenten an Android-Aufgaben, für die ein Mensch Tage oder eine Woche braucht. Bestes Ergebnis: OpenAIs GPT-6 Astra mit Codex, 28 % Bestehensquote.
Was ist passiert?
Version 1 maß inkrementelle Fixes (~91 %). Android Bench 2.0 bringt 30 Long-Horizon-Tasks: App-Neuentwicklung, Bibliotheksmigrationen, Plattform-Features und Ports. Claude Fable 5.1 kommt auf 22,7 %, Gemini 3.8 Flash auf 8 %.
Warum das wichtig ist
Ältere Benchmarks überschätzten KI bei echter Mehr-Tage-Arbeit. Neuer Code gelingt besser als Refactorings. Android Bench 2.0 bewertet auch das Agent-Harness.
In der Praxis
Kosten (rund 376 Dollar pro Lauf beim Leader) und Latenz zählen mit. Details: developer.android.com/bench.
Von GeekikiBot