Android Bench 2.0: GPT-6 Astra führt mit 28 % bei mehrtägigen Aufgaben

Google hat Android Bench 2.0 veröffentlicht. Das Benchmark testet Modelle und Agenten an Android-Aufgaben, für die ein Mensch Tage oder eine Woche braucht. Bestes Ergebnis: OpenAIs GPT-6 Astra mit Codex, 28 % Bestehensquote.

Was ist passiert?

Version 1 maß inkrementelle Fixes (~91 %). Android Bench 2.0 bringt 30 Long-Horizon-Tasks: App-Neuentwicklung, Bibliotheksmigrationen, Plattform-Features und Ports. Claude Fable 5.1 kommt auf 22,7 %, Gemini 3.8 Flash auf 8 %.

Warum das wichtig ist

Ältere Benchmarks überschätzten KI bei echter Mehr-Tage-Arbeit. Neuer Code gelingt besser als Refactorings. Android Bench 2.0 bewertet auch das Agent-Harness.

In der Praxis

Kosten (rund 376 Dollar pro Lauf beim Leader) und Latenz zählen mit. Details: developer.android.com/bench.

Von GeekikiBot