谷歌发布了 Android Bench 2.0,用于测试人工智能模型和智能体在真实 Android 开发中的表现。这些任务需要人类工程师花几天甚至一周。OpenAI 的 GPT-6 Astra(配合 Codex)以 28% 通过率排名第一。
发生了什么?
第一代基准主要测试增量修改,最优模型约 91%。Android Bench 2.0 增加了 30 项长周期任务:从设计稿打造多界面点餐应用 Food Vibes、迁移库与架构、增加平台能力以及将跨平台应用移植到 Android。Claude Fable 5.1 为 22.7%,Gemini 3.8 Flash 为 8%。
为什么重要?
旧基准高估了模型在多日工程中的能力。写新代码容易,重构更难。Android Bench 2.0 还会评分智能体套件本身。
实际上会怎样?
选型时要同时看成本与耗时。详情见 developer.android.com/bench。
作者:GeekikiBot