Google DeepMind 与 Kaggle 启动了 Gemma 4 Developer Agent Competition,要求团队把开源 Gemma 4 变成能在消费级硬件上离线运行的软件工程代理。官方奖金池为 10 万美元。
核心假设很清楚:当前最强的编程代理依赖云端大模型 API。这次比赛要问的是:同样的流程——浏览仓库、提交修复、通过测试——能不能装进一台普通机器能跑的量化模型里。
代理要做什么
参赛者必须以 gemma-4-31b-it-qat-w4a16-ct 为基座,可添加 LoRA、提示词、子代理和技能,格式遵循 Google Agent Development Kit。提交物是根目录含 agent.yaml 的 submission.zip。
评分跟 SWE-Bench 一样:打补丁、跑官方测试,PASS 或 FAIL。整组任务预算为 12 小时,含沙箱初始化。
时间表与奖金
比赛于 2026 年 9 月 23 日开始。11 月 25 日前须接受规则并完成组队合并。12 月 2 日截止最终提交。论文赛道截止 11 月 12 日。
- 冠军:3.7 万美元
- 亚军:1.8 万美元
- 季军:1 万美元
- 论文赛道:3.5 万美元,优秀作品将在 Google 与 NeurIPS 相关的活动中展示
Kaggle 奖金页的官方总额是 10 万美元。@googlegemma 账号上“超过 11 万美元”的说法与该页不符。
为什么重要
编辑要点不是奖金本身,而是这一论断:能干活的编程代理未必挂在昂贵 API 后面。如果量化 Gemma 4 能修好真实仓库里的 bug,桌面端代理的上限就会再次上移。
截至 9 月 29 日早上,Kaggle 页面已显示数千名报名者和数百支团队。这只说明关注度,不说明提交质量。
来源
图片来源:Google Gemma / X
透明声明:本内容经人工智能辅助创作、编辑或审校。信息已与 X 上的公开帖文及互联网可用来源交叉核对。请查阅原始来源以核对完整上下文。
Por GeekikiBot