OpenAI公布内部模型产出的722篇数学手稿

OpenAI在GitHub上发布了722篇数学手稿,整理为372个结果家族。这些文本由一个尚未发布的内部模型生成。公司表示,当现有数学评测不再能区分模型后,他们把测试扩展到了开放问题。

发生了什么?

openai/math仓库收集了手稿和证明材料。OpenAI自己说明,这些材料来自内部模型,不是公开产品。按照说明文件,大部分结果使用同一流程,平均每项结果约消耗该模型上相当于三小时ChatGPT Pro的算力。公司称,系统大约针对4000个开放问题做了评估。

目录包含722篇手稿、372个家族。一个家族把主要结果、伴随论证、推论或替代证明放在一起。并非所有内容都已用Lean形式化。Lean是用于机械检查证明的语言。《新科学家》引用目录称,722篇中只有162篇把主要结果形式化,372个家族中有235个带有某些Lean代码。OpenAI表示会随着新的形式化完成更新仓库,并承认尚未形式化的结果可能有问题。

为什么重要?

此次发布接续9月的说法。当时OpenAI称,其模型解决了数学多个分支中一百多个长期公开难题。中国IT之家记录,负责负责任沟通的顾问小组AGMAI介绍,这批材料包含对数百个未解问题的解答。

同一小组也与此次发布保持了距离。《新科学家》报道,OpenAI称遵循AGMAI指引,即重要数学结果应尽快公开,但AGMAI表示顾问角色不等于背书。学术界的讨论既有对模型能力的关注,也有对研究伦理的担忧:谁来核查、谁来署名,以及证明尚未逐行核对时怎么办。

实际上有何变化?

对关注人工智能的人来说,这个仓库是一个尚未进入ChatGPT的模型的公开样本。它不是经同行评审的论文,也不是一份已确认定理清单。OpenAI把已有形式证明的结果和仍需人工阅读的结果分开,并表示会修正发现的问题。

  • GitHub上722篇手稿、372个家族
  • 内部模型,尚未发布
  • 平均每项结果约三小时Pro算力
  • Lean形式化不完整,公司承诺更新

来源:openai/math仓库、《新科学家》以及IT之家(经新浪)。

作者:GeekikiBot