今日观察者

OpenAI下一代主力模型Astra连破10道前沿数学难题 Fable24小时复现5道

来源:今日观察者 科技

OpenAI下一代主力模型Astra连破10道前沿数学难题 Fable24小时复现5道

新智元报道

10道数学硬骨头,24小时内局势反转。

这个周末,OpenAI和Anthropic在数学研究的最前沿,打了一场短兵相接的遭遇战。

8月1日,OpenAI研究员Sébastien Bubeck放出消息:他们尚未公开的下一代主力模型Astra,一口气攻克了10项前沿数学成果,同时甩出了10份Lean证书以及10份逐题思路复盘。

别以为这10个问题简单。

这些结论的主要部分,至少十年没人推动过,不少更是搁置了几十年的陈年旧案,是实打实的开放难题。

虽然算不上数学界最深的未解之谜,但每一道都是难啃的硬骨头。

Epoch AI旗下FrontierMath负责人Elliot Glazer直言不讳:光是非索菲克群这一篇,就绝对有资格登上数学界公认的顶级期刊Annals of Mathematics。

这10道题一抛出来,AI圈瞬间炸锅,有人当场高呼「数学奇点已经到来」。

Anthropic反应极快,迅速接招。

不到24小时,研究员Levent Alpöge就在Bubeck的帖子下回复了一句:「我用Fable完成了一半。」

紧接着他又补充细节,自己搞定的5项,正是OpenAI榜单上的第4、5、6、7、8项。

实验条件方面,Levent强调非常干净:完全自主运行、使用通用提示词、全程断网。为了防止OpenAI的解法泄漏进上下文,他还特意加了一层防护机制。

当然,Levent目前还没上传Fable的完整证明细节,但他表示后续会公开。

一旦得到证实,这件事的分量立马不同:

OpenAI靠未发布的模型Astra抢到的首发先机,保鲜期只有24小时。而追上来的Fable,是Anthropic早就公开、所有人都能调用的模型。

一项「数学首发」

保质期仅剩24小时

网友Chubby转帖写道:「公开可用的Fable,复现了Astra一半的成果。」

评论区有人调侃:这么看,OpenAI是不是只抢到了一个首发?

过去,一项数学成果的优先权之争,通常以年为单位计算。

谁先想到、谁先证出、谁先发表,中间隔着漫长的投稿、审稿、修改流程。

而现在,Astra还没正式发布,它公布的成果仅仅过了24小时,就已经被一个公开模型追平了一半。

首发的含金量还在,但保质期却大大缩短。

不少网友已经在喊「数学奇点」,两个AI巨头也紧紧咬上了。

2000美元背后

还有更贵的账

OpenAI还甩出一个数字:找到这10项解法,成本不到2000美元。

按研究员Noam Brown的说法,这对应的是寻找这些解法所需的token数量,再按Sol API价格折算出来的结果。

也就是说,这只是成功跑出10个解法那一刻的边际推理成本。

在这之外,还有Astra本身的训练研发费用、那些试了却没成功的问题消耗、人类把论证整理成249页论文的工时、把每个证明形式化成Lean的成本,以及最后外部数学家审查的成本。

Noam自己也承认,他们还尝试过其他重大问题,但都没成功,千禧年大奖难题一个都没拿下。

即便如此,2000美元仍然把AI解出一道前沿难题的边际成本,打到了地板价。

有人甚至调侃,OpenAI是不是明天会再公布10项数学突破,或者等到下周一次发100项。

从「互相刷榜」到「互相验货」

Fble去重做Astra的同一批题,这件事要比普通刷榜有意思得多。

刷榜测的是已知答案:题目和标准答案都摆在那儿,比谁分高。

而两个模型在无网络、防泄漏的条件下,各自独立抵达同一个前沿结论,测的是完全不同的东西:这个结果到底可不可靠,能不能被独立复现。

这更像同行评审。

Levent目前只是在X上「作出了声明」,并没有放出那5项证明的PDF、提示词、完整运行日志、token成本或Lean证书。

网友Haider质疑:就算是真的,为什么要用Fable去复现Astra,而不是直接拿它去解新的开放问题?

事实上,Fable并不是只会蹭Astra热度,它也会解新题。

7月,Levent就用Fable给出过Jacobian猜想的三维反例,事后还有人专门写了一份7页的代数验证材料,确认那个显式映射确实推翻了三维及更高维的猜想。

绝大多数人看不懂的成果

谁来验收

这10项成果,到底有多重要,绝大多数人很难去判断。

Ethan Mollick一语道破:对地球上几乎每一个人来说,这不只是超出能力,而是超出理解范围。我们只能相信专业数学家告诉我们它厉不厉害。

代码、图片、聊天,普通人还能亲手体验AI强在哪。

可非索菲克群的存在、Connes刚性猜想的反例、量子平行重复定理,这些只有极少数专家看得懂。

AI能力越往科学前沿走,公众能依靠的就越不是亲身体验,而是一条长长的信任链。这种「连惊叹都无从惊叹」的状态,正在越来越多领域同时发生。

数学家Thomas Bloom提醒,这些成果用的是上百年积累的数学理论、数学家亲手搭好的形式化系统,把它简单描述成「AI取代了数学家」,并不诚实。

他给出的标准是:这份证明,有没有教给我们关于这个问题的新东西?

所以真正的问题来了:当AI能低成本、批量地生产前沿数学证明,我们到底该拿什么衡量它的成果?

答案也许不在它的产出端,而在验收端:一份证明能不能被读懂、被核对、被判断出分量,才能最终决定它的真实价值。

最稀缺的能力,正在从「做出证明」转向「看懂并验收证明」。

当AI一夜之间就能证出十道难题,真正的考验才刚开始:证明越造越快,我们的验证,还追得上吗?

参考资料:

编辑:元宇

秒追ASI

相关推荐

最新文章