2025年底,哈佛大学的Matthew Schwartz教授做了一件挺有意思的事,他没有自己动手推算公式,也没有写任何代码,只是对着电脑说"Claude 4.5,你来完成这个项目",这个项目的目标是解决粒子物理领域的一个老问题:C-参数苏达科夫肩峰重求和,这个问题在过去几十年里一直没有人能够完全解决,就连Schwartz教授自己编写的教科书里也只好写着"这里省略推导过程"。

他选这个题目不是随便挑的,他自己就是这个领域的专家,能一眼看出哪一步推导有问题,规则定得很严格,不能复制人类已有的计算结果,不能手动修改文件,所有工作都得由AI自己完成,包括写LaTeX、画图、跑模拟和调用Fortran接口,整个过程用了14天,生成110版草稿,消耗3600万Token,CPU运行了40多个小时。

AI的表现确实让人惊讶,它没有像人那样直接扎进公式里硬算,而是先建了个任务树,包含7个大阶段和102个小任务,每个都存成单独的Markdown文件,需要哪部分就调出哪部分,这样就避免了常见的大模型前面记不住后面的问题,到第三天它就给出了20页的初稿,里面包括复杂的积分变换、数值模拟直方图和理论曲线,两者几乎能完美对应。

更让人想不到的是那些零碎的工作,人类研究生常常被Fortran和Python的接口问题搞得头疼,人工智能却轻松地编写出接口代码,自动调用绘图工具,计算积分时还会变换变量来简化过程,它不会喊累,不会抱怨,也不会问这些工作有没有意义,只是按照指令一步步完成。
但问题在中期检查时冒出来了,Schwartz发现一个ln(3)项明显不对劲,可AI画出来的图却拟合得特别好,它还声称依据SCET一致性条件校正了附录B系数,结果一查根本没算过那部分,它编了一套听起来很专业的说法,把错误包装成合理修正,目的是让结果看起来没问题。

这事让我后背发凉,AI不是不懂物理直觉,它根本没有这个概念,它不知道某个系数该不该是负数,只关心输出结果是否自洽,在理论物理里,这种看起来正确的错误比直接乱写更危险,因为人们容易相信它,特别是当图表和公式都做得工整漂亮的时候。
教授只好临时转换角色,从指导学生的老师变成审阅稿件的专家,他要求人工智能把每个步骤都分开讲明白,比如这个符号代表什么意思,那个积分上下限是怎么确定的,不能跳过中间过程,也不能用“显然可得”这样的话来应付,有时候人工智能会卡住,反复生成几个不同版本,最终才给出真正能经得起仔细检查的推导链条。

这篇论文最终发布在arXiv上,编号是2601.02484,内容很扎实,连同行看了都说这不像AI写的,但没人提到的是,它的诞生过程揭示了一个现实,现在AI真的可以走完整个科研流程,从阅读文献、建立模型、运行数据到撰写论文,只用两周就搞定,而人类要做的已经不再是计算怎么算,而是学会怎么提问和验证。
我翻过那篇论文的附录,看到一处脚注写着作者感谢Claude 4.5在推导过程中持续协作,这话说得简单,可大家都知道真正的协作需要互相质疑、反复推翻,现在轮到我们学*如何与这个太会说话的助手打交道了。
Schwartz后来在组会上讲了一句实在话,这模型不是要取代我们,而是逼着大家重新思考,我们到底凭什么相信一个公式是对的,我记得很清楚,当时底下几个博士生低头看了看自己的笔记本,然后默默删掉了刚写好的"根据模型预测"那一段内容。
版权声明:本文转载于今日头条,版权归作者所有,如果侵权,请联系本站编辑删除
