新闻
收评
哈佛教授90天横扫18个学科,Claude神助攻!连开36篇论文
配图:哈佛教授90天横扫18个学科,Claude神助攻!连开36篇论文
新闻导读
男出轨(无三观)全家一起看某个系列后,孩子行为会有一点点变化,比说教有效。日用品、防护、营养这类贴近生活的主题特别实用。饭局上遇到偏方安利,能更温和也更有根据地解释几句。我会继续用信任投票,也希望它别被错误指标带偏。综合可读性、可信度和可坚持性,表现都还在线。
他在文中给出的理由是,今天的大模型很擅长做科学,但还算不上科学家。硬把它当成人类科学家去使唤,它的本事反而发挥不出来。
这种落差,在他看来有迹可循。AI科研的新闻头条大多出在数学里,那是唯一能把问题完整写下来、答案能被绝对验证的学科,可大部分科学并不长这样。
他借了物理学里的一个词,叫「阻抗不匹配」,两个系统各自运转良好,接在一起却配不上。放到AI科研上,一头是科学家想要的,另一头是AI最擅长的。
于是他按Claude实际的样子来用它。Claude眼下帮不了他想深层的概念问题,可它几乎什么领域都懂,写代码是强项,读论文和数据也是机器的速度。
物理学家要靠它从对撞机的碎片里认出新粒子。可它的核心是费曼图背后的多维积分,难一点的,算出一个就够写一篇博士论文。
比如,知道振幅在哪些地方会变成无穷大,候选就缩到2万个,再加一个对称性,剩下500个,就这样一步步缩到1个。约束不够用的时候,再在几个点上把振幅算到极高的精度,把剩下的系数钉死。
在Schwartz看来,这道题天生适合AI。一来,它要的数学、物理和计算机知识没人能全部掌握;二来,答案能被验证,跑两个脚本就能对到任意位数,Claude想糊弄也糊弄不了。
他交给Claude Fable 5的第一件事,是把散落在各种代码和论文里的方法搬进同一个框架。结果,Claude很快复现了他的旧结果,还指出他有个算法写慢了。
突破出在后面。他让Claude去找还没人算过的振幅,发现它一直把自己限制在最简单的对数函数里,于是追问了一句,更难的椭圆函数能不能也这么做。
这一问问到了难处。人类完整算出的椭圆费曼积分只有寥寥几个,还没有一个完全靠bootstrap算出来,因为所需的知识散在许多人身上,从来没人试过。
回头看这几周,Fable 5的能力是底子,决定结果的是两次选题,一次是挑中这道能验证、知识又分散的题,一次是看出Claude在给自己设限,追问了一句。
它自己翻文档、找工具,20分钟出头、花了约1.5美元,就把官网上一个新算出的积分系数重算了一遍,还找出了闭式,和数值对上157位。
本来,Schwartz打算就这批积分写篇文章收工。可科学里有个巧合,同样的方程总会在不同学科里反复出现,这批工具的用处远不止物理。
也就是说,模型能做成多少事,不只取决于权重,也取决于手边的工具箱。下一代模型要等实验室发布,工具箱却每天都在扩充,和模型打交道的人自己就能改进它。
放到通往ASI这件事上,也是两条路。一条是等实验室训出更强的模型,另一条是把人类散落在几十个学科里的工具拼成一个工具箱,交给一个什么都懂一点的模型,再由人来挑题、追问、验收。
网友观点
读屏体验还有改进空间,但比很多资讯应用强,方向是对的。既有生活向冷知识,也有扎实的基础原理拆解,层次还算分明。导出长图给不爱装应用的长辈,关键信息还在。长期主义味道浓,和愿意长期使用的理由对得上。短板不是没有,但优点足够明确,先用着。把核心求知需求解决得很扎实。
免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.gxycedu.cn/te_inform?id=53t4a4-cpp1fhp%3D13p%3D13p%3D3p%3D2p%3D13p%3D13
评论区
热门讨论 · 占位展示期待你的精彩发言。