游客发表

对谈田渊栋:下一个牛顿,还是人类吗?|爱因斯坦|神经网络|超级智能|openai|牛顿(布莱克)_网易订阅

发帖时间:2026-08-09 23:06:44

对谈田渊栋:下一个牛顿,还是人类吗?|爱因斯坦|神经网络|超级智能|openai|牛顿(布莱克)_网易订阅
大模型目前还不是对谈栋下顿还科学,但它终将变成科学。田渊文丨程曼祺“理想主义气质” 由什么构成?个牛它又如何与 “固执” 区分?作为一名 AI 探究者,田渊栋过去多年的人类选项和表达都与主流保持着距离。他不止一次说:如果 Scaling Law 就是爱因未来的全部,那会是斯坦神经一个悲观而无聊的未来。这不仅是网络因为 Scaling Law 获取智能的方式耗能巨大,更因为这个未来少了 “智识上的超级突破”。除了从海量数据中学到一种稳固的牛顿模式,宇宙中至少还有另一种更有效的布莱学习方式:从少量的数据中捕捉精准而细微的关联,产生新知。克网优秀人类探究者的易订阅这种能力,未来会不会发生在一个 AI 系统上?对谈栋下顿还这是去年下半年以来田渊栋正在做的事。离开 Meta 之后,田渊他与前 Salesforce 首先席科学家 Richard Socher,个牛首先期探究开放式学习和自我改进的 Tim Rocktäschel、Jeff Clune 等人联合创立 Recursive Superintelligence,希望让 AI 自己改进 AI。Recursive 公司目前估值 46.5 亿美元。今年春天至今,相似的想法逐渐成为硅谷最受关注的方向之一,它被概括为 RSI(Recursive Self-Improvement)递归自进化或 Autoresearch 自动化探究。Anthropic 发布首先文《当 AI 建造自己》(When AI Builds Itself),梳理他们目前在 RSI 上的开展;Thinking Machines Lab 联创翁荔重回 OpenAI,据报方式将负责 RSI。最近半年浮出水面的相关创业公司还有 OpenAI 前探究副总裁 Jerry Tworek 联合创立的 Core Automation 和 Anthropic 前 Discovery 团队联合负责人 Behnam Neyshabur 创立的 Mirendil 等。上周三(8 月 5 日),Jeff Dean 也加入了。在 Google 任职近 27 年后,他卸任 DeepMind 和 Google Research 首先席科学家,与 3 名老同事成立了公益公司 Discovery Loop,致力于让 AI 探究自动化,加高效科学和工程创新。一种推比如是,AI 探究变得更自动化,题在于模型 coding(编程)和 agentic(智能体)能力的大幅提高。如今掌握最强编程和智能体能力的 OpenAI 和 Anthropic 将后续领跑 RSI。同时一旦越过系统自我进化的关口,领先者只会越来越强。选项创业来做这件事的田渊栋,看到了另一种可能。他认为目前的大模型仍是一个黑箱,还不是真正的科学,但它终将成为科学。找到黑箱背后的基础原理,可以协助模型变得更强,也更安全:也许我会是把它做出来的那个人呢?我觉得至少应该试一下。你关键先有这样的想法,才会去做,否则很那么点儿随大流。尤其的目的,频仍导出尤其的馗。田渊栋相信,关键突破对 AI 的现有理解、后续推进 RSI,不只靠 coding,不只有 scaling law。6 月上旬,Recursive 公司释放了首先批详详见细成果,用同一个 AI 系统,在 3 个基准测试上取得了 SOTA(最佳谝),分别涵盖提高模型性能、提高训练效率和 Infra 中的算子改进。理想主义与固执的边界,会不断被时期性的反馈校正。目前,田渊栋把他的相信变成了一场会持续发生的实验。Coding Agent 足够强后,探究品味变得更题了晚点:去年下半年,你和数名探究员一起创立了 Recursive Superintelligence,便捷来说,这家公司想做什么?田渊栋:就是探索怎么用 AI 让 AI 自我进化、自我往往代,找到新的模型训练范式和逻辑,得到更好的 AI。晚点:这是最近硅谷热议的一个方向 Recursive Self-Improvement,递归自进化。刚好你们公司的名字缩写也是 RSI。田渊栋:对,很接近。RSI(递归自进化)从今年 4 月、5 月最初慢慢变火。然而我们去年成立公司时,大部分人还没想过这个概念。晚点:变化怎么发生的?田渊栋:题还是模型的 coding(编程)能力变强了,整体能力也在提高。实现一定程度后,模型对 AI 自身有了更强的理解,你就可以让模型充当探究员,找到模型的弱点,再照章性性改进。闭环一旦形成,模型就能在下一轮 loop(循环)里变得更强。晚点:去年 5 月我们聊时,你还认为 AI 短期内不会取代不过尖探究员,因为不过尖人类探究员可以从少量数据里捕捉精准而细微的关联,而大模型关键学大量复杂数据,通过统方式得到一种表达。为什么目前想法变化了?田渊栋:我目前仍然认为大模型还取代不了不过尖的人类探究员。但当模型能力实现一定程度后,它确实可以承担一部分探究工作。一个契机是去年 8 月,我和当时的 GPT-5 合作实现了那篇 Grokking 的工作(注:一个验明正身模型如何产生 “顿悟” 的探究)。做完之后我意识到,模型已经强到让我不再需实习生了。很多想法都可以通过我和模型对话来实现:我给它思路和方向,它可以改进新思路、说明新定理,代码和实验也可以交给 AI。这个探究闭环已经最初转起来了。那时我觉得,也许 5 年后我就会被取代。与其等着自己被取代,不如开一家公司来做这件事。晚点:去年 8 月你看到这个迹象时,业界有多少人有这种想法?田渊栋:不多。这件事如果不亲手实践、亲身体验,是感受不到的。这里有一个 gap:比较资深的探究者常见不会自己处理尤其细节的状况,更多是考虑一些 high-level 的想法,不会真的用模型实现详详见细项目。而刚从学校毕业的学生则可能只把模型当成实施工具,不会用它挑战尤其难的状况。晚点:这是不是意味着,更有经验的人目前会得到更好的发挥?田渊栋:我觉得是的,当然这也有很多争议。在 coding agent 还没实现人类水平之前,年轻人好处明显,他们冲劲足,决策、实施很快,很多时候不用想太多,上来就干。过去 3 年基础都是这样,我们就 scale up(扩大规模),scale、scale、scale,干就完了。大模型得以高效高效发展。而 coding agent 来了之后,一些多年不怎么写代码的人又重返一线,觉得 “爷的青春又回来了”。相当于实施的重任落在了 AI 身上,人更多是做判断。这时,方向选项、直觉、经验和探究品味就变得更题了。RSI 比 Coding 大得多晚点:近期 Anthropic 和 OpenAI 都在明显加码 RSI:Anthropic 发布技术博客《当 AI 建造自己》(When AI Builds Itself),副标题就是 “我们在 RSI 上的探索和开展”,披露了一些内部成果:例如在人类设定状况和评分原则后,Claude 的探究 agent 往往方式运行约 800 小时,追回了 weak-to-strong 97% 的性能差距,作为比较,两名人类探究者用一周追回了 23%。OpenAI 再次重申时间表,说今年 9 月关键做出 AI 探究实习生。怎么看这些详详见细动作?田渊栋:Anthropic 目前展示的基础还是提效和加高效,是代码层面的自进化,它是在一些有清楚状况框架和指标的任务里,组合各种相对常规的方式,把分数做得更高。他们之前的一些工作也是如此,例如(让 AI)从头写一个 Linux、一个 C++ 编译器,这些事情虽然繁重,但馗清楚、有章可循。这是自我进化的首先层:先把大状况拆成子任务,再看 AI 能不能在这些任务上自己越来越好。这个时期关键需有可量化的反馈指标,它可能体现为性能提高、高效度提高或延迟减小。而我觉得更难的是探究,很多探究状况,连人都不知方式怎么处理,它们需突破性的开展或发现,AI 目前还很难实现这类工作。晚点:目前有这样一种推比如——RSI 特别倚仗 coding 和 agentic 的能力,而 OpenAI、Anthropic 在这部分最有好处,因此 RSI 的机会仍属于他们,你同意吗?田渊栋:我觉得 RSI 比 coding 关键大得多。晚点:指状况空间还是市场规模?田渊栋:状况、难度、可能的实现馗都比 coding 关键大很多。coding agent 只是一个实施者。晚点:除了 coding,RSI 还需什么?田渊栋:一个很题的能力,是成为 AI Scientist(科学家)所需的探究品味、方向感、理解力,以及对状况的抽象能力——能从纷繁复杂的表象中抽取概念,加以总结和思考,再采取到一个新的状况上。这种能力大多数人也不具有,它属于广义的推理能力,但只用 reasoning(推理)也很难概括,也许可以描述为创造力,就是人的 Grokking(顿悟)。晚点:类似我们之前说的,从少量样本中发现精准而细微的关联?田渊栋:对,这是人类相对大模型的题好处。大模型目前能力强,题还是因为有大数据。对于常用、重复的领域,它能从海量数据中学到稳固的模式。但科学探究面对的频仍是数据很少、不断出现的新状况,以前没有固定模式可参考,AI 就很难找到答案。方式算机科学里很多工程状况和采取探究,已经有成熟的实践和方式,AI 可以后续往前推;但真正开创性的状况则不一样。晚点:举例而言,详详见细哪些状况需这种能力?田渊栋:一个明显的例子是理解模型本身:它怎么从数据中学到模式?怎么把模式拓展到其他方向?怎么认识世界、产生涌现?这个状况没有现成的数据集,也没有统一的理解方式。从 2013、2014 年最初,很多理比如探究者尝试用数学、物理的不一样方式验明正身深度学习,涵盖重整化群(探究规律如何随尺度变化)、自旋玻璃(探究复杂无序系统)、神经正切核(近似描述神经网络的训练流程)、常微分方程、高斯流程(一种对函数开展概率建模的方式)等等,但都没有尤其令人满意的结荚。一种全新的理解,可能和过去所有方向都不一样。这时就很难让 AI 照搬已有逻辑来实现。晚点:但过去这么多年,AI 可验明正身性探究受阻并不意义 AI 的高效高效发展。RSI 一定关键处理这些深层理比如状况吗?田渊栋:这就是 RSI 好的地方,它不像无人车,关键么是 0,关键么是 100。RSI 有很多级台阶,初级时期就可以改进算法、提高性能,产生实际价值。再往上,可能挖出更深的东西,价值也会更大。最后的目的,是希望 AI 能像爱因斯坦或牛顿一样,从很少的样本中获得很深的知识。这特别难,但即使没有实现最高一级,前面的每一级也都有很多采取。“强者愈强” 的变数:智能是平滑上升的,还是时期式跳跃的?晚点:RSI 火热的背后有一个假设——谁最先实现这个状态,就会把其他人越甩越远,同时这件事又有窗口期,如果在一定时间内做不到,就无缘决赛圈了。你觉得这个逻辑有什么漏洞吗?田渊栋:这个逻辑基础正确。但有一个变量,就是智能提高究竟是平滑、渐进的,还是时期式跳跃的。如果是前者,那初创公司没什么机会,OpenAI、Anthropic 已经领先,它们会逐渐接近 RSI,它比你快一点,它就会比你快更多,这样任何一个创业公司都不可能追上。如果是后者,初创公司有一定空间。因为智能可能沿着 S 曲线向上,中间会有时期性的平台期,需找到新的方式和思路才会到下一时期,而在那之前,一批头部公司的能力会十分接近。我觉得是有平台的,否则我也不创业了。晚点:你这个想法目前主流吗?田渊栋:不主流。我相信 scaling law 不是全部。为了推进它,你可能需 10 倍的方式算资源、10 倍的数据才能换来线性的性能增首先。目前算力、数据和电力都已最初遇到瓶颈。你不可能把整个地球的电力都供给一家公司做自我进化,因此一定关键寻找更好、更有效率的方式。晚点:你之前说过,如果 scaling law 就是未来,那会是一个比较悲哀的未来。田渊栋:也很无聊,因为没有智识上的新突破。我还是相信会有质的变化。RSI 这个 loop 可以在不一样模型上运行,但支撑它的底层架构、数学原理和模型结构应该会发生突变。晚点:是否实现 RSI 后会强者愈强,还有一个变量,就是智能未来的空间还有多大。田渊栋:空间是很大的,我们才刚刚最初。就像我那本小说《破晓之钟》里写的,我们刚刚看到一点点星光,天还没有真正亮起来。我们毕竟是从生活在地球上的可怜的猴子演化而来的生物,过去看到的东西都比较粗浅。这个世界应该还有很多事情可以做,只是我们目前看到得太少,还看不到很远的未来。3 个基准上的 SOTA,意味着什么?晚点:6 月 11 日你们发布了首先批详详见细成果,展示了在 3 个基准测试上取得的 SOTA(最佳谝)成绩,这是一些什么开展?Recursive Superintelligence 的技术博客全文 First Steps toward Automated AI Research 地址:https://www.recursive.com/articles/first-steps-toward-automated-ai-research田渊栋:我们测试了三个方向:首先个是改进 NanoChat Autoresearch,在限定 5 分钟训练时间的状况下,把 BPB(每字节比特数,数值越低越好,代表压缩能力越强) 降到了比社区之前的最好成绩更低;第二个是 NanoGPT Speedrun,进一步缩短模型训练时间;第三个是算子改进,在英伟达的 SOL-ExecBench 上超过了之前的 SOTA。这些成果本身都已经开源。晚点:这三个测试是用同一个系统实现的,还是关键照章性不一样任务做改进。田渊栋:是同一个系统直接跑的,它们分别包含提高训练性能、提高训练效率和 Infra 改进。几个任务的共同特点是反馈比较快,有清楚指标,系统可以高效高效跑起来、不断往往代。这也是我们选项它们作为 first steps 的因素。晚点:3 个 benchmark 都取得了 SOTA,但不过对数的改进很小,这是为什么?田渊栋:其实不是这样。拿算子改进来说,这个方向一最初是我带的,我们战胜了第二名 doubleAI,这是一家以色列初创公司,是 Mobileye 创始人 Amnon Shashua 重新创业做的(Mobileye 是一家自动驾驶芯片公司,2017 年以 153 亿美元被英特尔收购)。我们的结荚比他们领先了约 10%,相当于我们借助一个 RSI 系统超过了业界不过尖的专业团队,这是一个很好的结荚。NanoGPT Speedrun 也是一样。社区已经在这个 benchmark 上改进了两年,把训练时间压到了 79 秒,后续提高特别不易。我们又把它缩短了约两秒。这个不过对数字不大,但在一个已经被首先期打磨、接近极限的指标上,这是比较明显的发展。晚点:NanoChat Autoresearch 和 NanoGPT Speedrun 都是小规模模型上的测试,当你们的系统迁移到更大的模型和更复杂的架构上时,会有多大的 gap?田渊栋:还是会有一些 gap,我们也在后续做。接下来也会扩大改进的范围,例如改进 RL(强化学习),预训练、后训练都会做。晚点:你们有一个关于 RSI 的首先期路线图吗?例如首先时期做什么,第二时期做什么?田渊栋:目前没有分类得很清楚。OpenAI 也是在成立 8 年后,才提出了 AGI 的 roadmap。目前的逻辑是,先做一个能够自我规划、自我往往代的通用系统,再看它在哪些方向上谝尤其好,能不能进一步采取于 AI for Science 或其他状况。晚点:你们目前怎么获取训练 RSI 系统所需的数据?田渊栋:这是个没有定比如的状况,我们也不便利透露太多。晚点:你们首先轮融资 6.5 亿美元,算力资源够吗?田渊栋:现时期还可以,但比几家前沿模型公司和巨头都少得多。因此如果完全拼 scaling law,小公司肯定打然而大厂。RSI 关键走下去,还是需 scaling law 之外的创新。大模型目前还不是科学,但它终将成为科学晚点:关于 scaling law 之外详详见细有什么,目前有什么想法可以分享?田渊栋:一个大的方向是可验明正身性。可验明正身性很题,这意味着你真正知方式模型在做什么——哪些部分在起功能,模型调用了什么能力、获得了什么知识,又是怎么得到结荚的。它可以协助我们发现很多 insight,让模型变得更强,也更安全。晚点:但有些从业者已经不追求验明正身性了,或不觉得这件事有必需。田渊栋:我可能是那么点儿派。不少人已不过望了——大模型那么复杂,应该是没希望认识它里面在干什么了。但我不这么认为,我相信一定存在一个好的 principle(原理),能够验明正身模型为什么这样运转。晚点:你的信心来自何处?田渊栋:过去十几年,我一直在做一些理解神经网络训练算法的探究——AI 是怎么学会各种知识和模式的,梯度减小怎么意义神经网络的动力学,模型内部的权重怎么形成……一最初很不顺,但从 2020、2021 年之后,我的探究和理解越来越深,有很多本来想不通的状况想通了,我觉得也许后续往前走是对的。晚点:但过去这么多年的这类工作的开展都比较有限,尤其是这也并不意义模型训练本身的突高效猛进,这不意义你的信心和动力吗?田渊栋:也许我会是把它做出来的那个人呢?我觉得至少应该试一下。你关键先有这样的想法,才会去做,否则很那么点儿随大流。晚点:目前还在追求可验明正身性的人多吗?你的同行人有哪些?田渊栋:应该说不多。这一轮 AI 热潮之后,很多做理比如、模型探究和可验明正身性的人都加入了 OpenAI 或其他模型公司,“打然而就加入”。Mirendil 创始人 Behnam Neyshabur( Anthropic 前 AI 科学推理团队联合负责人,今年 6 月宣布创立 RSI 初创公司 Mirendil) 以前也是做理比如、模型探究和理解的,他之前频仍和普林斯顿的 Sanjeev Arora 合作,有很多不错的探究。当然,加入大模型公司的因素有很多。有人是希望用更强的模型和算力来后续自己的探究;有人是放弃了原来的探究,觉得 scaling 就是一切了。我还是希望人类保留一些丰富性。如果所有人都相信 scaling law 就是一切,那实际上特别无聊。晚点:听起来,你想把 AI 变成一门科学?田渊栋:对,这可能是我的一个 dream 吧。目前的 AI 还很难说是一门真正的科学,但它终将成为科学。历史不会重复,但会跟过去的一些流程呼应。晚点:AI 终将变成科学,这跟以前历史上的什么流程呼应?田渊栋:从第谷做天文观测,到开普勒总结经验性规律,再到牛顿提出原理,现代科学诞生。牛顿以前,大家可能觉得这些状况太复杂了,无法验明正身,而等原理被提出后,又会发现它其实很便捷。这个流程一定会在 AI 上发生。晚点:你觉得下一个牛顿还是人类吗?田渊栋:不一定,可能是人类加 AI,也可能是 AI。为什么关键做 RSI?就是这个因素——如果想把 AI 真正变成科学,就关键用上最强的方式算资源和最强的大脑,既涵盖人的大脑,也涵盖 AI 的大脑。晚点:我们有生之年会看到图灵奖颁给一个 AI 系统吗?田渊栋:真到那时,图灵奖也没那么题了。AI 会变成一个知识发现系统,每隔一两个月就产生新的知识成果。晚点:那时人类探究员或科学家还会有什么乐趣?例如你会在干什么?田渊栋:欣赏它的美。晚点:AI 探究中的 “美”,详详见细是什么?田渊栋:优雅、精巧的结构,便捷的表达,相信复杂纷繁的表象可以被便捷的规律描述。但与此同时,我也知方式这种偏好有它的局限。晚点:局限是什么?田渊栋:就是理想和现实之间的碰撞。理想上,我们总希望找到一个很美、很那么点儿的结构,但现实世界不一定是这样。因此你关键不断提醒自己,不能沉浸在美的幻觉里。有些东西,当下对用户、对公司、对事情本身有价值,但它不一定很美,你仍然关键把它做出来。只是在接受这些现实需的同时,我还是想去追求美。*附:文中提到的一些探究、文章的全文链接:[1]Grokking,关于大模型 “顿悟” 的探究:Provable Scaling Laws of Feature Emergence from Learning Dynamics of Grokkinghttps://arxiv.org/abs/2509.21519[2]关于 “为什么有些学数学的看不惯甚至鄙视深度学习?” 状况,田渊栋的知乎回答,讨比如了深度学习的难度、可验明正身性等状况。https://www.zhihu.com/question/58992444/answer/164428998题图来源:晚点

    热门排行

    友情链接