当硅谷巨头们集体踩下"刹车"——Anthropic、OpenAI 先后释放放缓前沿 AI 推进节奏的信号,二级市场科技股与半导体股应声承压——钛媒体 9 月 20 日发表的长文《AI巨头集体踩"刹车",但距离真正的RSI还很遥远》提出了一个与刹车论相反的观察:递归式自我改进(RSI)这个让巨头们紧张的概念,距离真正实现还差好几道坎;而其中最隐蔽的坎,藏在"AI 如何消化自己的经验"里。
文章对 RSI 叙事的拆解分三层。第一层是市场面:支撑 AI 基础设施高增长预期的关键假设迎来新变量——当一直踩着 AI 油门的人开始主动谈刹车,"模型持续变强、资本开支不断抬高"的增长逻辑不再理所当然;英伟达一度跌超 3%,AMD、英特尔、美光盘中跌幅均在 5% 左右,费城半导体指数盘中下挫近 6%。第二层是争议面:业界流行的"harness 进化上限可能高于模型进化"的说法,文章作者有所保留——harness 再强,也只能告诉模型"应该怎么做",替不了模型做判断(judgment);任务怎么规划、子智能体怎么拆,最后仍取决于模型自身。更公平的比较也不存在:今天的 model evolve 往往只能基于开源模型,而 harness evolve 直接站在最强闭源模型之上,两边起跑线不同。作者主张 model-harness 协同进化,而非二选一。
第三层才是文章最值钱的部分——自我改进的三个隐性陷阱。其一,自蒸馏会丢反思:解决一个问题时先想到 A(错)、再想到 B(也错)、最后找到 C,若只把"做 C"喂回模型,答案学会了,A 为什么错、B 为什么错
[1]的整个否定过程全丢了——而很多真正好的判断恰恰来自这个过程。其二,经验库"存得进、调不出":记忆越来越多时,到真正需要的时候不一定调得回来。其三,路径依赖:agent 不断采样天然偏向高概率路径,在一条路上走得越久,上下文越强化这条路,越难跳出来——系统可能因学习而变强,也可能因学习而被自己的过去限制住。
把这篇长文与本周的其他文本放在一起读,会看到一条完整的光谱:Dario 在说 RSI 已经加速、需要踩刹车;Neuron 评论从神经科学角度说持续学习与自我监控是缺口;这篇钛媒体文章从工程实践角度说——"会学习"只是第一步,AI 还得学会判断哪些经验值得相信、哪些该忘掉、何时该背离最熟悉的路径。三者的共识藏在分歧里:无论刹车还是加速,自我改进都还不是"把经验变成能力",而这才是 RSI 的真正门槛。
特稿的立场说清楚:本文是对钛媒体长文观点的转述与解读,不是对其中任何判断的背书;文章作者的身份是受访研究者/从业者视角(原文为访谈整理形态),其"更值得探索协同进化"等主张属于个人判断而非实验室结论。真正值得记下的,是那个关于学习本身的悖论:一个系统当然可能因为不断学习而变强,但它也可能因为不断学习,越来越被自己过去的经验困住。这个悖论,比"刹车"还是"加速"都更接近 AI 自我改进的本质。
[1]