Nathan Lambert
@natolambert
JSD和我在这个播客中最大的分歧是蒸馏的影响。在我们对互连的研究中,@ xeophon和我都同意,没有确凿的证据表明蒸馏对中国实验室产生了巨大的影响。
与此同时,顺丰的八卦工厂一直在加倍投入中国实验室,从蒸馏中获得巨大收益。
蒸馏产生巨大影响的论点是蒸馏痕迹进入中期训练,使RL工作更加容易。
我的论点是,蒸馏是在能力上提前1-2个月接近前沿,中国实验室已经有足够强大的模型,这种中间训练设置可以在他们自己的模型上完成,大部分能力的收获来自扩展RL环境训练,它不能干净地链接到蒸馏数据路径。我们觉得最近的RL仪表板来自
m @ xiaomimo支持这一说法。
如果你能相信中国实验室真的很擅长构建LLMs,甚至可能比专注于OpenAI/Ant等更好,因为他们目前的野心有点窄 (追赶),而不是变革性的产品/发明