一个发明了 RLHF 的人,现在说 RLHF 可能是问题本身。Diogo Almeida——InstructGPT、ChatGPT 与 GPT-4 论文的共同作者、基于人类反馈的强化学习(RLHF)这一训练范式的核心发明人之一——在离开 OpenAI 两年后,于 9 月 15 日发布了自己的新模型 Jev 与新的训练方法 RLCD。他在公开演讲中的批评一针见血:今天的 AI 很会"帮忙"(assistance),却还不太会"把活干完"(automation);而 RLHF 恰恰是让模型学会和稀泥的训练方式。
他的论证指向一个具体的失败模式。问今天的模型"方案 A 还是方案 B",它列五条优点、三条风险,最后补一句"请根据实际情况权衡"——在聊天场景里这叫得体,在自动化流程里这叫致命:下游一串子 agent 等着它做决定,它交出来一份公关免责声明。Almeida 的观察是,偏好优化(preference optimization)惩罚"可见的不确定性"甚于"自信的错误":模型学会了把话说圆,而不是把事做对。他据此主张训练目标应该超越人类偏好与可验证奖励这两极,加上第三个目标——校准的决策(calibrated decision-making)。
Jev 本身是这份批评的产品化。据 Almeida 发布材料,Jev 宣称推理速度提升 20 至 200 倍、成本降低 40 至 400 倍、输出 token 免费,定位"针对决策优化的前沿可组合智能"。需要立刻标注:这些性能数字全部是公司口径,未经第三方
[1][2]独立评测;"输出免费"的定价结构也意味着商业模式依赖下游推理或订阅。真正值得关注的不是数字,而是方向——如果一个曾参与塑造 ChatGPT 的工程师认为行业过去四年在训练目标上押错了注,这本身就是值得记录的信号。
把这份批评放回本周的行业语境,它和"减速"辩论形成了奇怪的互补。阿莫代伊呼吁慢下来,担心的是模型太强;Almeida 批评的是模型太"圆滑"——不够强的地方恰恰在决策而非语言。两者的交集是一个此前少有人直接说的判断:过去几年行业优化的核心指标(人类偏好、指令遵循、对话流畅度)与真正需要的指标(可靠决策、校准的不确定性、任务完成率)之间存在系统性错位。若这个判断成立,那么无论各家怎么调整发布节奏,训练目标本身都需要重写。
特稿的立场说清楚:本文不为 Jev 背书,也不预设 RLHF 必然失败。Almeida 的批评有一处天然弱点——他发明的 RLHF 让 ChatGPT 成为可能,而他的新公司要推翻的正是这套范式,动机与立场需要读者自行权衡。但"assistance 与 automation 是两种能力"这个区分本身,比任何单一模型都更值得记下:它可能是 2026 年关于 AI 最有用的一个句子。
[1][2]