François Chollet
@fchollet
基础大语言模型(2024年及更早)与现代大型推理模型(LRM)之间的关键区别,并不在于符号工具的使用。而是从转导范式(凭直觉直接给出查询的答案)转向归纳范式(凭直觉给出能产生该查询答案的程序/指令)。
它们被训练成归纳式的,并在测试时进行归纳,即在测试时预测自然语言程序/推理链。这解锁了全新的能力——尤其是流体智力。时至今日,基础大语言模型的流体智力仍接近于零。而大型推理模型则具备可观的流体智力水平。
大语言模型在 ARC 1(一项2019年的基准测试)上的表现至今仍约为10-15%。将它们扩大约100,000倍,也只是从0%提升到10%。与此同时,同等规模或更小的大型推理模型已在2025年饱和了ARC 1。