Rohan Paul
@rohanpaul_ai
论文发现 LLM 推理具有超出生成单词的内部结构,为从模型内部监控推理开辟了一条可能的途径。
法学硕士想要做什么以及它是否正确地做这件事似乎在内部是可以分开的。
研究人员追踪了8种常见的动作,包括提取事实、分解、回忆、演绎、代数和计算。
每一步都会产生独特的内部图案,这些图案在中间层周围最为清晰。
即使完全相同的标记在模型中看起来也会有所不同,具体取决于它正在执行的推理工作。
环境也塑造了这些状态。
当前30个令牌的访问被阻止时,下一次推理操作的信号减弱。
最重要的是,错误的计算或推导仍然可以携带正确的操作签名。
该模型可以表示它正在尝试的推理类型,但不一定能得出正确的推理。
– arxiv。组织/abs/2609.04753
标题:“思想链的表面之下:法学硕士推理操作的机械解释”