Rohan Paul@rohanpaul_ai2026年9月09日 10:15新的微软+清华大学论文发现,当法学硕士获得运行的结构化视图时,代理故障更容易诊断。 长时间的代理运行是混乱的。早期的错误可能会造成以后的症状,因此法学硕士阅读整个历史可能会归咎于错误的步骤。 让法学硕士有条理地进行,而不是原始的对话;这将 GPT-5.1 精确本地化从 3.63% 提高到 31.35%。 更好的代理调试在很大程度上取决于运行的表示方式,而不仅仅是判断模型的强度。 这个问题还没有解决;精确定位仍然只有 31.35%,但在要求法学硕士解释问题所在之前,将结构化跟踪和显式故障检查作为系统的一部分。打开原帖#511482