Rohan Paul
@rohanpaul_ai
Salesforce AI 的新研究发现,一旦围绕较弱的模型调整座席的提示、工具和工作流程,复制更强的模型可能会使情况变得更糟;针对自身故障的针对性修复效果更好。
较弱的模型不需要像双子座那样思考;它需要双子座来纠正自己方法失败的地方。
Salesforce 使用 Qwen3-Coder-30B-A3B 在 7 个企业任务中对此进行了测试。
围绕 Qwen 调整代理设置将平均成功率从 29.2% 提高到 78.0%。
更强的 Gemini 模型在相同的设置下达到了 93.6%,因此教 Qwen 复制 Gemini 看起来是显而易见的下一步行动。
相反,通过完整的 Gemini 运行对 Qwen 进行微调,成功率降至 63.1%,所有 7 项任务的性能均下降。
Qwen 学到了有用的知识,但它也复制了 Gemini 的计划方式,这不再适合围绕 Qwen 的原始行为建立的设置。
解决办法是保留 Qwen 自己失败的运行,并让 Gemini 仅纠正 Qwen 出错的步骤。
这使得成功率达到 79.7%,并且没有失去之前的成果。
教训:在不破坏已经在其周围工作的代理设置的情况下调整模型。