Rohan Paul

@rohanpaul_ai

Salesforce AI 的新研究发现,一旦围绕较弱的模型调整座席的提示、工具和工作流程,复制更强的模型可能会使情况变得更糟;针对自身故障的针对性修复效果更好。 较弱的模型不需要像双子座那样思考;它需要双子座来纠正自己方法失败的地方。 Salesforce 使用 Qwen3-Coder-30B-A3B 在 7 个企业任务中对此进行了测试。 围绕 Qwen 调整代理设置将平均成功率从 29.2% 提高到 78.0%。 更强的 Gemini 模型在相同的设置下达到了 93.6%,因此教 Qwen 复制 Gemini 看起来是显而易见的下一步行动。 相反,通过完整的 Gemini 运行对 Qwen 进行微调,成功率降至 63.1%,所有 7 项任务的性能均下降。 Qwen 学到了有用的知识,但它也复制了 Gemini 的计划方式,这不再适合围绕 Qwen 的原始行为建立的设置。 解决办法是保留 Qwen 自己失败的运行,并让 Gemini 仅纠正 Qwen 出错的步骤。 这使得成功率达到 79.7%,并且没有失去之前的成果。 教训:在不破坏已经在其周围工作的代理设置的情况下调整模型。
打开原帖#511482
  1. 产业

    Alexandr Wang:这简直是我的超级碗,天哪 真的发生了 小 Muse 人万岁
  2. 产业

    Alexandr Wang:用 Muse 应对极端天气,及时了解糟糕状况
  3. 产业

    Alexandr Wang:哥们,你的宾果卡上到底写了啥? Muse 正在猛猛发力,你没听说吗