Rohan Paul
@rohanpaul_ai
前沿模型在阅读合同时,有时会引用一条根本不存在的条款。
Overmind 用你自己的生产环境轨迹微调一个小型开源模型,然后在基于这些真实任务构建的评测上,把它与你当前使用的模型进行对比打分。
他们公布的对比是:经 Overmind 调优的 Qwen3.5 9B 对比 GPT5.6 Luna。该公司称,在法律合同中虚构条款减少了 20 到 30 倍,逐字引用条款的准确率提高了 7 倍。
在这里,可观测性层和训练层共享同一份数据。揭示智能体在哪里失败的轨迹变成了数据集,而评测是基于真实任务构建的,而非公开基准。
产出的是一个更小的开源模型,权重归你所有。你可以把它托管在 Overmind 上,也可以自己运行。