Rohan Paul

@rohanpaul_ai

前沿模型在阅读合同时,有时会引用一条根本不存在的条款。 Overmind 用你自己的生产环境轨迹微调一个小型开源模型,然后在基于这些真实任务构建的评测上,把它与你当前使用的模型进行对比打分。 他们公布的对比是:经 Overmind 调优的 Qwen3.5 9B 对比 GPT5.6 Luna。该公司称,在法律合同中虚构条款减少了 20 到 30 倍,逐字引用条款的准确率提高了 7 倍。 在这里,可观测性层和训练层共享同一份数据。揭示智能体在哪里失败的轨迹变成了数据集,而评测是基于真实任务构建的,而非公开基准。 产出的是一个更小的开源模型,权重归你所有。你可以把它托管在 Overmind 上,也可以自己运行。
打开原帖#511482
  1. 产业

    Greg Brockman:迈向加速科学发现、改善每个人的生活质量
  2. 研究

    François Chollet:G 会从数学 + 代码的 RLVR 中「涌现」吗?
  3. 研究

    François Chollet:如果参差不齐的能力前沿主要就是数学 + 代码呢?