Rohan Paul

@rohanpaul_ai

标准代理测试假设正确的答案永远不会改变,但在实时数据上却会改变。 因此,这篇 Adob​​e 论文检查了代码,重新计算它并获得更准确的分数。 Adobe 的解决方案是将正确的答案编写为代码,以便在每次测试运行时获取当前结果。然后,人工智能评分者会根据它检查代理的回复。 在 53 个测试用例中,AI 评分者通过这种方式将人类专家的匹配度比书面描述提高了 29%,并且使用的标记减少了 16%。由于没有答案可供检查,人工智能评分器的成绩比随机评分更差。 – arxiv。 org/abs/2609.16487 标题:“实时数据科学任务的基于技能的代理评估”
打开原帖#511482
  1. 研究

    François Chollet:基础大语言模型(2024年及更早)与现代大型推理模型(LRM)之间的关键区…
  2. 产业

    Michael Truell:Grok Bot 能把有用的工作做完,无需你主动提出要求
  3. 产业

    Aravind Srinivas:我们正在开源我们的多模态 Decision 模型,并通过我们的 Decis…