Rohan Paul
@rohanpaul_ai
标准代理测试假设正确的答案永远不会改变,但在实时数据上却会改变。
因此,这篇 Adobe 论文检查了代码,重新计算它并获得更准确的分数。
Adobe 的解决方案是将正确的答案编写为代码,以便在每次测试运行时获取当前结果。然后,人工智能评分者会根据它检查代理的回复。
在 53 个测试用例中,AI 评分者通过这种方式将人类专家的匹配度比书面描述提高了 29%,并且使用的标记减少了 16%。由于没有答案可供检查,人工智能评分器的成绩比随机评分更差。
– arxiv。 org/abs/2609.16487
标题:“实时数据科学任务的基于技能的代理评估”