Rohan Paul
@rohanpaul_ai
一个名为 JevBench 的新基准刚刚发布。
适用于输出为有界软件决策而不是开放式散文的模型,并遵循 TypeSafe 于 9 月 15 日发布的 Jev,它采用应用程序状态加上固定选择,并返回带有概率而不是散文的键入答案。
该基准测试的分数有意结合了智能、校准、速度和成本,因为即使原始精度很高,部署也可能会失败。
例如GPT-5.6 Luna 记录的硬情况精度比 Jev 1.13.0 高得多,但 Jev 领先于综合测试,因为该基准还对延迟、校准和成本进行了定价。
几何平均值会导致 1 个轴上的卓越性能无法完全补偿较弱的轴。
结果是关于狭窄类型决策工作负载的证据,而不是 Jev 通常比 GPT-5.6 Luna 能力更强的证据。