Rohan Paul

@rohanpaul_ai

一个名为 JevBench 的新基准刚刚发布。 适用于输出为有界软件决策而不是开放式散文的模型,并遵循 TypeSafe 于 9 月 15 日发布的 Jev,它采用应用程序状态加上固定选择,并返回带有概率而不是散文的键入答案。 该基准测试的分数有意结合了智能、校准、速度和成本,因为即使原始精度很高,部署也可能会失败。 例如GPT-5.6 Luna 记录的硬情况精度比 Jev 1.13.0 高得多,但 Jev 领先于综合测试,因为该基准还对延迟、校准和成本进行了定价。 几何平均值会导致 1 个轴上的卓越性能无法完全补偿较弱的轴。 结果是关于狭窄类型决策工作负载的证据,而不是 Jev 通常比 GPT-5.6 Luna 能力更强的证据。
打开原帖#511482
  1. 产业

    Alexandr Wang:muse 来俘获你们所有人的心了 🌹
  2. 前沿

    Nathan Lambert:关于我对RSI的最新看法:https://www.interconnect…
  3. 前沿

    Nathan Lambert:关于人工智能预测的讨论中,一个大问题是人们问“人工智能什么时候会取代X工作…