Hamel Husain
@hamelhusain
昨天把它测试了一下。 一些想法:
坏处:
1. 工作流程在查看数据之前创建评估,并让您纠正其错误。 我认为在尝试编写评估之前,您应该首先查看数据以加深理解并确定要处理的优先级。
2. 它创建了用于查看数据的 Markdown 文件,并要求我们“告诉它”哪些标签已关闭。 您应该创建自己的注释应用程序。 毕竟您正在使用编码代理(我们在直播中做到了这一点)!
3.它的评估范围太宽泛,同时捆绑了太多类型的失败。 首先查看数据可以避免这种情况。 我担心这可能会将人们引向错误的方向。
4. 工作流程让我们立即陷入特定评估的困境。 它还在几个步骤中询问“它看起来正确吗”,但没有真正为您提供足够的信息来做出决定。 我认为这在很多情况下会引导人们走向错误的工作流程。
好处:
1. 开箱即用的问题发现能力给我留下了深刻的印象,这是其他自动评估方法无法找到的! 它发现了人工切换、格式化、语音代理等方面的问题。 使用代理迭代地查看数据仍然更好,但这是我所见过的更“一次性”问题发现方法的最强性能。
2. 与之前的评估插件相比,这在用户体验方面是一个很大的改进 https://x.com/ClaudeDevs/status/2098500999656923145?s=20
3. 他们发布的博客文章传达了我同意的想法,例如查看数据、智能采样、不要使自己的评估饱和等的重要性。我真的很高兴更多的人以这种方式思考评估。
我们尝试在此处使用此功能的视频:https://x.com/i/broadcasts/1nKOLQOwQEEGR?s=20