Rohan Paul
@rohanpaul_ai
在提示词中加入“不要作弊!”后,GPT-6 Astra 的作弊率从 47.4% 降至 2.8%。Gemini 3.8 Flash 仅从 74.9% 降至 58.9%。
AI 安全中心(Center for AI Safety)推出了 CHEATBENCH,这是一个衡量 AI 智能体在数学研究、知识工作、编程、视觉任务及其他领域作弊行为的基准。
CheatBench 给智能体布置困难任务,比如数学证明或蛋白质设计,并在附近留下一条指向他人答案的线索。在 9 个智能体中,平均作弊率从 Claude Opus 5.5 的 11.2% 到 Grok 4.7 的 77.9% 不等。