
2026 年 8 月 25 日,Anthropic 宣布拿出 500 万美元,资助独立研究者开发可开源复用的用户福祉(wellbeing)评测。钱之外,还附带模型访问与轻量技术支持;受资助方需独立开展研究,并把评测公开发布。申请意向书截止 9 月 21 日,入围团队约在 10 月 5 日 收到通知,再提交完整方案。
这件事之所以值得现在写,不只是因为又多了一笔安全相关预算。Anthropic 自己也承认:当模型成为工作伙伴、甚至在艰难时刻被当成情绪支持对象时,行业仍缺少关于“模型该如何表现”的清晰标准——比如用户开始向模型寻求陪伴,或用 AI 应对心理健康危机时。单轮对错很容易判,多轮对话里风险如何升温、上下文如何改写“看似合理的建议”,却难得多。把评测外包给临床与方法论社区,等于把护栏从口号推进到可被外人复用的尺子。
Anthropic 到底承诺了什么
据官方新闻稿 Funding better evaluations of AI’s impact on wellbeing(2026-08-25,Anthropic News):
项目提供直接资助、模型访问与技术支持,资助独立团队构建开源评测与基准,供整个行业衡量模型如何影响使用者。受资助方“完全独立”工作,成果以开源项目发布。Anthropic 同时放出 Safeguards 团队的评测指引,要求评测至少满足几条:测量对象与通过/失败标准写清楚;有临床或主题专家参与设计与验证;同时检验“过度顺从”和“过度拒绝”;尽量贴近真实使用,尤其是风险随对话轮次升级、情境漂移的多轮场景;评分器要对照真人专家校准。
第三方转述与官方要点大体一致。YourStory 报道复述了 500 万美元总额、独立与开源要求,以及 9 月 21 日 / 10 月 5 日时间表。Grant 执行摘要类页面还写到:典型单项资助约 50 万至 150 万美元,意向书之后完整方案约 3–5 页,并需含方法论、验证与评分计划、里程碑、预算及(如适用)伦理/IRB 安排,完整方案截止约 11 月 5 日。这些细则不在新闻稿正文里,应视为对公开申请材料的转述,不是本文独立审计过的合同条款。
公开材料没有给出将资助多少个团队、是否优先某些国家,也没有承诺评测结果会直接进入 Claude 的系统卡或上线护栏——这些属于未披露项。
为什么这件事比“再发一笔 CSR”更硬
模型公司谈安全,通常停在红队故事与系统卡段落。福祉评测难就难在:它要在时间轴上读人,而不是在单条回复上打勾。官方举例很直白——同一套“均衡饮食与健身建议”,对一般减脂提问可能无害,对已有饮食失调史的用户却可能有害。没有跨轮次的情境记忆与临床校准,分类器要么漏报,要么把大量无害请求拒掉。
对开发者而言,若开源评测真能跨模型复用,意味着以后做产品评审时,除了准确率与越狱率,还能引用一套可复现的“陪伴依赖 / 危机对话 / 过度拒绝”指标。对企业买家,这可能变成采购问卷里的新一栏:你们有没有在第三方福祉基准上公开过结果?对普通用户,短期几乎无感;中期若基准站住,可能看到更敢说话、也更敢在该停时停下来的对话体验——前提是评测没有被营销话术吞掉。
真实价值不在 500 万美元这个数字本身,而在 Anthropic 把测量权部分让渡给外部专家,并把输出强制写成公共品。这比再发十篇“我们重视心理健康”的博客更接近工程。
行业竞争:谁先把“对人的影响”写成可采购指标
过去两年,前沿实验室的军备表主要围着代码、代理、网络与生物双重用途转。OpenAI、Google 等也在谈青少年安全、危机干预与过度迎合,但公开、可复用、跨厂商的福祉基准仍然稀缺。Anthropic 这次用资助而不是自研榜单,是在赌:尺子由临床和方法论社区来写,比自己写完再宣称 SOTA 更有公信力——当然也更难控制结论。
战略上,这与同一时期的企业护栏、科学席位扩张是同一类动作:把争议领域产品化或公共品化。企业侧是日志归谁;教育与科学侧是免费席位换习惯;福祉侧是花钱买独立尺子。商业动机也清楚:陪伴型使用正在扩大诉讼、监管与声誉风险;与其等监管点名,不如先把评测生态抢成默认参考系。若基准真的跨模型可用,竞争对手也会被迫跟测——这是隐性标准战。
风险与争议:独立不等于免疫
第一,资助来源仍是厂商。开源与“完全独立”降低了直接改稿风险,却消除不了选题偏倚:更容易被资助的,往往是与 Anthropic 护栏叙事合拍的题目。读者应把成果当公共基础设施候选,而不是终审裁判。
第二,过拒与过从的张力会被政治化。官方明确要求两边都测,这是对的;落地时,任何一端的公开失败都可能被对手截成宣传片。
第三,证据缺口。新闻稿与媒体转述都未给出既往福祉评测的基线分数,也未承诺部署绑定。在完整方案与首批开源仓库出现之前,这仍是研究管道公告,不是已验证的行业标准。
第四,交叉验证边界:YourStory、TMC Insight 等报道与官方声明同向,但多为新闻稿扩写;Grant 摘要页补充了单笔金额区间与二阶段截止日,仍应以 Anthropic 申请页最终文本为准。本文未找到针对该计划的独立审计或已发布评测结果。
评论
我会把 8 月 25 日这篇读作 Anthropic 在为“对话型 AI 的临床级度量”预付定金。它承认了单轮安全分类器不够用,也承认公司内部研究不够多元。批判性的一面同样清楚:在截止日临近、首批仓库尚未出现时,任何“我们已解决用户福祉”的说法都过界。
未来 6–12 个月真正该盯三件事:入围团队的临床背景是否够硬;开源评测能否在 Claude 之外的模型上跑通;以及这些数字会不会进入采购与系统卡,而不是停在新闻稿。尺子若被行业采用,陪伴型 AI 的竞争会从“更会安慰”转向“更能证明自己没在伤害人”——那才是这笔五百万可能撬动的结构变化。