9 月 21 日晚间,盖茨基金会联合全球 AI 生态的多家机构宣布一项联合承诺:五年内推动超过 30 亿人用自己日常使用的语言和语音,安全、有效地使用 AI 服务。首批 60 家签署方包括 OpenAI、Anthropic、谷歌、微软、亚马逊、英伟达——从最前沿的实验室到最传统的云巨头,第一次为同一个目标签在同一张纸上。

[1][2]

这份承诺要解决的问题,是 AI 领域最安静也最顽固的缺口:语言数据集的代表性。当前前沿模型的训练与能力展示高度集中在英语与少数大语种上——全球约 7000 种语言中,绝大多数语言在主流模型的训练数据里几乎不存在,或者只占可怜的比重。这意味着 AI 能力的红利,天然向英语世界倾斜;而对数十亿非英语使用者来说,"AI 可及性"不是有没有手机的问题,是模型根本不说你说话的问题。盖茨基金会此前已宣布两年至少 10 亿美元投入 AI 可及性,这次联合承诺是它在"语言"这一单点上的集结号。

这个名单的象征意义值得单独读。OpenAI、Anthropic、谷歌、微软——这几家公司在过去一周里还在为减速、反垄断诉讼、谁证明哥德巴赫吵得不可开交,现在却全部出现在同一份公益承诺上。这不矛盾:商业竞争的对手,在"扩大市场基数"这件事上是天然盟友——多语种数据集不只是公益,它本身就是下一个用户增长曲线。一个会说印地语或斯瓦希里语的模型,打开的是以十亿计的潜在市场。公益叙事与商业逻辑在这里罕见地重合了。

当然,承诺与落地之间隔着真实距离。60 家签署方意味着责任分散,五年推动 30 亿人是难以独立核验的目标值;语言数据集的构建需要面对语料版权、低资源语言的采集成本、以及"翻译≠本地化"的质量问题——一个模型"会说"某种语言,与它在那种语言的文化语境里"可靠",是两回事。更关键的考验在于:签署方会不会把多语种能力做成付费墙后面的高级功能,还是真的让它普惠。这个承诺的真正判据,不在签字仪式,而在两年后各家公司公开的多语种模型评估结果里。

[1][2]
清晨的社区数字中心,一名志愿者背影正在教一位老人使用平板电脑,屏幕上是一排语言切换图标,窗外阳光洒进房间,桌上摆着多语言的宣传手册
让 AI 说你的语言, AI 生成插画,非新闻照片