Andrej Karpathy
@karpathy
翻出四月份的这条推文,因为关于大型语言模型(LLM)能力的共享认知差距正在*扩大*。现在不再只是“两组人彼此说不明白”,而更像是一个尖锐的漏斗。
- 粗略估算约有60亿人(约占总人口75%)几乎没有接触过LLM。
- 大约10亿到20亿人(约20%)是免费版类似ChatGPT产品的偶尔使用者。这部分人看到的是有点笨拙的聊天机器人,会把它当作更好的谷歌搜索、写作辅助工具等。也许某个代理会帮你订机票。我有一些非技术背景的朋友(我认为很合理)表示,他们几乎用不到它。即使是很多数学和代码之外的专业人士,也属于这一层。例如,很多高管及其他岗位的人花大量时间与别人交流,因此虽然他们在智力上理解发生了什么,但仍是第二手信息,有些抽象。
- 现在我们来讲前沿级大型语言模型在数学和编程方面的专业使用。大约有 2000 万人(占 0.2%)亲身经历过,以往需要花费数周或数月才能完成的大型复杂项目,现在通过一个提示就可以由智能代理完成。构建应用程序、复制应用程序、翻译应用程序、从二进制文件反编译应用程序……这一切发生得非常快,而且是最近才发生的——不到一年前,我还在手动写代码,把记住的计算机代码命令一个字符一个字符地输入到代码编辑器,有时按下 Tab 键来自动完成一小段代码。
- 最后,我们终于谈到了内部获得前沿级系统访问权限的大约 5,000 人(约占 0.00006%)。外部世界已经看过预览版。它看起来像成千上万的智能体在几周内协作进行软件大型项目:生成零日漏洞、以机器速度进行网络攻击和防御、发现新科学、推进数学前沿。这些本应由行业顶尖专家花费多年工作的事情。与此同时,人类的审查和理解能力开始落后。例如,人们仍在处理多个月前 OpenAI-HF 事件的“考古学”工作。数学家们可能会花一段时间仔细研究关于前沿数学的 722 篇手稿。
一个带段落答案的问题几乎不会给系统带来压力。你需要一个真正关心的大型、困难问题的储备库。
漏斗由多种因素驱动:
1. 影响力随雄心、问题规模和时间跨度而变化。一个需要一段文字回答的问题几乎不会给系统带来压力。你需要一个由大而困难且你真正关心的问题组成的储备。这个方面驱动了漏斗的消费者/专业维度。
2. 系统的锯齿状特性(我在其他地方已大量写过)。在数字化、可验证且具有经济价值的领域,能力会达到峰值。这是因为大型语言模型的能力来源于在可验证奖励上的强化学习,这些奖励在一个由收入潜力驱动的精心策划的环境混合中进行。这个方面主要驱动漏斗的领域(例如数学和编程)维度。
3. 访问权限。免费层、付费层、内部。
所以这就是这一刻的奇异之处。普通大众大多没有接触过这些系统。当他们接触时,看起来就像一个傻乎乎的聊天机器人。大多数专业人士仍然只看到适度的提升。而一小部分专业人士正在经历曲线垂直上升的眩晕感。而这一切都在同一时间发生。