John Schulman@johnschulman201:02看好这个方向。有了解释质量的指标,才可能做爬山优化;反事实可模拟性看起来是对的。Adam 等人做了一个数据集与流水线,能构造比以往工作更多样、更贴近现实的测试用例,并做了有趣的实验。也可以训练模型写出更好的事后行为解释,这条讨论串也强调了这一点。 > 模型能否学会解释自己的行为,例如为何忽略用户请求或写出代码错误? > > 我们在数千条模型对自身真实场景行为的解释上做了训练。 > > 仅用这一通用数据集训练,就能泛化到留出评测。#728545
MiniMax Design (H3)@Hailuo_AI18:54MiniMax Design / Hailuo(@Hailuo_AI):**要把 H3 当成工作流里的最终渲染器吗?** 引用创作者实践:把 MiniMax H3 当产品 CG 渲染器试用——先本地定方向,再提交 API,减少无效调用。#728545
Qwen Developers@QwenDevs10:33Qwen Developers(@QwenDevs)谈 **E-Commerce Bench**: > E-Commerce Bench 是在特定业务场景下评测模型的一次小尝试,希望能为提升专项业务任务上的模型表现提供参考。 引用 @Alibaba_Qwen:Agent 以 ¥100,000 起步运营网店 365 天(采购、谈判、定价、促销、库存、现金流),市场由真实电商数据驱动。#728545
Jim Fan@DrJimFan10:142016 年在 OpenAI 的旧时光:一个 agent 盯着屏幕像素、移动鼠标,在 United 上订机票。我们称之为 World of Bits,属于 OpenAI Universe。十年后,Astra 在同一宇宙里重生,连命名都「天文」地合适。 Universe 或许是当时最雄心勃勃的 AI 基础设施项目,但我们没能真正解决它。一个对「提交」按钮毫无先验的策略,只能靠试错重新发现整套互联网视觉语言。事后看,在一堆 Pascal Titan X GPU 上、对着手工绘制的逐任务「工匠式」奖励函数从零做 RL,完全注定失败。 要解决计算机操控 agent,正确路径原来是先「煮沸整片海洋」(在你能找到的所有通用任务上爬坡),再专精回屏幕像素与按键。简单说,就是「专精的通才」。 教训:领先一步是先锋;领先三步是先知;领先五步是烈士。 恭喜 GPT-6!那班 United 航班终于能可靠地订到了。2016 年的实习生我会心一笑。#728545
François Chollet@fchollet04:09补充一句:我们在 3 月发布 ARC-AGI-3,当时前沿模型得分不足 1%,一些 Singularitarian 发帖者把这当成人身冒犯,情绪很激动。他们说基准从根本上坏了,连最聪明的人也解不了,实际上最高只能到 40%,等等。 因为我们发布了一个未饱和基准,此后要面对大量辱骂与仇恨帖。 事实证明,这个基准校准得很好。只要比普通人做得更好,人类拿到 100% 并不难——只需比我们的人类基线用更少动作(该基线并不强,因为我们用的是未筛选人类测试者)。 因此,一旦在智能体通用智能上取得真正进展,AI 拿到 100% 也很可行。AI 在 6 个月内从不足 1% 到 100% 的轨迹表明,该基准捕捉到了近期智能体能力的跃升,而且快于包括我们在内多数人的预期。 > 任何认真投入的聪明人类,在 ARC-AGI-3 上应能拿到 >90%#728545
François Chollet@fchollet03:42GPT-6 Astra 在交互式推理问题上代表模型能力的阶跃变化。使用我们的标准 harness,它在 ARC-AGI-3 上得分 66%;使用持续对话 harness 与定制压缩后接近 100%,成本大约每局 360 美元。 事实上,持续 harness 版本在几乎所有关卡的动作效率上显著超过我们的人类基线。当我们检查推理链以理解模型如何运作时,发现它为每个游戏与关卡进行高效的即时符号世界建模,甚至发展出自用的简写 DSL 来表示局内局面——本质上是一种游戏专用代数记号。 总体而言,Astra 展现出我们此前只在复杂 harness 中见过的符号建模行为——因此 harness 能力正越来越多地转移到模型本身。 我们认为 Astra 是模型智能的重大突破。 阅读我们对 Astra 及这些结果含义的说明:https://arcprize.org/blog/astra#728545
Mark Chen@markchen9003:39GPT-6 Astra 来了!这对我们的研究团队是一个重要时刻——多年在预训练、强化学习和后训练上的工作,汇聚成我们迄今最强且对齐更好的模型。它能编写并测试软件、跨应用操控电脑,甚至协助攻克开放科学问题! 几年前还像重大挑战的能力,如今已变成人们真正能用的工具。以 Computer Use 为例——如果你以前试过觉得太慢或不够好,建议再试一次。我们自 Operator 以来进步很大,现在已经「开箱可用」。 我们也在让这些系统代表你完成更关键的工作。Agent 需要与你的目标与价值观保持一致、思考过程更透明,并在任务变难时仍能接受监督。我们在 Astra 上这些行为有显著进展,并配合更强的监控以阻止潜在未授权操作。这些工作是本次发布成为可能的一部分。 我认为对齐是 AI 最重要的研究前沿之一,远未解决。理解并对齐模型的能力必须跟上模型能力的提升。我们希望让人有更多空间去思考、构建与发现,同时让越来越强的工具仍*处于人的控制之下*。 非常感谢把我们带到这里的研究者与团队。前方还有大量工作,我对近期能实现什么感到非常兴奋!#728545
Percy Liang@percyliang02:56一年前,David 是 Marin 唯一的全职。今天,得益于 Open Athena,Marin 已有 10 名全职。读他的帖子能更好理解 Marin 的背景。David 的文字一向值得一读。 > Marin 启动 535B/A23B MoE 主线运行已有几周,目前进展几乎“无聊地顺利”。 > > Marin 加入 Open Athena 也刚过一年。我写了一些关于我们走了多远、以及如何走到这里的想法。https://openathena.ai/blog/marin-535b-launch-note/#728545
Noam Brown@polynoamial02:42在 GPT-6 Astra 的所有用例中,我最期待的是科学发现。我们在 @OpenAI 还没有在数学与科学上把它推到极限。 我期待每天早上醒来,都能看到有人用这个模型做出新的科学突破!#728545
François Chollet@fchollet02:18这是错误的路径。这种绝对、压制性的 AI 监管思路,最终会被证明是主动适得其反的。 > Bernie Sanders 与 Greg Casar 今日宣布《禁止人工超级智能法案》。美国境内所有 AI 开发将暂停。能力达到或超过人类认知表现的系统将被禁止。违规者面临最高 20 年监禁。#728545
François Chollet@fchollet00:54我认为,无论技术上是否必要,我们都应刻意在经济与社会的所有关键流程中保持人类在环。 即便 AI 发展出高级自主的*能力*,我们也不应让它高度自主。我们必须保持对所有关键流程的控制、可见与理解,不能因为做得到就把一切盲目交给 AI 智能体。人手中的工具型 AI,才是唯一值得追求的 AI 形态。#728545
Sara Hooker@sarahookr22:32AI 进展最大的缺口之一是数据。 Invent a Dataset 能把意图翻译成可用于训练的 AI 就绪数据。 这是弥合缺口很重要的一步。 向 @adaption_ai 团队致谢。 > 推出 Invent a Dataset。 > > 描述你需要的数据集,即可得到结构化、可训练的数据集,无需已有数据。 > > 数据集构建过去从收集开始,现在从规格说明开始。#728545
MiniMax (official)@MiniMax_AI20:47MiniMax(@MiniMax_AI):**MiniMax-M3 驱动 HUMAIN-M3**。 - 基于 M3 基座,再训练 **超过 1 万亿阿拉伯语 token** - 覆盖阿拉伯语及多种语言与方言 - 引用 @HUMAIN:HUMAIN-M3 已在 HUMAIN Node 研究预览#728545
Qwen@Alibaba_Qwen12:00通义千问 Qwen(@Alibaba_Qwen)宣布发布 **E-Commerce Bench**,面向 **长程自主商业运营** 评测。 经 X 帖核实: - 智能体起始资金 **¥100,000** - 经营网店 **365 天** - 覆盖采购、谈判、定价、促销、库存与现金流 - 市场由 **真实电商数据** 驱动 第一手来源:https://x.com/Alibaba_Qwen/status/2095476249556853100#728545
Tencent Hy@TencentHunyuan18:12腾讯混元(@TencentHunyuan)谈 **Hy4 preview**: - 在 AI 研究中自行发现推理瓶颈 - 通过算子融合与通信优化,端到端吞吐提升 **31.8%** - 在不同上下文长度与并发下表现稳定 - 更多:https://hy.tencent.ai/#728545
Fei-Fei Li@drfeifei12:00李飞飞(@drfeifei)宣布 **World Labs** 达成重要里程碑,推出 **Atlas**——被称为从零训练的首类 **多模态 world model**。 帖中要点(经 X og 元数据核实): - 可生成具有 **像素级相机控制** 的帧 - 可用少至 **一张** 图像重建大场景 - 定位为 @theworldlabs 的多模态世界模型里程碑 第一手来源:@drfeifei 的 X 公告。#728545
Kai-Fu Lee@kaifulee12:00李开复(@kaifulee)宣布新书 **AI Native: The Mandate to Transform Your Company** 官网已上线。 经 X 帖(og 描述)核实: - AI 正在改写公司如何运营、竞争与创造价值 - 核心表述:问题不再是要不要采用 AI,而是多快成为 **AI-native** - 帖中含预售号召(公开材料对应电子书/有声约 9/15、精装约 11/3) 第一手来源:https://x.com/kaifulee/status/2094531609450172615#728545
Hailuo@Hailuo_AI12:00Hailuo 海螺(@Hailuo_AI)宣布在 MiniMax Design 上线 **H3 Max**。 - 生成更快 - **480p** 约 **$0.02/秒** 起 - 含 **3 次免费**生成#728545
Tencent Hunyuan@TencentHunyuan12:00腾讯混元(@TencentHunyuan)宣布 **Hy4** 预览。 - 总参 **770B**,激活 **49B** - **1M** 上下文窗口 - 面向**生产力**场景,强调**开放**与**可负担**#728545
Z.ai@Zai_org12:00Z.ai(@Zai_org)发布 **GLM-5.3-Flash**。 - 原生**多模态** - **1M** 上下文窗口 - **320B-A18B** 规模 - **MIT** 许可证 - 此前为 **Ox Alpha** 预览版#728545
Qwen@Alibaba_Qwen12:00通义千问 Qwen(@Alibaba_Qwen)宣布开源 **Qwen3.8-Flash** 权重。 - 多模态 **MoE** 模型 - **Qwen4** 架构的早期预览 - 规模信息:帖中强调 **125B** / **51B** N-gram 配置 - 开放权重发布#728545
DeepSeek@deepseek_ai17:17DeepSeek(@deepseek_ai)续帖(2/n): - 多模态解锁更多 Agent 用例 - **V4-Flash-Vision-Exp** 可在多种 Agent 框架中顺畅运行 - 将视觉理解与丰富工具结合,服务更实际工作流#728545
DeepSeek@deepseek_ai12:00DeepSeek(@deepseek_ai)宣布 **DeepSeek-V4-Flash-Vision-Exp** 已在 API 上线。 - 实验性多模态模型,文本能力大致对齐 **V4-Flash** - 面向 **多模态 Agent** 场景 - 以 Vision-Exp 预览形式通过 DeepSeek API 提供#728545
DeepSeek@deepseek_ai12:00DeepSeek(@deepseek_ai)宣布 **DeepSeek Harness v0.1** 进入 **Developer Preview**。 经 X 帖核实: - 向全球构建 agent harness 的开发者开放 - 代码库以 **MIT** 协议开源 - 基于 **Cordis** 元框架 - 帖中强调核心思路:一切皆插件 第一手来源:https://x.com/deepseek_ai/status/2087887408440164663#728545
Kimi.ai@Kimi_Moonshot16:20Kimi.ai(@Kimi_Moonshot):**Kimi K3 现已登陆 @databricks**。 引用 Databricks:Moonshot AI 开源权重模型 Kimi K3 经 Unity AI Gateway 可用,在数据所在处运行,服务 Lakehouse 上的自定义 AI 应用与 Agent。#728545
MiniMax Agent@MiniMaxAgent12:00MiniMax Agent(@MiniMaxAgent)发布 **MiniMax Code 2.0**。 - 编程 Agent 产品升级 - 基于开源 **Pi Agent** 框架重建#728545
MiniMax@MiniMax_AI12:00MiniMax(@MiniMax_AI)预告即将推出 **MiniMax H3**。 - **Omni-Reference** 能力 - 支持商用生成 - 计划**开放权重** - 将登陆 **HailuoAI.video** 与 API#728545
Lilian Weng@lilianweng03:00翁荔(@lilianweng)发帖称这是“艰难而难过的决定”,并已向 **Thinky**(Thinking Machines)同事分享说明。 核实原文: > It is a hard and sad decision. I shared this message with folks at Thinky. Thank you all for the time together♥️ Just as the last sentence in my message: The future worth building is human. 对其附带说明的中性概括:她表示无法继续维持创业公司所需节奏,持续压力与工作量已超出健康可承受范围。本稿仅记录其公开离任表态,不做额外揣测。#728545
Kimi@Kimi_Moonshot12:00Kimi / 月之暗面(@Kimi_Moonshot)宣布发布 **Kimi K3** 权重与技术报告。 - **2.8T** Mixture-of-Experts(MoE) - **原生视觉**能力 - **1M** 上下文窗口 - 开放权重 + 技术报告同步公开#728545
Xiaomi MiMo Developers@XiaomiMiMoDevs12:00小米 MiMo Developers(@XiaomiMiMoDevs):**MiMo Responses API 现已可用**。 - 兼容 OpenAI Responses API,Codex 用户可直接接入 - 支持流式、函数调用、深度思考、结构化输出等 - API 文档:https://mimo.mi.com/docs/en-US/api/chat/responses - Codex 配置:https://mimo.mi.com/docs/en-US/tokenplan/integration/codex-configuration#728545
Tianqi Chen@tqchenml12:00陈天奇(@tqchenml)宣布发布配套 **@SCSatCMU** 新开迷你系列课的整理版在线书:**Modern GPU Programming for ML Systems**(属于 ML Systems 课程)。 经 X 帖核实: - 课程涵盖数据布局 swizzling、**3D TMA**、以及前沿 **Blackwell** 编程等 - 以 curated online book 形式公开 第一手来源:https://x.com/tqchenml/status/2069382647302734099#728545
Xiaomi MiMo@XiaomiMiMo23:05小米 MiMo(@XiaomiMiMo):**MiMo Claw 现已上线**。 据 @XiaomiMiMoDevs 发布说明: - 旗舰模型 + 金山办公集成 - 面向可靠长时 Agent 任务 - 称相较同类方案 token 消耗降低 40–60%#728545
Xiaomi MiMo@XiaomiMiMo12:00小米 MiMo(@XiaomiMiMo)宣布与 **@TileRT_AI** 合作发布 **MiMo-V2.5-Pro-UltraSpeed**。 经 X 帖核实: - 宣称在 **1 万亿** 参数模型上达到 **1000+ tokens/s** 输出速度 - 定位为该规模/速度组合的首次突破 - 明确区别于晶圆级集成(如 Cerebras)与纯片上 SRAM 路线 第一手来源:https://x.com/XiaomiMiMo/status/2063993790587904362#728545