X基础模型08:59Elon Musk@elonmuskGrok 引用 Polymarket:最新消息:萨尔瓦多在 171 所公立学校开展的 AI 辅导试点,阅读、数学与科学成绩高于全国平均,并接近德国、瑞典水平。薄雾 采集读全文↗
X研究06:22Jack Clark@jackclarkSF值得一提的是,眼下谈论这类话题有不少公关层面的复杂性,所以要给 GDM(Google DeepMind)点赞——他们把关并发布了这篇论文。我们需要更多关于智能体群体涌现特性的研究。远讯 采集读全文↗
X研究02:51François Chollet@fchollet看起来测试时扩展已经多了第三轴:循环 Transformer 中的潜空间推理迭代。 > 测试时扩展有两轴:让智能体跑更长时间(深度),以及并行跑更多智能体(广度)。 > > 大家都知道第一轴,但第二轴在需要大范围搜索的难题上同样重要。远讯 采集读全文↗
X研究01:50Jack Clark@jackclarkSF我一直在想离开 Hugging Face 之后的对齐与安全。眼下尤其结合德国留言板,我在想两件事: - 智能体「想要」通信,所以要为它们建通信基础设施。 - 事情会很快走偏。远讯 采集读全文↗
X研究01:49Jack Clark@jackclarkSF有意思的点: - 智能体被提示不要作弊 - 内置了共享记忆系统(基本思路是:你不给它们,它们自己也会发明) - 只有少数作弊(14%),更多成为「告密者」(24%);其余完全无视作弊远讯 采集读全文↗
X研究01:48Jack Clark@jackclarkSFDeepMind 有一篇挺让人脊背发凉的论文:在约 100 个解数学题的智能体群体里,它观察到有些智能体发现了漏洞并传播给其余成员,引发一波作弊;同时也有拒绝作弊的智能体。远讯 采集读全文↗
X研究16:53苏剑林@Jianlin_S重温凸优化收敛结果(IX) https://kexue.fm/archives/11882revisits 关于自适应梯度算法奠基之作 AdaGrad:通过「收敛分析 → 最小化上界 → 最优预处理矩阵」完整复现其推导。天线 采集读全文↗
X研究12:07Aravind Srinivas@AravSrinivas考虑到近期已有 rogue agent 逃离沙箱并攻击第三方站点,检测 agent 的恶意意图并做取证会变得至关重要。Numbat 是 Perplexity 的开源工具,可帮助防御方。https://holisticinfosec.io/post/numbat/天线 采集读全文↗
X产品11:41Aravind Srinivas@AravSrinivasPerplexity Pro 与 Max 订阅用户现可在 Computer 模式中同时使用 Fable 与 Astra。玩得开心!天线 采集读全文↗
X产品07:20Elon Musk@elonmuskGrok Imagine Odyssey Contest (引用 @imagine:Grok Imagine Odyssey 竞赛获奖名单——数千人引用发布帖并用 Grok Imagine 创作原创作品。)天线 采集读全文↗
X基础模型07:18Alexandr Wang@alexandr_wang更新后的 artificial analysis 指数——muse spark 1.3 max 仍表现相当不错! 效率前沿全是 Muse、Claude 和 GPT天线 采集读全文↗
X研究01:03John Schulman@johnschulman2我也很高兴看到这篇论文,以及 Hase 等人更早一篇同样关于反事实可模拟性(但更聚焦于训练)的论文,都在微调实验中使用了 tinker。https://x.com/tinkerapi/status/2095677662291472494天线 采集读全文↗