Rohan Paul

@rohanpaul_ai

谷歌发布了面向端侧多模态 AI 的 EmbeddingGemma 2,采用 Apache 2.0 许可证 > 把文本、代码、图像、音频和视频放进手机上同一个可搜索的空间。 为手机补上了缺失的一块:一种无需把数据发送到服务器就能理解和搜索你自己内容的方式。 > 7.4 亿参数,采用 Gemma 4 架构。 > 各部分是模块化的,所以纯文本应用只需要 2.7 亿参数,而 1.7 亿参数的视觉编码器和 3 亿参数的音频编码器仅在需要时加载。 > 在 Pixel 11 Pro 上,量化后的文本权重占用约 191MB 活动内存,完整的多模态模型约占 567MB。 > 上下文窗口扩大 4 倍,达到 8K token,足以在一次输入中容纳约 5.5 分钟音频、29 张图像或 58 帧视频。 > 代码搜索提升最大,MTEB Code 得分从 68.76 升至 78.68,而多语言文本得分保持持平。 > 谷歌还声称在音频和视觉基准上取得了 10 亿参数以下模型的最佳成绩,并胜过一些规模是其两倍的专用模型,
打开原帖#511482
  1. 产业

    Greg Brockman:迈向加速科学发现、改善每个人的生活质量
  2. 研究

    François Chollet:G 会从数学 + 代码的 RLVR 中「涌现」吗?
  3. 研究

    François Chollet:如果参差不齐的能力前沿主要就是数学 + 代码呢?