H company 在 2026 年 9 月 28 日的 Hugging Face 文章里发布 Holo4。系列有两个尺寸:27B 稠密模型,以及 35B-A3B 混合专家模型。两者都在 H Models API 上提供。文章同时发布 Holotron 3 的更新版 Holotron4 Nano。
Holo4 被写成通过手头有的接口和软件打交道:图形界面、代码、MCP 和 API,哪一种合适就用哪一种。它在桌面、网页、Android、代码沙箱和业务 API 上跑的是同一个模型,调用方式也相同。文章说,多数智能体模型只为一种接口训练:没有屏幕时,只看图形界面的模型是盲的;偏好工具调用的模型则会停在没有 API 的应用前面。
[1]
训练用的是监督学习和强化学习。环境与任务包括他们的 Agentic Task Factory 生成的那些。工厂至今大约做出 1 万个任务,覆盖网页应用、MCP 服务器和桌面环境,也包括同一状态同时从图形界面和 MCP 暴露出来的混合环境。
OSWorld 2.0 上,Holo4 27B 是 61.7%,Opus 5.5 是 81.8%,Holo4 35B-A3B 是 30.9%。稠密的 27B 高于这个混合专家模型。文章说,它用少几个数量级的参数、低得多的成本做到这一点。页面没有给出 Opus 5.5 的参数量,本篇不把「数量级」换成一个倍数。
分数背后的公开基准轨迹被说成全部开源,可以在 trajectories.hcompany.ai 回放,或从 Hugging Face 下载。
[1]成本图的注释要分开读。OSWorld 2.0 的成本是按每次智能体运行的输入和输出 token 估算的。Holo4 按 H Models API 的价格、单次运行计价。其他闭源和开放权重的点用的是官方 OSWorld 2.0 排行榜。文章写明:发布版本、测试套和任务子集并不相同。那条线连接的是闭源模型里不被支配的分数与成本组合,Holo4 被排除在这条线之外。
AutomationBench 不是同一套测量。Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B 用的是 AutomationBench v1.0.6,分数和成本在他们内部的测试套里量。其他模型的公开集分数来自 README,每项任务的成本来自官方排行榜,而排行榜跑的是私有集。他们说,等私有集评完再报告 Holo4。
FreeCAD 和 Godot 的例子给出了调用次数和 token 数。Holo4 27B 做埃菲尔铁塔用了 84 次调用、130 万 token。文章没有给这些例子的成功率。
权重格式在同一页有两种写法。开头的合集写成 FP16、FP8、GGUF。文末写 Hugging Face 上的权重是 BF16、FP8、NVFP4 和 4-bit GGUF。本篇不把这两种写法收成一种精度。抽出的正文里没有 Apache 字样,本篇不写开源许可证。轨迹开源是另一句话,不自动变成权重许可证。
Holotron4 Nano 是把同一套后训练用在 Nemotron 3 Nano Omni 上。文中说增益是相对基座的绝对百分点,但抽出的正文没有列出那些百分点。优化过的 DSpark 草稿模型被说成将在未来几天发布。
[1]要点
- 两个尺寸都在 H Models API 上:27B 稠密,以及 35B-A3B 混合专家。
- OSWorld 2.0 上 27B 为 61.7%,低于 Opus 5.5 的 81.8%;35B-A3B 只有 30.9%。
- 公开基准的轨迹被说成全部开源。页面没有写权重的 Apache 许可证。
- AutomationBench 把内部测试套和私有集成本放在一起。Holo4 的私有集还没报告。