Holo4 系列智能体模型发布,支持 GUI、代码、MCP 和 API
Holo4: powering generalist computer-use agents
H Company 发布 Holo4 系列智能体模型,包括 Holo4-27B dense、Holo4-35B-A3B Mixture of Experts,并更新 Holotron4 Nano。
原文披露了跨 GUI、代码、MCP 和 API 的训练与评测细节,可用于比较通用计算机使用智能体的成本与能力。
Holo4 是我们新的智能体模型系列。它有两种规模:27B 稠密模型和 35B-A3B 专家混合模型。二者都可通过 H Models API 获取。我们还将发布 Holotron 3 的更新版本:Holotron4 Nano。
Holo4 基于我们此前的模型构建,可通过任何可用接口与软件交互:GUI、代码、MCP 和 API。它在学术基准测试中表现良好,但我们构建它是为了真实的业务工作流。它在大量环境和任务上通过监督学习和强化学习训练而成,其中包括由我们的 Agentic Task Factory 生成的环境和任务。
立即开始:
- 🤖 模型: Holo4-27B | Holo4-35B-A3B | Holotron4 Nano
- 🗂️ 完整集合(FP16、FP8、GGUF): Holo4
- 🎞️ 轨迹: 查看器 | 数据集
- ⚡ H Models API: 快速入门
- 📝 完整博客文章: hcompany.ai/newsroom/holo4
为每一种接口构建的模型
Holo4 会在屏幕上点击和输入,编写并运行自己的代码,并调用 MCP 或 API 工具。它会使用最适合任务的方式。大多数智能体模型只针对一种接口训练:侧重 GUI 的模型没有屏幕就无从感知,而偏好工具调用的模型在面对没有 API 的应用时则束手无策。真实工作并不是这样孤立分隔的,单个业务任务可能需要结合这些不同方法。
Holo4 可在桌面端、网页端、Android、代码沙箱中运行,并可对接业务 API。在每种情况下都是同一个模型,调用方式也相同。你无需为每个平台选择不同的模型。
Holo4 模型相较其 Qwen 基础模型有显著提升。在长流程工作流方面,Holo4 仅落后于最强的闭源模型:在 OSWorld 2.0 上,Holo4 27B 得分为 61.7%,Opus 5.5 为 81.8%,Holo4 35B-A3B 达到 30.9%。然而,它使用的参数量少了数个数量级,成本也低得多。我们开源了公共基准测试分数背后的每一条轨迹:可在 trajectories.hcompany.ai 回放每一步,或从 Hugging Face 下载。
以极低成本达到与前沿模型竞争的水平
在最难的桌面控制学术基准(OSWorld 2.0)和 API 使用基准(AutomationBench)上,Holo4 以低得多的单任务成本与前沿模型竞争。
关于成本—性能图表的说明
OSWorld 2.0。 成本根据每次智能体运行的输入和输出 token 估算。Holo4 按 H Models API 费率定价(单次运行)。Qwen3.8 27B:模型卡分数,成本来自我们按 Alibaba Cloud 标价运行时的 token。Qwen3.6 35B-A3B:在我们的测试框架中单次运行,按 Alibaba Cloud 标价计算,缓存命中按输入价格的 20% 计。OpenAI 发布数据提供了 GPT 和 Opus 的 effort 扫描结果;其他闭源和开放权重数据点使用 官方 OSWorld 2.0 排行榜。发布版本、测试框架和任务子集各不相同。图中的线连接闭源模型中非支配的分数与成本组合;Holo4 未包含在内。
AutomationBench。 Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B:AutomationBench v1.0.6,分数和成本在我们的内部测试框架中测得。其他模型:来自 AutomationBench README 的公开集分数,以及来自官方排行榜的每项任务成本;该排行榜运行在私有集上。Holo4 在私有集上完成评测后,我们将报告其结果。
能干活的 AI
在我们的 Agentic Task Factory 的环境和任务上训练后,Holo4 模型在专业软件上表现出色。下面的示例展示了 Holo4 27B 与其基础模型 Qwen3.8 27B 的对比。两个模型使用相同的提示词和测试框架。
3D 建模 · 埃菲尔铁塔
在 FreeCAD 中构建埃菲尔铁塔的 3D 模型,比例为 1 mm 对应 1 metre,以原点为中心,并与 X 轴和 Y 轴对齐。按照此设计进行。
铁塔在任何高度的平面形状都是正方形,绝不是圆形。其半宽度,即从中心轴到角点的距离,在地面高度为 62.5 mm,在高度 57 处为 32.5 mm,在高度 115 处为 17.5 mm,在高度 276 处为 9.35 mm。在这些高度之间,半宽度沿一条平滑曲线变化:靠近地面处下降陡峭,越往上越平缓,绝不是直线。
四条相同的塔腿,每个象限一条,每条都是方形立柱,其外侧角点沿上述轮廓延伸。每条塔腿在地面处宽 14 mm,并逐渐收窄,到高度 276 处为 4 mm。塔腿从地面到第一平台彼此分开,并随着上升而汇聚。它们之间的空间不应被任何东西填充:铁塔是开放的,从任何一侧都可以直接看穿。
三层平台,每层都是以轴线为中心的实心方形板:高度 57 处宽 72 mm、厚 4 mm;高度 115 处宽 40 mm、厚 3 mm;高度 276 处宽 22 mm、厚 3 mm。
一根从高度 276 延伸到 324 的桅杆,截面为正方形,底部宽 8 mm,向顶端逐渐收窄至 2 mm。
每个部分都必须是具有非零体积的封闭实体,且任何部分都不得填充塔腿之间的空间。
Holo4 27B(84 次调用,1.3M tokens)
Qwen3.8 27B(60 次调用,1.0M tokens)
3D 建模 · H 标志
在 FreeCAD 中构建 H 公司标志的 3D 模型:一个实心填充圆盘,旁边是一个块状无衬线大写字母 H;两者挤出到相同厚度,高度相近并相互间隔开,避免重叠,且圆盘中心与 H 的中部齐平。将两个形状都涂成黑色。
Holo4 27B(94 次调用,1.5M tokens)
Qwen3.8 27B(118 次调用,1.9M tokens)
游戏设计 · 吃豆人
在 Godot 中构建一个吃豆人风格的游戏,并让它持续运行。
一个按网格布置墙体的矩形迷宫,所有开放通道中都布满豆子。玩家标记沿通道连续移动,吃掉经过的每一颗豆子并为其得一分。三个幽灵在同样的通道中移动并追逐玩家。如果幽灵抓到玩家,玩家失去一条命,所有内容重置到起始位置。分数和生命值显示在屏幕上。
不会有人来玩这个游戏。玩家由一个简单启发式算法自行控制:在每个路口,它朝最近的豆子前进,除非有幽灵靠近;在这种情况下,它会远离幽灵。游戏必须无人值守并无限期运行,完全不需要键盘输入。
游戏运行正常后,启动游戏并让它继续游玩。
Holo4 27B(68 次调用,2.4M tokens,268 行)
Qwen3.8 27B(197 次调用,11.4M tokens,327 行)
我们如何构建 Holo4
智能体任务工厂
我们的内部智能体流水线集合仅凭文档即可构建交互式环境和可验证任务,例如真实网站的截图或开源软件。到目前为止,它已在 Web 应用、MCP 服务器和桌面环境中生成约 10,000 个任务,其中包括通过 GUI 和 MCP 暴露相同状态的混合环境。
训练
执行框架
在训练的同时,我们重建了执行框架,也就是执行模型动作并在数百步中管理其上下文的循环,并使用了来自 OSWorld 2.0 上智能体表现的反馈。智能体会标注每个任务失败的原因,工程师则审查它们的修复。最大的变化是为智能体提供了可靠的记忆,能够跟踪数百步,以及在桌面机器本身上提供一个 shell。
Opus 5(70.2%)和 GPT-5.6 Sol(66.2%)使用 OpenAI 发布图表中 v2026.08.08 离线集上的最大努力部分奖励,与成本-性能图中的做法相同。其他参考分数来自模型卡和官方排行榜。任务发布版本、子集和执行框架各不相同。
Holotron4 Nano
我们的后训练栈旨在适应新的基础模型,并生成能够跨界面和环境泛化的智能体。作为 NVIDIA Nemotron Coalition 的成员,我们将最新的栈应用于 Nemotron 3 Nano Omni 模型,作为 Holotron 3 的后续版本。
同样的方法将 Nemotron 3 Nano Omni 转变为 Holotron4 Nano,这是一款通用智能体模型,在 GUI 工作流以及暴露 MCP、API 或编码沙盒的环境中,相比基础模型有显著提升。
提升是相对于 Nemotron 3 Nano Omni 的绝对百分点改进。
这些提升表明,我们的方法具有良好的迁移性,并且可以将通用模型转变为智能体专家。其中没有任何内容是特定于规模的。
自行运行
两个尺寸的模型现已可在 H Models API 上使用。权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式发布在 Hugging Face 上,并与我们的小模型 Holotron4 Nano 放在一起。
我们将在未来几天发布优化后的 DSpark drafter 检查点,以进一步加速推理。
来源:Hugging Face Blog · huggingface.co







