![]()
Holo4 是一款在真实计算机环境中通过反复试错训练而成的开源视觉-语言-动作(VLA)模型。它针对 Windows、Linux 与浏览器三套操作域进行了专项训练,目标是把"像人一样操作电脑"这一能力,开放、可复现地交到研究者与开发者手里。
我们为何构建 Holo4
通用计算机操作智能体(General Computer-Use Agents)是一类能直接接管桌面或浏览器、为用户完成真实任务的模型:它们观察屏幕像素、解读用户指令、规划多步操作,并点击、键入、滚动、拖拽——和人类使用软件的方式几乎一样。其潜在用途极广:从自动处理表单、抓取数据,到为非技术用户搭桥引路。
不过,训练这类智能体面临三个棘手难题:
- 环境:智能体必须在真实可交互的桌面/浏览器中训练,而非静态的网页或合成截图。
- 数据:监督微调(SFT)所需的大规模、带标注的真实轨迹,成本极高、几乎不可扩展。
- 稳定性:在长时间多步任务中,强化学习(RL)容易因奖励稀疏或策略发散而崩溃。
正因如此,业界普遍转向私有方案:闭源模型在云端运行,用户按调用付费,不可下载、不可审计、不可在自有数据上微调。Holo4 选择走另一条路:把训练栈、轨迹数据与模型权重都开源出来。
Holo4 是什么
Holo4 是一个开源视觉-语言-动作模型,由 HoloBrain(Holo 系列的后训练框架)基于 Qwen3-VL-8B 基座后训练而成,并已在 HoloDAP(一个在真实 OS 与浏览器中执行任务并产出可校验轨迹的代理运行时)上得到验证。
它面向桌面级计算:在真实 Windows VM、Linux VM 与 Chromium 浏览器内运行,并通过强化学习而非大规模人工标注完成训练。其训练数据全部来自 HoloDAP 在上述环境中实际执行任务时产出的轨迹与奖励信号。
当前首发的 Holo4 权重为 8B 规模,可在单张消费级 GPU(如 RTX 4090)上本地运行。模型以 Apache 2.0 协议发布,并配套提供训练栈、轨迹数据与评测脚本。
关键能力一览
- 真实环境训练:直接在真实 Windows/Linux VM 与 Chromium 浏览器中训练,而非仅靠截图或网页 HTML 模拟。
- 强化学习后训练:使用 HoloBrain 后训练框架,通过真实任务反馈进行 RL 训练,而非依赖人工标注的 SFT 轨迹。
- 多步桌面任务:可完成包含点击、键入、滚动、拖拽在内的多步桌面任务,覆盖 Windows 应用、Linux 应用与浏览器场景。
- 开源与可复现:模型权重以 Apache 2.0 发布,并同步开源 HoloDAP 代理运行时、轨迹数据与评测脚本。
- 本地可运行:8B 版本可在单张消费级 GPU(如 RTX 4090,24GB 显存)上本地推理,无需云端依赖。
支持状态
- Windows VM:支持(已训练,已发布)。
- Linux VM:支持(已训练,已发布)。
- Chromium 浏览器:支持(已训练,已发布)。
- macOS:当前不支持。
- 移动端(Android/iOS):当前不支持。
快速上手
环境准备:
- 一台运行 macOS 或 Linux 的主机(Windows 主机当前不支持训练)。
- 一块显存 ≥ 24GB 的消费级 GPU(RTX 4090 验证通过)。
- 已安装 Docker 与 Python 3.10+。
安装与运行:
-
克隆 Holo1 仓库:
git clone https://github.com/HoloBrain1/holo1.git cd holo1 -
安装 HoloDAP(代理运行时)与推理所需的 Python 依赖:
pip install -e ./holodap pip install -r requirements.txt -
拉起 Windows VM、Linux VM 与 Chromium 浏览器环境:
holodap up windows holodap up linux holodap up chromium -
下载 Holo4-8B 权重并启动本地推理:
huggingface-cli download HoloBrain/Holo4-8B --local-dir ./models/Holo4-8B python serve.py --model ./models/Holo4-8B --port 8000 -
通过 HoloDAP 客户端向模型下达任务,例如:
holodap run --model http://localhost:8000 --task "open the start menu and launch Notepad"
技术栈
- 基座模型:Qwen3-VL-8B。
- 后训练框架:HoloBrain(开源,包含 RL 训练循环、奖励模型与轨迹回放机制)。
- 代理运行时:HoloDAP(在真实 OS 与浏览器内执行任务、产出可校验轨迹的开源运行时)。
- 训练环境:真实 Windows VM、Linux VM 与 Chromium 浏览器实例。
- 数据来源:全部来自 HoloDAP 在上述环境中实际执行任务时产出的轨迹与奖励信号,不依赖人工标注的 SFT 轨迹。
- 推理后端:支持单 GPU(≥ 24GB 显存)本地推理,无需云端依赖。
- 开源协议:模型权重与训练栈均以 Apache 2.0 发布。
后续路线
Holo4 是 Holo 系列三篇博文中的第一篇。后续两篇将分别介绍 HoloBrain 后训练框架的具体设计,以及 HoloDAP 代理运行时的架构与评测结果。
Holo4:驱动通用型计算机操作智能体的开源模型
Holo4 是我们推出的全新智能体(agentic)模型系列。它提供两种规格:27B 稠密(Dense)模型和 35B-A3B 混合专家(Mixture of Experts)模型,两者均已上线 H Models API。此外,我们还将发布 Holotron 3 的更新版本——Holotron4 Nano。
Holo4 在前代模型的基础上进行了升级,可通过任意可用接口与软件交互:图形用户界面(GUI)、代码、模型上下文协议(MCP)以及各类 API。它在学术基准测试中取得了优异成绩,但我们的真正目标是服务真实的业务工作流。Holo4 通过监督学习与强化学习,在一个涵盖大量环境与任务的数据集上完成训练,其中部分任务由我们的「智能体任务工厂(Agentic Task Factory)」生成。

立即上手:
- 🤖 模型: Holo4-27B | Holo4-35B-A3B | Holotron4 Nano
- 🗂️ 完整资源(FP16、FP8、GGUF): Holo4
- 🎞️ 轨迹数据(Trajectories): 查看器 | 数据集
- ⚡ H Models API: 快速入门
- 📝 完整博客文章: hcompany.ai/newsroom/holo4
为各种界面而生的模型
Holo4 能在屏幕上点击和键入,能够编写并运行自己的代码,还能调用 MCP(模型上下文协议)或 API 工具。它会根据任务需要灵活选用最合适的方式。大多数智能体模型只针对单一界面进行训练:专注于 GUI(图形界面)的模型在没有屏幕时就无能为力;而偏好工具调用的模型则只能守在那些提供了 API 的应用前面。真正的业务工作并不是这样被割裂的,一项完整的业务任务往往需要把多种方式组合起来才能完成。
Holo4 可以在桌面、Web、Android、代码沙箱中运行,也可以对接业务 API。无论在哪种场景下,都是同一个模型,调用方式也完全一致。你无需为每个平台单独挑选不同的模型。
相比其 Qwen 基座模型,Holo4 模型有了显著提升。在长链路工作流上,Holo4 仅落后于最强的闭源模型:在 OSWorld 2.0 基准上,Holo4 27B 取得了 61.7% 的成绩,而 Opus 5.5 为 81.8%;Holo4 35B-A3B 则达到了 30.9%。但它是在参数量低了数个量级、成本也大幅更低的情况下取得这些成绩的。我们在公开基准上的每一条得分轨迹都已开源:你可以在 trajectories.hcompany.ai 上逐步回放整个过程,也可以从 Hugging Face 下载完整数据集。
