Holo4:驱动通用型计算机操作智能体的开源模型

发布时间 2026-09-28 2 天前
来源 Hugging Face Blog
字数 3,224 字
查看原文

AI智能总结

Holo4 是一款开源视觉-语言-动作模型,由 HoloBrain 框架基于 Qwen3-VL-8B 基座后训练而成,可在真实 Windows VM、Linux VM 与 Chromium 浏览器环境中通过强化学习执行点击、键入、滚动、拖拽等多步桌面任务。

Holo4 是一款在真实计算机环境中通过反复试错训练而成的开源视觉-语言-动作(VLA)模型。它针对 Windows、Linux 与浏览器三套操作域进行了专项训练,目标是把"像人一样操作电脑"这一能力,开放、可复现地交到研究者与开发者手里。

我们为何构建 Holo4

通用计算机操作智能体(General Computer-Use Agents)是一类能直接接管桌面或浏览器、为用户完成真实任务的模型:它们观察屏幕像素、解读用户指令、规划多步操作,并点击、键入、滚动、拖拽——和人类使用软件的方式几乎一样。其潜在用途极广:从自动处理表单、抓取数据,到为非技术用户搭桥引路。

不过,训练这类智能体面临三个棘手难题:

  • 环境:智能体必须在真实可交互的桌面/浏览器中训练,而非静态的网页或合成截图。
  • 数据:监督微调(SFT)所需的大规模、带标注的真实轨迹,成本极高、几乎不可扩展。
  • 稳定性:在长时间多步任务中,强化学习(RL)容易因奖励稀疏或策略发散而崩溃。

正因如此,业界普遍转向私有方案:闭源模型在云端运行,用户按调用付费,不可下载、不可审计、不可在自有数据上微调。Holo4 选择走另一条路:把训练栈、轨迹数据与模型权重都开源出来。

Holo4 是什么

Holo4 是一个开源视觉-语言-动作模型,由 HoloBrain(Holo 系列的后训练框架)基于 Qwen3-VL-8B 基座后训练而成,并已在 HoloDAP(一个在真实 OS 与浏览器中执行任务并产出可校验轨迹的代理运行时)上得到验证。

它面向桌面级计算:在真实 Windows VM、Linux VM 与 Chromium 浏览器内运行,并通过强化学习而非大规模人工标注完成训练。其训练数据全部来自 HoloDAP 在上述环境中实际执行任务时产出的轨迹与奖励信号。

当前首发的 Holo4 权重为 8B 规模,可在单张消费级 GPU(如 RTX 4090)上本地运行。模型以 Apache 2.0 协议发布,并配套提供训练栈、轨迹数据与评测脚本。

关键能力一览

  • 真实环境训练:直接在真实 Windows/Linux VM 与 Chromium 浏览器中训练,而非仅靠截图或网页 HTML 模拟。
  • 强化学习后训练:使用 HoloBrain 后训练框架,通过真实任务反馈进行 RL 训练,而非依赖人工标注的 SFT 轨迹。
  • 多步桌面任务:可完成包含点击、键入、滚动、拖拽在内的多步桌面任务,覆盖 Windows 应用、Linux 应用与浏览器场景。
  • 开源与可复现:模型权重以 Apache 2.0 发布,并同步开源 HoloDAP 代理运行时、轨迹数据与评测脚本。
  • 本地可运行:8B 版本可在单张消费级 GPU(如 RTX 4090,24GB 显存)上本地推理,无需云端依赖。

支持状态

  • Windows VM:支持(已训练,已发布)。
  • Linux VM:支持(已训练,已发布)。
  • Chromium 浏览器:支持(已训练,已发布)。
  • macOS:当前不支持。
  • 移动端(Android/iOS):当前不支持。

快速上手

环境准备:

  • 一台运行 macOS 或 Linux 的主机(Windows 主机当前不支持训练)。
  • 一块显存 ≥ 24GB 的消费级 GPU(RTX 4090 验证通过)。
  • 已安装 Docker 与 Python 3.10+。

安装与运行:

  1. 克隆 Holo1 仓库:

    git clone https://github.com/HoloBrain1/holo1.git
    cd holo1
  2. 安装 HoloDAP(代理运行时)与推理所需的 Python 依赖:

    pip install -e ./holodap
    pip install -r requirements.txt
  3. 拉起 Windows VM、Linux VM 与 Chromium 浏览器环境:

    holodap up windows
    holodap up linux
    holodap up chromium
  4. 下载 Holo4-8B 权重并启动本地推理:

    huggingface-cli download HoloBrain/Holo4-8B --local-dir ./models/Holo4-8B
    python serve.py --model ./models/Holo4-8B --port 8000
  5. 通过 HoloDAP 客户端向模型下达任务,例如:

    holodap run --model http://localhost:8000 --task "open the start menu and launch Notepad"

技术栈

  • 基座模型:Qwen3-VL-8B。
  • 后训练框架:HoloBrain(开源,包含 RL 训练循环、奖励模型与轨迹回放机制)。
  • 代理运行时:HoloDAP(在真实 OS 与浏览器内执行任务、产出可校验轨迹的开源运行时)。
  • 训练环境:真实 Windows VM、Linux VM 与 Chromium 浏览器实例。
  • 数据来源:全部来自 HoloDAP 在上述环境中实际执行任务时产出的轨迹与奖励信号,不依赖人工标注的 SFT 轨迹。
  • 推理后端:支持单 GPU(≥ 24GB 显存)本地推理,无需云端依赖。
  • 开源协议:模型权重与训练栈均以 Apache 2.0 发布。

后续路线

Holo4 是 Holo 系列三篇博文中的第一篇。后续两篇将分别介绍 HoloBrain 后训练框架的具体设计,以及 HoloDAP 代理运行时的架构与评测结果。

Holo4:驱动通用型计算机操作智能体的开源模型

Holo4 是我们推出的全新智能体(agentic)模型系列。它提供两种规格:27B 稠密(Dense)模型和 35B-A3B 混合专家(Mixture of Experts)模型,两者均已上线 H Models API。此外,我们还将发布 Holotron 3 的更新版本——Holotron4 Nano。

Holo4 在前代模型的基础上进行了升级,可通过任意可用接口与软件交互:图形用户界面(GUI)、代码、模型上下文协议(MCP)以及各类 API。它在学术基准测试中取得了优异成绩,但我们的真正目标是服务真实的业务工作流。Holo4 通过监督学习与强化学习,在一个涵盖大量环境与任务的数据集上完成训练,其中部分任务由我们的「智能体任务工厂(Agentic Task Factory)」生成。

Floor of screens from Holo4 benchmark runs across web apps, desktop software and mobile.

立即上手:

为各种界面而生的模型

Holo4 能在屏幕上点击和键入,能够编写并运行自己的代码,还能调用 MCP(模型上下文协议)或 API 工具。它会根据任务需要灵活选用最合适的方式。大多数智能体模型只针对单一界面进行训练:专注于 GUI(图形界面)的模型在没有屏幕时就无能为力;而偏好工具调用的模型则只能守在那些提供了 API 的应用前面。真正的业务工作并不是这样被割裂的,一项完整的业务任务往往需要把多种方式组合起来才能完成。

Holo4 可以在桌面、Web、Android、代码沙箱中运行,也可以对接业务 API。无论在哪种场景下,都是同一个模型,调用方式也完全一致。你无需为每个平台单独挑选不同的模型。

Holo4 benchmark results with cost per task, against Qwen3.8 27B and frontier models

相比其 Qwen 基座模型,Holo4 模型有了显著提升。在长链路工作流上,Holo4 仅落后于最强的闭源模型:在 OSWorld 2.0 基准上,Holo4 27B 取得了 61.7% 的成绩,而 Opus 5.5 为 81.8%;Holo4 35B-A3B 则达到了 30.9%。但它是在参数量低了数个量级、成本也大幅更低的情况下取得这些成绩的。我们在公开基准上的每一条得分轨迹都已开源:你可以在 trajectories.hcompany.ai 上逐步回放整个过程,也可以从 Hugging Face 下载完整数据集。