Holo4发布:千问底座,专门强化Computer Use

2026-09-29 2 次阅读 RSS订阅
动察 Beating AI 快讯,法国 AI 公司 H Company 发布 Computer Use 模型 Holo4,包括 27B 和 35B-A3B 两个版本。前者基于 Qwen3.8 dense 架构,后者基于 Qwen3.5 MoE 架构继续做后训练。 H Company 主要强化了电脑操作和长任务执行能力,把原本的通用模型进一步训成面向 Computer Use 的 Agent 模型。 监督微调阶段,H Company 一共用了 1270 亿 tokens,其中约四分之三是成功完成任务的 Agent 操作轨迹,覆盖桌面、网页、手机、MCP 和 API。随后又做强化学习,分别训练「桌面和网页」与「终端、MCP 和 API」两类专家能力,再合回同一个模型。公司还自己生成了约 1 万个软件操作任务,用来训练跨应用和长流程工作。 H Company 还重做了 Agent harness,让模型在数百步任务里持续记住前面的操作,并可以直接调用电脑上的 shell。 效果主要体现在长任务上。Holo4 27B 在 OSWorld 2.0 得到 61.7%,Qwen3.8-27B 官方成绩为 48.0%;在普通 OSWorld 上,Holo4 为 85.2%,Qwen3.8-27B 则为 84.3%。不过这些成绩的 harness、任务版本和评测设置并不完全一致,不能当成严格的同条件对照。

📰 来源:https://www.okx.com/zh-hans/feed/post/88691105020096

💬 引用锚点
Holo4 基于 Qwen 底座强化 Computer Use 能力,训练数据中四分之三为成功任务轨迹。
通过强化学习分别训练桌面/网页与终端/MCP/API 专家能力再合并,提升模型任务执行效果。
长任务记忆和 Shell 直接调用能力显著提升,OSWorld 2.0 成绩达 61.7% 领先原版。

常见问题

Holo4 是什么类型的模型?▼
Holo4 提供了哪些版本规格?▼
Holo4 是如何提升长任务性能的?▼
Holo4 在 OSWorld 2.0 上的表现如何?▼