Hugging Face让Claude Code、Codex直接参与RL训练

2026-10-06 1 次阅读 RSS订阅
动察 Beating AI 快讯,Hugging Face 开源了一套 Multi-harness RL 方案,可以直接把 Claude Code、Codex、OpenCode 等现成 Coding Agent 接进强化学习流程,用来训练接入其中的开源模型,不需要为每个 Agent 重新搭一套训练环境。 OpenAI 等大模型公司早就在自己的 Agent 环境里训练模型。Hugging Face 这次把类似能力做成了通用开源工具,让其他团队也能直接利用现成 Agent 做 RL。 而且模型不用只在一种 Agent 里训练。一次训练可以轮流在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 中跑任务,让同一个模型适应不同的提示词、工具和执行逻辑,减少只会某一种 Harness 的「偏科」。 他们拿 Liquid AI 的一款 26 亿参数小模型测试。相同权重只换 Agent,任务通过率就能从约 62% 掉到 33%。同时在四套 Agent 环境里训练后,平均通过率从 42.2% 提高到 54.2%,不同 Agent 中的提升也比只在单一环境训练更均衡。

📰 来源:blockbeats

💬 引用锚点
通用开源RL方案能让非大厂团队直接复用Claude Code等现成Coding Agent,大幅降低强化学习训练门槛。
多Agent轮流训练可使模型适应不同工具与逻辑,避免能力偏科并显著提升任务通过率。
同等参数在单一Agent切换时通过率可腰斩,说明模型泛化能力高度依赖训练环境的多样性。

常见问题

Hugging Face 开源的 Multi-harness RL 是什么?▼
使用 Multi-harness RL 的主要优势是什么?▼
Multi-harness RL 的训练效果如何?▼
哪些编码代理支持插入 Multi-harness RL?▼