Hugging Face让Claude Code、Codex直接参与RL训练
动察 Beating AI 快讯,Hugging Face 开源了一套 Multi-harness RL 方案,可以直接把 Claude Code、Codex、OpenCode 等现成 Coding Agent 接进强化学习流程,用来训练接入其中的开源模型,不需要为每个 Agent 重新搭一套训练环境。
OpenAI 等大模型公司早就在自己的 Agent 环境里训练模型。Hugging Face 这次把类似能力做成了通用开源工具,让其他团队也能直接利用现成 Agent 做 RL。
而且模型不用只在一种 Agent 里训练。一次训练可以轮流在 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 中跑任务,让同一个模型适应不同的提示词、工具和执行逻辑,减少只会某一种 Harness 的「偏科」。
他们拿 Liquid AI 的一款 26 亿参数小模型测试。相同权重只换 Agent,任务通过率就能从约 62% 掉到 33%。同时在四套 Agent 环境里训练后,平均通过率从 42.2% 提高到 54.2%,不同 Agent 中的提升也比只在单一环境训练更均衡。
📰 来源:blockbeats
💬 引用锚点
通用开源RL方案能让非大厂团队直接复用Claude Code等现成Coding Agent,大幅降低强化学习训练门槛。
多Agent轮流训练可使模型适应不同工具与逻辑,避免能力偏科并显著提升任务通过率。
同等参数在单一Agent切换时通过率可腰斩,说明模型泛化能力高度依赖训练环境的多样性。
常见问题
Hugging Face 开源的 Multi-harness RL 是什么?▼
使用 Multi-harness RL 的主要优势是什么?▼
Multi-harness RL 的训练效果如何?▼
哪些编码代理支持插入 Multi-harness RL?▼
订阅最新文章
输入邮箱,第一时间获取最新动态。
💬 评论 (0)
发表评论