让AI迁移整个代码库,94.6%没过关:20项任务13项无人做成

2026-08-26 49 次阅读 RSS订阅
动察 Beating AI 快讯,AI Agent 公司 Einsia 发布 SWE Refactor Bench,专门测 Coding Agent 能不能自己迁移整个代码库。20 个任务来自 SQLite、zlib、libsodium、GraphHopper 等真实项目,包括 C 改 Rust、Maven 改 Gradle、SQLite 移植到 WASI。每项给 Agent 6~30 小时。 评测第一关检查旧技术栈是不是真的被替掉,防止 Agent 留着旧代码混过去;第二关跑超过 13 万项固定检查;最后再派 6 个独立 Coding Agent,各花 1 小时专门找隐藏 bug。 8 个前沿模型、26 种配置一共跑了 520 次。340 次确实完成迁移,88 次把预先准备的测试全部跑绿,但其中 60 次又被最后一轮找出了隐藏 bug。最终只有 28 次完全过关,通过率 5.4%;20 个任务里有 13 个没人做成。Claude Opus 5 的 xhigh 配置最好,20 个任务完整通过 5 个。 现在的 Coding Agent 已经能大规模改代码,但要做到「整个系统改完还能完全不出错」,还差得很远。

📰 来源:https://www.okx.com/zh-hans/feed/post/85674402254016

💬 引用锚点
AI迁移整个代码库的通过率仅5.4%,表明现有Coding Agent在复杂重构任务中仍存在显著的能力短板。
即便Agent跑通全部测试用例,仍有近七成的项目在后续独立检查中被发现隐藏bug。
现有AI在单点代码修改上已具规模,但实现完整系统迁移且零错误仍面临巨大挑战。

常见问题

AI迁移整个代码库的成功率有多高?▼
该基准测试包含哪些类型的具体任务?▼
AI代理完成这些迁移任务需要多长时间?▼
研究得出的主要结论是什么?▼
这项研究是如何评估AI能力的?▼