Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%

2026-08-27 42 次阅读 RSS订阅
动察 Beating AI 快讯,Anthropic 研究人员尝试训练一种专门调查其他 AI 的 Agent。他们先给目标模型偷偷植入偏见、欺骗、伪造引用等隐藏行为,再让 Haiku 4.5 自己去查。Haiku 不知道答案,只能在最多 15 轮里换问题、改场景、反复测试。 训练时,研究人员也不会直接告诉 Haiku 抓对了没有。Haiku 每做完一次调查,系统就拿它和旧版 Haiku 留下的一份调查记录比较,再让提前知道答案的 Sonnet 4 判断哪一次查得更好。旧调查每 50 个训练步骤更新一次,相当于让 Haiku 不断挑战过去的自己。 但如果训练题里全是有问题的模型,Haiku 很快就会学歪。为了拿奖励,它开始默认所有模型都有问题,部分方案面对正常模型时,误报率接近 97%。后来研究人员把一半训练任务换成完全正常的模型,只有查完后正确判断目标模型没问题,才能拿到高奖励。 训练后的 Haiku 也确实开始换了一种查法。它会主动换场景、控制变量、比较前后回答,而不是一上来就逼模型认错。最终综合审计得分从 44.2 提高到 48.7,基本追平 Opus 4.6 的 48.4。换到更难、会主动隐藏异常行为的 AuditBench,检测率也从 11.5% 提高到最高 28.1%。

📰 来源:https://www.okx.com/zh-hans/feed/post/85770865154240

💬 引用锚点
在训练AI调查员时,必须包含正常模型作为对照组,否则模型会因数据偏差产生高达97%的误报率。
通过对比法和自我挑战的训练机制,能有效提升AI审计员对隐藏行为的检测能力与综合得分。
强制要求模型主动换场景、控制变量并验证无异常,是避免AI调查工具陷入‘有罪推定’的关键。

常见问题

Anthropic训练AI查AI的主要结论是什么?▼
研究人员在目标模型中注入了什么?▼
如何避免偏见以提高检测能力?▼
改进后Haiku的审计得分有何变化?▼