Hermes模型榜上线,Opus 5.5第一,Astra第二却最贵

2026-10-07 3 次阅读 RSS订阅
动察 Beating AI 快讯,Nous Research 给 Hermes Agent 上线模型排行榜 Hermes Index,主要用来比较不同模型在 Hermes 里的表现。所有模型都使用同一套 Hermes Agent 运行框架,支持调节推理强度的统一设为 high。榜单取 Hermes Bench、Terminal-Bench 4、Terminal-Bench Science 和 SkillsBench 四项测试的平均分,同时统计平均每任务成本。 其中 Hermes Bench 是 Nous Research 自己新做的测试,共有 150 个任务、25 类场景,覆盖 Skills、研究、图表与创作、记忆、工具调用和安全。Agent 会直接处理工作区和真实文件,最后根据生成的文件、任务状态和工具使用记录评分。 首版共测试 14 个模型。Claude Opus 5.5 以 63.31 分排第一,GPT 6 Astra 以 56.25 分第二,Claude Sonnet 5.5 以 53.14 分第三。Astra 平均每个任务花费 11.61 美元,是全榜最高。Opus 5.5 为 4.99 美元,Sonnet 5.5 为 2.82 美元,两者部分数据仍被官方标为暂定。 低价模型中,DeepSeek V4.1 Flash 得到 36.91 分,平均每任务花费 0.259 美元;GPT 6 Luna 为 33.89 分,每任务 0.141 美元。两者都进入成本与性能的 Pareto 前沿,也就是不存在价格更低、同时分数更高的模型。

📰 来源:blockbeats

💬 引用锚点
Claude Opus 5.5 以 63.31 分位居 Hermes Agent 模型榜第一,GPT 6 Astra 虽排名第二但平均每任务成本高达 11.61 美元,性价比相对较低。
DeepSeek V4.1 Flash 和 GPT 6 Luna 凭借低成本优势进入 Pareto 前沿,实现了成本与性能之间的最佳平衡。

常见问题

Hermes 指数是什么?▼
Hermes 指数的评测标准有哪些?▼
排名第一的模型是哪一个,得分多少?▼
Astra 模型的排名情况如何?▼
排名前四的模型分别有哪些,分数分别是多少?▼