25款模型集体输给人类:AI仍看不懂很多生活常识

2026-10-08 2 次阅读 RSS订阅
Scale Labs 和 Elorian 发布了 HSS,这是一项新的基准测试,用于检测 AI 是否能理解图像和视频中的隐含意义。人类得分为 93.1%,而顶级模型 GPT-6 Astra 得分为 53.6%。94% 的失败案例涉及遗漏线索或误读关系。

📰 来源:https://www.okx.com/zh-hans/feed/post/89489518152896