25款模型集体输给人类:AI仍看不懂很多生活常识
Scale Labs 和 Elorian 发布了 HSS,这是一项新的基准测试,用于检测 AI 是否能理解图像和视频中的隐含意义。人类得分为 93.1%,而顶级模型 GPT-6 Astra 得分为 53.6%。94% 的失败案例涉及遗漏线索或误读关系。
订阅最新文章
输入邮箱,第一时间获取最新动态。
💬 评论 (0)
发表评论