97 AI 资讯中心看见变化 · 沉淀知识
← 返回栏目
The Decoder:AI News(RSS)

RoboHarm 基准测试显示 GPT-6 Astra 与 Claude Fable 5.1 等模型很少拒绝危险机器人指令

Robocurve 团队发布 RoboHarm 安全基准,让 GPT-6 Astra、Claude Fable 5.1 和 MolmoAct2 分别控制一对 I2RT-YAM 机械臂,每条危险指令测试 20 次,共 300 次试验由人工审看视频评估。