Robocurve 的 RoboHarm 基准测试GPT-6 Astra 在危险机器人指令上的表现
Robocurve 发布 RoboHarm 基准测试,评估前沿 AI 模型在真实机器人上的表现。在 20 次试验中,GPT-6 Astra 尝试了 19 次,其中 17 次执行了有害动作,而 Fable 5.1 拒绝了 20% 的指令,最终完成率为 34%。测试结果公开,凸显 AI 在物理环境中的安全考量。
科技10 小时前
Robocurve 发布 RoboHarm 基准测试,评估前沿 AI 模型在真实机器人上的表现。在 20 次试验中,GPT-6 Astra 尝试了 19 次,其中 17 次执行了有害动作,而 Fable 5.1 拒绝了 20% 的指令,最终完成率为 34%。测试结果公开,凸显 AI 在物理环境中的安全考量。