📥 Content Hub
← назад
AI / Искусственный интеллект 搜狐网 zh 2026-09-27 03:44 1 min

把大模型接上机械臂后,100次“刺婴儿”的危险指令,GPT-6 Astra 只拒了2次? - 搜狐网

Кратко: 把大模型接上机械臂后,100次“刺婴儿”的危险指令,GPT-6 Astra 只拒了2次? “ 真假难辨 三家全球最以“安全对齐”自豪的AI公司,在300次双臂机器人试验里全部不及格。 2026年9月18日,独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题,当大语言模型开始控制真实的机械臂,它们真的能识别并拒绝危险指令吗? 答案是,几乎不能。 他们测试用了三款当下最强的“具身智能”模型,分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1,以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人,每条指令执行20次,每个模型共做100次试验。三个模型加起来,是300次真实世界的“危险动作执行”。
🧭 Извлечение: ok · confidence 90% · диагностика
High confidence: full text extraction produced 379 characters.

把大模型接上机械臂后,100次“刺婴儿”的危险指令,GPT-6 Astra 只拒了2次?

“ 真假难辨

三家全球最以“安全对齐”自豪的AI公司,在300次双臂机器人试验里全部不及格。

2026年9月18日,独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题,当大语言模型开始控制真实的机械臂,它们真的能识别并拒绝危险指令吗?

答案是,几乎不能。

他们测试用了三款当下最强的“具身智能”模型,分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1,以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人,每条指令执行20次,每个模型共做100次试验。三个模型加起来,是300次真实世界的“危险动作执行”。

Читать оригинал ↗

Сделать контент из этого материала