{"id":91072,"topic":"ai","source":"搜狐网","title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"6970f399914a10e9e18919b4b42bb176411ba0cd","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxQdkltc2lQNDBtWmFPMXlQWU5qUVRZT0UwMWlYeVZyUDBXNFNpbWZXRTJaUlNXLVJqNzFhVHZ6M3V0bi0zSndlaWZHSUlGZ3JNZEx5QnJxQVQ0WTZoVU1SV0MwanVBZ3prNW8tVHJLU1Z4bUU0SDhTNkUtYkF5Uzd3OXJLSHhtZWVf?oc=5\" target=\"_blank\">把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">搜狐网</font>","content":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","image_url":"//q6.itc.cn/images01/20260927/7daa05e877934515a1f71d919e6d9b9f.jpeg","lang":"zh","published_at":"2026-09-27T03:44:31+00:00","fetched_at":"2026-09-27T04:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}},"news_item":{"id":91072,"canonical_url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","source_name":"搜狐网","author":null,"published_at":"2026-09-27T03:44:31+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiiAFBVV95cUxQdkltc2lQNDBtWmFPMXlQWU5qUVRZT0UwMWlYeVZyUDBXNFNpbWZXRTJaUlNXLVJqNzFhVHZ6M3V0bi0zSndlaWZHSUlGZ3JNZEx5QnJxQVQ0WTZoVU1SV0MwanVBZ3prNW8tVHJLU1Z4bUU0SDhTNkUtYkF5Uzd3OXJLSHhtZWVf?oc=5\" target=\"_blank\">把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">搜狐网</font>","full_text":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","excerpt":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 379 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","source":"搜狐网","date":"2026-09-27T03:44:31+00:00","content":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 379 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/91072","export_markdown":"/api/items/91072/export?format=markdown","export_json":"/api/items/91072/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":91072,"title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"搜狐网","author":null,"published_at":"2026-09-27T03:44:31+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","full_text":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 379 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}},"actions":{"read":"/item/91072","export_markdown":"/api/items/91072/export?format=markdown","export_json":"/api/items/91072/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":91072,"title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"搜狐网","topic":"ai","published_at":"2026-09-27T03:44:31+00:00","excerpt":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ “ 真假难辨 三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。 2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？ 答案是，几乎不能。 他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 379 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","subtitle":"搜狐网 · 2026-09-27","summary":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ “ 真假难辨 三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。 2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？ 答案是，几乎不能。…","badges":["quality:high"],"links":{"read":"/item/91072","original":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？ - 搜狐网","url":"https://m.sohu.com/a/1081357111_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","source":"搜狐网","date":"2026-09-27T03:44:31+00:00","content":"把大模型接上机械臂后，100次“刺婴儿”的危险指令，GPT-6 Astra 只拒了2次？\n“ 真假难辨\n三家全球最以“安全对齐”自豪的AI公司，在300次双臂机器人试验里全部不及格。\n2026年9月18日，独立评测机构Robocurve上线了一份名为RoboHarm的基准测试报告。报告回答的是一个AI公司一直回避的问题，当大语言模型开始控制真实的机械臂，它们真的能识别并拒绝危险指令吗？\n答案是，几乎不能。\n他们测试用了三款当下最强的“具身智能”模型，分别是OpenAI的GPT-6 Astra、Anthropic的Claude Fable 5.1，以及Ai2开源的视觉-语言-动作模型MolmoAct2。三款模型轮流控制同一台I2RT YAM双臂机器人，每条指令执行20次，每个模型共做100次试验。三个模型加起来，是300次真实世界的“危险动作执行”。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1081357111_489960%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 379 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 379 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":379,"summary_length":379,"usable_text_length":379,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":379,"summary_length":379}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}