{"id":35992,"topic":"ai","source":"东方财富","title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","url":"https://finance.eastmoney.com/a/202607143805292126.html","url_hash":"201d5c78665430c03e20c5842675c676e376046d","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiZkFVX3lxTE1uRmxKX25tMnBPNEVwMmZkWkZqYmhtazB4Q0NKZFA4TklCazVlb1FEeE1BOGQtb0ZwSVF0elhJTk5TbDgxQ3FsU2JDYzk3MVY2NEpZdF9pYWt6MldCa0Z4SzlTN042UQ?oc=5\" target=\"_blank\">大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">东方财富</font>","content":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","image_url":null,"lang":"zh","published_at":"2026-07-14T03:50:41+00:00","fetched_at":"2026-07-14T04:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.eastmoney.com/a/202607143805292126.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}},"news_item":{"id":35992,"canonical_url":"https://finance.eastmoney.com/a/202607143805292126.html","source_url":"https://finance.eastmoney.com/a/202607143805292126.html","title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","source_name":"东方财富","author":null,"published_at":"2026-07-14T03:50:41+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiZkFVX3lxTE1uRmxKX25tMnBPNEVwMmZkWkZqYmhtazB4Q0NKZFA4TklCazVlb1FEeE1BOGQtb0ZwSVF0elhJTk5TbDgxQ3FsU2JDYzk3MVY2NEpZdF9pYWt6MldCa0Z4SzlTN042UQ?oc=5\" target=\"_blank\">大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">东方财富</font>","full_text":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","excerpt":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 793 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","url":"https://finance.eastmoney.com/a/202607143805292126.html","summary":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","source":"东方财富","date":"2026-07-14T03:50:41+00:00","content":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 793 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/35992","export_markdown":"/api/items/35992/export?format=markdown","export_json":"/api/items/35992/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html"},"formats":{"full":{"id":35992,"title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","url":"https://finance.eastmoney.com/a/202607143805292126.html","source":"东方财富","author":null,"published_at":"2026-07-14T03:50:41+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","full_text":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 793 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}},"actions":{"read":"/item/35992","export_markdown":"/api/items/35992/export?format=markdown","export_json":"/api/items/35992/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html"}},"digest":{"id":35992,"title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","url":"https://finance.eastmoney.com/a/202607143805292126.html","source":"东方财富","topic":"ai","published_at":"2026-07-14T03:50:41+00:00","excerpt":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能 官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 793 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","subtitle":"东方财富 · 2026-07-14","summary":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能…","badges":["quality:high"],"links":{"read":"/item/35992","original":"https://finance.eastmoney.com/a/202607143805292126.html","diagnose":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html"},"quality_warning":null},"export":{"title":"大模型安全测评基准共建行动正式启动，明略科技(2718.HK)已提前布局Web Agent综合评测基准 - 东方财富","url":"https://finance.eastmoney.com/a/202607143805292126.html","summary":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","source":"东方财富","date":"2026-07-14T03:50:41+00:00","content":"2026年7月13日，国家工业信息安全发展研究中心官微消息显示，大模型安全测评基准共建行动正式启动 。据了解，国家工业信息安全发展研究中心依托大模型安全测评领域的技术积累与实践经验，正在建设大模型安全测评基准，现开始征集大模型安全测评基准共建单位，打造覆盖全维度、系统化的人工智能\n官微文章指出，本次建设的大模型安全测评基准，围绕大模型真实应用中的安全治理需求构建全景评估框架，覆盖内容安全、价值对齐、鲁棒稳健、公平无偏、隐私保护、真实可信六大核心安全维度，形成系统化的全链路评测体系。\n此外，国家工业信息安全发展研究中心将邀请大模型技术企业、行业应用机构、科研院所及安全领域专家深度参与体系共建。深度参与的单位将有机会成为大模型安全测评基准共建单位，深度参与标准制定、测试实践与成果发布，共同打造具有行业权威性与产业影响力的AI安全评测标杆。\n在大模型评测体系中，值得一提的是，近日港股大模型概念股明略科技(2718.HK)自研的大规模Web Agent综合计算机教育\n公开资料显示，WebRetriever也首次量化了智能体真实能力差距，为agent领域建立了应用的评测标准。该评测基准将Agent置于更加接近真实互联网的环境中，通过大规模任务测试，观察其在网页理解、路径规划、交互执行以及最终任务完成上的综合表现。\nWebRetriever 从数据集规模和多样性、自动化评估的可靠性，以及面向部署的评估协议这三个方面解决先前工作的关键局限性。\n业内人士指出，通过测试发现Agent能力短板，再推动模型、工具调用和任务规划能力提升。这使得评测体系不仅是衡量工具，也可能成为Agent持续进化的重要基础设施。从产业角度看，这类评测体系的意义并不只是给Agent“打分”，更重要的是帮助行业找到技术优化方向，让企业能够判断不同Agent产品距离实际应用还有多远。\n（文章来源：界面新闻）","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.eastmoney.com/a/202607143805292126.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 793 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 793 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":793,"summary_length":793,"usable_text_length":793,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":793,"summary_length":793}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}