{"id":81044,"topic":"ai","source":"InfoQ-CN","title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","url_hash":"431138e218307f7e87984878cba5bb399c348c02","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE02d3MyeTVlWmRaWjY4Yy1xN19DSUdpMFc4MWdUbTNXSlF5elJlRk5zZVFGR2ctYWdsS3FvSGtFR1ZvU3llSEtta2xJcnVPcWZNRFk3cmsyNmxNaEt5dEE?oc=5\" target=\"_blank\">Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. BoRP 技术架构：从“读”取代“写”\n对比表示（Contrastive Representation）：如何通过 Suffix-only Prompt 剥离对话背景，提取纯净的满意度信号。\n几何感知探测引擎：利用向量范数（Norm）与离群度（Outlierness）量化极端样本。\n3. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4. 工业级落地优化与 A/B Test 实践\nKV-Cache 复用与前缀共享：如何支撑单卡 A100 日处理百万级会话。\n不确定性预警：利用中间层与输出层差异作为“认知冲突”代理，过滤异常预测。\n5. 总结与未来演进\n骨干模型进化：更换 Backbone 时如何实现“免重训”迁移。\n局限性与未来：复杂推理场景下的生成式补充。\n实践痛点：\n极端样本挖掘难（“大海捞针”）：在大规模工业流量中，极好或极差的“极化样本”分布极稀疏，传统随机抽样很难构建高质量的评测基准。\n评测成本与全量监控的矛盾：生成式模型评测 Token 消耗巨大，导致企业只能进行抽样评测，无法在 A/B Test 中捕捉微小的满意度波动。\n生成式评测的“不公平”偏置：模型容易因为回复更长或回复位置不同而给出高分，这种系统性偏置严重干扰了模型的真实优化方向。\n模型升级的沉没成本：每次升级 Base 模型，往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型，开发周期极长。\n前沿亮点：\n范式创新：提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力，而是挖掘 LLM 的 latent knowledge，从底层逻辑上消除了字数偏置和格式敏感性。\n极高性价比的工程实现：通过 Suffix-only Probing 和多维度特征增强，实现了在 8B 模型上对齐 GPT-4 级的评测精度，且成本降低至前者的 3% 左右。\n可解释的评测不确定性：创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度，为工业界提供了自动化的“坏案例（Bad-case）”过滤机制。\n听众收益：\n技术方案：掌握一套可落地的、基于回归探测的低成本 LLM 评测架构，解决评测算力贵的瓶颈。\n方法论：学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准（Rubric）。\n实战经验：了解如何将 LLM 内部信号与传统 A/B Test 指标结合，提升线上实验的灵敏度和方差削减（Variance Reduction）。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","image_url":"https://static001.infoq.cn/resource/image/e6/39/e6b32c512168d5ea82b21aa3881e0f39.jpg","lang":"zh","published_at":"2026-09-13T02:01:34+00:00","fetched_at":"2026-09-13T03:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4.","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}},"news_item":{"id":81044,"canonical_url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","source_url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","source_name":"InfoQ-CN","author":null,"published_at":"2026-09-13T02:01:34+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE02d3MyeTVlWmRaWjY4Yy1xN19DSUdpMFc4MWdUbTNXSlF5elJlRk5zZVFGR2ctYWdsS3FvSGtFR1ZvU3llSEtta2xJcnVPcWZNRFk3cmsyNmxNaEt5dEE?oc=5\" target=\"_blank\">Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","full_text":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. BoRP 技术架构：从“读”取代“写”\n对比表示（Contrastive Representation）：如何通过 Suffix-only Prompt 剥离对话背景，提取纯净的满意度信号。\n几何感知探测引擎：利用向量范数（Norm）与离群度（Outlierness）量化极端样本。\n3. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4. 工业级落地优化与 A/B Test 实践\nKV-Cache 复用与前缀共享：如何支撑单卡 A100 日处理百万级会话。\n不确定性预警：利用中间层与输出层差异作为“认知冲突”代理，过滤异常预测。\n5. 总结与未来演进\n骨干模型进化：更换 Backbone 时如何实现“免重训”迁移。\n局限性与未来：复杂推理场景下的生成式补充。\n实践痛点：\n极端样本挖掘难（“大海捞针”）：在大规模工业流量中，极好或极差的“极化样本”分布极稀疏，传统随机抽样很难构建高质量的评测基准。\n评测成本与全量监控的矛盾：生成式模型评测 Token 消耗巨大，导致企业只能进行抽样评测，无法在 A/B Test 中捕捉微小的满意度波动。\n生成式评测的“不公平”偏置：模型容易因为回复更长或回复位置不同而给出高分，这种系统性偏置严重干扰了模型的真实优化方向。\n模型升级的沉没成本：每次升级 Base 模型，往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型，开发周期极长。\n前沿亮点：\n范式创新：提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力，而是挖掘 LLM 的 latent knowledge，从底层逻辑上消除了字数偏置和格式敏感性。\n极高性价比的工程实现：通过 Suffix-only Probing 和多维度特征增强，实现了在 8B 模型上对齐 GPT-4 级的评测精度，且成本降低至前者的 3% 左右。\n可解释的评测不确定性：创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度，为工业界提供了自动化的“坏案例（Bad-case）”过滤机制。\n听众收益：\n技术方案：掌握一套可落地的、基于回归探测的低成本 LLM 评测架构，解决评测算力贵的瓶颈。\n方法论：学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准（Rubric）。\n实战经验：了解如何将 LLM 内部信号与传统 A/B Test 指标结合，提升线上实验的灵敏度和方差削减（Variance Reduction）。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4.","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2939 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4.","source":"InfoQ-CN","date":"2026-09-13T02:01:34+00:00","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. BoRP 技术架构：从“读”取代“写”\n对比表示（Contrastive Representation）：如何通过 Suffix-only Prompt 剥离对话背景，提取纯净的满意度信号。\n几何感知探测引擎：利用向量范数（Norm）与离群度（Outlierness）量化极端样本。\n3. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4. 工业级落地优化与 A/B Test 实践\nKV-Cache 复用与前缀共享：如何支撑单卡 A100 日处理百万级会话。\n不确定性预警：利用中间层与输出层差异作为“认知冲突”代理，过滤异常预测。\n5. 总结与未来演进\n骨干模型进化：更换 Backbone 时如何实现“免重训”迁移。\n局限性与未来：复杂推理场景下的生成式补充。\n实践痛点：\n极端样本挖掘难（“大海捞针”）：在大规模工业流量中，极好或极差的“极化样本”分布极稀疏，传统随机抽样很难构建高质量的评测基准。\n评测成本与全量监控的矛盾：生成式模型评测 Token 消耗巨大，导致企业只能进行抽样评测，无法在 A/B Test 中捕捉微小的满意度波动。\n生成式评测的“不公平”偏置：模型容易因为回复更长或回复位置不同而给出高分，这种系统性偏置严重干扰了模型的真实优化方向。\n模型升级的沉没成本：每次升级 Base 模型，往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型，开发周期极长。\n前沿亮点：\n范式创新：提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力，而是挖掘 LLM 的 latent knowledge，从底层逻辑上消除了字数偏置和格式敏感性。\n极高性价比的工程实现：通过 Suffix-only Probing 和多维度特征增强，实现了在 8B 模型上对齐 GPT-4 级的评测精度，且成本降低至前者的 3% 左右。\n可解释的评测不确定性：创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度，为工业界提供了自动化的“坏案例（Bad-case）”过滤机制。\n听众收益：\n技术方案：掌握一套可落地的、基于回归探测的低成本 LLM 评测架构，解决评测算力贵的瓶颈。\n方法论：学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准（Rubric）。\n实战经验：了解如何将 LLM 内部信号与传统 A/B Test 指标结合，提升线上实验的灵敏度和方差削减（Variance Reduction）。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2939 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/81044","export_markdown":"/api/items/81044/export?format=markdown","export_json":"/api/items/81044/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec"},"formats":{"full":{"id":81044,"title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","source":"InfoQ-CN","author":null,"published_at":"2026-09-13T02:01:34+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4.","full_text":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. BoRP 技术架构：从“读”取代“写”\n对比表示（Contrastive Representation）：如何通过 Suffix-only Prompt 剥离对话背景，提取纯净的满意度信号。\n几何感知探测引擎：利用向量范数（Norm）与离群度（Outlierness）量化极端样本。\n3. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4. 工业级落地优化与 A/B Test 实践\nKV-Cache 复用与前缀共享：如何支撑单卡 A100 日处理百万级会话。\n不确定性预警：利用中间层与输出层差异作为“认知冲突”代理，过滤异常预测。\n5. 总结与未来演进\n骨干模型进化：更换 Backbone 时如何实现“免重训”迁移。\n局限性与未来：复杂推理场景下的生成式补充。\n实践痛点：\n极端样本挖掘难（“大海捞针”）：在大规模工业流量中，极好或极差的“极化样本”分布极稀疏，传统随机抽样很难构建高质量的评测基准。\n评测成本与全量监控的矛盾：生成式模型评测 Token 消耗巨大，导致企业只能进行抽样评测，无法在 A/B Test 中捕捉微小的满意度波动。\n生成式评测的“不公平”偏置：模型容易因为回复更长或回复位置不同而给出高分，这种系统性偏置严重干扰了模型的真实优化方向。\n模型升级的沉没成本：每次升级 Base 模型，往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型，开发周期极长。\n前沿亮点：\n范式创新：提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力，而是挖掘 LLM 的 latent knowledge，从底层逻辑上消除了字数偏置和格式敏感性。\n极高性价比的工程实现：通过 Suffix-only Probing 和多维度特征增强，实现了在 8B 模型上对齐 GPT-4 级的评测精度，且成本降低至前者的 3% 左右。\n可解释的评测不确定性：创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度，为工业界提供了自动化的“坏案例（Bad-case）”过滤机制。\n听众收益：\n技术方案：掌握一套可落地的、基于回归探测的低成本 LLM 评测架构，解决评测算力贵的瓶颈。\n方法论：学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准（Rubric）。\n实战经验：了解如何将 LLM 内部信号与传统 A/B Test 指标结合，提升线上实验的灵敏度和方差削减（Variance Reduction）。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2939 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}},"actions":{"read":"/item/81044","export_markdown":"/api/items/81044/export?format=markdown","export_json":"/api/items/81044/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec"}},"digest":{"id":81044,"title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","source":"InfoQ-CN","topic":"ai","published_at":"2026-09-13T02:01:34+00:00","excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！ 推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2939 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","subtitle":"InfoQ-CN · 2026-09-13","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！ 推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI…","badges":["quality:high"],"links":{"read":"/item/81044","original":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec"},"quality_warning":null},"export":{"title":"Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线｜QCon上海 - InfoQ-CN","url":"https://www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4.","source":"InfoQ-CN","date":"2026-09-13T02:01:34+00:00","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n阿里巴巴高级技术专家孙鹏已确认出席 “AI Agent 可观测与持续改进工程” 专题，并发表题为《Read, Don't Write: 重塑大模型评价体系，构建全自动、可进化的“探测式”评测管线》的主题分享。当全行业都在为“如何让 LLM 评价得更准”而绞尽脑汁时，我们是否走错了路？传统的生成式 LLM-as-a-Judge 正在成为企业沉重的“算力枷锁”：不仅全量评测成本高昂，更深陷字数偏置、中心化趋向等系统性偏置。本次分享将带来一种全新的“探测式评测”范式——BoRP（Bootstrapped Regression Probing）。他们不再让模型“写”评语，而是直接“读取”模型隐状态下的满意度信号。通过对比表示提取与 PLS 回归技术，他们将评测成本降低了 97%，同时在人类对齐度上超越了传统的生成式 Judge。他们将深入解析如何从零构建这套“读脑”管线，包括如何在无标注流量中自动孵化评测标准，以及如何通过层间不确定性量化评测的可信度。这一方案已在万亿级流量的 A/B 测试中落地，为模型迭代提供了实时、高敏的“体温计”。本次分享将结合真实案例，展示 badcase 如何入池、分派、修复和验证，并说明当前哪些环节仍需人工决策。\n孙鹏,阿里巴巴高级技术专家。目前从事千问智能体开发生态相关研发工作，此前主要负责信息流推荐业务架构、abtest 实验、交易系统等相关工作。他在本次会议的详细演讲内容如下：\n演讲提纲：\n行业趋势与评测困境\n开放式对话评测的现状：指标 Gap 与滞后的用户反馈。\n传统生成式 Judge 的三大“税”：成本税、延迟税、偏置税（中心化倾向、字数偏置）。\n2. BoRP 技术架构：从“读”取代“写”\n对比表示（Contrastive Representation）：如何通过 Suffix-only Prompt 剥离对话背景，提取纯净的满意度信号。\n几何感知探测引擎：利用向量范数（Norm）与离群度（Outlierness）量化极端样本。\n3. PLS 回归头设计\n相比 PCA，如何通过有监督回归过滤话题噪音，提升样本效率。\n冷启动与自动化对齐管线：自引导（Bootstrapping）如何在无标注流量中通过“极化挖掘”自动生成评测标准（Rubric）。\n专家对齐：仅需数百条标注实现 Krippendorff’s alpha 0.80 的高信度对齐。\n4. 工业级落地优化与 A/B Test 实践\nKV-Cache 复用与前缀共享：如何支撑单卡 A100 日处理百万级会话。\n不确定性预警：利用中间层与输出层差异作为“认知冲突”代理，过滤异常预测。\n5. 总结与未来演进\n骨干模型进化：更换 Backbone 时如何实现“免重训”迁移。\n局限性与未来：复杂推理场景下的生成式补充。\n实践痛点：\n极端样本挖掘难（“大海捞针”）：在大规模工业流量中，极好或极差的“极化样本”分布极稀疏，传统随机抽样很难构建高质量的评测基准。\n评测成本与全量监控的矛盾：生成式模型评测 Token 消耗巨大，导致企业只能进行抽样评测，无法在 A/B Test 中捕捉微小的满意度波动。\n生成式评测的“不公平”偏置：模型容易因为回复更长或回复位置不同而给出高分，这种系统性偏置严重干扰了模型的真实优化方向。\n模型升级的沉没成本：每次升级 Base 模型，往往需要重新构建数万条评测数据集并重新 SFT 专用评测模型，开发周期极长。\n前沿亮点：\n范式创新：提出了“Read, Don't Write”的评测新范式。不再依赖模型的生成能力，而是挖掘 LLM 的 latent knowledge，从底层逻辑上消除了字数偏置和格式敏感性。\n极高性价比的工程实现：通过 Suffix-only Probing 和多维度特征增强，实现了在 8B 模型上对齐 GPT-4 级的评测精度，且成本降低至前者的 3% 左右。\n可解释的评测不确定性：创新性地利用层间隐状态的“认知冲突”来量化评测结果的可信度，为工业界提供了自动化的“坏案例（Bad-case）”过滤机制。\n听众收益：\n技术方案：掌握一套可落地的、基于回归探测的低成本 LLM 评测架构，解决评测算力贵的瓶颈。\n方法论：学习如何利用 Bootstrapping 从无标注数据中自动化提炼业务评测标准（Rubric）。\n实战经验：了解如何将 LLM 内部信号与传统 A/B Test 指标结合，提升线上实验的灵敏度和方差削减（Variance Reduction）。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）将于 10 月 22 日—24 日举办。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/0kYhxXxhOXhxGATe64ec","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2939 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2939 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2939,"summary_length":1429,"usable_text_length":2939,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2939,"summary_length":1429}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}