{"id":86716,"topic":"ai","source":"InfoQ-CN","title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","url_hash":"9dd17e540ef8a7c22a3b7e4d7378fafe5addf61a","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE1YQVZKLTNkSERPUjJlcF9SY1ZxQWZVX2FRSG5aUURoUlpJWDBIZGh6OHY3S1ZmcUFfOU5wNjJuQnlCc0dHdGlLM0FkNkJSOXd6TXdSRnR1bmxmdVpkYWc?oc=5\" target=\"_blank\">Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","image_url":"https://static001.infoq.cn/resource/image/aa/7c/aa1c1fb0fd3c79624a7d1ba5cb32a27c.jpg","lang":"zh","published_at":"2026-09-21T02:01:48+00:00","fetched_at":"2026-09-21T02:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}},"news_item":{"id":86716,"canonical_url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","source_url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","source_name":"InfoQ-CN","author":null,"published_at":"2026-09-21T02:01:48+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE1YQVZKLTNkSERPUjJlcF9SY1ZxQWZVX2FRSG5aUURoUlpJWDBIZGh6OHY3S1ZmcUFfOU5wNjJuQnlCc0dHdGlLM0FkNkJSOXd6TXdSRnR1bmxmdVpkYWc?oc=5\" target=\"_blank\">Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","full_text":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2274 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","source":"InfoQ-CN","date":"2026-09-21T02:01:48+00:00","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2274 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/86716","export_markdown":"/api/items/86716/export?format=markdown","export_json":"/api/items/86716/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX"},"formats":{"full":{"id":86716,"title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","source":"InfoQ-CN","author":null,"published_at":"2026-09-21T02:01:48+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","full_text":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 2274 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}},"actions":{"read":"/item/86716","export_markdown":"/api/items/86716/export?format=markdown","export_json":"/api/items/86716/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX"}},"digest":{"id":86716,"title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","source":"InfoQ-CN","topic":"ai","published_at":"2026-09-21T02:01:48+00:00","excerpt":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！ 推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 2274 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","subtitle":"InfoQ-CN · 2026-09-21","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！ 推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI…","badges":["quality:high"],"links":{"read":"/item/86716","original":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX"},"quality_warning":null},"export":{"title":"Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践｜QCon 上海 - InfoQ-CN","url":"https://www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","summary":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","source":"InfoQ-CN","date":"2026-09-21T02:01:48+00:00","content":"从「构建 AI」到「驾驭 AI」，100+ 实战案例拆解 AI Native 时代的工程新实践！\n推理模型持续突破能力边界，Coding Agent 深度参与研发流程，Agent Runtime、Agent Framework 快速演进……AI 正在从回答问题的模型，演变为能够自主规划、调用工具、执行任务的软件系统。AI 不再只是软件中的一个能力，而开始成为软件系统的一部分。这意味着软件工程面对的挑战也发生了变化：团队需要思考的不再只是如何训练模型、模型、部署模型 或优化 Prompt，而不是如何让具备自主能力的 AI 稳定、可信、可控地运行。模型决定 AI 能做什么，系统决定 AI 能否真正创造价值。\n在这一背景下，2026 年 QCon 全球软件开发大会大会 · 上海站正式启动。本次大会将于 10 月 22 日—24 日举办，聚焦 Harness AI 时代的工程实践，围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等前沿技术方向，邀请全球技术社区与产业一线的实践者，系统性分享前沿洞察与实战经验，共同探索 AI 从能力到系统、从实验到生产的真实路径。\n蚂蚁集团 & 大模型训练数据处理系统 Altum 技术负责人王鑫已确认出席 “AI Infra：算力效率决定规模化落地” 专题，并发表题为《Altum：蚂蚁集团新一代大模型训练数据处理系统设计与实践》的主题分享。在大模型训练数据规模持续提升、模型迭代效率持续加快的背景下，业界在模型数据处理的 GPU 效能、任务稳定性、数据交付时效等方面面临巨大挑战。蚂蚁通过新一代大模型训练数据处理系统 Altum 的建设，尝试系统化解决这些问题。本次分享将重点介绍在性能、稳定性、效率等方面提升的关键技术策略和背后的思考与取舍，以及业务生产实践案例。\nApache Member（Apache 软件基金会成员），多个 Apache 顶级项目的 PMC Member、Committer，多个 Apache 孵化器项目的 Mentor。蚂蚁集团新一代大模型训练数据处理系统 Altum 技术负责人、实时智能技术负责人。加入蚂蚁集团前曾就职于阿里巴巴，并参与大数据领域早期创业。具备数据智能领域引擎、平台、数据解决方案的复合背景，当前重点关注 AI Data Infra 的建设。\n演讲提纲：\n背景\n业界、蚂蚁在大模型训练数据处理上面临的挑战；\n整体方案\n涵盖算力、引擎、平台、数据等多个层次的体系化方案；\n极致性能优化\n异构算力融合调度：向上兼容不同算子体系、向下支持多种算力类型，提升全局资源利用率；\n基于数据湖存储 Paimon 的端到端升级：从数据采集到模型训练消费的端到端优化，提升存储与网络 IO 性能；\n算子性能优化与增量计算（全局去重、样本重试、增量同步等），提升 GPU 计算性能；\n稳定性提升\n样本级重试、端到端可观测与 SLA 保障、熔断保护机制、智能运维诊断；\n研发效率提升\n端到端场景化 Pipeline：场景化研发范式、增强能力（节点、算子）、人机协同研发；\nAgentic 数据处理：支持逐条数据的多轮 Agent 处理；\n生产实践与未来展望\n在阿福、百灵等内部场景的落地效果；\nAI Data Infra 发展方向。\n实践痛点：\n跨引擎调度的统一抽象 vs 引擎特有能力损失：不同引擎的统一在一定程度上牺牲了各引擎的独有优化，需要在统一对齐上做 tradeoff，做不到「零损失抽象」；\n样本级重试的降本空间 vs 幂等约束与熔断阈值的平衡难题：只重跑失败样本能根治「全量重跑烧 GPU」，但失败熔断阈值在「误杀抖动」与「无效烧卡」之间难以平衡。\n前沿亮点：\n「高失败率、低吞吐、高交付时长」三角困局下的体系化解法；\n从全局资源利用率、存储与网络 IO、计算性能全方位的极致性能优化；\n场景化、Agentic 方式的 AI 数据研发新范式。\n听众收益：\n了解大模型背后训练数据处理的全链路；\n掌握全链路数据处理背后的关键技术挑战与系统性解法；\n获得真实业务场景下的落地路径。\n除此之外，本次大会还策划了Loop Engineering、千行百业 Agent 创新实践、Agent 自主进化：从记忆到持续学习、Agent as a Service、Vibe Coding 时代的新质量债、理性驾驭 AI 的 SRE 可靠性工程、金融 AI Native工程实践：从研发提效到业务破局、AI Infra：算力效率决定规模化落地、AI Native 架构等 20 个专题论坛，届时将有来自不同行业、不同领域、不同企业的 100+资深专家在现场带来前沿技术洞察和一线实践经验。\nQCon 全球软件开发大会·2026（上海站）现已正式启动。本届大会聚焦 Harness AI 时代的工程实践，从「构建 AI」到「驾驭 AI」，围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型 等热门技术方向，邀请全球技术社区与产业一线实践者，共同分享 AI Native 时代最具价值的工程经验。9 折倒计时进入最后一周，现在报名立减 680，查看更多详情可扫码或联系票务经理 18514549229 进行咨询。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/AGIRRRtM1lBDFIvwWuRX","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 2274 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 2274 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":2274,"summary_length":2274,"usable_text_length":2274,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":2274,"summary_length":2274}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}