# 当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn

*Источник: finance.sina.com.cn*
*Дата: 2026-09-24*
*Язык: zh*

**Кратко:** 当Qwen开始训练Qwen
（来源：硅星人）
作者｜Yoky
微信｜yokyliu617
Qwen在一个月里，自己改了自己33次。
不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。
9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。
过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。
大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。
这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。
只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。
而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。
云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。
1
训练下一代模型的，开始包括模型自己
Chatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。
阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。
这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。
比普通语料更有价值的是一本由真实世界写出来的错题集。
刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。
过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。
对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。
RSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。
如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。
阿里公布的RSI系统，试图让Qwen进入这个过程。
第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。
第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。
第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。
简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。
一个月，Qwen3.8-Max的分数从40涨到了45
这是整套流程里最容易被忽略，也最重要的一步。
模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。
这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。
在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。
Qwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。
1
它一路改到了芯片
如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。
真正让它变成技术战略的，是这套自动化开始向下蔓延。
Qwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。
过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。
现在，模型开始参与优化运行自己的系统。
再往下，是芯片。
在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。
刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。
这才是“递归”真正有想象力的地方。
当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。
但三件事放在一起，阿里的路线已经非常清楚：
向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。
它不是在给Qwen增加三个功能。
它是在把算法、系统和硬件，接进同一个自我改进的回路。
1
模型公司的下一款产品，是生产模型的能力
过去，我们习惯把一家模型公司的产品理解成模型本身。
GPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。
但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。
它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。
最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。
还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。
以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。
所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。
当Qwen开始训练Qwen，榜单已经不是重要的数字。
模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。
点个“爱心”，再走 吧

当Qwen开始训练Qwen
（来源：硅星人）
作者｜Yoky
微信｜yokyliu617
Qwen在一个月里，自己改了自己33次。
不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。
9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。
过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。
大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。
这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。
只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。
而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。
云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。
1
训练下一代模型的，开始包括模型自己
Chatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。
阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。
这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。
比普通语料更有价值的是一本由真实世界写出来的错题集。
刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。
过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。
对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。
RSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。
如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。
阿里公布的RSI系统，试图让Qwen进入这个过程。
第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。
第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。
第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。
简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。
一个月，Qwen3.8-Max的分数从40涨到了45
这是整套流程里最容易被忽略，也最重要的一步。
模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。
这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。
在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。
Qwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。
1
它一路改到了芯片
如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。
真正让它变成技术战略的，是这套自动化开始向下蔓延。
Qwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。
过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。
现在，模型开始参与优化运行自己的系统。
再往下，是芯片。
在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。
刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。
这才是“递归”真正有想象力的地方。
当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。
但三件事放在一起，阿里的路线已经非常清楚：
向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。
它不是在给Qwen增加三个功能。
它是在把算法、系统和硬件，接进同一个自我改进的回路。
1
模型公司的下一款产品，是生产模型的能力
过去，我们习惯把一家模型公司的产品理解成模型本身。
GPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。
但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。
它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。
最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。
还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。
以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。
所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。
当Qwen开始训练Qwen，榜单已经不是重要的数字。
模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。
点个“爱心”，再走 吧

[Оригинал](https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993)