{"id":89213,"topic":"ai","source":"finance.sina.com.cn","title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","url_hash":"7187a3935bac6cb4329b954ca3738181a53ec58a","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMisgFBVV95cUxOVzFPbkxfM3RSSmJBTjgxZkpsN3VlOXc2cHJwVVZ1NUJBY3ZvVTJwTnhDQlVZVUlhNlY5eGNUNXhfeXY4RjE1Wk5NakpvbTVNWG5rNlpBWTNDUlZBOEpTajYwaEUtWm1lWVh6WXgxOGI4Ri1OQVFFMkk3XzRIems3S1Z1bTBFTmZaR0YzMEFpMkd5Umk5ZDktT2FKNXBMVjZ4N1BVS2EwWUM5NTRienpQb0h3?oc=5\" target=\"_blank\">当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">finance.sina.com.cn</font>","content":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","image_url":"https://n.sinaimg.cn/spider20260923/149/w660h289/20260923/3757-1e9b73b29db7522fc730796466a97273.jpg","lang":"zh","published_at":"2026-09-24T00:33:45+00:00","fetched_at":"2026-09-24T01:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}},"news_item":{"id":89213,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","source_name":"finance.sina.com.cn","author":null,"published_at":"2026-09-24T00:33:45+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMisgFBVV95cUxOVzFPbkxfM3RSSmJBTjgxZkpsN3VlOXc2cHJwVVZ1NUJBY3ZvVTJwTnhDQlVZVUlhNlY5eGNUNXhfeXY4RjE1Wk5NakpvbTVNWG5rNlpBWTNDUlZBOEpTajYwaEUtWm1lWVh6WXgxOGI4Ri1OQVFFMkk3XzRIems3S1Z1bTBFTmZaR0YzMEFpMkd5Umk5ZDktT2FKNXBMVjZ4N1BVS2EwWUM5NTRienpQb0h3?oc=5\" target=\"_blank\">当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">finance.sina.com.cn</font>","full_text":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","excerpt":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3049 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","summary":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","source":"finance.sina.com.cn","date":"2026-09-24T00:33:45+00:00","content":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3049 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/89213","export_markdown":"/api/items/89213/export?format=markdown","export_json":"/api/items/89213/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":89213,"title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","source":"finance.sina.com.cn","author":null,"published_at":"2026-09-24T00:33:45+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","full_text":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3049 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}},"actions":{"read":"/item/89213","export_markdown":"/api/items/89213/export?format=markdown","export_json":"/api/items/89213/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":89213,"title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","source":"finance.sina.com.cn","topic":"ai","published_at":"2026-09-24T00:33:45+00:00","excerpt":"当Qwen开始训练Qwen （来源：硅星人） 作者｜Yoky 微信｜yokyliu617 Qwen在一个月里，自己改了自己33次。 不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3049 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","subtitle":"finance.sina.com.cn · 2026-09-24","summary":"当Qwen开始训练Qwen （来源：硅星人） 作者｜Yoky 微信｜yokyliu617 Qwen在一个月里，自己改了自己33次。 不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。…","badges":["quality:high"],"links":{"read":"/item/89213","original":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"当Qwen开始训练Qwen|云栖大会|阿里巴巴|大模型|模型|数据_手机新浪网 - finance.sina.com.cn","url":"https://finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html?oid=800&vt=4&cid=76993&node_id=76993","summary":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","source":"finance.sina.com.cn","date":"2026-09-24T00:33:45+00:00","content":"当Qwen开始训练Qwen\n（来源：硅星人）\n作者｜Yoky\n微信｜yokyliu617\nQwen在一个月里，自己改了自己33次。\n不是改了33次回答，也不是多跑了33次评测。它开始自己搭训练流程、自己构造数据、自己设计实验、自己定位能力缺陷，再把结果送进下一轮训练。\n9月22日，阿里巴巴在云栖大会上集中公布大模型进展：基于新一代架构的Qwen4已经在训练中，未来Qwen4.5、Qwen5等版本将扩展至5—10T参数；视频生成、语音、图像、世界、音乐和全模态等模型，也在当天或近期推出新版本。与此同时，递归自我改进（RSI）已初步进入模型训练、推理和芯模协同等环节。\n过去，数据怎么造、实验怎么做、问题怎么找，都由研究员推动。现在，模型开始参与制造自己的下一代。\n大模型竞争正在从“谁的模型更强”，走向“谁能让模型更快地继续变强”。\n这也是今天整个AI行业重新讨论RSI，递归自我改进的原因。\n只是，模型自己生成一点数据，再拿这些数据训练自己，还不是那个科幻叙事里的“自我进化”。更准确的边界是：当模型开始寻找改进目标、设计训练流程、调用研发工具，并验证这一轮改进有没有用，它才真正从训练对象变成研发参与者。\n而且，它不会只发生在模型权重里。训练、评测、推理系统和硬件需要一起进入这个循环。Qwen参与训练自己、优化运行自己的推理系统，再参与设计承载自己的芯片。\n云栖中真正重要的，不只是下一代Qwen会有多大，而是下一代Qwen将如何被训练出来。\n1\n训练下一代模型的，开始包括模型自己\nChatbot时代，模型回答一次问题，任务就结束了。Agent不是。它要规划、调用工具、检查结果、继续修改，一项任务可能跑几个小时，经历很多次中间决策。\n阿里巴巴ATH事业群Token Foundry Qwen LLM项目负责人刘大一恒把这个变化概括得很直接：AI的消费，正在从“一次对话”变成“一项任务”。这句话也解释了RSI为什么偏偏在今天变得重要——任务越长、步骤越多，模型留下的真实反馈就越丰富，训练系统也越有可能从使用过程中获得下一轮进化的材料。\n这意味着模型每天留下的，不只是答案，还有大量失败现场：哪一步总做错，哪种工具不会用，什么任务反复卡住，用户又在哪些地方一次次推翻它。\n比普通语料更有价值的是一本由真实世界写出来的错题集。\n刘大一恒在演讲中披露，Qwen3.8-Max相比Qwen3.7，两个月内来自真实用户的收入增长8.5倍，Token消耗量增长12倍。收入和Token当然不等于智能，但它们说明Qwen正在进入更多真实任务，也因此看到更多真实错误。\n过去的问题是缺数据。现在的问题开始变成：谁能更快从这些错误里找到值得修补的能力，再把它送回训练。\n对模型公司来说，真实使用因此不再只是商业化的结果，也开始反过来成为研发基础设施的一部分。用户越多当然不自动等于模型越强，只有当反馈能够被识别、筛选并重新进入训练，它才会变成能力。\nRSI要接上的，就是“使用—失败—训练—再使用”这条原来由研究员手动推动的链路。\n如果这条链真的能够持续运转，模型发布就不再只是一次研发的终点。它进入现实世界的那一刻，反而是下一轮训练的起点。\n阿里公布的RSI系统，试图让Qwen进入这个过程。\n第一步，它从真实的内测日志和用户反馈里定位能力缺陷。不是笼统地说“编程还不够好”，而是找到自己究竟在哪类任务、哪个环节和哪种条件下更容易失败。\n第二步，它围绕缺陷自动构造训练数据。发现错题还不够，还要给自己出一批能够补上缺口的新题。\n第三步，验证这批题到底有没有用。模型生成的数据不会直接进入Max训练，而是先放到小模型上做多轮验证和迭代，筛掉无效数据，再送进旗舰模型。\n简单解释一下，就是Qwen不只开始给自己出题，还要先找一个小号的自己试做一遍，看看这些题是不是真的能把模型教会。\n一个月，Qwen3.8-Max的分数从40涨到了45\n这是整套流程里最容易被忽略，也最重要的一步。\n模型自己造数据并不稀奇。难的是它会不会把错误重复一遍，会不会专挑自己已经会的题，或者干脆学会讨好评测标准。一个循环跑得很快，不代表它跑对了方向。\n这套系统已经连续运行超过一个月，完成33轮有效迭代，并在相关流程中实现人类完全“零参与”。\n在外界看来这已经是比较扎实的工作，但刘大一恒仍把它形容为一次“探索”，“一项实验”。不难看出，Qwen对此的野心更大。\nQwen给这套系统设定的目标，是构建一种“更加自动化、持续化、数据驱动的自我进化机制”。三个词里，真正关键的是“持续化”：不是等下一次大版本发布再修，而是让真实世界的反馈不断回到训练中。\n1\n它一路改到了芯片\n如果故事只到自动造数据，Qwen做的仍然可以被理解成一次后训练流程升级。\n真正让它变成技术战略的，是这套自动化开始向下蔓延。\nQwen面对一款此前没有见过的平头哥新款GPU，自主适配并优化Qwen3.8-Flash的SGLang推理框架，最终让单实例推理吞吐提升96%。\n过去，一款新模型要在一块新芯片上跑顺，需要工程师理解硬件、修改推理框架、测试瓶颈，再一轮轮优化。\n现在，模型开始参与优化运行自己的系统。\n再往下，是芯片。\n在真实的工业级EDA环境里，Qwen拿到的输入只有一份总线模块规格。它参与前端、验证和后端流程，根据工具返回的结果反复修改。整个过程连续运行超过60小时，累计调用EDA工具超过1万次，最终在保证性能的同时，将芯片面积缩减42%。\n刘大一恒在现场把这条关系说得更完整：“模型设计芯片，而更强的芯片又将反哺更强的模型。”阿里把它称为芯模协同进化。模型参与设计芯片，芯片再用来运行和训练模型，软硬件之间开始形成一条彼此加速的回路。\n这才是“递归”真正有想象力的地方。\n当然，概念不能乱装。自我训练是RSI的核心实践；推理框架适配和EDA设计，更接近模型研发自动化向系统与硬件延伸。把三件事全部粗暴地叫作RSI，只会让这个词迅速变成又一个什么都能解释的技术黑话。\n但三件事放在一起，阿里的路线已经非常清楚：\n向上，让模型从真实世界获得反馈，参与训练自己；向下，让模型优化运行自己的系统，甚至参与设计承载自己的芯片。\n它不是在给Qwen增加三个功能。\n它是在把算法、系统和硬件，接进同一个自我改进的回路。\n1\n模型公司的下一款产品，是生产模型的能力\n过去，我们习惯把一家模型公司的产品理解成模型本身。\nGPT、Claude、Gemini、Qwen。每隔几个月推出一个新版本，能力更强，价格更低，上下文更长。\n但如果RSI这条路成立，模型公司真正需要生产的，会多出一样东西：一套持续生产下一代模型的系统。\n它需要真实生产场景提供问题，需要模型识别值得修补的缺陷，需要数据和实验系统寻找答案，也需要可靠的评测判断答案有没有用。\n最终比拼的就不只是一次训练能堆多少卡、做出多大的模型。\n还要看谁能更快获得真实反馈，谁能更快把失败变成训练，谁能用更低的成本验证一次改进，再把结果送回下一轮。\n以前看点位。以后还要看斜率。点位回答今天谁更强。斜率回答半年后谁会更强。\n所以今天Qwen的进步，更像是一个信号：大模型已经不满足于成为人类的生产力工具。它开始触碰生产大模型本身的工具链。\n当Qwen开始训练Qwen，榜单已经不是重要的数字。\n模型公司的终极产品，可能不再是某一代模型，而是一套能够持续生产下一代模型的系统。\n点个“爱心”，再走 吧","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-23/detail-inisusym1359387.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3049 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3049 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3049,"summary_length":3049,"usable_text_length":3049,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3049,"summary_length":3049}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}