{"id":81671,"topic":"ai","source":"新浪财经","title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","url_hash":"bdfe634b15ab14282458c2c0c48de1785bb79716","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxNajdIaFFhTlIzQ3g1bmIwcndlU25QVGRCRnNBQkN5UjFqZWhsSUd1UVVxUnF3XzNTSVRTc0lsQVk1eWFwR3pMQWNXOXVyYjVlTHp5a1M5TGxPdmRzcTZNVVRKd2NmSjl3M3kyVC1JbUNBQmdBYmwydU5TUWdHSlJEUnpGWE5pU0t2OHY3NUc4VDNaenJ4dERvTk5ZclUwdGN1QjRJVzVuOA?oc=5\" target=\"_blank\">从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","content":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","image_url":"https://n.sinaimg.cn/spider20260913/229/w660h369/20260913/d53e-f60ed8b9ba516056437afa9de1319fdf.jpg","lang":"zh","published_at":"2026-09-13T11:42:14+00:00","fetched_at":"2026-09-14T04:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","cluster_id":3498310,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}},"news_item":{"id":81671,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","source_name":"新浪财经","author":null,"published_at":"2026-09-13T11:42:14+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMipwFBVV95cUxNajdIaFFhTlIzQ3g1bmIwcndlU25QVGRCRnNBQkN5UjFqZWhsSUd1UVVxUnF3XzNTSVRTc0lsQVk1eWFwR3pMQWNXOXVyYjVlTHp5a1M5TGxPdmRzcTZNVVRKd2NmSjl3M3kyVC1JbUNBQmdBYmwydU5TUWdHSlJEUnpGWE5pU0t2OHY3NUc4VDNaenJ4dERvTk5ZclUwdGN1QjRJVzVuOA?oc=5\" target=\"_blank\">从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","full_text":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","excerpt":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3686 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","summary":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","source":"新浪财经","date":"2026-09-13T11:42:14+00:00","content":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3686 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/81671","export_markdown":"/api/items/81671/export?format=markdown","export_json":"/api/items/81671/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":81671,"title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","source":"新浪财经","author":null,"published_at":"2026-09-13T11:42:14+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","full_text":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 3686 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}},"actions":{"read":"/item/81671","export_markdown":"/api/items/81671/export?format=markdown","export_json":"/api/items/81671/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":81671,"title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","source":"新浪财经","topic":"ai","published_at":"2026-09-13T11:42:14+00:00","excerpt":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？ （来源：机器之心Pro） 机器之心发布 过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。 于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 3686 characters.","reading_time_min":1,"cluster_id":3498310},"card":{"display_title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","subtitle":"新浪财经 · 2026-09-13","summary":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？ （来源：机器之心Pro） 机器之心发布 过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。 于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？…","badges":["quality:high"],"links":{"read":"/item/81671","original":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？|GPT-3|ChatGPT|具身智能|Qwen|OpenAI_手机新浪网 - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html?vt=4&cid=76993&node_id=76993","summary":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","source":"新浪财经","date":"2026-09-13T11:42:14+00:00","content":"从认路到「跌倒再战」，机器人也在重走大模型的Scaling之路？\n（来源：机器之心Pro）\n机器之心发布\n过去三年，大模型走完了一条已被反复验证的路：先在海量数据上预训练出能力，再用对齐把能力变成可用性，最后靠大规模部署中的真实反馈持续进化。GPT-3、InstructGPT、ChatGPT——三步，一步一个台阶。\n于是一个问题开始在具身智能行业里产生：这条路，能不能在物理世界原样再走一遍？\n提出这个问题，是因为具身智能正卡在一道与当年大模型相似的“鸿沟”前：模型在仿真榜单上分数越刷越高，演示视频越拍越炫，但真正放到真实环境里，换一个场景、换一台机器，往往就要重新采数据、重新训练。而在物理世界里，差一点就是失败，而失败之后，大多数机器人只能停在原地等人来解决。榜单上的领先，与真实世界的可用之间，始终隔着一段距离。\n最近几天，一家名为亮源新创的具身智能公司，用两次技术发布给出了自己的回答：9 月 1 日，开源通用导航模型LightNav-0；9 日又发布了机器人韧性控制技术Light REACT。\n前者对应“对齐”，后者对应“部署”。两次发布落子的位置，严格对着大模型那三步棋。\n这并不奇怪。这家公司的创始人姜旭，此前是 OpenAI 的算法专家，方向是 RLHF，而这正是 ChatGPT 背后的对齐方法。他创业后率先提出“规模化预训练（Scalable Pre-Training）、规模化对齐（Scalable Alignment）、规模化部署（Scalable Deployment）”的三段范式。他的信条是：通用比专用重要；即先实现全场景的泛化，再走向全场景的精确。与“先在单一场景做精、再谈泛化”仍是主流打法相比，这算得上是一条 “反共识”路线。\n亲历者\n参与过“能力如何变成可用性”的完整答案\n要理解这家公司为什么这么下棋，得先回到 RLHF 在大模型历史上的位置。\n2020 年的 GPT-3 已经证明了规模化预训练的威力，但它本质上只会“补全下一个词”。看起来能力惊人，却谈不上好用。真正的转折发生在对齐：InstructGPT 用人类反馈的强化学习，把“会补全”驯化成“会干活”，同一个基座模型，交互体验天差地别。再往后，ChatGPT 把对齐后的模型推到亿级用户面前，真实使用中暴露的问题源源不断回流，成为下一代模型的养料。也就是说，能力、可用性、进化速度，分别来自三个不同的环节，这是大模型行业用五年时间换来的认知。\n姜旭的履历恰好穿过其中最关键的一环。在 OpenAI 从事 RLHF 研究，意味着他是从一线看到了“对齐”如何把一个只会补全的模型变成改变行业的产品。也就是说，当很多团队还在讨论范式的理论框架时，他已经见过这套范式完整运转一遍的成果。\n这段经历，解释了这家公司技术选择里那股罕见的笃定：\n十天内两连发\n对齐与部署，各落一子\n9 月 1 日开源的LightNav-0，解决的是“认路”。它以开源视觉语言模型为基座，不添加任何导航专用模块，同一套模型权重，可以零样本地部署到人形、四足、轮式乃至飞行机器人上。模型无需采新数据、不做微调，就能听懂自然语言指令，自己找路。\n据其技术报告，该模型在 10 项公开仿真评测中取得领先；一个被复现者格外留意的细节是，仅用单目 RGB、不依赖深度与里程计，它在动态跟踪基准上的成绩超过了使用全景与多相机的系统。传感器配置降级、成绩反超，这类反直觉的数字，往往最能说明方法本身的含金量。\nLightNav-0 在公开视觉语言导航评测基准上实现全面领先\n设计上也有巧思：为了让模型“记住来路”又不被历史观测撑爆，团队按人类记忆的遗忘曲线来分配注意力，即越久远的画面，保留得越粗略，眼前的画面保留最高精度。数据则没有走遥操作采集的路，而是把 2000 余个真实场景转化为仿真资产，在其中合成了 4000 余小时训练数据。也就是说，真实世界负责定义数据分布的边界，仿真负责在这个边界内规模化合成，具身后训练由此跨过了最难的冷启动门槛。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n落到工程细节上，基座是Qwen3-VL-4B-Instruct，团队没有为导航添加任何专用头，而是选择了扩展词表。\n双通道指点（dual-channel pointing）token在图像坐标系中表达与任务、场景、本体无关的空间意图；残差向量量化（RVQ）动作分词器再把意图落成 10 步 SE（2）轨迹——一个粗码本加两级残差码本，分辨率依次约 0.9 米、7 厘米与 4 厘米，全部经由基座原生的自回归语言头解码。历史观测按遗忘曲线压缩：采样率随帧龄指数衰减、空间池化步长指数增长，支持 256K 至 1M 三档像素预算。后训练沿“ER 中期训练—具身 SFT—在线 RL”三阶段推进；发布时还附带了一套面向部署的评测：210 个真实室内外场景、1097 个 episode。\n一周后的Light REACT，解决的是“摔不垮”。发布前几天，一段测试视频先在 X 上传开：一台双腿被捆住的人形机器人，起身失败后转为爬行，脱困、绳索剪断，再自行站起走掉。全程一个策略网络，没有模式切换，没有人工介入。\n视频链接：https://mp.weixin.qq.com/s/Ni-xmVKpcG5fxD0S0MRLww\n技术博客把“韧性”拆成了一座四层金字塔：身体完好时按指令行走；被推搡、被撞倒后自己爬起来；部分关节断电或锁死时，换一种步态（比如跛行、单足跳）继续移动；伤到双足行走在物理上已不可行，就转入爬行，保住移动能力本身，而不是保住某一种走法。\n真机演示里最耐人寻味的一幕：机器人双膝“过热断电”后跛行，中途电力恢复（没有任何信号告知它），它从自己身体最近的反应里推断出“腿又能用了”，自行站回直立行走。\n配方上，Light REACT（REsilient humAnoidConTrol）分三步走：\n承载这一切的，是一个支持全身上下文学习（Whole-Body In-Context Learning）的 Transformer 单一模型：不依赖故障标签、不做模型切换、不做部署期权重更新。\n团队将韧性称为规模化部署的“最后一公里”：机器人先得摔不垮，部署产生的经验流才不会中断，数据飞轮才转得起来。\nLightNav-0 开源不到一周，已有第三方在消费级显卡上完整跑通官方模型并公开实测；海外技术博主对那段绑腿视频的评价是：一套策略搞定行走、爬行与摔倒恢复，“令人印象深刻”。在这个惯于用剪辑视频讲故事的赛道里，“可下载、可复现”正在成为一种更稀缺的说服力。\n拼图\n算法判断、训练工程与真机落地的互补阵型\n把大模型的路线搬进机器人，需要的远不只是一个想法。这条技术链路天然横跨多个领域：既要有对范式与算法的判断，决定资源投向哪里；也要有大规模模型训练的工程能力，把判断变成模型；还要有真实机器人上的控制与落地能力，让模型在物理世界里兑现。三块能力，缺一块，链条就断在那一环。\n围绕这条技术链路，亮源新创搭建起一支优势互补的技术团队：CEO 姜旭牵引技术路线，推动技术范式与对齐方法的研发探索；联合创始人兼 CTO 范廷翔负责机器人整体工程与算法落地，推动模型能力在真实机器人上的集成、验证与应用。团队在大脑算法、多模态模型训练与具身 Agent 等方向设有专门负责人，协同推进算法研发、规模化训练与真机落地。据了解，公司成立于 2024 年底，目前在北京、深圳与新加坡三地设有团队。\n姜旭，亮源新创创始人兼 CEO\n具身智能的“部署时刻”\n过去两年，具身智能的竞争主要发生在榜单和演示视频里。但一个判断正在业内形成共识，即下一阶段的胜负手在别处：当机器人真正走出实验室，谁能让它们在真实世界持续运行、持续回传经验，谁才拥有属于自己的数据飞轮。\n特斯拉在自动驾驶上验证过这个逻辑，北美的人形机器人公司也在反复讲同一个故事：部署规模决定数据规模，数据规模决定进化速度。这正是大模型故事里“部署”那一步的具身版本，也是所有玩家迟早要过的关。\n从这个视角回看，亮源新创十天内的两次落子就有了另一层含义：导航解决“去哪儿”，韧性解决“倒了还能继续”——都是机器人离开实验室之前，必须先回答的问题。而按照“三段范式”的棋谱，预训练、对齐、部署三格，这家公司已经点亮了后两格的第一子。\n从 OpenAI 到亮源新创，如果说姜旭此前参与回答的命题是“如何让大模型从能力走向可用”，那么接下来要回答的，是如何让同一套范式在物理世界完整转起来。\n据了解，团队围绕该范式的更多技术成果仍在推进中，一款面向消费场景的机器人产品也已在研发日程上，将在适当时机对外披露。\n对这家刚刚完成首次连续亮相的公司而言，十天两子只是开局。这盘棋能不能在物理世界里走通，现在下结论还早。但至少，它并不是一张凭空画出的棋谱，毕竟人们已经在数字世界里见过一次相似路径如何改变一个行业。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-13/detail-inirsuvy5392366.d.html%3Fvt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 3686 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 3686 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":3686,"summary_length":3686,"usable_text_length":3686,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":3686,"summary_length":3686}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}