{"id":88881,"topic":"ai","source":"leiphone.com","title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","url_hash":"274eaab7e676984a4a3a8cebc9beb76f3c34fc42","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMickFVX3lxTE1TcHpfRVF4WGgxbnYyYjQ2Mnc5MUdDWjl0V2ZLVHk3WU03U1VxZmszSldkOFhuc29oMUlfY3BGbU5SYXVrYXdfUDNGenJvZzNFMS1xYXhsNzNNd1QxRk5ybjRGVUloVVhGV1RsUUlBUEJyQQ?oc=5\" target=\"_blank\">乐享以太大模型，让中国具身智能坐上定义席</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">leiphone.com</font>","content":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","image_url":null,"lang":"zh","published_at":"2026-09-23T01:46:00+00:00","fetched_at":"2026-09-23T14:15:09+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}},"news_item":{"id":88881,"canonical_url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","source_url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","source_name":"leiphone.com","author":null,"published_at":"2026-09-23T01:46:00+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMickFVX3lxTE1TcHpfRVF4WGgxbnYyYjQ2Mnc5MUdDWjl0V2ZLVHk3WU03U1VxZmszSldkOFhuc29oMUlfY3BGbU5SYXVrYXdfUDNGenJvZzNFMS1xYXhsNzNNd1QxRk5ybjRGVUloVVhGV1RsUUlBUEJyQQ?oc=5\" target=\"_blank\">乐享以太大模型，让中国具身智能坐上定义席</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">leiphone.com</font>","full_text":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","excerpt":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 9150 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","summary":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","source":"leiphone.com","date":"2026-09-23T01:46:00+00:00","content":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 9150 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/88881","export_markdown":"/api/items/88881/export?format=markdown","export_json":"/api/items/88881/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html"},"formats":{"full":{"id":88881,"title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","source":"leiphone.com","author":null,"published_at":"2026-09-23T01:46:00+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","full_text":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 9150 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}},"actions":{"read":"/item/88881","export_markdown":"/api/items/88881/export?format=markdown","export_json":"/api/items/88881/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html"}},"digest":{"id":88881,"title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","source":"leiphone.com","topic":"ai","published_at":"2026-09-23T01:46:00+00:00","excerpt":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。 作者丨幸丽娟 编辑丨董子博 具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 9150 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","subtitle":"leiphone.com · 2026-09-23","summary":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。 作者丨幸丽娟 编辑丨董子博 具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像…","badges":["quality:high"],"links":{"read":"/item/88881","original":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","diagnose":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html"},"quality_warning":null},"export":{"title":"乐享以太大模型，让中国具身智能坐上定义席 - leiphone.com","url":"https://www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","summary":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","source":"leiphone.com","date":"2026-09-23T01:46:00+00:00","content":"从“预测”到“求解”：乐享以太大模型重塑 Physical AI 解题范式。    作者丨幸丽娟\n    编辑丨董子博\n                                                                                                       \n具身智能行业一直在等一个 ChatGPT 时刻。但这个时刻，未必长得像 ChatGPT。决定这个时刻的，不是机器人会聊天，也不是机器人学会了几个动作，而是在不确定环境里，机器人能不能自主思考、判断和执行，在无序的事件中，持续完成任务。过去两年，行业积累的几乎全是“能力上限”的展示：选好场景、选好时机、反复调试，再拍出一条完美的Demo。上限可以“被编辑”出来展示。真实效果如何，却少有人敢公开测。但机器人真正进入现实世界，考验的不只是最好时能做到什么，更是环境不断变化时，它还能不能把事情做下去。9 月 16 日傍晚。上海闵行一家烧烤店门口，乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时，它们要接单、烤串、上菜。这场直播的规则，测的正是机器人在这种真实环境里的应变能力。更绝的是，观众可以实时干预：随机出题，自由改造场地布局，随手改道具摆放位置，临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务，就是“干扰”，看机器人能不能像人一样自己“圆场子”。而就在不久前，这家公司刚刚站在了一场舆论风暴的中心。7 月，乐享上线以太大模型官网并公开完整技术路线；8月26日，一段机器人协作收拾房间的10分钟一镜到底 Demo，在具身圈传开。\n9 月 3 日，OpenAI 上线 GPT-6 Astra 官网；三天后，首席科学家 Jakub Pachocki 发表万字长文《异星心智》。9 月 10 日，乐享创始人郭人杰发文，三问 OpenAI：技术理念为何高度重合？概念表述为何如出一辙？官网设计为何似曾相识？他称对方“像素级搬运”“直接蒸馏”，并称法律团队已启动程序。舆论随之分成两派。一派说这是硬实力，另一派说这是“蹭热度”、“demo造假”。面对这些质疑声，乐享决定让搭载以太大模型的机器人自己上场回应。于是，这场户外烧烤直播来了。被推到台前的，还有一组更根本的追问：当计划被打破、条件被临时改写、任务被中途打断，机器人还能不能重新收敛到目标？如果能，又凭什么能？乐享敢把场子开放出来，就是因为以太大模型的架构从一开始就不是为“把预设流程跑完”设计的。这一点，在近一个小时的直播里看得最清楚。炉子支起来，名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐，一台负责守炉。整条任务链是：接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。为了证明现场没有遥操，创始人郭人杰把摄像机带进后厨，翻转镜头拍现场人员，又掀开背景幕布，展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是，完全没有人遥操的空间。他在开场直言直播的仓促：“我们周日才跟烧烤店老板聊好，花几万块钱租下这块场地。”然后，机器人的五项核心能力在这场直播中，被反复测试：主动感知。服务机器人在完成点单、将需求传递给烧烤机器人后，会注意顾客的等餐时间，当感知到顾客等候较久，会主动上前询问出餐进度。更细致的一个瞬间是：在没有人开口要求的情况下，它想到吃烧烤的顾客会需要纸巾，主动把纸巾送了过去。多模态理解。有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人，它需要理解这句话的语义，同时结合视觉信息确认顾客指的是哪一份订单，然后将新要求转身传递给负责烧烤的同伴。烧烤机器人收到调味指令后，精准识别食物位置，均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。流式记忆。一个小时的直播被打散来做：3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链，能把进度推进到收尾。更直观的一幕是：服务机器人正在给顾客点单，突然被要求“拿瓶水”。它停下点单，先去递水，再接着把单点完。整个过程没有犹豫，也没有等下一条指令。这件事看起来简单，但对机器人来说不是。打断一次，上下文就可能被覆盖，任务状态归零，它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言，这几乎是不可能完成的任务。动力学建模。烧烤机器人自主为食材刷涂酱汁，这个过程非常考验空间感知和力度控制，因为模型需要理解物体的物理属性，结合动力学模型输出符合物理规律的动作。另一个更能说明问题的瞬间是翻面：机器人第一次给食材翻面时没有翻好，食材掉落炉架。第二次调整了抓取和翻转姿势，成功了。这背后，是动力学建模在实时求解：系统不是从记忆里检索一个“标准翻面动作”，而是在当前的重心偏移、摩擦系数和夹持条件下，重新解出了一组能让动作成立的力矩参数。持续自进化。烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间，同样是模型持续自我迭代能力的直接写照。这种并不完美的过程，恰恰能让人直观地看到模型是如何通过失败反馈，自主进化，最终顺利完成任务。这五项能力，看似在测五个不同的维度，实际上指向模型从数字世界走向物理世界的真正门槛：机器人能不能在约束不断变化的情况下，依旧能把事情做对。过去，这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了，模型在不同的约束条件下，靠自主智能就可以把“对的动作”解出来。这两台机器人默契完成协作任务的画面，很容易让人想到八月底那段在具身圈刷屏的视频。10分钟，一镜到底。狭小的空间里，两台不同品牌和型号的机器人，全程自主协作收拾房间。一台机器人用刮水器擦玻璃，有一处怎么都擦不干净。它重复几次后停下来，判断脏东西可能在玻璃外面，于是把刮水器伸出窗外；接着，它收拾桌面，双手被占满时，另一台主动拿起桌上的围巾挂到它脖子上，发现围巾太长，还用双手把围巾捧起来，被帮助的机器人看懂了，弯下了腰......双方通过自主协同，完成了这次物品“迁徙”；随后，较矮的机器人要把围巾放进柜子上方隔层，可它只有 1.3 米，够不到。它找到旁边的箱子推到地上，想弯腰搬起来垫脚，却发现自己弯不下腰，于是它选择用脚踢过去；箱子踢歪了，机器人又开始琢磨怎么把箱子回正，这时候，身高 1.7 米的另一台机器人走了过来：它似乎看出了同伴的困境，放下了手上的活，主动帮忙把围巾放到目标位置。中途闹钟响了，两台机器人转去处理桌面和冰箱收纳任务，做完再回来接着做没做完的事，进度没被清零。一个在室内，一个在户外；一个做家务，一个要烤串上菜。展示的却是同一件事：以太大模型可以让机器人自主思考，自主决策，并在试错中完成自我进化，以及实现跨本体协作。要回答这一点，得先看市面上现有的具身智能主流方案为什么做不到。2026年4月，英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告：VLA 已死，WAM 当立。这番论断将两条路线的争论推到了台前。但无论是哪条路线，两者的底层逻辑却是同一件事：预测。从 RT-1、RT-2 到 OpenVLA，再到 Π0 系列，VLA 的思路是：把图像和语言指令编码进一个多模态主干，直接解码出动作序列。数学上，它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l，输出动作 a。这条路的好处很直接：快。链路短，延迟低，能接高频控制；语言模型的语义能力可以直接复用，机器人“听得懂”开放词汇的指令。但随着模型走向更加开放的真实环境，一些结构性缺陷也开始暴露。第一个缺陷，是语言被架空。ICML 2026上的一篇论文（LangForce）给这个缺陷起了一个学术名字：信息坍缩。在目标驱动的数据采集范式下，语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”，看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零，模型实际上忽略了语言，退化成了一个纯粹的视觉策略。在 RoboCasa 基准上，一个完全忽略语言指令的纯视觉模型，成功率与接收完整语言指令的模型几乎相同。这意味着，VLA 学到的不是“理解指令然后行动”，而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是：分布外的新场景、新任务，泛化会显著下滑。第二个缺陷，是它跳过了对环境的动力学建模。它不预测动作执行后世界会怎么变，只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题，因为它压根没在算这件事。WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构：先预测动作执行后世界状态会如何变化，再反推最优控制指令。数学上，它学的是一个未来状态与动作的联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l，同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”，这种物理知识比语义知识更通用。但它依旧没有解决信息坍缩问题。WAM 的视频预测同样绑在具体本体的相机视角上，语言指令在其中的权重依然很低。它补了物理，没补语义。而且代价很大。基于视频扩散 Transformer 的 WAM，推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积，最终误导决策。VLA 快，但语言被架空、不做动力学；WAM 补了物理，但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作，一个预测世界状态。而真实世界的变体是无穷的。光照角度、物体摆放、地面摩擦、人的随机干预，这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里：分布外，没有高概率样本可取。也就是说，预测范式依赖的是训练数据里见过的情形。分布外没有数据，模型就没有可参照的概率分布，决策也就失去了依据，预测出“下一个对的动作”更是无从谈起。乐享没有执着于在“预测”这道题上找最佳答案，而是直接换一个题：不预测“下一个最可能的动作”，求解的是“约束条件下，什么状态会更接近目标”。作为机器人的大脑，以太大模型的核心机制是 Energy-Driven（能量驱动），底层由神经元分配来支撑。两者各回答一个问题：用什么来判断一个状态是不是“对的状态”，以及这个判断在哪里被计算出来。“能量”这个词容易让人联想到物理能量，但它在以太大模型里是一个数学对象：任务完成度、物理约束、记忆状态和动作可行性，被整合进一个统一的能量函数。每个项都是一个数字，描述当前状态在某个维度上“有多好”或“有多差”。加起来，得到一个总分。总分越低，状态越好。机器人的决策过程，就是在这个能量地形上找低点。哪个行动能让总分降得更多，就执行哪个。对比来看，VLA 和 WAM 的底层都是概率对象，都受同一个数学性质的约束：分布是归一化的，所有可能结果的概率加起来必须等于 1。这就带来一个限制：两个分布无法直接加在一起，得到一个新的合法分布。“把杯子拿起来”是一个分布，“不要碰到旁边的碗”是另一个分布。把这两个分布相加，在数学上无法构成一个新的合法分布，更不可能自动获得“拿起杯子同时不碰碗”的语义。从机制上看，这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束，要么往训练集里加数据，要么加一个适配模块。约束进的是训练集，不是目标函数。而能量是标量，标量天然支持复合：任务目标是一个能量项，物理约束是另一个能量项。加起来，就得到一个新的目标函数。不需要重新训练，不需要为每个任务单独微调。这是能量驱动和预测范式最根本的分野：预测范式把约束塞进数据，能量范式把约束写进目标。决策方式也跟着变了。拟合分布的模型本质上在做条件检索：给定当前观测，从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因，分布外没有高概率样本可取。而能量最小化是一个优化过程：它在当下的具体环境里当场找一个低能量解，而且求解自带剪枝，能量高的候选会被迅速淘汰，不必把成千上万条路径都推演完。回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”，不会主动把手伸出窗外，因为“伸出窗外”从未与“擦玻璃”配对过。但在能量框架下，“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”，物理约束包括“污渍可能在任一侧”，内侧达不到目标，系统自然搜索到外侧。搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子，够不到，它就找到箱子，想搬起来垫脚，但发现自己弯不下腰。试了几次之后，它一脚把箱子踢到了柜子边。这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作，VLA 和 WAM 都不会主动做这件事。但在能量框架下，“目标物不可达”是一个能量项，“箱子可以承重”是一个物理约束，“弯不下腰”是一个本体约束，“脚可以推动箱子”是另一个物理约束。系统在当下环境里，用这些约束解出了一条可行路径。它判断下一步行动的方式，不是从记忆里翻答案，是当场“解题”：在约束不断变化的当下，重新解出什么才是对的状态。能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”，但还有一个工程问题没解决：这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型，算力根本撑不住实时闭环。以太大模型的解法是神经元分配。它按需调度计算资源，不让整个模型始终处于活跃状态。架构上，它搭了一条仿生神经通路：前额叶皮层负责意图解析和长时序规划，角回与内嗅皮层负责流式长时记忆，顶上小叶与上丘负责主动感知，运动皮层与小脑负责运动规划与动态补偿，脊髓层负责力位控制与本能反射。这套架构真正的关键，不在分层本身，而在分层之间的运行方式：- 信息是双向的。 它不是“感知层→理解层→决策层→控制层”的单向管道。思考的结果流向躯体，躯体的传感器反馈回传上层认知。脑子在想的时候，身体已经在响应；身体遇到突发扰动的时候，认知也在同步更新。\n- 时间尺度被解耦了。 高层推理是慢的，它处理的是“擦不干净要不要换一面”这类需要认知参与的问题。而碰到外力、抓取打滑、姿态失衡这类响应，下沉到脊髓层，不走完整的高层推理。\n- 主动感知是“能量项”，不是“功能模块”。 传统机器人是“拿到什么图像就处理什么”。而以太大模型会自己转视角、移动机身、换观测姿态去补盲区。这件事在能量框架里的逻辑很清晰：信息不足意味着不确定性高，而不确定性本身就是一项能量，所以“去看一眼”是降低能量的自然解，不需要额外写一条“探索策略”。\n直播里，机器人面对陌生调料瓶花了几次尝试才摸到合适抓法，翻面在失败一次后重新调整姿势后成功。这些瞬间背后都是同一个机制：不是每个决策都走完整推理，抓取打滑下沉到脊髓层快速响应，高层认知同时判断要不要换一种抓法。机器人尝试失败后，通过实时调整策略取得成功，这个过程里，模型参数没有变，变的是它在当下重新解出来的动作。它不需要等下一次训练才能变好，在干活的过程中就能持续修正自己。这也许才是“自进化”在工程层面的真实含义：不是预先训练出来的，而是运行中当场“解”出来的。Yann LeCun 近期在 ECCV 2026 主旨演讲中说过一句话，恰好点到了同一件事：如果机器人经过预先训练才完成任务，那只是在套用“配方”。这不是智能，只是陈述性知识和技能的堆积。因此，真正的智能，不是在见过的情形里做对，而是在没见过的时候，依然有办法。这套机制里还有一个很少被展开、但很关键的差异：监督信号的来源变了。它是理解 200/0/4 这三个数字的钥匙。VLA 想进化，需要动作标签。而动作标签的高质量来源，目前仍然主要依赖真机轨迹——每条轨迹背后都是遥操作、人力、设备成本。这是当前 VLA 训练链条中成本最高、也最难规模化的一环。WAM 想变强，需要未来画面。人类视频可以用，但视频里没有动作标签，所以它只能学“世界怎么变”，再反推该做什么。执行结果和预期不符、物理约束被违反、任务完成度没到，这些在能量面上直接体现为“能量没降下去”。不需要有人告诉它“这次做错了”，环境本身给出了反馈。这就是 Evolution Manager 能成立的底层逻辑。2023年，Google DeepMind 发表了一项关于能量模型作为机器人策略的论文，证伪了“高维连续空间中的能量模型不可训练”的长期说法，并给出了可用的训练目标。EBT-Policy 则进一步验证：用标量能量做机器人策略，部分任务上两步推理就收敛，相比扩散策略常见的 100 步减少了 50 倍。并且在没有任何专门训练的情况下，能从失败动作序列中零样本恢复。200 小时人类视频，一个人要连续 8 天才能看完；0 小时真机数据，意味着没有一条遥操作轨迹；4B 参数，是当前通用 VLA 和 WAM 的十分之一到几十分之一量级。行业对 Scaling 的默认假设是能力来自数据和参数的堆叠，所以这组数字容易被读成“乐享在挑战 Scaling Law”。这个说法带偏了重点。过去，机器人要学会一个动作，需要有人告诉它“看到这个场景，手脚应该怎么动”。这个“告诉”的过程，就是标注。标注越细，成本越高。Aether 换了一种学法：它不看人怎么动，看结果对不对。东西有没有烤好、盘子有没有端稳、调料有没有撒上——这些事情的成败，结果本身就说明了一切。不需要有人额外标注“这一下对了”或“这一下错了”。人类视频里确实没有动作标签，但充满了结果：重力让东西下落，接触让物体移动，工具被使用后会留下痕迹，污渍被擦掉后表面会变干净。这些都是物理后果。任务有没有完成、动作有没有违反物理规律，可以从结果里反推出来。所以数据需求下降，是换了一种学法之后自然发生的事。VLA 学的是动作空间，而动作空间是本体相关的——双臂、灵巧手、轮式底盘、人形，关节维度和构型都不一样，所以跨本体通常需要额外编码本体信息。WAM 的视频预测同样绑在具体本体的相机视角上。但能量函数定义在任务状态和物理约束这一层，是本体无关的。换一台机器人，不变的是目标项和物理项，变的只是“这台身体的力矩上限、可达空间、重心稳定性”这几个约束项。这也解释了以太的 Self Model（自我模型）为什么要显式表征“本体能力边界”：它不是要表示自己是什么形状，而是要表示“哪些动作在我这个身体上不可行”。正是有了这个自我模型，同一个“大脑”进入不同的身体，只需要重新求解一次能量最小化。户外烧烤直播里，烤串和上菜由两台不同的机器人完成，烤到什么程度该出餐、顾客改了口味该怎么同步，没有一步是提前设定的，是两台机器人在现场根据彼此的任务状态实时协调出来的。来自两家互为竞品厂商的机器人，身高不同，构型不同，共用一套模型，自主分工。机器人拎拖鞋拎的是挂绳、把毛巾试三次挂上自己肩头，这些细节反过来也是它“了解自己身体”的证据。回过头来看户外烧烤直播测试和10分钟一镜到底Demo 展示的五项能力，都并非从数据集中训练而来，是这四个底层机制里涌现出来的。跨本体不是一个需要额外攻克的工程模块，它是能量函数定义在本体之上的一个水到渠成的结果。一个烧烤摊，比任何一间实验室都难。风一吹，炭火忽大忽小；烤串在炉子不同位置，火力不一样，得挪来挪去；地面不平，端着盘子走的时候会晃；顾客站在旁边，随时改主意。如果这些它都能应付，那“Physical AI 的第三条路”就不再只是一个完美预设的 Demo，而是一台真真切切在户外干起了活的机器人。200 小时人类视频、0 小时真机数据、4B 参数，在户外开放环境里跑通了长时序任务和跨本体协作。以太这个模型的出现，在具身圈是地震式的。它的意义不仅仅是，在 VLA、WAM 之外，开辟了Physical AI的第三条路，更在于它重新定义了具身智能的整套“解题范式”。具身模型过去的问题是：机器人下一步该做什么？模型学的是一套从观测到动作的映射，遇到没见过的场景，就只能靠检索、靠猜。以太大模型直接换了一个问题：当前状态下，机器人做什么才是对的？问题一换，跨本体、长时序、自进化这些原本各自为战的能力，就变成了同一个机制在不同约束下的表现。它是一个更强的机器人模型，更是一条截然不同的解题思路。这套“解题范式”对于整个具身行业的意义，具体体现在三个方面。过去两年具身智能的默认假设是：先有一个聪明的通用模型，再想办法适配到机器人上。这个路径下，“跨本体”永远是一个后置的工程问题：不同身体构型不同、动作空间不同，模型要重新适配，成本永远降不下来。而能量驱动的做法把目标定义在本体之上：同一个“大脑”可以进入不同的身体，跨本体从“要攻克的技术难题”变成了“架构设计下自然发生的事”。这件事如果成立，行业的价值链会重新排布：大脑和本体解耦之后，“谁的模型能上更多的身体”，会比“谁的身体更灵巧”更关键。如果核心竞争力是“动作库有多大”，那比的是数据和算力。谁的数据多、算力大，谁就领先。这是资源竞赛，大玩家有天然优势。如果核心竞争力是“计划被打乱之后能不能自己找回来”，那比的是架构。架构对了，小团队也能做出大玩家做不到的事。这也是乐享一个二十人的团队，能在现在这个时间点，做出以太大模型这样硬核的具身大模型的原因。从 Transformer 到大模型时代，主流叙事一直是从视觉或语言出发。“以太”这个名字本身就是一种表态：乐享认为能量比语言更本质。在单细胞生物阶段，没有视觉、没有语言，能量就已经在引导动作和交互。虽然这条路线还在早期，但方向已经清晰。能量函数怎么设计、跨本体约束怎么协同、自进化怎么在部署中保持稳定——这些问题的答案，会在更多真实场景的迭代中被解开。而这场直播已经证明了一件事：当环境不再可控、计划不断被打断，一台机器人可以不等指令、不靠检索，靠自己在现场解出“下一步怎么做才是对的”。雷峰网雷峰网雷峰网(公众号：雷峰网)从公开质疑OpenAI“像素级搬运”，到把机器人推到上海闵行烧烤店门口直播，背后是乐享对自身技术路线的笃定，也是中国具身智能从“追随”走向“定义”的一次突围。雷峰网原创文章，未经授权禁止转载。详情见转载须知。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.leiphone.com/category/academic/Ti3obLMNSuHn5OpR.html","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 9150 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 9150 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":9150,"summary_length":9150,"usable_text_length":9150,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":9150,"summary_length":9150}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}