# 比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA|VLA|自动驾驶|供应链|AI文本生成|论文_手机新浪网 - finance.sina.com.cn

*Источник: finance.sina.com.cn*
*Дата: 2026-07-29*
*Язык: zh*

**Кратко:** 比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA
贾浩楠 发自 副驾寺
智能车参考 | 公众号 AI4Auto
连比亚迪都开始发AI论文了！
而且不是成果平平的灌水文章。
最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。
HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。
太反差了！
过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。
但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。
甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。
但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：
不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。
HyWorldVLA想解决什么？
先说这篇论文到底在研究什么。
HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：
让AI从“识别道路”走向“理解世界”。
因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。
简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？
这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。
但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：
既想让模型理解真实世界的细节，又希望模型能够高效推理。
一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。
另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。
HyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。
在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。
把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。
效果如何？
HyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。
和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。
因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。
也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。
HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。
这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。
但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。
所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：
比亚迪证明了自己具备多模态、物理AI基础模型研究能力。
怎么做到的？
HyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。
第一步：训练一个视频压缩器。
先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。
第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。
这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。
第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。
论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。
那SOTA到底靠什么赢的？消融实验给出了答案。
最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。
隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。
噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。
一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。
两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。
HyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。
但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。
重新认识比亚迪AI：论文背后是一支什么样的团队？
HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。
顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。
HyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。
至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。
其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。
但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。
而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。
这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。
几个高频出现的名字，也印证了这种判断。
Liulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。
第一次出现的时间点，是2025年。
再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——
他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。
从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。
再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。
Hongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。
说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。
最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。
第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。
这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。
第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。
第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。
据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。
比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。
这是物理AI从技术出发的第一性原理，在组织架构上的反应。
所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。
它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。
自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。
但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。

比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA
贾浩楠 发自 副驾寺
智能车参考 | 公众号 AI4Auto
连比亚迪都开始发AI论文了！
而且不是成果平平的灌水文章。
最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。
HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。
太反差了！
过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。
但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。
甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。
但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：
不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。
HyWorldVLA想解决什么？
先说这篇论文到底在研究什么。
HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：
让AI从“识别道路”走向“理解世界”。
因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。
简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？
这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。
但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：
既想让模型理解真实世界的细节，又希望模型能够高效推理。
一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。
另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。
HyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。
在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。
把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。
效果如何？
HyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。
和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。
因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。
也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。
HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。
这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。
但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。
所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：
比亚迪证明了自己具备多模态、物理AI基础模型研究能力。
怎么做到的？
HyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。
第一步：训练一个视频压缩器。
先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。
第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。
这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。
第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。
论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。
那SOTA到底靠什么赢的？消融实验给出了答案。
最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。
隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。
噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。
一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。
两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。
HyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。
但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。
重新认识比亚迪AI：论文背后是一支什么样的团队？
HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。
顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。
HyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。
至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。
其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。
但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。
而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。
这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。
几个高频出现的名字，也印证了这种判断。
Liulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。
第一次出现的时间点，是2025年。
再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——
他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。
从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。
再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。
Hongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。
说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。
最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。
第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。
这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。
第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。
第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。
据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。
比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。
这是物理AI从技术出发的第一性原理，在组织架构上的反应。
所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。
它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。
自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。
但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。

[Оригинал](https://finance.sina.cn/tech/csj/2026-07-29/detail-inikmytp5859371.d.html?oid=WA%200821%207001%200763%20(FORTRESS)%20Kusen%20Pintu%20Baja%20Fortress%20Pilangkenceng%20Madiun&vt=4)