{"id":48936,"topic":"ai","source":"Sohu","title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","url_hash":"1daf07a7065e44f8cb87f7845f36d153e8397565","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxPb1JtRlMzZmFzckZva2FYSEhlUTVuX1lBNEI2ZjEtM2YwQTEydklYUXdCM3dSVkdxejJJZG04aXhzaFEwdnBCQUduSUdfXzJNblN5UkliQ3o1Sk1MdEVzVlZwNzFTd1JpVDA1dWdUcWk4dXdVaHVUT3gtNUM3LWJYZmNadFdqRmdidGdQQg?oc=5\" target=\"_blank\">比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","content":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","image_url":"//q3.itc.cn/q_70/images03/20260729/cba026012ed9443886b2d45e5623056f.png","lang":"zh","published_at":"2026-07-29T08:38:04+00:00","fetched_at":"2026-07-29T13:15:07+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}},"news_item":{"id":48936,"canonical_url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source_url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","source_name":"Sohu","author":null,"published_at":"2026-07-29T08:38:04+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxPb1JtRlMzZmFzckZva2FYSEhlUTVuX1lBNEI2ZjEtM2YwQTEydklYUXdCM3dSVkdxejJJZG04aXhzaFEwdnBCQUduSUdfXzJNblN5UkliQ3o1Sk1MdEVzVlZwNzFTd1JpVDA1dWdUcWk4dXdVaHVUT3gtNUM3LWJYZmNadFdqRmdidGdQQg?oc=5\" target=\"_blank\">比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">Sohu</font>","full_text":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","excerpt":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4566 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","source":"Sohu","date":"2026-07-29T08:38:04+00:00","content":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4566 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/48936","export_markdown":"/api/items/48936/export?format=markdown","export_json":"/api/items/48936/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"formats":{"full":{"id":48936,"title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","author":null,"published_at":"2026-07-29T08:38:04+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","full_text":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4566 characters.","diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}},"actions":{"read":"/item/48936","export_markdown":"/api/items/48936/export?format=markdown","export_json":"/api/items/48936/export?format=json","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"}},"digest":{"id":48936,"title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","source":"Sohu","topic":"ai","published_at":"2026-07-29T08:38:04+00:00","excerpt":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA 来源：智能车参考 贾浩楠 发自 副驾寺 智能车参考 | 公众号 AI4Auto 连比亚迪都开始发AI论文了！ 而且不是成果平平的灌水文章。 最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。 HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。 太反差了！…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 4566 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","subtitle":"Sohu · 2026-07-29","summary":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA 来源：智能车参考 贾浩楠 发自 副驾寺 智能车参考 | 公众号 AI4Auto 连比亚迪都开始发AI论文了！ 而且不是成果平平的灌水文章。 最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。…","badges":["quality:high"],"links":{"read":"/item/48936","original":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","diagnose":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334"},"quality_warning":null},"export":{"title":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA - Sohu","url":"https://m.sohu.com/a/1056265091_122014422?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334","summary":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","source":"Sohu","date":"2026-07-29T08:38:04+00:00","content":"比亚迪AI团队首次曝光！哈工大机器人基因亮眼，大模型首发即SOTA\n来源：智能车参考\n贾浩楠 发自 副驾寺\n智能车参考 | 公众号 AI4Auto\n连比亚迪都开始发AI论文了！\n而且不是成果平平的灌水文章。\n最新公开的一篇HyWorldVLA，来自比亚迪汽车新技术研究院，瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action（VLA）+ World Model（世界模型）。\nHyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩，PDMS达到 90.59。\n太反差了！\n过去几年，外界提到比亚迪智能化，更多想到的是“天神之眼”、供应链整合、规模化落地，当然还有今年的“兜底”。\n但要让你具体callback一下，迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。\n甚至有传言比亚迪智能发布会的PPT，都是供应商帮忙做的。\n但这篇论文一出，让所有人看到一个基因都完全不一样的比亚迪：\n不但有自动驾驶成果，还有一支长期投入物理AI基础模型的研发团队。\nHyWorldVLA想解决什么？\n先说这篇论文到底在研究什么。\nHyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线：\n让AI从“识别道路”走向“理解世界”。\n因此，近几年行业开始探索端到端自动驾驶模型，模型直接从传感器输入，输出车辆控制或轨迹，而进一步的发展，就是加入世界模型（World Model）。\n简单理解，世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么，还能预测未来：几秒后道路会如何变化？其他交通参与者可能如何行动？车辆应该采取什么策略？\n这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。\n但问题是，目前的自动驾驶世界模型仍然面临一个核心矛盾：\n既想让模型理解真实世界的细节，又希望模型能够高效推理。\n一种方式是Pixel-level World Model，也就是直接预测未来视频画面。优势是直观，模型可以生成未来道路、车辆、环境变化。但缺点也明显：计算成本高，而且容易受到视觉噪声影响。\n另一种方式是Latent World Model，也就是在压缩后的隐藏空间中预测未来。这种方法效率更高，更适合大规模模型训练。但问题是：模型可能理解了抽象关系，却丢失了真实世界细节。\nHyWorldVLA提出的，就是一种混合世界模型（Hybrid World Modeling），留视觉世界模型对于环境细节的理解能力，又利用隐空间模型提升推理效率。\n在此基础上，论文进一步引入Vision-Language-Action（VLA）模型，让系统不仅能够理解视觉环境，还能够结合语义信息生成驾驶动作。\n把两条路的好处都拿到，同时把各自的短板规避掉，最终形成：看见环境、理解环境、预测未来、采取行动的端到端流程。\n效果如何？\nHyWorldVLA选择的测试平台，是当前自动驾驶研究领域较受关注的公开基准：NAVSIM v1。\n和传统视觉任务测试并不一样，它更关注：如果车辆真的按照AI规划路线行驶，会不会安全、高效完成驾驶任务。\n因此，它采用了更接近实际驾驶质量的综合指标PDMS（Predictive Driver Model Score）。其中包括是否发生责任碰撞；是否保持在可行驶区域；是否保持合理安全距离；是否完成驾驶目标；车辆运动是否平顺舒适。\n也就是说，一个模型不能靠“慢慢开”获得高分，也不能只追求速度而忽略安全，需要同时做到：安全、效率、舒适。\nHyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩，达到公开结果中的领先水平。\n这说明：至少在公开数据集和仿真驾驶环境中，比亚迪这套基础模型具备当前自动驾驶研究前沿能力。\n但需要客观看待：benchmark领先，不等于已经完成量产自动驾驶。\n所以，比亚迪自动驾驶大模型SOTA，更准确的意义是：\n比亚迪证明了自己具备多模态、物理AI基础模型研究能力。\n怎么做到的？\nHyWorldVLA的混合不是简单地把两条路线拼接在一起，而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。\n第一步：训练一个视频压缩器。\n先用视频VAE把连续的视频帧压缩成紧凑的隐特征，后续模型在这个压缩空间里做预测，而不是在原始像素空间里硬扛噪声。为了提升压缩质量，编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节，显著改善了重构画面的清晰度。\n第二步：预训练。 把图像、动作、语言和隐特征全部转成统一的离散token，拼成一个长序列，用自回归的方式让模型学会预测下一个token是什么。\n这个阶段的关键设计是“两条腿走路”——模型同时做两件事：预测未来画面的token，以及预测未来隐特征。画面token预测相当于一个“监工”，逼迫隐空间必须保留足够的信息才能还原出清晰的画面，防止表征在学习过程中变得空洞无用。\n第三步：联合微调。 到了这一步，模型不再预测画面，只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。\n论文验证了两种动作模块——一种是从候选轨迹里打分选最优，一种是用生成模型直接输出连续轨迹——两者都有提升，说明这套方法的增益不依赖特定的动作设计。\n那SOTA到底靠什么赢的？消融实验给出了答案。\n最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间，PDMS从90.59掉到87.50——这是所有消融里跌幅最大的，说明像素级的精细监督对整体表现至关重要。反过来，去掉隐空间、只保留像素级模型，PDMS也掉到89.91。两条路线谁都不能少，单靠一条都到不了90.59。\n隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征（λ₃=0），PDMS只有90.17；给一个适中的权重（λ₃=0.1），达到最优90.59；权重继续加大反而掉到89.75。这说明：适度约束能防止预训练学到的语义在微调中被冲掉，但约束太强又会束缚模型自己去发现对开车最有用的表征。\n噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65，DriveVLA-W0也只有61.18；HyWorldVLA达到86.87。这个差距说明：在恶劣天气下，在压缩空间里做推理远比在像素空间里死磕要可靠得多。\n一句话总结：这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”，让它保留足够的环境信息；微调时切换到纯隐空间推理，自动获得了对雨雾光照的免疫力。\n两个阶段分工明确，互不干扰，而不是让一个模型同时扛两项任务。\nHyWorldVLA代表的是自动驾驶基础模型探索方向，与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势，但选择了VLA与混合世界模型结合的具体技术路径，有自己的差异化侧重。\n但距离真正大规模量产部署，仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。\n重新认识比亚迪AI：论文背后是一支什么样的团队？\nHyWorldVLA这篇论文完全由比亚迪汽车新技术研究院（也就是原来的规划院，杨东生领导）独立完成，没有外部高校或研究机构合作署名，这在车企AI论文中不算常见。\n顺着“新技术研究院”这条线，再把范围扩大到整个比亚迪关联去扩大检索，可以发现一些更完整的信息。\nHyWorldVLA是比亚迪第一篇多模态基础模型论文，但不是第一篇AI论文。\n至少还有一篇EMoE-Planner（基于混合专家的自动驾驶规划模型），发表于2025年。\n其他的论文还包括赛车轨迹优化（Global minimum time trajectory planning considering curvature and distance for track racing）、胎噪判断地形（Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle）。\n但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。\n而再往前，公开渠道几乎查阅不到比亚迪的AI学术论文。\n这在一定程度上证明，比亚迪对于核心的AI基础模型研究，是近几年才开始做的。\n几个高频出现的名字，也印证了这种判断。\nLiulong Ma，资料不多，github上极其低调，也没有个人主页和Google学术主页，但比亚迪汽车新技术研究院几篇公开AI论文中都有署名，而且是通讯作者。\n第一次出现的时间点，是2025年。\n再往前，Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向，与当前Physical AI技术趋势高度重合——\n他出身哈工大，而且是著名的哈工大机器人技术与系统国家重点实验室，以及哈工大机电系。\n从他的研究方向上推断，指导老师有可能是哈工大的赵杰教授，哈工大机器人研究所所长。\n再从哈工大这条线索入手，还能够发现比亚迪AI团队更鲜明的哈工大基因。\nHongbiao Zhu，前面提到的EMoE-Planner第一作者，2025年论文发表时，也隶属比亚迪汽车新技术研究院，但是他的过往履历，同样紧密关联哈工大，以及CMU。\n说明BYD新技术研究院的AI团队，不是单纯招聘汽车算法工程师，而是在吸收顶尖名校的计算机、机器人人才，包括哈工大、CMU，形成一个“机器人AI派”的团队。\n最后，总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。\n第一，时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner，2026年有HyWorldVLA，中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。\n这表明比亚迪内部有一个稳定运转的基础AI研究小组，而非项目制的阶段性投入。\n第二，学术圈露出的团队成员背景高度集中，鲜明的哈工大和CMU背景。\n第三，这与比亚迪同时在推进的自研机器人项目形成了呼应。\n据公开信息，比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线，本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。\n比亚迪这个AI团队，和其他车企最大的不同在于，不是从汽车电子或ADAS工程延伸过来的研发路线，某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。\n这是物理AI从技术出发的第一性原理，在组织架构上的反应。\n所以，比亚迪发布HyWorldVLA的意义，不只是多了一篇论文。\n它让外界第一次看到：这家年销量全球领先的新能源车企，正在展示过去并不显性的能力——物理AI的基础模型研发。\n自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”，比亚迪显然已经认识到这一点，不过HyWorldVLA是否代表比亚迪已经进入第一梯队，还有待验证。\n但至少，比亚迪是所有老牌车企中，率先摆脱“就事论事”搞智能辅助驾驶，按照AI系统能力建设团队，把研究向机器人和基础大模型推近的玩家。\n— 联系作者 —","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//m.sohu.com/a/1056265091_122014422%3Fscm%3D10001.325_13-325_13.0.0-0-0-0-0.5_1334","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4566 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4566 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4566,"summary_length":4566,"usable_text_length":4566,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4566,"summary_length":4566}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}