# 从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN

*Источник: InfoQ-CN*
*Дата: 2026-09-22*
*Язык: zh*

**Кратко:** “AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。
今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。
支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。
首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。
其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。
这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。
技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。
承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。
此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。
与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。
阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。
图片，从“生成图片”走向视觉生产
过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。
这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。
今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。
科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。
因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。
营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。
影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。
而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。
同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。
Qwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。
从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。
当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。
真正理解“审美”的音乐生成模型
AI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。
音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。
今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。
在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。
不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。
如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？
Happy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。
这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。
在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。
但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。
比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。
Happy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。
除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。
对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。
专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。
Happy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。
这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。
视频，从生成能力走向创作智能
这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。
视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。
最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。
而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。
模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。
沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。
“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。
要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。
一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。
阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。
Agentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。
多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。
对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。
Agentic PE 辅助生产也未必是最终的架构形态。
阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。
过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。
图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。
更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。

“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。
今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。
支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。
首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。
其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。
这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。
技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。
承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。
此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。
与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。
阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。
图片，从“生成图片”走向视觉生产
过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。
这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。
今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。
科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。
因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。
营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。
影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。
而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。
同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。
Qwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。
从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。
当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。
真正理解“审美”的音乐生成模型
AI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。
音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。
今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。
在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。
不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。
如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？
Happy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。
这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。
在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。
但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。
比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。
Happy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。
除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。
对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。
专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。
Happy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。
这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。
视频，从生成能力走向创作智能
这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。
视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。
最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。
而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。
模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。
沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。
“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。
要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。
一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。
阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。
Agentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。
多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。
对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。
Agentic PE 辅助生产也未必是最终的架构形态。
阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。
过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。
图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。
更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。

[Оригинал](https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq)