{"id":88067,"topic":"ai","source":"InfoQ-CN","title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","url_hash":"7d698886eb8972fc527ec89891208a9aa71f4fdb","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE13TlJ6YXBwd29GTHJmZEstdjZFWE10RU5pbHRYZFFwTVlIQm5GQ1U1bFJRWFBIUnRUdl9HWTBoeW1KbE1fUkxfamhwcE9UZTVuSmZJUnZXMlVjbkN6dmc?oc=5\" target=\"_blank\">从生成内容到创造体验，多模态大模型如何改变内容生产？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","content":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","image_url":"https://static001.infoq.cn/resource/image/4d/12/4dc9940166c7e808557409667be84c12.png","lang":"zh","published_at":"2026-09-22T12:43:40+00:00","fetched_at":"2026-09-22T13:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}},"news_item":{"id":88067,"canonical_url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","source_url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","source_name":"InfoQ-CN","author":null,"published_at":"2026-09-22T12:43:40+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMiXkFVX3lxTE13TlJ6YXBwd29GTHJmZEstdjZFWE10RU5pbHRYZFFwTVlIQm5GQ1U1bFJRWFBIUnRUdl9HWTBoeW1KbE1fUkxfamhwcE9UZTVuSmZJUnZXMlVjbkN6dmc?oc=5\" target=\"_blank\">从生成内容到创造体验，多模态大模型如何改变内容生产？</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">InfoQ-CN</font>","full_text":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","excerpt":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5199 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","summary":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","source":"InfoQ-CN","date":"2026-09-22T12:43:40+00:00","content":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5199 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/88067","export_markdown":"/api/items/88067/export?format=markdown","export_json":"/api/items/88067/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq"},"formats":{"full":{"id":88067,"title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","source":"InfoQ-CN","author":null,"published_at":"2026-09-22T12:43:40+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","full_text":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 5199 characters.","diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}},"actions":{"read":"/item/88067","export_markdown":"/api/items/88067/export?format=markdown","export_json":"/api/items/88067/export?format=json","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq"}},"digest":{"id":88067,"title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","source":"InfoQ-CN","topic":"ai","published_at":"2026-09-22T12:43:40+00:00","excerpt":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。 今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。 支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 5199 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","subtitle":"InfoQ-CN · 2026-09-22","summary":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。 今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。…","badges":["quality:high"],"links":{"read":"/item/88067","original":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","diagnose":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq"},"quality_warning":null},"export":{"title":"从生成内容到创造体验，多模态大模型如何改变内容生产？ - InfoQ-CN","url":"https://www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","summary":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","source":"InfoQ-CN","date":"2026-09-22T12:43:40+00:00","content":"“AI 会深刻改变我们原有的工作流、认知和创作习惯。已经发生的事情，无法阻挡。”执导《可可西里》《南京！南京！》的导演陆川说。\n今年云栖大会，陆川使用阿里巴巴多模态模型，制作了短片《历史·现场》，复原 1626 年明代北京城的“王恭厂之变”。过去需要数月、千万级投入的制作，这次团队只用了 5 天。陆川甚至评价，模型对上下文的理解“已经达到‘博士后’的水平，超过 80% 以上的普通人”。\n支撑陆川这类专业创作实践的，是过去一年多模态生成能力的持续提升。 沿着技术演进继续往前看，两条路径尤其明显。\n首先，从单模态生成走向多模态融合生成。对于视频而言，模型不仅可以联合处理画面与声音，参考图、参考视频、音频、运镜轨迹、3D 白模等也可以成为生成条件。过去主要依靠文字描述的创作意图，开始通过更直接的多模态信息传递给模型，生成因此更加一致和可控。\n其次，从生成内容走向创造体验。随着生成时长增加、速度提升，视频正在从离线生成走向实时流式生成。模型可以在生成过程中持续接受输入，根据新的状态生成后续内容，由此进入游戏、互动内容和仿真等新的应用空间。\n这两条路径，也贯穿了阿里巴巴过去一年的多模态模型演进。2025 年底发布的 Wan 2.6，已经支持智能分镜调度、参考生视频、多角色一致性等能力，视频生成开始从文生视频、图生视频，走向由更多参考信息共同控制的创作。今年 4 月，Happy Horse 1.0 进一步采用单流 Transformer，原生联合生成音频和视频。整个第一梯队的视频模型，也在指令跟随、人物与场景一致性、复杂运动、物理合理性和多镜头生成等方面持续推进。\n技术能力的提升，也在改变内容生产本身。AI 已经开始进入越来越多专业工作流，成为内容生产的新基础设施。\n承接此前在多模态领域的积累，今年云栖大会，阿里巴巴进一步更新了多模态生成模型家族。\n此次发布包括图像生成模型 Qwen-Image-3.1、音乐生成模型 Happy Shrimp 1.1 以及面向长视频和复杂创作的 Agentic PE（智能体式创作引擎）。新一代视频生成模型也将在今年 11 月发布。\n与此同时，阿里巴巴还公布了对未来多模态模型的技术判断。\n阿里巴巴 ATH 技术副总裁，淘天集团首席科学家郑波在云栖大会现场提到，三年内会出现一个原生全模态统一模型，体验将不再受限于模态的边界。\n图片，从“生成图片”走向视觉生产\n过去两年，图像生成模型的画质、审美和真实感快速提升。但进入生产场景，一张图片好看还不够。创作者需要稳定、可控地完成任务，而不是反复“抽卡”，靠概率碰出一张能用的图。\n这对图像模型提出了更具体的要求：信息要准确，排版要考究，专业内容要理解，生成结果最好能直接使用。\n今年云栖大会上，阿里巴巴展示了 Qwen-Image-3.1 面向这类生产场景的能力。郑波以科研图示、营销图片和电影分镜为例，解释了生产力图像模型需要解决的问题。\n科研制图目前已经普遍使用了 AI 图像生成。部分学术出版商已经开始允许 AI 辅助制作示意图、流程图等解释性图片，但前提是作者核验内容准确性，并明确披露 AI 的使用。在这个领域，AI 生成内容的准确性和对专业知识的理解，对于研究人员来说至关重要。2024 年，《Frontiers in Cell and Developmental Biology》就曾撤回一篇包含 AI 生成图示的论文，其中出现了严重失真的大鼠解剖结构和错误标注。\n因此，面对学术原理图，模型需要实现“世界知识的渲染”：先理解复杂的科学原理，再将概念、流程和关系准确呈现出来。图画得像不像，只是其中一个要求；知识有没有表达错，才决定它能不能进入科研生产。\n营销也是 AI 生图非常受欢迎的应用场景。电商和品牌需要持续生产商品介绍、广告和社交媒体素材，一张图片往往同时包含商品、文字、图示和版式。现场以“一杯咖啡的风味之旅”为主题，展示了 Qwen-Image-3.1 生成的图片。可以看到，模型能够同时处理中文标题、小字、图示和段落，并将不同信息组织出清晰的视觉层级，让读者一眼抓住重点。\n影视制作同样离不开图像模型。AIGC 影视工作流不仅需要生成最终视频，前期还要持续生产角色形象、场景和分镜等内容资产。尤其是电影分镜，需要把剧情进一步转换成具体的画面和镜头。给出一段剧情，Qwen-Image-3.1 可以生成包含画面、对白、动作和镜头语言的分镜脚本，为后续视频生成提供更明确的视觉参考。\n而生产力图像还有一个重要要求：模型需要理解一张图片在不同层级上的结构。\n同一张人物照片，创作者可能只想修改其中一个对象，也可能需要提取轮廓、重新设计版式；再往后，还可能希望从单张正面照片生成不同角度的角色，甚至继续扩展人物所在的空间。任务从局部像素一路延伸到结构、版面、角色和环境，对图像的理解层级也随之加深。\nQwen-Image-3.1 提供了“点、线、面、体、场”五个维度的编辑能力，分别对应像素锚定、结构勾勒、版面构建、角色塑造和世界营造。郑波表示，“编辑能力一定程度体现了图像模型的 reasoning 能力”。这里的编辑，已经不只是对生成结果进行局部修改，也包括从已有图像中理解和提取结构，再沿着不同维度重新组织和生成内容。\n从科研图示、营销图片到电影分镜，这些生产任务最终指向的是同一个要求：减少随机性，增加确定性。\n当模型能够准确理解信息，并围绕已有视觉资产继续组织和生成内容，图像生成才真正走向生产。\n真正理解“审美”的音乐生成模型\nAI 音乐供给快速增长，完整歌曲的生成能力早已不再稀缺。现在，行业开始更关注专业可控性，以及更难量化的音乐品质：审美、旋律、人声和情绪表达。\n音乐的特殊之处也在这里。图像是否准确，可以从文字、物体、空间关系等维度验证；音乐的评价却包含大量难以量化的因素。一段旋律是否抓耳，人声是否自然，情绪是否准确，编曲是否符合特定文化和音乐类型的审美，很难依靠传统 Benchmark 完整衡量。\n今年云栖大会发布的 Happy Shrimp 1.1，进一步提升了旋律、人声、创作意图理解和多语言演唱能力。目前，模型覆盖百余种曲风和十余种主流语言，可以生成人声歌曲和纯音乐。相比 1.0，1.1 的旋律记忆点更强，人声唱法和情绪表达更加丰富，对复杂创作指令的理解进一步提升，多语言演唱的发音也更加准确、清晰。\n在大会现场，郑波展示了 Happy Shrimp 1.1 生成的多首作品。\n不同语言下，模型都能较为清晰地完成人声演唱，并按照要求处理曲风和情绪。\n如何让模型更好地理解创作意图，理解容易被主观意义影响的“好听”？\nHappy Shrimp 1.1 引入了 音乐审美建模与强化学习，将旋律、律动、声部清晰度、空间定位和音色自然度纳入更精细的奖励反馈。也就是说，音乐性本身开始成为模型的优化目标。\n这种变化首先体现在旋律和编排上。Happy Shrimp 1.1 强化了旋律的记忆点，让主题能够在重复、变化和再现中保持辨识度；编排则进一步处理配器、声部和律动，让主歌、副歌、桥段等不同部分承担各自的段落功能，推动整首作品的情绪发展。\n在人声生成上，准确只是基础，唱法和情绪同样决定最终的听感。Happy Shrimp 1.1 提升了多语种演唱的准确性和清晰度，也增加了唱法和情绪表达的丰富度。目前，模型覆盖百余种曲风和十余种主流语言。\n但“好听”没有一套统一标准。不同年代、文化和音乐类型，都有各自的旋律、配器、律动和演唱习惯。除了音乐审美，模型还需要把创作者相对抽象的描述，转换成具体的音乐选择。\n比如用户只给出“雨夜返乡，克制的喜悦”，模型需要判断什么样的曲风和配器符合对应的文化语境，什么样的唱法适合这种情绪，律动应该有多强，段落又应该如何展开。\nHappy Shrimp 1.1 通过世界知识增强音乐理解与生成，将文化语境和场景意图进一步对应到曲风、音色、律动和结构。\n除了理解音乐本身，真正面向创作的模型，还要理解不同创作者需要什么。\n对于普通用户，目标是降低从一个想法到一首完整歌曲的门槛。在 Happy Shrimp（快乐虾米）里，用户可以从一句想法开始，描述故事、情绪和风格，生成一首人声歌曲或纯音乐；歌词可以自己写，也可以由 AI 辅助完成。\n专业音乐人的需求则不同。他们需要保留自己的创作判断，并对旋律、编曲、人声和其他元素拥有更细的控制。一次生成之后，还需要继续修改、比较和选择版本。\nHappy Shrimp 1.1 支持多模态参考、局部编辑和多轮创作。例如一次 Remix 可以要求模型“保留 A 的旋律，用 B 的编曲风格与 C 的音色重新演绎”；局部修改副歌鼓组时，则只增强鼓组的冲击力，同时保护旋律、人声和其他段落。\n这让创作者能够继续修改和加工生成结果，而不是反复抽卡，被迫接受模型的一次性成品。\n视频，从生成能力走向创作智能\n这次发布会上，在预告新一代视频生成模型发布时间的同时，郑波公布了阿里巴巴对视频模型演进方向的判断。\n视频模型已经从早期的 DiT 验证阶段，走向多模态参考创作，并开始进入理解创作的阶段。\n最早的 DiT 验证阶段，核心是先把视频生成出来，解决生成质量问题。今年上半年开始，多模态参考能力快速演进，模型能够同时理解文字、图片、视频和音频，视频生成也从相对单一的输入走向多模态创作。郑波表示，目前市场上绝大部分用户都已经在使用多模态参考。\n而现在，阿里巴巴的视频生成模型正在迈向下一个阶段：在生成素材的同时，进一步理解创作目标和创作意图。\n模型需要更懂叙事和镜头，能够从一个想法、一个故事出发，自动拆解剪辑和分镜，组织角色与场景，再完成最终生成。再往后，阿里巴巴还在探索将理解、推理、生成和交互进一步统一，让 AI 从生成内容走向理解创作、参与创作和完成创作。\n沿着这个方向，阿里巴巴下一代视频模型将会朝“ 更长、更可控、更完整、更智能” 四个方向提升。\n“更长”，是在更长时间里保持人物、场景和内容的一致性，讲完一个完整故事；“更可控”，是让创作者更精确地控制人物、场景、镜头和其他创作元素；“更完整”，是从生成单个镜头走向理解剧情、情绪和完整叙事；“更智能”，则是更好地理解创作意图。\n要做到更长、更可控、更完整、更智能，仅靠视频生成模型本身并不够。\n一段几秒的视频，还可以用 Prompt 描述人物、动作和镜头。到了几十秒甚至更长的视频，人物如何移动、摄影机沿什么轨迹运动、角色在空间中的位置如何变化，都需要持续控制。并且，除了文本、图片、视频和音频，3D 白模、2D Layout、运动轨迹、人物姿态、深度信息和相机几何这些模态，也可以成为视频生成的控制条件。并且不同条件作用的对象、时间和范围不同，视频生成工具还需处理跨时间的约束、工具调用，以及人物和场景等素材的持续复用。\n阿里巴巴因此提出了 Agentic PE（智能体式创作引擎）辅助生成体系，用来组织复杂任务和长时域生成所需的多模态条件。\nAgentic PE 先根据生成任务，确定需要哪些控制条件，再调用工具构建和组织这些条件。条件可以包括空间布局、运动轨迹、人物姿态、深度、参考图像和视频，以及相机几何信息。对于长时段生成，它还会规划不同时间段的约束，并持续更新条件。为提高效率，它会检索和复用已有素材，并根据任务要求和时延选择控制精度。同时，推理时使用的控制信号需要在模型训练阶段得到支持，才能在生成时发挥作用。\n多模态预训练与 Agentic PE 配合，可以让视频在持续生成的过程中保持可控，支持长视频和实时流式生成。预训练让模型学会使用图像、姿态、轨迹等条件。Agentic PE 则负责组织、构建和更新这些条件。\n对于长视频，持续的条件约束有助于保持前后内容一致，让变化符合创作要求。对于实时流式生成，条件可以随着新输入逐步更新，引导后续画面，实现边生成、边交互。\nAgentic PE 辅助生产也未必是最终的架构形态。\n阿里巴巴同时在探索理解与生成的统一建模。让理解、思考与规划、视觉生成共享表征并联合训练，同时保留不同模态的输出头或专家。\n过去几年，图像、音乐和视频生成主要沿着各自的技术路线发展。现在，生成任务正在变得更加复杂：文本之外，图像、视频、音频，以及轨迹、相机参数、3D 几何等信息，都开始成为生成条件。\n图片开始从一次生成走向可编辑、可继续生产的视觉资产；音乐开始从生成完整歌曲，走向对旋律、审美和创作意图更细致的控制；视频则开始处理更长的叙事、更复杂的条件，并进一步探索实时流式生成。\n更丰富的多模态输入、更完整的创作能力，以及实时生成与交互，正在带着 AI 从生成内容，走向创造体验。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//www.infoq.cn/article/rNHK14OsBl5CgSpMoTPq","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 5199 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 5199 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":5199,"summary_length":5199,"usable_text_length":5199,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":5199,"summary_length":5199}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}