{"id":85516,"topic":"ai","source":"t.cj.sina.cn","title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","url_hash":"d9001010f820bf3ef47acaf01bba45277018b6eb","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxQcTBjMTNHME40Yko1eG5qZWl6T2w2LWRaMEVSaGU0cG54aTA3RnZ0bC1XN21CY3ZQYTd2RUNHaWlFUzhNOGlja2IzQ2VscmRpUWN1NFhNeDRPOHdsM2ZaQ1g1LW1oMnVlckt6dmNmQ0JmSXFZWHVndW0ydjZ3bm93ZWk5X1lCR1JFNzlOQg?oc=5\" target=\"_blank\">豆包大模型再更新，发力多模态编程，一手实测来了</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">t.cj.sina.cn</font>","content":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","image_url":null,"lang":"zh","published_at":"2026-09-18T06:38:04+00:00","fetched_at":"2026-09-18T22:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","cluster_id":3542542,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}},"news_item":{"id":85516,"canonical_url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","source_url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","source_name":"t.cj.sina.cn","author":null,"published_at":"2026-09-18T06:38:04+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMijAFBVV95cUxQcTBjMTNHME40Yko1eG5qZWl6T2w2LWRaMEVSaGU0cG54aTA3RnZ0bC1XN21CY3ZQYTd2RUNHaWlFUzhNOGlja2IzQ2VscmRpUWN1NFhNeDRPOHdsM2ZaQ1g1LW1oMnVlckt6dmNmQ0JmSXFZWHVndW0ydjZ3bm93ZWk5X1lCR1JFNzlOQg?oc=5\" target=\"_blank\">豆包大模型再更新，发力多模态编程，一手实测来了</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">t.cj.sina.cn</font>","full_text":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","excerpt":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4491 characters.","diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","summary":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","source":"t.cj.sina.cn","date":"2026-09-18T06:38:04+00:00","content":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4491 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/85516","export_markdown":"/api/items/85516/export?format=markdown","export_json":"/api/items/85516/export?format=json","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26"},"formats":{"full":{"id":85516,"title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","source":"t.cj.sina.cn","author":null,"published_at":"2026-09-18T06:38:04+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","full_text":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 4491 characters.","diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}},"actions":{"read":"/item/85516","export_markdown":"/api/items/85516/export?format=markdown","export_json":"/api/items/85516/export?format=json","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26"}},"digest":{"id":85516,"title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","source":"t.cj.sina.cn","topic":"ai","published_at":"2026-09-18T06:38:04+00:00","excerpt":"编辑｜冷猫、Panda 国庆、中秋双节快到了，出游的地方想好了吗？ 这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。 视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg 提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 4491 characters.","reading_time_min":1,"cluster_id":3542542},"card":{"display_title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","subtitle":"t.cj.sina.cn · 2026-09-18","summary":"编辑｜冷猫、Panda 国庆、中秋双节快到了，出游的地方想好了吗？ 这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。 视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg 提示词：收集整理山西旅游相关知识和信息，绘制一份 3D…","badges":["quality:high"],"links":{"read":"/item/85516","original":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","diagnose":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26"},"quality_warning":null},"export":{"title":"豆包大模型再更新，发力多模态编程，一手实测来了 - t.cj.sina.cn","url":"https://t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4?finpagefr=p_104&","summary":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","source":"t.cj.sina.cn","date":"2026-09-18T06:38:04+00:00","content":"编辑｜冷猫、Panda\n国庆、中秋双节快到了，出游的地方想好了吗？\n这件事，AI 已经能帮上忙。我们只给了模型一段话，它依靠出色的多模态编程能力，交出了一份可交互的 3D 山西旅行导览。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：收集整理山西旅游相关知识和信息，绘制一份 3D 山西旅行景点地图/导览，可移动并可交互点击，了解各个景点在哪，主要看点是什么，有什么游玩 tips。画面清晰、好看、有趣。\n结果相当惊艳！打开页面，首先是一张汇集山西代表性景点的山水风格首页。进入地图后，模型按照山西的海拔起伏搭出了 3D 地形，配色清爽耐看，整体信息也大致准确，还推荐了 4 条主题旅游路线。\n这是字节前两天上线的新版豆包 2.1 Pro（版本号：0915），API 已在火山方舟全量上线，豆包工作同步接入。\n官方公布的更新方向有四个：多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解，以及 Token 效率。其中最受关注的是多模态编程，也就是让模型看着设计稿、图纸、录屏写代码，再根据运行画面继续修改。\n过去几天，我们围绕该模型做了一轮集中实测。\n跟着小王子从一幅画开始\n正巧，最近有位同事带了本《小王子》来编辑部，所以在这一轮实测中，我们决定跟着小王子走一趟：给他建星球、盖房子，再帮他和地球保持联系。\n第一站，是小王子的 B612 星球。\n这是一颗很小的星球，上面有三座火山、几棵猴面包树和一朵玫瑰。我们的需求是：在这颗星球上设计一栋房子，整体做成一个可以摆在桌上的微缩星球摆件，并且能旋转、能看到昼夜变化。输入相关提示词，结果如下：\n从模型生成效果看，成品的摆件感很足，玫瑰开放、昼夜交替，光影与色彩的过渡都很柔和。小王子说自己有一天看了 44 次日落，模型把昼夜循环的最高速度也设成了一天 44 次。\n搭建过程中，模型会自己截图、上手操作场景，发现问题后再回头改代码。\n模型自主截图操作示意，5 倍速。\n星球有了，房子也得讲究一些。\n我们找来一张小王子城堡的外观五视图，让模型据此重建 3D 模型。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张城堡的外观五视图，构建一个 3D 模型，要求同步生成室内布局，并且可以打开屋顶查看。\n结果并非 100% 完美复刻，但整体过关，城堡各部分的空间关系还原得相当准确。提示词之外，模型还主动加上了自动旋转和墙体透视。\n现在，小王子已经安好了家，我们该怎么联系他呢？\n不如送他一台苹果刚发布的 iPhone Duo，当然，是数字版的。\n我们让豆包 2.1 Pro 基于三张图片和两个视频生成了一个 iPhone Duo 折叠概念演示，并且其中还安装了一个可以通过折叠方式游玩的 Flappy Bird 小游戏。\n这个任务的难点在于，折叠方式和游戏玩法都只存在于视频里，模型要先看懂画面中的开合动作和游戏规则，再把它们写成代码。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n读取并理解文件夹中的两个折叠屏视频展示和相应图片，然后构建一个 iPhone Duo 模型程序。一开始的界面是折叠起来的，用户可以点击侧边位置打开，然后界面上有一些图标，其中有一个 Flappy Bird 图标，点击这个图标可以打开视频中演示的游戏。用户可以点击空白处实现虚拟 iPhone Duo 的折叠，并玩这个游戏。\n交互的完成度不错：数字版 iPhone Duo 的两块屏幕做到了与 Flappy Bird 的翅膀同频，扇动起来穿过一个又一个的关口。有趣的是，豆包 2.1 Pro 还给这个小游戏起了一个恰到好处的名字：Foldy Bird。美中不足的是，最终样式与真实 iPhone Duo 略有差异，倒是更像 Surface Duo。\n从一颗星球到一座城堡，再到一台能折叠的手机，小王子的家算是安顿好了。这一路上，豆包 2.1 Pro 接收的信息不只有文字，还有设计图和视频。它必须去看，并且看懂，才能真正开始动手去创作。\n小王子的故事先讲到这里，现在回到我们的日常生活。\n从星球回到地面，只需一张图，豆包能盖房\n现实中需求，往往就是一张图：一张建筑平面设计图、一张庭院设计图或一张随手画的草稿。\n先从一张建筑平面设计图开始，我们让豆包 2.1 Pro 将其转化为了可交互的三维模型。这里，模型能获得的信息几乎全部来自平面图本身。对缺乏多模态理解能力的模型来说，这类任务很难仅靠文字推理完成。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n新版豆包 2.1 Pro 读懂了平面图中各类图例的含义，并据此还原出空间布局。更有意思的是，它还考虑到了用户会怎样查看这个模型，主动加入了隐藏屋顶、自动旋转和视角切换。它理解的不只是图，还有人会怎么使用这个结果。\n这与官方披露的方向一致：据字节介绍，新版模型对工程图纸中尺寸标注、公差符号的识别精度有所提升，也能更准确地识别 CAD 工件等 3D 物体。\n更进一步，你甚至可以把自家庭院「搬」进数字世界，再让它快速经历四季。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：参考设计图，做一个 web3D 的庭院，然后模拟春夏秋冬四季，生成不同季节的庭院风貌。\n最后，是一张我们自己手绘的潦草草图。我们让豆包 2.1 Pro 据此构建一个支持多主题切换的个人工作台：\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n提示词：基于这张手绘图，构建我的个人工作台主页。设置中支持多主题切换，包括极简风格、像素画风格、水墨画风格、莫兰迪色风格、Atom 编辑器经典风格、Aurora Gradient、赛博朋克等。不懂的先问我，清楚后再构建。\n结果相当好，我个人尤其偏好其中的赛博朋克风格。而且它还提供了非常丰富的个性化设置能力，让我们可以将其配置成真正实用的个人工作台。\n测试最后，我们再看看「鹈鹕骑自行车」的任务表现。\n这是 AI 圈流传很广的民间测试，源自开发者 Simon Willison 常用的一句提示词：Generate an SVG of a pelican riding a bicycle。本次测试，我们加点力度，在2D基础上，要求生成3D像素风的。\nSeed2.1 Pro 升级版先交出一版 2D 动画，接着按要求给出了 3D 结果。\n可以看到，鹈鹕的外形特征、双腿骑车时的运动姿态都被表现出来，主体与背景树木之间也呈现出了合理透视关系，随着镜头变化，身体与车身的空间关系依然保持稳定。\n看图写代码的背后\n新版豆包 2.1 Pro 更新了什么？\n测完回过头，再来看看这次更新本身。\n本次更新的豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者于今年 6 月对外公开，在短短 3 个月内保持高频自进化迭代，多模态编程能力已达到国内领先水平。\n其核心亮点主要体现在两个方面。\n一是更懂复杂代码仓库。官方披露，在开源游戏 Luanti（约 38.7 万行代码、1000 个真实历史 Issue）的自主修复中，模型调度多个子 Agent 连续运行近 36 小时，完成根因定位与跨文件修复，83% 的任务达到可合并标准。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n二是「看图写代码」。借助视觉理解能力，模型可以直接读懂设计稿、图纸和操作录屏，再转成前端代码和游戏逻辑。\n官方展示的一个案例中，一套没有文档的老 ERP 系统，只提供一段操作录屏和几张草图，模型读懂了约 28 万行 Java 代码，依据录屏与草图开发出移动端页面，并跑通了完整业务链路。\n视频链接：https://mp.weixin.qq.com/s/ICb4P_FqTZVgaeMvZs_9dg\n支撑这些的，是多模态理解能力的提升。前面城堡五视图、平面图、iPhone Duo 视频这几个测试，考的正是这些能力。\nAgent 方面，模型强化了证据溯源、权威信源检索和数据核验，幻觉明显减少，在金融投研这类需要多轮调研、产出长报告的专业任务中，交付更加可靠。\n图：iPhone Duo 首年出货量预测分析，豆包 2.1 Pro 派出了 4 个子智能体进行预测核实，得到了非常详实的结果，同时也列出了无法核实的信息。\n这些能力的背后是字节在多模态上的长期积累。\n目前，豆包 2.1 系列模型在视觉理解、Computer Use、Mobile Use 等任务上都处于相当领先的水平；在创作侧，Seedance、Seedream、Seed Audio 分别覆盖视频、图像和音频生成。\n成本上，新版图像推理和视频推理的 Token 消耗比上一代减少 30% 以上，对看图写代码这类需要反复截图、对照画面的任务来说，这一点很具备吸引力。\n目前，开发者可直接在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型，普通用户下载升级豆包工作最新版，选择「豆包 2.1 Pro（0915 新版）」即可体验。\n让机器看懂人\n编程，从来就不仅仅围绕文本一种模态。\n真实工程里的大量知识，藏在设计图、软件界面、操作录屏，甚至老员工的操作习惯里。前端工程师的日常，也有很大一部分是把别人的设计一点点变成代码。只会读文字的编程模型，天然缺了一条腿。多模态补上的正是这一条。\n从技术发展路线看，编程正在越来越多地和多模态能力结合，这也是 AI 编程走向生产级落地的必修课。\n越来越多地，编程智能体开始带着一双「眼睛」去工作：可以看界面、看图片、理解空间和视觉反馈，再决定代码应该怎么写。与此同时，编程能力本身也不再只是服务于「做软件」，它正在变成 AI 解决通用任务的一种工具。\n再从字节视角看，豆包 2.1 Pro 的更新，正凸显其在多模态领域的优势：将以 Seed Audio、Seedance、Seedream 为代表的领先技术积累，进一步整合并转化为面向真实工作场景的生产力。豆包大模型正在将「编程模型」和「通用 Agent」能力不断融合，服务越来越多的生产力场景。\n而更深的变化，发生在人与机器之间。过去几十年，是人在学习机器的语言：写代码，写 PRD，写接口文档，把想法一层层翻译成机器能执行的格式。\n现在，机器开始学着看懂人的表达：一张随手画的草图，一段录下来的操作，一次屏幕上的演示，都可以直接成为开发的起点。\n从人读懂机器，到机器读懂人。当模型有了「眼睛」，代码就成了它的「手」。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//t.cj.sina.com.cn/articles/view/3996876140/ee3b7d6c027017qp4%3Ffinpagefr%3Dp_104%26","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 4491 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 4491 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":4491,"summary_length":4491,"usable_text_length":4491,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":4491,"summary_length":4491}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}