{"id":86970,"topic":"ai","source":"新浪财经","title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","url_hash":"1a2c9114630dcc67c6e3c218a41e12ff8d3e5453","author":"","summary":"<a href=\"https://news.google.com/rss/articles/CBMisgFBVV95cUxNRHZPZUVEV1YteW5ITmhwUEV5bTdqR1pHZGxhT2dzVXRUbUpsZFBERkE4Q1praVVENEN4SDRkd1FUaXdGVGU0WE1TenZicG1NdDIxU0tJZk52Y2d6SkFRdlJuX1NjTTJkNHByaWxtODJELWdabEdZMG9mUElYUkhaeWNsVEJScGYwbWl3ajBwdDZjdXVaVHZNdDQ0SXNtSFhUWjcxV1liLUFhc1VJYUF2SWdR?oc=5\" target=\"_blank\">GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","content":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","image_url":"https://n.sinaimg.cn/spider20260921/287/w660h427/20260921/f40b-14af0a6cdd0b7a6e6fe6035bde1492c7.jpg","lang":"zh","published_at":"2026-09-21T07:31:27+00:00","fetched_at":"2026-09-21T08:15:08+00:00","status":"read","starred":0,"extract_state":"ok","summary_auto":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","cluster_id":null,"extract_retries":0,"extract_error":null,"contract_version":"news_item.v1","format_contract_version":"news_item_formats.v1","dedup_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}},"news_item":{"id":86970,"canonical_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","source_url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","source_name":"新浪财经","author":null,"published_at":"2026-09-21T07:31:27+00:00","locale":"zh","topic":"ai","tags":[],"rss_summary":"<a href=\"https://news.google.com/rss/articles/CBMisgFBVV95cUxNRHZPZUVEV1YteW5ITmhwUEV5bTdqR1pHZGxhT2dzVXRUbUpsZFBERkE4Q1praVVENEN4SDRkd1FUaXdGVGU0WE1TenZicG1NdDIxU0tJZk52Y2d6SkFRdlJuX1NjTTJkNHByaWxtODJELWdabEdZMG9mUElYUkhaeWNsVEJScGYwbWl3ajBwdDZjdXVaVHZNdDQ0SXNtSFhUWjcxV1liLUFhc1VJYUF2SWdR?oc=5\" target=\"_blank\">GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent</a>&nbsp;&nbsp;<font color=\"#6f6f6f\">新浪财经</font>","full_text":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","excerpt":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 6290 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}}},"display_formats":["compact","card","full","digest_section","json"]},"daily_stack_record":{"title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","summary":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","source":"新浪财经","date":"2026-09-21T07:31:27+00:00","content":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 6290 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}},"tags":[]},"fallback_formats":["markdown","json","html"],"actions":{"read":"/item/86970","export_markdown":"/api/items/86970/export?format=markdown","export_json":"/api/items/86970/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"},"formats":{"full":{"id":86970,"title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","source":"新浪财经","author":null,"published_at":"2026-09-21T07:31:27+00:00","locale":"zh","topic":"ai","tags":[],"excerpt":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","full_text":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","reading_time_min":1,"extraction":{"state":"ok","confidence":0.9,"error":null,"explanation":"High confidence: full text extraction produced 6290 characters.","diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}}},"quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}},"actions":{"read":"/item/86970","export_markdown":"/api/items/86970/export?format=markdown","export_json":"/api/items/86970/export?format=json","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"}},"digest":{"id":86970,"title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","source":"新浪财经","topic":"ai","published_at":"2026-09-21T07:31:27+00:00","excerpt":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent （来源：量子位） Codex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。 随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。 同时，也让一个曾经遥远的问题变得越来越具体： 通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？…","quality_bucket":"high","quality_reason":"High confidence: full text extraction produced 6290 characters.","reading_time_min":1,"cluster_id":null},"card":{"display_title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","subtitle":"新浪财经 · 2026-09-21","summary":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent （来源：量子位） Codex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。 随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。 同时，也让一个曾经遥远的问题变得越来越具体：…","badges":["quality:high"],"links":{"read":"/item/86970","original":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","diagnose":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993"},"quality_warning":null},"export":{"title":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经","url":"https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993","summary":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","source":"新浪财经","date":"2026-09-21T07:31:27+00:00","content":"GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent\n（来源：量子位）\nCodex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。\n随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。\n同时，也让一个曾经遥远的问题变得越来越具体：\n通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？\n但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。\n物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。\n今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。\nRPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。\nRPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。\n开源代码链接：https://github.com/RLinf/RPent\n在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。\n值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。\n1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；\n而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。\n2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。\n抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；\n当原有运动路径不可行时，再调整腕部姿态继续执行。\n接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。\n这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。\n3、最后两个任务则进一步展示了RPent对已有能力的复用。\n机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳\n探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。\n这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？\nRPent所探索的，正是这样的具身智能体形态。\n机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。\n当前具身智能的发展，正在逐渐呈现两种不同的技术路线。\n一条是纯VLA端到端。\n用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。\n另一条是纯大模型Agent（如CAP-X这类工作）。\n随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。\n两条路线之间并非简单的替代关系，而是对应了不同层次的能力：\nRPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：\n由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。\n背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）\nRPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。\n在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。\n智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。\n在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。\n上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。\n用户层（User Layer）：智能体交互入口\n用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。\n用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。\n智能层（Intelligence Layer）：任务规划与能力调度中心\n智能层由Agentic PlannerAction Primitive组成。\nAgentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。\nAction Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。\n接口层（Interface Layer）：统一连接模型与机器人\n接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。\n无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。\n环境层（Environment Layer）：连接真实与仿真世界\n环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。\n新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。\n此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。\n通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。\n同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。\n在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。\n但进入物理世界之后，问题变得复杂得多。\n机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。\n如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。\n因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。\nRPent用三层接口把智能决策与设备执行分开：\n（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）\n通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。\n能完成一次任务，并不意味着真正拥有了这项能力。\n在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。\n如果每次执行结束后经验随即消失，智能体就只能反复从零开始。\nRPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。\nRPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。\n记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。\n例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。\n当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。\n探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。\n在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%\n此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。\n通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。\n智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。\n将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。\n大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。\n因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。\n在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。\nRPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。\n在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。\n进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。\n在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。\nRPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。\n社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？\n为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。\nGPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。\n在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。\n其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。\n结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。\n从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。\n当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态\n机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。\n所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。\n从一次任务，到一类任务；从一次执行，到持续进化。\nRPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。\n开源地址：https://github.com/RLinf/RPent\n*本文系量子位获授权刊载，观点仅为原作者所有。","confidence":0.9,"diagnostics_url":"/api/diagnose?url=https%3A//finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html%3Foid%3D800%26vt%3D4%26cid%3D76993%26node_id%3D76993","quality_bucket":"high","failure_kind":"none","retryable":false,"quality_reason":"High confidence: full text extraction produced 6290 characters.","quality_profile":{"profile_version":"extraction_quality.v2","bucket":"high","confidence":0.9,"failure_kind":"none","retryable":false,"retry_after_attempts":0,"reason":"High confidence: full text extraction produced 6290 characters.","operator_guidance":{"severity":"ok","recommended_action":"trust_full_text","next_step":"Use the extracted full text as the primary article source.","operator_label":"Ready","can_retry":false,"can_use_summary":false,"diagnostics_required":false},"content_depth":{"contract_version":"content_depth.v1","category":"full_text","label":"Full text","has_full_text":true,"has_summary":true,"content_length":6290,"summary_length":6290,"usable_text_length":6290,"source_field":"content"},"legacy_collapsed":false,"signals":{"extract_state":"ok","extract_error":null,"extract_retries":0,"content_length":6290,"summary_length":6290}},"tags":[],"format_contract_version":"news_item_formats.v1"}}}