# GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent - 新浪财经

*Источник: 新浪财经*
*Дата: 2026-09-21*
*Язык: zh*

**Кратко:** GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent
（来源：量子位）
Codex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。
随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。
同时，也让一个曾经遥远的问题变得越来越具体：
通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？
但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。
物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。
今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。
RPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。
RPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。
开源代码链接：https://github.com/RLinf/RPent
在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。
值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。
1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；
而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。
2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。
抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；
当原有运动路径不可行时，再调整腕部姿态继续执行。
接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。
这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。
3、最后两个任务则进一步展示了RPent对已有能力的复用。
机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳
探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。
这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？
RPent所探索的，正是这样的具身智能体形态。
机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。
当前具身智能的发展，正在逐渐呈现两种不同的技术路线。
一条是纯VLA端到端。
用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。
另一条是纯大模型Agent（如CAP-X这类工作）。
随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。
两条路线之间并非简单的替代关系，而是对应了不同层次的能力：
RPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：
由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。
背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）
RPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。
在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。
智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。
在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。
上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。
用户层（User Layer）：智能体交互入口
用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。
用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。
智能层（Intelligence Layer）：任务规划与能力调度中心
智能层由Agentic PlannerAction Primitive组成。
Agentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。
Action Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。
接口层（Interface Layer）：统一连接模型与机器人
接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。
无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。
环境层（Environment Layer）：连接真实与仿真世界
环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。
新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。
此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。
通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。
同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。
在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。
但进入物理世界之后，问题变得复杂得多。
机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。
如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。
因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。
RPent用三层接口把智能决策与设备执行分开：
（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）
通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。
能完成一次任务，并不意味着真正拥有了这项能力。
在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。
如果每次执行结束后经验随即消失，智能体就只能反复从零开始。
RPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。
RPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。
记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。
例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。
当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。
探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。
在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%
此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。
通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。
智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。
将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。
大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。
因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。
在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。
RPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。
在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。
进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。
在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。
RPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。
社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？
为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。
GPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。
在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。
其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。
结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。
从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。
当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态
机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。
所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。
从一次任务，到一类任务；从一次执行，到持续进化。
RPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。
开源地址：https://github.com/RLinf/RPent
*本文系量子位获授权刊载，观点仅为原作者所有。

GPT-6 Astra开进机器人身体！清华联手无问芯穹等开源RPent
（来源：量子位）
Codex、Claude Code等数字世界智能体，已经向我们展示出了一种全新且高效的工作方式：大模型理解目标，拆解任务，调用适当的工具，并根据执行结果不断调整计划，直到完成任务。
随着GPT-6 Astra开始接受真实机器人操作测试，这种“让大模型作为决策大脑”的智能体范式正逐渐走向物理世界。
同时，也让一个曾经遥远的问题变得越来越具体：
通用大模型，能否成为机器人的“大脑”，让机器人真正完成现实世界中的复杂任务？
但机器人面对的不是可以随时回滚的代码，在物理世界里，环境持续变化、状态无法完全观测，动作一旦发生也很难轻易撤销，抓取、装配、插拔等精细操作更需要专门的模型与控制能力。
物理世界中的智能体，不只是“想明白”，还必须“看得见、做得到、反应快”，并且“记得住”。
今天，由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施RPent正式开源。
RPent面向真实物理世界，将通用大模型的任务理解与规划能力、VLA等专家模型的精细操作能力，以及记忆、工具和机器人接口连接起来，形成从感知、决策、执行到反馈纠错的完整闭环，使智能体能够持续适应环境变化，并将经过验证的经验沉淀为可复用的能力，在与物理环境的持续交互中不断学习和进化。在LIBERO-PRO基准测试中达到92.6%的任务成功率，并将端到端任务完成速度优化7倍以上。
RPent由大规模具身强化学习框架RLinf的核心团队打造，延续了该团队在具身智能基础设施领域的技术积累。
开源代码链接：https://github.com/RLinf/RPent
在这一视频中，RPent展示了多个有趣的开放式任务：机器人将钢珠倒入碗中，双臂协同擦拭盘子，还会主动移开遮挡物，找到藏在碗下的勺子。
值得注意的是，这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化，是开始从“执行学过的动作”，走向“理解任务、调用能力，并根据环境变化调整行动”。
1、例如，当任务变化为“将干净餐具放入纸箱”时，面对同一只蓝色盘子，冻结VLA只会沿用训练时学到的动作，将它错误地放入金属篮中；
而在RPent中，智能体会先观察当前环境，再根据新的目标选择放置位置。执行过程中，如果视觉定位出现偏差，它还会检查结果、排除错误目标，并重新定位手中的盘子。任务变了，机器人也能随之改变行动。
2、另一个任务中，机器人需要读取瓶身和袋子上的品牌标签，将不同饮料放入对应的袋子。
抓起瓶子后，它会先进行小幅试抬，确认夹持稳定；
当原有运动路径不可行时，再调整腕部姿态继续执行。
接着，面对被碗遮挡的勺子，机器人也不会直接尝试抓取，而是先移开两个碗，让目标重新变得可见、可达。
这里展示的已经不再是一条预先写死的动作序列，而是一个完整的“观察-判断-执行-纠错”闭环。
3、最后两个任务则进一步展示了RPent对已有能力的复用。
机器人可以将原本用于“拿起并放置容器”的技能重新组合，用于倾倒钢珠；又把抓取动作与双臂协同、持续接触组合起来，完成持盘、擦拭和收纳
探索成功后，RPent会把经过验证的任务逻辑沉淀为任务卡（Task Card）；再次执行时，RPent可以启用Flash Mode，通过任务卡直接复用这套流程，只根据当前视觉状态做必要调整，避免每一步都重新调用大模型，有效降低了具身智能体执行的延时。
这一整套Demo想展示的，并不是“机器人又学会了几个动作”，而是一个更重要的问题：当机器人走向开放世界，新的任务、物体和障碍不断出现时，它能否像人一样将已有技能重新组织起来，完成训练分布之外的任务？
RPent所探索的，正是这样的具身智能体形态。
机器人不再只是执行一条固定指令，而是能够理解目标、调用能力、应对变化，并将一次成功沉淀为下一次可以复用的经验，这正是具身智能体的雏形。
当前具身智能的发展，正在逐渐呈现两种不同的技术路线。
一条是纯VLA端到端。
用一个视觉-语言-动作模型直接吃下观测、吐出动作，精细操作做得很好，但一旦任务变长、语言变花、场景被扰动就迅速退化。
另一条是纯大模型Agent（如CAP-X这类工作）。
随着GPT-6这一代通用模型对具身任务的覆盖率快速提升，大模型直接输出动作已经能跑通不少任务——但它在亚厘米级的精度、执行时延与“越用越强”这几件事上仍有明显短板。
两条路线之间并非简单的替代关系，而是对应了不同层次的能力：
RPent并不是在两种路线之间进行折中，更不是让某一个模型变得无所不能，包办从任务理解到机械臂控制的全部工作，而是将具身智能拆解为不同层次的能力，让不同模型各自承担最擅长的事情：
由此，它们形成“观察-规划-执行-反馈-再规划”的闭环，让智能体从一次性执行任务，走向在真实世界中持续成长。
背后算法，源于团队于7月份提出的Harness VLA工作（链接：https://arxiv.org/abs/2607.08448）
RPent采用开放的模块化设计，将系统划分为用户层、智能层、接口层和环境层四大层级。
在用户层，可以通过交互式命令行或Web Dashboard下达任务，并查看视觉输入、推理过程和动作轨迹。
智能层中的规划器结合基础模型、Memory与工具库拆解任务，动作原语则把VLA、WAM和程序化技能封装成可调用工具。
在环境层和接口层，机器人控制、模型服务和仿真环境可以独立部署，通过轻量级通信连接。
上层任务逻辑不必绑定某一种机器人或仿真器，新增设备只需实现标准动作、状态与环境接口。当前RPent已覆盖LIBERO-PRO、RoboCasa、RoboTwin、RoboDojo等仿真环境，以及Franka、双臂Franka、YAM、SO101等真实设备。
用户层（User Layer）：智能体交互入口
用户层提供类似Claude Code/Codex的交互式CLI，以及可选Web Dashboard。
用户可以下达任务指令，并实时查看智能体推理过程、视觉输入和动作轨迹，实现对智能决策过程的可观测及实时交互。
智能层（Intelligence Layer）：任务规划与能力调度中心
智能层由Agentic PlannerAction Primitive组成。
Agentic Planner结合基础模型、Memory和Tool Library，实现任务理解、规划与工具调用，并通过Agentic Loop完成“规划 → 执行 → 反馈 → 记忆更新”的持续优化。
Action Primitive将VLA、WAM等学习型操作模型，以及Code as Policy等程序化技能统一封装为标准工具，使大模型负责复杂任务理解与规划，专家模型负责高精度动作执行，从而兼顾泛化能力与操作精度。
接口层（Interface Layer）：统一连接模型与机器人
接口层将智能体决策转换为机器人可执行指令，为不同设备提供统一调用接口，包括动作执行、状态读取、环境渲染和设备复位等能力。
无论是真实机器人还是仿真平台，上层Agent、提示词和工具均无需针对设备重新开发，实现跨机器人、跨环境迁移。
环境层（Environment Layer）：连接真实与仿真世界
环境层负责任务执行，目前已支持LIBERO-PRO、RoboCasa、RoboTwin等仿真环境，以及Franka、双臂Franka、YAM等真实设备。
新增机器人只需作为独立模块接入robots/ 目录，即可被框架自动识别和调用。
此外，智能层与环境层采用独立进程架构，支持模型服务、机器人控制和仿真环境的独立部署、迁移与重启，为持续研发和长期运行提供工程保障。
通过模块化架构与统一接口设计，RPent不绑定单一模型或机器人，而是构建了一个开放、可扩展的具身智能基础设施，让不同模型、技能与硬件能够灵活组合、高效协同。
同时，每一次任务执行产生的反馈都可以沉淀到记忆系统，为后续任务提供经验支持，使智能体在真实环境中持续学习与优化，将智能体的能力从“一次性部署”推向了“持续演进”。
在数字世界中，Agent的能力边界很大程度上取决于它能调用哪些工具。MCP的出现，让大模型可以通过统一的工具协议访问搜索、代码、数据库等数字资源。
但进入物理世界之后，问题变得复杂得多。
机器人、相机、传感器、仿真器和各种物理设备都有各自的接口。即使是完成同一个任务，不同机器人也可能使用完全不同的控制方式。
如果每接入一种设备，都需要重新开发一套Agent，那么智能体很难真正规模化扩展。
因此，RPent将“工具-机器人-环境”进一步抽象，通过分层接口把智能决策与物理执行解耦。将“大模型决策”与“物理设备执行”连接起来，实现智能体、工具和硬件之间的统一协作。
RPent用三层接口把智能决策与设备执行分开：
（在开头的真机视频中展示的Franka和YAM的操控，都来自于统一接口。）
通过MCP、RPC与MHS的分层设计，RPent正在构建一套连接模型、工具、机器人与物理设备的统一接口体系，让智能体能够像调用数字工具一样调用物理能力，从“操作数字资源”进一步走向“操作真实世界”。
能完成一次任务，并不意味着真正拥有了这项能力。
在物理世界中，试错的成本远高于数字环境。一次失败的抓取可能需要重新布置场景，一次错误操作甚至可能造成设备损坏。
如果每次执行结束后经验随即消失，智能体就只能反复从零开始。
RPent的Memory系统希望改变的正是这一点：让一次探索产生的经验，成为未来任务执行的基础。
RPent将经验按复用范围组织为三层记忆，并为记忆记录适用范围、类型、可信度和支撑证据。新经验需要经过验证后才能提高可信度；相互冲突的记录会被保留和隔离，避免偶然成功污染已有能力。
记忆机制中包含Recipe，也就是可迁移的任务方案，而不是某一次执行中的固定坐标。
例如，系统可以记录“先根据任务描述和当前画面确认目标，再调整夹爪位置，调用VLA完成抓取，并检查抓取结果”的操作过程。
当物体位置改变时，智能体重新观察环境，再复用相同逻辑，而不是直接沿用原来的坐标。
探索模式允许更新记忆；评测模式只读使用已经冻结的经验，使演进过程更加可控。
在LIBERO-Pro Goal实验中，引入记忆机制后，RPent在任务扰动环境下表现出明显提升：在位置交换任务中，成功率从31.0%提升至87.0%
此外，RPent支持记忆资产分发。一次探索产生的经验可以同步至其他智能体，使单个智能体获得的能力能够成为整个系统持续进化的基础。
通过Memory系统，RPent将智能体从“一次性完成任务”推进到“持续学习和积累经验”。
智能体的能力不再完全依赖模型预训练，而是在真实世界交互中不断增长。
将大模型引入机器人控制回路，为智能体带来了更强的理解和规划能力，但也带来了新的挑战。
大模型推理速度通常远慢于机器人动作执行速度。在物理环境中，等待模型生成下一步决策可能成为整个系统的主要延迟来源。
因此，RPent并不是单纯追求更快的大模型，而是通过架构优化减少不必要的调用，让智能体运行节奏更加贴近真实世界。
在实际应用中，大量机器人任务具有较强重复性：任务目标和执行逻辑基本稳定，变化的主要是物理位置、姿态和环境状态。对于这类任务，如果每次都从头进行完整规划，无疑会产生大量重复推理。
RPent通过Flash Mode来解决Agentic Planner应用于真机的这一加速问题，其核心技术载体是任务卡（Task Card）。
在探索阶段，RPent允许规划器调用大模型、VLA和程序化技能，尝试不同动作组合，并将成功且经过验证的任务流程压缩为Task Card。Task Card保存任务阶段、动作原语、关键目标与检查条件，不保存只能在一次场景中使用的固定坐标。
进入Flash Mode后，系统优先按照Task Card执行：视觉模块重新定位关键物体，执行模块根据当前状态调整动作；只有在检查失败、环境偏离或流程无法继续时，才重新调用规划器处理。这样既保留了大模型应对变化的能力，也避免在稳定流程中反复进行高成本推理。
在LIBERO Object的200次评测中，开启Flash Mode将平均执行时间从283.6秒降低至40.9秒，在成功率仅下降3.5个百分点的情况下，实现约7倍加速。这也是开头真机视频中Flash Mode的技术含义：把探索得到的成功方案转化为可以快速复用、同时保留环境适应能力的执行流程。
RPent将已经验证的任务逻辑沉淀下来，在环境发生变化时仅做必要调整，让具身智能体从“每次重新规划”走向“经验复用执行”——不只是记住过去做过什么，更能将已有经验转化为更高效的行动。
社区当下对于Agentic Planner存在相同的问题：到底进展到哪一步了？
为了回答这个问题，RPent推出了Leaderboard板块（https://rpent.readthedocs.io/zh-cn/latest/rst_source/leaderboard.html），采用不同技术路线、不同基座模型的方案在性能和延时的对比一目了然。
GPT-6 Astra在RPent中展现出突出的长程任务与扰动适应能力。在更强调指令变化、布局变化和长程执行的LIBERO-Pro上，RPent/GPT-6 Astra达到92.63%，相比图中第二名RPent/Opus-4.7的82.4%高出10.23个百分点；相比π_RLinf的50.0%高出42.63个百分点。此外，开启了Flash Mode的RPent明显降低了延时。
在RoboCasa365 Target50的厨房长程任务中，RPent/GPT-6 Astra达到59.20%，位列图中第一，高于RPent/GPT-5.5的57.1%。这说明更强的基础模型经过RPent的工具组织、记忆与执行闭环后，能够有效转化为物理任务能力。
其余榜单也显示了RPent对不同模型与执行配置的兼容性：RPent/Opus-4.7在LIBERO达到96.0%；RPent/GPT-5.5在RoboTwin达到62.4%，均处于图中领先位置。
结果更值得关注的不是某一个模型单独完成了全部控制，而是通用模型、专家模型、工具和记忆系统可以在同一框架内协同发挥作用。
从Codex、Claude Code到RPent，AI正在从“在数字世界完成任务”，走向“在物理世界完成任务”。
当智能体走向真实世界，变化的不只是模型能力的边界，也包括支撑这种能力运行的基础设施形态
机器人需要看见环境、理解任务、调用不同能力、完成精细动作，还需要根据真实反馈不断调整策略，并把已经验证过的经验保留下来。
所以，围绕这一完整过程来组织智能体系统的RPent，并非只是一个开源的“让大模型控制机器人”的框架，而是一套能够连接模型、工具、机器人与环境，并支持智能体在真实世界中持续运行、积累经验和不断递归演进的智能中枢。
从一次任务，到一类任务；从一次执行，到持续进化。
RPent所代表的，正是大模型真正走进物理世界之后，需要重新构建的下一层基础设施。
开源地址：https://github.com/RLinf/RPent
*本文系量子位获授权刊载，观点仅为原作者所有。

[Оригинал](https://finance.sina.cn/stock/jdts/2026-09-21/detail-inisqkzx2131897.d.html?oid=800&vt=4&cid=76993&node_id=76993)