当前位置:首页 > 电商学院 > 汉潮快讯 > 怎样让 Codex 在物理世界干活?清华大学联合无问芯穹、正行创新全新开源具身智能体基础设施 RPent,任务加速 7 倍

怎样让 Codex 在物理世界干活?清华大学联合无问芯穹、正行创新全新开源具身智能体基础设施 RPent,任务加速 7 倍

0人阅读|来源:极客公园|发布时间:2026-09-22 00:20:02
导读:随着 GPT-6 Astra 开始接受真实机器人操作测试,数字世界的智能体范式正逐渐走向物理世界。

随着 GPT-6 Astra 开始接受真实机器人操作测试,数字世界的智能体范式正逐渐走向物理世界。同时也把一个问题变得越来越具体:通用大模型,能否成为机器人的「大脑」,让机器人真正完成现实世界中的复杂任务?

但物理世界中的智能体,不仅要「想明白」,还必须「看得见、做得到、反应快」,并且「记得住」。

今天,由清华大学、无问芯穹、正行创新联合发起的具身智能体基础设施 RPent 正式开源。RPent 面向真实物理世界,将通用大模型的任务理解与规划能力、VLA 等专家模型的精细操作能力,以及记忆、工具和机器人接口连接起来,形成从感知、决策、执行到反馈纠错的完整闭环,使智能体能够持续适应环境变化,并将经过验证的经验沉淀为可复用的能力,在与物理环境的持续交互中不断学习和进化。在 LIBERO-PRO 基准测试中达到 92.6% 的任务成功率,并将端到端任务完成速度优化 7 倍以上。

RPent 真机效果:从「会动」到「会做事」

此次发布同步释出了一系列 RPent 真机 demo,展示了多个有趣的开放式任务:值得注意的是,这些任务并不是为每一种场景单独训练一个专用策略。机器人真正发生的变化,是开始从「执行学过的动作」,走向「理解任务、调用能力,并根据环境变化调整行动」。

例如,当任务变化为「将干净餐具放入纸箱」时,面对同一只蓝色盘子,冻结 VLA 只会沿用训练时学到的动作,将它错误地放入金属篮中;

而在 RPent 中,智能体会先观察当前环境,再根据新的目标选择放置位置。执行过程中,如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。任务变了,机器人也能随之改变行动。

另一个任务中,机器人需要读取瓶身和袋子上的品牌标签,将不同饮料放入对应的袋子。

抓起瓶子后,它会先进行小幅试抬,确认夹持稳定;当原有运动路径不可行时,再调整腕部姿态继续执行。

面对被碗遮挡的勺子,机器人也不会直接尝试抓取,而是先移开两个碗,让目标重新变得可见、可达。

这里展示的已经不再是一条预先写死的动作序列,而是一个完整的「观察—判断—执行—纠错」闭环。

最后两个任务中,机器人可以将原本用于「拿起并放置容器」的技能重新组合,用于倾倒钢珠;又把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳

探索成功后,RPent 会把经过验证的任务逻辑沉淀为任务卡(Task Card);再次执行时,RPent 可以启用Flash Mode ,通过任务卡直接复用这套流程,只根据当前视觉状态做必要调整,避免每一步都重新调用大模型,有效降低了具身智能体执行的延时。

重要的并不是「机器人又学会了几个动作」,而是「当机器人走向开放世界,新的任务、物体和障碍不断出现时,它能否像人一样将已有技能重新组织起来,完成训练分布之外的任务?」

RPent 所探索的,正是这样的具身智能体形态——机器人不再只是执行一条固定指令,而是能够理解目标、调用能力、应对变化,并将一次成功沉淀为下一次可以复用的经验,这正是具身智能体的雏形。

RPent 核心设计思路:让模型各自承担擅长的事

RPent 不是让某一个模型变得无所不能,包办从任务理解到机械臂控制的全部工作,而是将具身智能拆解为不同层次的能力,让不同模型各自承担最擅长的事情:

○ 通用大模型负责理解任务、制定计划;

○ VLA、WAM 等专家模型负责高精度动作执行;

○  记忆系统沉淀经验,推动智能体持续优化;

○  框架负责连接模型、工具与真实环境,形成闭环。

形成「观察—规划—执行—反馈—再规划」的闭环,让智能体从一次性执行任务,走向在真实世界中持续成长。

当智能体走向真实世界,变化的不只是模型能力的边界,也包括支撑这种能力运行的基础设施形态。RPent 所代表的,正是大模型真正走进物理世界之后,需要重新构建的下一层基础设施。

来源:互联网

免责声明:本文为转载,仅作信息分享交流之用。版权归原作者所有,如有侵权,请联系删除。

汉潮热门产品

HOT PRODUCT
  • AI搜荐(GEO产品)
  • 五大AI数字员工
  • AI大模型外呼机器人
  • 汉潮O2O城市生活服务系统
  • 汉潮智慧门店新零售系统