henry 发自 凹非寺 量子位 | 公众号 QbitAI 机器人的GPT时刻,还真得靠GPT(doge)! 刚刚,GPT-6 Astra接上宇树G1,进厨房干活了~ 在斯坦福团队的最新项目HomeBody中,宇树G1先探索一个从来没见过的厨房,随后就能根据语言指令,收拾物品、丢掉纸盒,甚至把不在眼前的药找出来,递到人手里。 比如,让它把咖啡袋集中放到中间,再丢掉指定的牛奶和橙汁纸盒。 G1就会在厨房里来回搬运,把咖啡袋归拢到岛台上,再处理要丢弃的纸盒。 再比如,一句「帮我把药拿来」。 即使药不在当前视野里,它也能从之前保存的画面中找到线索,走到对应抽屉前,打开抽屉、取出药,再递给人,期间还能把丢纸盒的任务一并完成。 可以说,从Robocurve此前让GPT和Claude控制机械臂,完成桌面抓放测试,到这次G1走进厨房, 大模型控制机器人的任务范围,又往外扩了一圈。 这一次,机器人不只要判断眼前抓什么,还得记住东西在哪,再把走路、抓取、放置连成一串。 更值得注意的是,团队表示,部署到这个新厨房时,系统不需要额外采集训练数据,也无须再训练一套专用动作策略,泛化性是相当可以了。 看到这里,有人已经忍不住开始盘算了: 我要是有钱买台G1,再接上GPT,是不是也能……? 不过,也先别急着下单,事情还没简单到「买台机器人,登录GPT」这一步。 咱们先看看HomeBody究竟是怎么把活干起来的? 让GPT把机器人技能当工具调用 简单来说,HomeBody的核心思路可以概括为一句话: 让GPT把机器人技能当工具调用。 Astra负责理解目标、安排步骤,再调用导航、抓取、开抽屉等技能,把任务一步步做完。 不过,要让机器人去厨房拿东西,先得让它知道:厨房长什么样,东西又放在哪里。 整个过程,可以分成三步。 Step 1,先逛一圈,把厨房记下来 在HomeBody中,机器人接到的第一条指令很简单,「你是一台厨房机器人,请探索这个空间」。 随后,Astra会选择值得观察的位置,引导G1移动。机器人一边走,一边记录相机画面、激光雷达扫描,以及自身的关节姿态和途经位置。 相机负责看清房间里有什么,激光雷达等传感器提供实测的空间结构;SLAM,也就是同步定位与建图,则帮助机器人一边建立地图,一边确定自己在哪。 这些观察不会随着机器人转身就消失,而是会被保存下来,成为后续任务可以调用的空间记忆。 Step 2,把现实厨房搬进模拟器 逛完还不够,Astra接下来还要担任Real2Sim智能体,在Isaac Sim仿真平台里搭出一个数字厨房。 这个数字孪生相当于一份立体房间模型,帮助系统判断各处的位置,以及机器人与目标之间的空间关系。 为了让数字厨房不仅看起来像,HomeBody还会把SLAM测得的几何信息也交给模型,用真实测量约束重建结果。 毕竟,台面的位置、通道的宽度,都会影响机器人能不能走过去、手能不能伸到位。 随后,系统会把真实世界的定位地图与数字厨房对齐到同一个坐标系,再将拍到的画面、内容描述和对应位置关联起来。 这样一来,之前保存的画面就不只是「我见过这个抽屉」,还对应着一个可以返回的位置。 之后再找东西,机器人就能先从记忆里查线索,再走回对应地点。 Step 3,给个目标,让它自己安排动作 准备完成后,用户就可以说「收拾一下厨房」,再补充咖啡袋放哪里、哪些纸盒要扔。 Astra会结合当前画面、地图、空间记忆、手里有没有拿着东西,以及上一步的执行结果,选择接下来调用哪项技能、操作哪个目标。 前面展示的取药demo就用到了这种能力。用户虽然没说药在哪,但系统可以从保存的关键画面中找到抽屉,再把导航、开抽屉、取药等技能接起来。 GPT负责安排,身体到底谁来控制? 此前,Robocurve让GPT、Claude控制机械臂,是让模型根据相机画面和机器人状态,通过工具调用指定夹爪的位置、朝向和开合状态,再由底层模块转换成具体动作。 HomeBody同样采用工具调用,但交给GPT的是更完整的技能:导航、抓取、放置、开抽屉,以及从抽屉中取物。 要理解这两者的区别,咱们先看看机器人系统的一种常见分工: System 2是视觉语言模型(VLM),负责看图、理解指令、决定做什么; System 1是视觉语言动作模型(VLA),负责生成动作命令; System 0则是底层控制器,负责协调身体执行。 简单说,就是「安排任务—生成动作—控制身体」。 而HomeBody调整的,正是中间这一环: 让System 2直接调用技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过一个学习型VLA。 具体来说,这些技能库里装的是已经写好、可复用的电机技能(Navigate、Pick、Place、Open drawer、Pick from drawer 等)。 这些技能有统一

about image