Lecture15
\makecscover
来源审计与课程主问题
这讲课并不是在宣布“机器人领域已经有了 GPT 时刻”,而是在提出一份 2023 年的研究配方:能否把机器学习 scaling 的设计原则、不断进步的 Internet-scale language / vision models,以及大规模离线机器人数据组合起来,让真实机器人能力不再靠一项一项手工工程缓慢增长。Ted Xiao 随后用 RT-1、SayCan、Inner Monologue 和 DIAL 展示这份配方如何分别进入 skill learning、planning、feedback 与 data augmentation。
本讲如何重建
课程官网提供了录像与三篇必读论文,却没有公开独立 slide deck。因此本讲以 Stanford Online 1080p 官方录像为母版,对 screen-share 区域每两秒采样一次,从 2,284 帧中筛出 315 个高召回稳定候选,再人工去重为 45 个独立教学状态;最终按核定时间戳从 1920x1080 原视频重新提取全宽帧,避免截断幻灯片右侧。口头动机和问答来自官方 en-US 人工字幕;本地旧字幕是 4,183 条重复滚动自动字幕,已由 1,840 条非空人工 caption 替换。
| 证据层 | 本地材料 | 在讲义中的职责 |
|---|---|---|
| 官方录像 | 1:16:07 视频与 45 张恢复 teaching states | 决定课堂顺序、架构图、结果表、演示与系统地图 |
| 官方人工字幕 | lecture15.en.srt 与 timed transcript |
恢复 speaker motivation、工程取舍、问答限制与不确定性 |
| 课程必读论文 | RT-1、SayCan、Inner Monologue | 核对公式、实验定义、结果边界与模块接口 |
| 补充一手论文 | BC-Z 与 DIAL | 解释历史前驱、离线数据和 VLM relabeling |
| 审计文件 | manifest、coverage、teacher-voice ledger | 证明视觉与口述节点均有教学去向 |
历史边界
课堂日期是 2023 年 2 月 7 日。RT-2、Open X-Embodiment、PaLM-E、Gemini Robotics 及后来的 vision-language-action scaling 结果不能倒灌为课堂证据。末尾会单列现代 VLA 解读,但与 Ted Xiao 当时的主张分开。
先把相近术语分开
讲者在口头上会把 foundation model、Internet-scale model 和 LLM 宽松混用,但写成讲义时必须区分训练对象、数据来源和系统职责。下面的术语表先建立阅读坐标,后文再给公式和案例。
| 术语 | 解决的问题 | 核心机制与课程关系 |
|---|---|---|
| Foundation model | 一个模型能否复用于大量下游任务 | 依赖规模化训练、通用接口和可迁移表示;本讲把它作为目标而非既成事实 |
| Imitation learning | 没有显式 reward 时怎样从示范学 policy | 监督学习 \(p(a o,l)\);RT-1 的稳定起点 |
| Offline robot learning | 如何把采集与训练解耦 | 先收集固定数据集,再反复训练多个方法;减少真实机器人在线试错 |
| Tokenization | 如何让图像、语言与动作进入统一序列模型 | 把连续或高维输入压成离散/紧凑 token;RT-1 的互操作接口 |
| Affordance | 当前状态下某项技能是否可执行 | SayCan 用 value / success score 约束 LLM 的语言先验 |
| Closed-loop planning | 执行失败后怎样更新计划 | Inner Monologue 把 scene、clarification 与 success feedback 回灌给 planner |
| Vision-language model | 怎样用 Internet-scale visual semantics 改写 robot data | DIAL 用 VLM 生成更丰富语言标签,而不是直接控制机器人 |
四个贯穿全讲的问题
读后续系统时应持续追问:机器人数据到底缺数量还是缺多样性;Transformer 的价值来自参数规模还是统一 token interface;LLM 提出的动作怎样被物理可执行性约束;反馈和语言标签又怎样改变下一轮 policy。只有把四个问题放在同一条系统链上,才能看清四篇工作不是互不相干的 demo。
本讲的系统论命题
机器人 foundation model 的难点不只是训练一个更大网络,而是让技能数据、实时控制、语言规划、环境反馈和语义标签拥有可组合接口。Language 在这份 2023 recipe 中更像“universal glue”:连接模块,但不能替代每个模块的物理 grounding。
本章小结
本讲使用官方录像、人工字幕和五篇一手论文重建,并把“研究 recipe”与“已证明 foundation model”严格区分。接下来先理解机器人为什么向往 emergence 与 homogenization,再讨论物理世界为何成为最后一块难倒的 domino。
为什么机器人也想要 Foundation Model
语言和视觉领域已经展示规模化训练带来的复用能力,机器人却仍常为每个任务单独采集、训练和调参。开场的标题与实验室 montage 把这个落差视觉化:机器人能完成许多漂亮演示,但能力增长仍像一组彼此割裂的项目,而不是一条可持续扩展的统一曲线。
从一组机器人 Demo 到一个 Scaling 问题
标题 slide 把方向命名为 “Towards a Robotics Foundation Model”,其中 Towards 比 Foundation Model 更重要。第二张 montage 展示多台机械臂在不同厨房、物体和任务上的经验,提示真实世界控制已经有大量局部能力;真正的问题是这些经验能否被一个可扩展系统共同吸收。
\lecturefigure{slide-01-title.jpg}{Towards a Robotics Foundation Model:课堂研究议程而非完成声明}{官方录像恢复幻灯片 V001;Stanford CS25 Lecture 15}
\lecturefigure{slide-02-robot-experience-montage.jpg}{真实机器人经验的多样性:不同厨房、物体、动作与 embodiment}{官方录像恢复幻灯片 V002;Stanford CS25 Lecture 15}
\teachervoice{Ted Xiao 一开始把这场课描述为自己对未来方向的“尝试理解”。他的目标是问机器人能力能否从线性、项目式进步转为更快的复合增长,而不是声称今天已经出现可验证的通用机器人 emergence。}
课堂路线:Ingredient、System、Feedback、Data
Agenda 先讲三类 ingredient,再依次进入 RT-1、SayCan、Inner Monologue 和 DIAL。这个顺序对应一台完整机器人:RT-1 学低层技能,SayCan 组合技能,Inner Monologue 根据反馈重规划,DIAL 扩展离线数据的语言覆盖,最后再把各层拼回系统地图。
\lecturefigure{slide-03-agenda-foundation.jpg}{课程路线:从 foundation-model ingredients 到四个机器人系统案例}{官方录像恢复幻灯片 V003;Stanford CS25 Lecture 15}
Emergence 与 Homogenization 的吸引力
Foundation model 对机器人最有吸引力的两点是 \term{emergent capabilities} 与 \term{homogenization}。前者指规模增加后出现小模型不可见的复杂能力;后者指同一个表示和训练接口能够服务组合式下游任务。slide 4 左侧借用语言模型 emergence plots,右侧用“房间—建筑—世界”示意机器人状态空间的巨大跨度。
\lecturefigure{slide-04-why-foundation-model.jpg}{为什么想要 robotics foundation model:emergence 与 downstream homogenization}{官方录像恢复幻灯片 V004;Stanford CS25 Lecture 15}
读图:这不是机器人 scaling curve
左下曲线来自语言模型任务,用来说明能力可能在 scale 后显现;右侧椭圆只是机器人环境覆盖的概念图。它们共同提出假设:机器人也许需要跨过某个数据、任务与模型规模,才会出现更强组合泛化。课堂没有给出机器人自己的临界点,因此不能把这张图当成已验证 law。
\teachervoice{有学生当场问“机器人 foundation model 是否已经存在”。讲者的回答是还不清楚,并进一步说,机器人领域也许需要先看到自己的 emergent-capability curve,才有资格把系统称为 foundation model。}
为什么机器人是最后一块 Domino
语言、图像、代码和音乐可以从互联网获得巨大静态语料,机器人数据却要求真实设备与世界交互。每条轨迹包含硬件时间、操作员成本、安全风险、物体布置和长时状态变化。Domino slide 因此不是说 robotics 没有进展,而是说它缺少与 web-scale token 同样便宜、可复制的数据生产机制。
\lecturefigure{slide-05-why-not-foundation-model.jpg}{Why not:物理交互使 robotics 成为最难倒下的 foundation-model domino}{官方录像恢复幻灯片 V005;Stanford CS25 Lecture 15}
“更多数据”不是一句可执行建议
机器人 episode 的价值取决于新增了什么:新任务、新物体、新背景、新 embodiment、新语言还是同一动作的重复。若只增加容易场景的重复轨迹,成本上升却不一定扩大行为覆盖;后面的 RT-1 曲线会直接验证 task diversity 的重要性。
把愿景拆成三种 Ingredient
与其直接训练一个巨型机器人模型,讲者先把问题拆成三类可操作 ingredient:借鉴 ML scaling 的 architecture / tokenization;利用外部 Internet-scale models 的 language 与 common-sense priors;把机器人学习从昂贵在线试错转向可复用的大型 offline datasets。
\lecturefigure{slide-06-ingredients-overview.jpg}{机器人 foundation-model recipe 的三类原料}{官方录像恢复幻灯片 V006;Stanford CS25 Lecture 15}
三类 Ingredient 不能互相替代
高容量架构解决表示与互操作问题,外部 foundation models 提供语义 prior,offline robot data 提供真实动作与接触动力学。只有语言没有执行能力,只有机器人轨迹没有语义覆盖,只有大模型没有实时预算,都会让系统停在某一层。
本章小结
机器人向往 foundation model,是因为 emergence 与 homogenization 能把局部技能变成可复用能力;物理数据的昂贵和异质性又使这条路不能照搬互联网训练。课堂于是把愿景拆为架构、外部 prior 和离线数据三种原料。
从 Online Robot Learning 到 Offline Recipe
这一章把三种原料逐一展开,并用 Google Brain 六年机器人研究史解释为什么团队最终选择 multi-task imitation。关键转变不是放弃在线学习,而是先让数据成为独立基础设施,使多个算法能够反复消费同一批真实经验。
Ingredient 1:Scaling-Friendly Architecture
第一类原料来自语言和视觉 scaling:高容量 network、self-attention、更多 compute/data、tokenization 和模块互操作。Transformer 的价值不只在 attention 公式,而是它提供一种统一序列接口,使图像历史、语言指令和动作都能进入同一 autoregressive model。
\lecturefigure{slide-07-ingredient-ml-scaling.jpg}{Ingredient 1:从 ML scaling 借鉴 architecture、compute、data 与 tokenization}{官方录像恢复幻灯片 V007;Stanford CS25 Lecture 15}
Tokenization 的机器人含义
在 NLP 中 token 通常是离散子词;在 RT-1 中,图像先变成紧凑视觉 token,连续控制量被量化成 action tokens。统一 token interface 允许复用 Transformer,但量化误差、序列长度和实时解码成本会成为新的工程约束。
Ingredient 2:借用 Internet-Scale Models
第二类原料不要求机器人团队从零训练语言或视觉语义。外部模型会在自身领域持续变好,可以提供 common sense、语言理解、视觉类别和可组合表示。对机器人而言,这些模型最适合做 planner、captioner、labeler 或 representation provider,而不是在没有 grounding 时直接输出 motor command。
\lecturefigure{slide-08-ingredient-internet-models.jpg}{Ingredient 2:利用不断进步的 Internet-scale generative models}{官方录像恢复幻灯片 V008;Stanford CS25 Lecture 15}
\teachervoice{讲者把这一点称为“Bitter Lesson 2.0”:不只选择会随 compute 变好的算法,还要把机器人接口设计成未来更强 foundation model 可以直接插入。今天的语言模型不是终点,系统应当吃到明天模型进步的红利。}
Ingredient 3:Robotics 从 Online 转向 Offline
第三类原料是数据制度。在线 RL 在机器人上需要边执行边学习,失败会损坏设备或浪费操作时间;offline learning 则先固定数据集,再用同一批 trajectories 训练和比较多个模型。slide 9 把 The Pile、LAION 等离线语料与机器人传统 online / on-policy 学习并置,强调数据消费方式的差异。
\lecturefigure{slide-09-ingredient-offline-data.jpg}{Ingredient 3:foundation models 消费巨型离线语料,而机器人长期依赖在线采集}{官方录像恢复幻灯片 V009;Stanford CS25 Lecture 15}
设离线示范数据为 \(\mathcal{D}=\{(o_t,l,a_t)\}\),其中 \(o_t\) 是观测、\(l\) 是语言任务、\(a_t\) 是专家动作。最直接的 behavioral cloning 目标是
它把控制学习化成监督学习,稳定而容易扩展;但 policy 一旦偏离专家轨迹,就会遇到训练分布没有覆盖的状态,这也是 offline imitation 的根本限制。
六年历史:从 End-to-End 到 Multi-Task
历史 slide 把 2016--2020 的 goal conditioning、QT-Opt、sim2real 和大规模真实机器人 RL,与 2020--2022 的 BC-Z、IL+RL、MT-Opt 等多任务系统连接起来。它不是完整综述,而是团队内部问题的变化:先问“端到端机器人能否学会一个任务”,再问“如何在更复杂场景中扩展到许多任务”。
\lecturefigure{slide-10-google-robotics-history.jpg}{Google Brain robotics 历史:从单任务端到端学习到多任务数据与策略}{官方录像恢复幻灯片 V010;Stanford CS25 Lecture 15}
\lecturefigure{slide-11-online-to-offline-shift.jpg}{六年转向:从 online methods 到 offline multi-task imitation}{官方录像恢复幻灯片 V011;Stanford CS25 Lecture 15}
\teachervoice{在学生询问“24/7 robot farm 是否足够”时,讲者强调机器人小时数不是唯一尺度。如果全天采集的都是同一类动作和场景,数据量增加却不扩展 task diversity;真正稀缺的是覆盖新的 failure mode 与组合变化。}
BC-Z 在课程中的位置
BC-Z 使用语言或人类视频作为 task conditioning,在约百种 manipulation tasks 上训练 multi-task imitation policy,并测试 zero-shot task combinations。它证明 templated language 足以充当任务接口,也暴露 ResNet policy 对训练分布和新场景的敏感性,为 RT-1 提供数据与架构起点。
把 Ingredient 变成 Recipe
最终配方把三列原料和 lessons 对齐:高容量 architecture / tokenization;可替换、持续变强的 external models;大量且多样的离线机器人数据。底部句子将它们压缩为“large diverse offline datasets + high-capacity architectures + language as universal glue”。
\lecturefigure{slide-12-foundation-recipe.jpg}{Turning Ingredients into a Recipe:架构、外部模型与离线数据的组合}{官方录像恢复幻灯片 V012;Stanford CS25 Lecture 15}
Data Generation 与 Data Consumption 解耦
在线系统常为某个算法定制采集流程,算法改变就要重新跑机器人;offline recipe 把轨迹变成长期资产,使 RT-1、未来 RL 或不同 architecture 都能消费同一数据。解耦不会消除 distribution shift,却显著降低迭代成本并提高可复现性。
本章小结
课堂 recipe 的核心不是“Transformer 万能”,而是统一接口与数据制度:tokenization 让多模态进入同一模型,外部 foundation models 提供可替换 prior,offline datasets 让采集和训练解耦。RT-1 接下来会把这些原则放入严格的实时控制预算。
RT-1:把多任务模仿学习写成实时 Transformer
RT-1 的设计不是从模型榜单开始,而是从一组现实约束倒推:已有 130,000 条示范需要被利用,新数据采集昂贵,通用 vision backbone 太慢,task 是语言条件,机器人还必须以稳定频率闭环控制。架构只有同时满足吞吐、时序、动作精度与泛化才有意义。
从 Agenda 进入 Skill Learning
Agenda 将 RT-1 放在第一项系统案例,因为所有高层 planner 最终都要调用可执行 skill。若低层 policy 只能完成三种动作,再强的 LLM 也只能对三种动作重新排列;因此课程先扩大 skill library,再讨论语言如何组合它们。
\lecturefigure{slide-13-agenda-rt1.jpg}{Agenda:RT-1 作为机器人 foundation-model recipe 的 skill-learning 层}{官方录像恢复幻灯片 V013;Stanford CS25 Lecture 15}
First Principles:约束先于 Architecture
slide 14 汇总三类输入约束。模型必须 robust / generalize;off-the-shelf vision models 不能满足真实世界实时推理;数据带 language conditioning,需要 multi-modality。右侧 lesson 把这些约束映射为 attention 与 tokenization,而不是先选一个大 Transformer 再寻找应用。
\lecturefigure{slide-14-rt1-first-principles.jpg}{RT-1 first principles:鲁棒性、实时视觉与语言条件共同决定架构}{官方录像恢复幻灯片 V014;Stanford CS25 Lecture 15}
实时控制不是平均 latency
机器人控制关注 tail latency 和节拍稳定性。一次偶发长延迟可能让夹爪错过物体或控制器使用过时图像;因此论文中的 compact backbone、TokenLearner 和 decoder 设计不仅是省 FLOPs,更是在保护闭环时序。
RT-1 Architecture:图像、语言与动作 Token
RT-1 输入六帧图像历史和语言指令。图像经过 FiLM-conditioned EfficientNet 与 TokenLearner 压缩,再与语言条件一起进入 decoder-only Transformer,输出离散化动作 token。模型按自回归方式预测控制维度,使多模态控制可以写成统一序列 likelihood。
\lecturefigure{slide-15-rt1-architecture.jpg}{RT-1 架构:FiLM EfficientNet、TokenLearner、Transformer 与 action tokens}{官方录像恢复幻灯片 V015;Brohan et al., 2022}
若把输入序列写成 \(x=(x_1,\ldots,x_n)\),其中包含 visual、language 和 action tokens,自回归目标为
训练时只对 action token 计算主要控制损失,视觉和语言提供条件。这里的统一并不意味着三种模态信息量相同;TokenLearner 正是为了把图像的高维 patch 序列压到实时可处理范围。
Action Discretization 与 3 Hz Budget
连续动作维度被映射到 256 个 bins。若某一维动作 \(a\in[a_{\min},a_{\max}]\),可用
得到离散 token,推理后再映射回连续控制。量化把多维回归变成 categorical prediction,便于 Transformer 解码,但也引入有限精度和多维 token 依赖。
\lecturefigure{slide-16-rt1-design-takeaways.jpg}{RT-1 design takeaway:100 ms 推理、六帧历史、81→8 patch、256 bins、35M 参数}{官方录像恢复幻灯片 V016;Stanford CS25 Lecture 15}
读图:三个不同时间尺度
控制循环约 3 Hz,即每步约 333 ms;模型前向预算约 100 ms,为传感、通信与执行留下空间;六帧历史只覆盖很短时间窗口,用于判断运动趋势而非长期任务记忆。35M 参数是实时部署权衡,不能与后来离线大 VLM 的参数量直接比较。
\teachervoice{讲者反复回到 context length:若把每帧所有 image patches 都送入 Transformer,序列会立刻爆炸。TokenLearner 只保留当下任务相关的少量视觉 token,是“能够在机器人上跑起来”的必要条件,而不是可有可无的压缩技巧。}
for observation_history, instruction, expert_action in dataset:
image_features = film_efficientnet(observation_history, instruction)
visual_tokens = token_learner(image_features, output_tokens=8)
language_tokens = sentence_encoder(instruction)
action_tokens = discretize(expert_action, bins=256)
context = concat(language_tokens, visual_tokens)
loss = autoregressive_action_loss(transformer, context, action_tokens)
update(loss)
def act(observation_history, instruction):
context = encode(observation_history, instruction)
predicted_tokens = transformer.decode(context)
return undiscretize(predicted_tokens)
本章小结
RT-1 把多任务 imitation 写成 tokenized autoregressive control,但它的关键贡献同样是 resource accounting:六帧历史、TokenLearner 压缩、35M 参数和动作量化共同满足实时闭环。下一章要检查这些设计是否真的换来跨任务和跨场景泛化。
RT-1 的 Scaling 与 Generalization 证据
训练任务上的平均 success rate 不能说明机器人能否进入新厨房、忽略 distractor 或组合未见指令。RT-1 因此沿 seen tasks、unseen tasks、distractors 和 backgrounds 四个轴评估,并进一步测试多个变化因素同时出现时的性能。
Visual 与 Semantic Diversity
上一章只证明 RT-1 能在实时约束下执行多任务控制,还没有回答这些能力是否依赖训练厨房、固定物体与模板指令。本节先把 generalization 拆成四种可区分的分布变化;读图时应分别比较 seen、unseen、distractor 与 background 条件,而不是只看最高柱或总体平均。这里的结果能支持相对 baseline 的优势,却不能证明模型获得了开放世界语义理解。
slide 17 左侧四组柱子比较 RT-1、GATO、BC-Z 与 BC-Z XL,右侧展示背景、物体和干扰变化。RT-1 在四组条件下整体更强,但 unseen / background 条件仍明显低于 seen tasks,说明“最好 baseline”不等于已经解决开放世界泛化。
\lecturefigure{slide-17-rt1-visual-semantic-diversity.jpg}{RT-1 在 seen、unseen、distractor 与 background 变化上的成功率}{官方录像恢复幻灯片 V017;Brohan et al., 2022}
读图:四根柱子测的是不同失败模式
Seen tasks 主要检验训练分布拟合;unseen tasks 检验语言与行为组合;distractors 检验注意力是否被无关物体带偏;backgrounds 检验视觉分布变化。四项不能压成一个平均数,因为不同 architecture component 对不同轴的贡献不同。
多因素变化比单因素更难
前一张图把变化因素逐项隔离,便于定位模型在哪一类 shift 上退化;真实部署却很少一次只改变一个变量。本节因此转向 compound shift,问题是背景、布局、物体位置、视角和语言同时变化时,单因素优势能否继续保持。看图时先比较 level 1 到 level 3 的递进下降,再观察 unseen kitchen 的具体差异;这组演示说明联合变化更难,但不能把少量成功案例当作任意新环境都可迁移的证据。
slide 18 把柱状结果与 unseen kitchen 视频并排:机器人不仅换背景,还可能同时遇到新物体位置、不同桌面、语言变化和视角差异。stacked bars 的 level 1/2/3 表示越来越多因素同时变化,RT-1 虽领先,但最高难度成功率仍有限。
\lecturefigure{slide-18-rt1-variation-unseen-kitchen.jpg}{多因素 generalization:在 unseen kitchen 中同时改变背景、布局和任务}{官方录像恢复幻灯片 V018;Stanford CS25 Lecture 15}
第二个 demo 使用自然语言变体,例如不再重复训练模板,而以更自由的描述要求机器人行动。它展示 language conditioning 的价值,也暴露任务语义仍依赖已有 skill coverage:模型可以理解换一种说法,却不能凭语言创造训练数据从未包含的物理能力。
\lecturefigure{slide-19-rt1-language-variation-demo.jpg}{语言变化演示:在多因素视觉变化中执行不同措辞的任务}{官方录像恢复幻灯片 V019;Stanford CS25 Lecture 15}
\teachervoice{讲者把这些视频当作定量图的补充,而不是“挑最好案例”。他反复提醒多因素 generalization 远难于单变量测试;机器人在新厨房工作几次,并不等于已经学会任意家庭环境。}
跨 Distribution 的数据混合
RT-1 还混入 simulation / sim-to-real、bin-picking 和不同 embodiment 数据。图中左侧是数据来源,右侧柱状条报告它们对 targeted evaluations 的相对改善。这里的结论是高容量模型能从异质数据中提取共享信息,而不是所有数据无条件正迁移。
\lecturefigure{slide-20-rt1-diverse-data-distributions.jpg}{训练在多种 data distributions:everyday robots、simulation 与 bin picking}{官方录像恢复幻灯片 V020;Stanford CS25 Lecture 15}
Data interoperability 有边界
不同机器人拥有不同相机、动作空间和动力学。若没有 embodiment identifier、action normalization 或共享语义,简单拼接数据会产生冲突。RT-1 的结果是“部分异质数据可以帮助特定分布”,不是“任意 robot dataset 都能直接合并”。
Task Diversity 比 Raw Size 更关键
data scaling slide 的横轴是保留的数据比例,纵轴是 success rate;蓝点是 seen tasks,黑点是 generalization。绿色箭头表示减少总数据量,紫色箭头表示在保留较多 episode 的同时减少 task diversity。后者导致的下降更陡,说明重复同一任务不能替代覆盖更多任务。
\lecturefigure{slide-21-rt1-data-scaling.jpg}{Scaling with data:减少 task diversity 比等量减少 episode 更伤泛化}{官方录像恢复幻灯片 V021;Brohan et al., 2022}
机器人数据的四个“规模”
- Episode count:轨迹总数;
- Task diversity:不同技能与目标组合;
- Environment diversity:背景、布局、物体与 lighting;
- Embodiment diversity:不同机器人和 action space。
“数据更大”只有说明是哪一种规模,才具有工程意义。
Ablation:不是单一 Transformer 效应
ablation 图以完整 RT-1 为零点,向下表示成功率损失。GATO、BC-Z、BC-Z XL、去掉大模型、去掉 pretraining、改连续/自回归 action、去掉 history 或 Transformer,分别在四种评价轴产生不同下降。结果说明 architecture、pretraining、history 和 action representation 都参与性能,而非只靠参数量。
\lecturefigure{slide-22-rt1-design-ablations.jpg}{RT-1 design ablations:各组件对四类 generalization 的相对影响}{官方录像恢复幻灯片 V022;Brohan et al., 2022}
读图:不要只找最长的柱
每种颜色对应不同 evaluation axis,某组件可能主要帮助 unseen tasks,却对 seen tasks 影响较小。w/o transformer 或 w/o pretraining 的损失不能被单独解释为 causal law,因为替代结构、训练稳定性与容量可能同时改变。Ablation 的价值是定位脆弱轴,而不是给组件排绝对名次。
本章小结
RT-1 的证据显示 Transformer-style token interface 能在实时预算下提升多任务控制与多个泛化轴,但能力仍随场景复杂度下降。最强数据结论是 task diversity 高于简单 episode repetition;最强系统结论是多组件共同作用,不能把成功归因于“用了 Transformer”一句话。
SayCan:让 LLM 计划,让 Affordance 决定能不能做
RT-1 扩展了 skill library,却没有回答“给我清理桌面”怎样被拆成多步技能。SayCan 把语言模型当作 high-level planner,同时用机器人 value / affordance model 约束每一步是否在当前状态可执行,从而连接 Internet-scale common sense 与 grounded control。
从 Skill Learning 转向 Planning
Agenda 的第三项进入 SayCan。课堂 timeline 随后把 2021--2022 的 multi-task robot policies 与 2022--2023 的 LLM-powered planning 连接起来:低层动作仍来自 robot data,高层组合开始借用语言模型。
\lecturefigure{slide-23-agenda-saycan.jpg}{Agenda:SayCan 进入 language-conditioned planning 层}{官方录像恢复幻灯片 V023;Stanford CS25 Lecture 15}
\lecturefigure{slide-24-robotics-foundation-timeline.jpg}{机器人研究 timeline:从 scale real operations 到用 LLM 加速机器人系统}{官方录像恢复幻灯片 V024;Stanford CS25 Lecture 15}
两个问题:Fixed Commands 与 No Grounding
第一,机器人只能调用有限技能集合,例如 find apple、pick apple、go table;LLM 必须学会“说机器人语言”。第二,LLM 没有摄像头和动力学,不知道苹果是否存在、夹爪是否能抓到;系统必须给语言先验加 physical affordance grounding。
\lecturefigure{slide-25-language-models-robotics-challenges.jpg}{Language models for robotics:固定 skill vocabulary 与缺少 real-world grounding}{官方录像恢复幻灯片 V025;Stanford CS25 Lecture 15}
Planner 不能创造不存在的 Skill
LLM 可以把目标分解得很漂亮,但若 low-level library 没有“开抽屉”或“擦拭液体”,planner 只能输出不可执行文本。系统上限由 grounded skills 的覆盖决定,这也是讲者在 Q&A 中明确指出的 SayCan bottleneck。
SayCan Score:Useful 与 Possible 的乘积
对候选技能 \(k\)、高层目标 \(g\) 和当前状态 \(s\),SayCan 可写成
其中 \(h\) 是已执行步骤。第一项问“这一步对完成语言目标是否有用”,第二项问“机器人现在是否做得到”。在 log space 中两者相加,避免某个语言上合理但物理上不可能的动作占据首位。
\lecturefigure{slide-26-saycan-architecture.jpg}{SayCan:LLM usefulness 与 robotic affordance 联合选择下一项技能}{官方录像恢复幻灯片 V026;Ahn et al., 2022}
读图:候选排序而不是自由生成控制
中间表列出 find apple、pick apple 等技能。LLM 分数偏好符合目标的步骤,affordance 分数过滤当前不可执行项,系统选择 combined score 最高者,执行后重新排序。低层 controller 不由 LLM token 直接驱动。
实验:Planning 与 Execution 分开计分
架构图说明了 SayCan 如何联合 usefulness 与 affordance,但还需要区分“计划在语言上合理”与“机器人最终完成任务”这两个不同命题。本节用独立指标检查高层排序和低层执行各自贡献;读结果时应先比较 planning 与 execution 的差距,再看移除 grounding 的 ablation。实验能够证明环境可执行性评分不可缺少,却不能单凭总体成功率判断剩余失败究竟来自感知、控制还是 skill coverage。
课堂报告 101 条 long-horizon instructions,规划成功率约 84%,执行成功率约 74%,并要求连续组合十个以上 navigation / manipulation skills。去掉 grounding 后性能接近减半,说明语言 plausibility 不能替代环境可执行性。
\lecturefigure{slide-27-saycan-experiment-results.jpg}{SayCan experiment overview:84% planning、74% execution 与 grounding ablation}{官方录像恢复幻灯片 V027;Ahn et al., 2022}
Planning Success 不等于 Task Success
一个步骤序列可以语义正确,却因感知、抓取或导航失败而无法执行。分开报告 planning 与 execution 能定位瓶颈;若只报最终任务率,就无法判断失败来自 LLM、affordance model 还是 low-level skill。
PaLM-SayCan:外部模型进步如何传导
slide 28 横轴是 language model size,纵轴是 planning performance。PaLM-SayCan 随模型规模上升而改善,说明在机器人数据不变时,外部 LLM 进步可以通过 planner 接口传导到系统。蓝色 FLAN-SayCan 点也提醒 instruction tuning 与模型家族会混入 scale 对比。
\lecturefigure{slide-28-palm-saycan-scaling.jpg}{PaLM-SayCan:更强 LLM 提升高层规划表现}{官方录像恢复幻灯片 V028;Stanford CS25 Lecture 15}
更好的 prompt 和 chain-of-thought 还能处理“找一种不是苹果的水果”或多步骤清理请求。右侧示例把自然语言解释转成可调用技能序列,展示 LLM 的语义 decomposition;但每个序列仍要经过 affordance score 才能进入机器人。
\lecturefigure{slide-29-palm-saycan-prompting.jpg}{PaLM-SayCan prompting:CoT 与更强提示生成多步技能序列}{官方录像恢复幻灯片 V029;Stanford CS25 Lecture 15}
\teachervoice{讲者最看重 SayCan 的“leverage”:不重新采集机器人轨迹,只替换更好的 LLM 或 prompt,规划能力就能上升。但他同样强调,这种 leverage 只作用于 skill selection,不能补上 low-level controller 根本不会的动作。}
本章小结
SayCan 用 LM usefulness 与 affordance probability 的乘积连接语言先验和物理执行。它证明外部 LLM 进步能传导到机器人 planning,也把系统上限暴露得很清楚:grounded skill library、affordance model 和低层执行仍是不可跳过的瓶颈。
Inner Monologue:从 Open Loop 到 Feedback-Conditioned Replanning
SayCan 每一步会重新选择技能,却可能不知道上一步是否成功。若机器人没抓到可乐仍继续“拿给用户”,高层计划在语言上连贯、在世界中却已经失效。Inner Monologue 为 planner 增加 scene description、clarification 和 success detector,让语言推理真正闭环。
Agenda 与 Open-Loop Failure
Agenda 进入 Inner Monologue。下一张 slide 用失败轨迹说明问题:用户要一杯饮料,planner 选择可乐;抓取失败后,系统仍按原序列继续移动并宣告完成。缺少 observation feedback 时,CoT 只是 open-loop script。
\lecturefigure{slide-30-agenda-inner-monologue.jpg}{Agenda:从 SayCan 转向带环境反馈的 Inner Monologue}{官方录像恢复幻灯片 V030;Stanford CS25 Lecture 15}
\lecturefigure{slide-31-saycan-open-loop-failure.jpg}{Open-loop failure:抓取可乐失败后,planner 仍继续执行旧计划}{官方录像恢复幻灯片 V031;Huang et al., 2022}
具身 Planning 必须维护可更新状态
语言计划隐含一个 belief:桌上有什么、机器人拿到了什么、用户偏好是什么、当前子目标是否完成。任何 action 后都可能改变 belief。若系统不读取新观测,后续 token 再合理也只是对过期世界状态的推理。
Passive Scene Description
上一小节的失败轨迹表明,open-loop planner 即使生成了合理步骤,也会在一次抓取失败后继续沿过期计划前进。最直接的修复不是立刻改变 planner,而是先让环境状态持续回到语言上下文。本节考察 passive feedback 如何把检测结果和任务进展压缩成文本;看图时要同时关注它提供了哪些状态,以及哪些物理事实因 detector ontology 不足而被丢弃。
被动反馈由 detector 或 VLM 持续写入,例如“我看到一罐可乐和一瓶青柠汽水”“黄色积木已在黄色碗中”。这些描述把高维图像压成 planner 可消费的文本状态,使 LLM 在每步后知道世界是否发生预期变化。
\lecturefigure{slide-32-inner-monologue-passive-feedback.jpg}{Passive feedback:object detection、task-progress description 与 visual QA}{官方录像恢复幻灯片 V032;Huang et al., 2022}
Passive feedback 的信息瓶颈
Scene caption 只保留 detector 会表达的概念。若系统没有“杯子倾倒”“液体泄漏”或“夹爪空了”的标签,planner 看不到这些事实。文本化降低接口复杂度,也把 perception ontology 变成上限。
Active Scene Description 与 Clarification
主动反馈只在 planner 不确定时请求,例如询问用户偏好、澄清指令或查询物体位置。slide 33 把 active scene description 与 visual QA in context 放在一起:机器人可以问“你想要哪种饮料”,再根据回答更新计划,而不是在不确定条件下猜测。
\lecturefigure{slide-33-inner-monologue-active-feedback.jpg}{Active feedback:只在需要时询问用户、环境或视觉问答模块}{官方录像恢复幻灯片 V033;Huang et al., 2022}
若把文本 belief 记为 \(b_t\),执行观测为 \(o_{t+1}\),success signal 为 \(z_{t+1}\),用户反馈为 \(u_{t+1}\),闭环更新可抽象为
与 open-loop plan 不同,每一步选择都基于更新后的 belief。
Success Detector 与结果表
结果 slide 上半部比较 CLIPort、oracle、LLM、object feedback 与 Inner Monologue 等组合,下半部给出具体对话和 task-progress detector。读表时应先区分 seen / unseen tasks,再比较只加 object feedback、只加 success feedback 与二者结合的差异。
\lecturefigure{slide-34-inner-monologue-results.jpg}{Inner Monologue results:object feedback、success detector 与闭环 replanning}{官方录像恢复幻灯片 V034;Huang et al., 2022}
Feedback 不是自动真实
Success detector 可能误报,scene description 可能漏物体,用户回答也可能含糊。Closed loop 只是让错误有机会被纠正;若反馈模型系统性偏差,planner 会在错误 belief 上反复自洽。
Importing Common Sense 的边界
最后一张 slide 用 2018 年“机器人瓶颈是 high-level semantic planning”的说法,与 2022 年 LLM 的“no”形成对比。下方 lesson 更准确:若 language 是系统 universal API,foundation models 可以注入 common sense。它降低高层语义规划成本,却没有消除 perception、skill 和 control bottlenecks。
\lecturefigure{slide-35-foundation-common-sense-lesson.jpg}{利用 foundation models 注入 common sense,但不替代物理系统}{官方录像恢复幻灯片 V035;Stanford CS25 Lecture 15}
\teachervoice{讲者没有把 LLM 说成机器人“大脑”。他的论点是 language interface 使外部模型的 common sense 能进入已有系统;如果 detector、affordance 或 controller 不提供正确接口,LLM 再强也没有可操作的世界状态。}
belief = describe_scene(initial_observation)
history = []
while not task_complete(belief):
candidates = language_model.propose_skills(goal, belief, history)
scored = []
for skill in candidates:
useful = language_model.score(skill, goal, history)
possible = affordance_model.score(skill, belief)
scored.append((useful * possible, skill))
skill = max(scored)[1]
outcome = execute(skill)
feedback = collect_scene_success_and_user_feedback(outcome)
belief = update_belief(belief, feedback)
history.append((skill, feedback))
本章小结
Inner Monologue 把语言 planning 从 open-loop sequence 变成 observation-conditioned loop。Passive scene、active clarification 和 success detection 提供不同反馈通道;系统能力仍受 perception ontology 和 detector reliability 限制,但至少能在世界偏离计划时重新规划。
DIAL:用 VLM 扩展 Offline Dataset 的语言覆盖
RT-1 证明大规模离线模仿可行,却暴露数据经济问题:130,000 episodes、13 台机器人、17 个月、约 700 tasks,还需要把结构化 teleoperator command 改写成自然语言。DIAL 不重新采集动作,而是用 VLM 为已有轨迹生成更丰富 instruction labels。
Agenda 与 Teleoperation Cost
RT-1 的 scaling 结果容易让人把注意力集中在 architecture,却忽略每条 robot trajectory 背后的采集和语言标注成本。DIAL 的出发点正是重新核算这条数据供应链:哪些步骤必须由机器人和操作员完成,哪些语义工作可以交给预训练视觉语言模型。本节先读懂原始 pipeline 的两层人工成本;这些数字解释了扩展瓶颈,但不能直接推出自动标签具有与人工标签相同的精度。
Agenda 进入 DIAL。slide 37 将原始数据链拆成两条:操作员用结构化命令采集动作,crowd worker 再把命令改成自然语言。两层人工成本使每增加一个 semantic concept 都很昂贵,也让绝大多数轨迹只有模板式标签。
\lecturefigure{slide-36-agenda-dial.jpg}{Agenda:DIAL 进入 data augmentation 层}{官方录像恢复幻灯片 V036;Stanford CS25 Lecture 15}
\lecturefigure{slide-37-rt1-teleoperation-cost.jpg}{RT-1 数据经济:130k episodes、13 robots、17 months、700 tasks 与人工语言标注}{官方录像恢复幻灯片 V037;Stanford CS25 Lecture 15}
\teachervoice{讲者把 DIAL 的动机讲得很务实:RT-1 的“secret ingredient”不是某个 fancy layer,而是昂贵且长期的数据工程。若只讨论模型而不讨论谁在遥操作、谁在重标注,就无法解释机器人 scaling 的真实成本。}
四阶段 Pipeline
DIAL 先在小规模 crowd-sourced instructions 上 fine-tune VLM;再用它为大规模 offline dataset 生成语言;随后将原始轨迹、人类标签和 VLM 标签混合训练 language-conditioned policy;最后用训练中未出现的自然语言评估 RT-1-style controller。
\lecturefigure{slide-38-dial-pipeline.jpg}{DIAL 四阶段:少量人类语言、VLM relabeling、混合训练与 unseen instruction evaluation}{官方录像恢复幻灯片 V038;Xiao et al., 2022}
令 \(\mathcal{D}_A\) 为少量人工自然语言标签,\(\mathcal{D}_B\) 为大量原始结构化轨迹,\(\hat{\mathcal{D}}_B\) 为 VLM 重标后的轨迹,则 policy 目标可写成
关键不在公式复杂度,而在 \(l\) 的支持集被扩展:同一行为可以获得空间关系、属性、同义表达和更自然的描述。
Language Space 从 Cluster 走向覆盖
左侧 embedding clusters 来自结构化命令,颜色和簇边界非常清楚,因为每个模板近似 one-hot task ID;右侧 DIAL predictions 更连续,不同表达在语义空间中互相穿插。中间例子显示 open top drawer、move bottle near chip bag 等轨迹如何被改写成更描述性的语言。
\lecturefigure{slide-39-dial-language-clusters.jpg}{Structured commands 与 DIAL predicted language 的 embedding-space 对比}{官方录像恢复幻灯片 V039;Xiao et al., 2022}
稠密 Language Space 有什么用
模板标签只告诉 policy “任务编号”,难以共享 left、lonely object、颜色、形状等概念。更丰富语言让不同任务在词义层面重用表示,并允许测试时用训练未见的 paraphrase 指定同一动作。代价是 VLM 会产生噪声甚至错误描述。
Novel Instructions:看总体,也看类别
结果 slide 左侧比较不同 dataset mixtures,右侧展示 raise the leftmost can、move the lonely object to the others、move the right apple to the left 等未见指令。完整 DIAL 在 overall 上达到 60%,其中 spatial 与 rephrased categories 较强,semantic category 仍明显更难。
\lecturefigure{slide-40-dial-novel-instruction-results.jpg}{DIAL novel-instruction evaluation:数据组合、类别结果与定性示例}{官方录像恢复幻灯片 V040;Xiao et al., 2022}
60% 不等于开放语言控制
测试包含六十余条手工构造 novel instructions,覆盖空间、改写和部分语义变化,但不是任意自然语言。讲者还明确说 compositional generalization 的系统 ablation 不完整,许多成功案例的内部机制并不清楚。
Takeaway:Diversity 足够时,少量 Label Noise 可容忍
DIAL takeaways 有三点:把 VLM 当 data augmentation;把 Internet-scale priors 注入 offline data;当 dataset 足够大且行为多样时,少量标签噪声可能仍可接受。最后一点不是说 label quality 无关,而是冗余轨迹和多样语义能缓冲部分错误。
\lecturefigure{slide-41-dial-takeaways.jpg}{DIAL takeaways:VLM augmentation、Internet priors、offline diversity 与有限 label noise}{官方录像恢复幻灯片 V041;Stanford CS25 Lecture 15}
\teachervoice{Ted Xiao 对“label noise okay”非常谨慎:噪声过高仍会伤害训练,且机器人行为本身必须足够多样。再好的 captioner 也不能从完全相同的动作轨迹中凭空创造一个未采集技能。}
本章小结
DIAL 把 foundation model 放在数据层而不是控制层:VLM 重写已有轨迹的语义接口,使同一动作数据支持更多语言。它降低人工标注成本并改善 novel instruction,但无法替代行为覆盖,且对组合泛化的证据仍有限。
系统地图、Q&A 限制与研究议程
四个案例完成后,课程把它们重新映射到一台机器人系统,并在问答中主动暴露上限:skill library 仍小,imitation 只是起点,compositional scaling 没有阈值,六帧视觉上下文又已经接近模型容量。
What's Next:先回到系统层
Agenda 最后一项不是再介绍一篇论文,而是把 local successes 组合起来。任何“机器人 foundation model”声明都应回答:skill learning、planning、low-level control、data augmentation 和 object representation 分别由谁负责,接口如何传递,失败如何反馈。
\lecturefigure{slide-42-agenda-whats-next.jpg}{Agenda:从四篇工作返回完整机器人系统}{官方录像恢复幻灯片 V042;Stanford CS25 Lecture 15}
Component Map:不同 Foundation Models 放在哪里
系统表把 RT-1 放在 skill learning,SayCan / Inner Monologue 放在 planning,Code as Policies 放在 low-level control,DIAL 放在 data augmentation,NLMap 放在 object-centric representations。顶端 recipe 强调这些方法共同依赖 large diverse offline data、high-capacity architecture 和 language glue。
\lecturefigure{slide-43-system-component-map.jpg}{系统 component map:RT-1、SayCan、Inner Monologue、Code as Policies、DIAL 与 NLMap}{官方录像恢复幻灯片 V043;Stanford CS25 Lecture 15}
Language 是 API,不是单体智能
语言让 skill、plan、scene description 和 label 共享可读接口,因此外部模型容易接入;但每个模块仍需要独立 data、evaluation 与 failure handling。把所有模块合成一个 decoder 可能简化接口,却不会自动消除 grounding 与实时控制问题。
2016–2023:问题如何变化
timeline 把三阶段问题写在横轴下:2016--2021 问端到端真实机器人如何学习;2021--2022 问如何扩展到许多 tasks;2022--2023 问如何借 foundation models 加速 robotics。右侧列出的 SayCan、Inner Monologue、DIAL、Code as Policies 与 NLMap 是系统部件,不是一个统一 end-to-end model。
\lecturefigure{slide-44-robotics-progress-timeline.jpg}{机器人研究进展:从 end-to-end、multi-task scaling 到 foundation-model leverage}{官方录像恢复幻灯片 V044;Stanford CS25 Lecture 15}
Closing 与公开项目
时间线已经把 RT-1、SayCan、Inner Monologue 与 DIAL 放回各自解决的问题,结尾则把这些系统重新落到可复查的论文、代码和演示上。本节不是再增加一种新方法,而是检查整堂课留下了哪些可继续验证的入口。看最后一页时应把公开项目与前文的 data、planning、feedback 和 grounding 模块一一对应,同时避免把精心挑选的 demo 当成长期自主运行的完整证明。
Thank-you slide 保留四个项目入口和一个清理可乐的机器人示例。它提醒读者本讲的证据来自可查论文、代码与 demo,而不是抽象愿景。演示中的长指令仍被分解为有限技能序列,体现了 language planning 与 skill library 的边界。
\lecturefigure{slide-45-thank-you.jpg}{结语:SayCan、Inner Monologue、RT-1、DIAL 项目与清理任务演示}{官方录像恢复幻灯片 V045;Stanford CS25 Lecture 15}
Q&A 一:Generalization 没有统一阈值
学生询问组合泛化需要多大规模。讲者回答取决于 task definition、dataset scale 和 concept,当前没有一个数字能预测跨颜色、物体和技能的 emergence;他个人猜测可能还差一到两个数量级的数据,但明确把这作为主观判断。
不要把“一两个数量级”写成 Scaling Law
这句话来自问答中的 rough intuition,没有控制实验、横轴定义或置信区间。它能表达“当前规模仍小”,不能用来预测某个参数量或 episode count 必然出现通用机器人能力。
Q&A 二:SayCan 的瓶颈是 Grounded Skills
SayCan 的 affordance/value functions 只能给有限 skill library 打分。如果机器人只有三项技能,planner 最多产生三项技能的组合;扩大语言模型不会增加新的动作 primitive。高层 instruction coverage 因而取决于低层技能的数量、精度和状态覆盖。
\teachervoice{讲者称这是 SayCan 的“100% bottleneck”:planner 的 buffet 里有多少菜,决定它能组合多少目标。这个比喻比“LLM 负责 planning”更准确,因为它把能力上限放回机器人数据与 controller。}
Q&A 三:Imitation 是 Existence Proof,不是终局
RT-1 当时主要使用 imitation loss。讲者作为 RL 研究者希望加入 offline improvement 或 RL,但选择 multi-task imitation 是因为它稳定、可扩展、已经证明大规模真实数据能工作。工程上先建立可靠 base policy,再研究更复杂 optimization,比一开始同时解决所有问题更可验证。
为什么不直接 Online RL
真实机器人 reward 稀疏、失败昂贵、数据并行受硬件限制。Offline imitation 牺牲主动探索,换来稳定训练和可复用 dataset。未来 RL 若要加入,仍需处理 distribution shift、安全约束与离线 value extrapolation。
Q&A 四:六帧已经接近 Context Limit
长任务需要分钟级记忆,但高维图像 token 很快耗尽 context。RT-1 的六帧只覆盖短期运动,无法存储整条轨迹或 few-shot demonstration。讲者提出 retrieval transformer 或其他 memory mechanism 作为可能方向,并明确说当前把完整轨迹塞入 context 并不现实。
\teachervoice{最后的限制非常具体:不是“模型还不够聪明”,而是六张图像就已接近 context budget。长时具身任务需要压缩、检索、状态摘要或外部 memory;简单扩大 prompt 会同时推高 latency 和实时控制风险。}
本章小结
系统地图显示四篇工作分别填补 skill、plan、feedback 和 data 接口;问答则指出它们没有自动合成通用机器人。真正的剩余瓶颈是 grounded skill coverage、学习算法、可预测的 generalization 和长时 memory。
现代 VLA 延伸:从 2023 Recipe 到统一模型
本节是 2026 年的工程解读,不属于 2023 年课堂事实。它不使用后来系统反向证明本讲正确,而是分析 Ted Xiao 的 recipe 在统一 vision-language-action model 中仍然保留哪些约束。
统一模型仍需要模块化验收
即使把视觉、语言和动作放进一个模型,训练与部署仍应分别审计 perception、planning、skill execution、feedback 与 data coverage。端到端 loss 可以共享表示,却会让错误来源更难定位;因此系统层 evaluation 仍需保留 SayCan 式可执行性、Inner Monologue 式闭环和 DIAL 式数据语义审计。
统一参数不等于统一责任
一个 checkpoint 可以同时承担多种功能,但工程契约仍要回答:哪类 token 能控制真实动作,谁验证动作安全,谁维护长期状态,谁判断任务完成,哪些输入只是数据而不是指令。参数共享不能替代权限与验收边界。
Data Mixture 需要显式 Resource Accounting
现代多机器人数据混合应记录每个 embodiment、任务、环境与语言标签的比例。若一个高频简单任务占据大部分 token,训练 loss 下降可能掩盖稀有关键技能退化;若不同 action spaces 没有规范化,模型会把同一 token 学成冲突控制。RT-1 的 task-diversity 结果仍提醒我们:token count 不是覆盖率。
Memory 与 Latency 是共同约束
更长 context 可以保留更多视觉历史,却增加前向成本和控制延迟。具身系统通常需要把近期高频状态、长期任务摘要和可检索 episodic memory 分层,而不是把所有帧永久放入 attention window。评价时应同时报告 success、latency、control frequency、memory size 与 recovery behavior。
现代化解读的边界
课堂系统拥有封闭厨房、有限动作和专用 detector;开放世界 VLA 面临更多传感器、人员安全和不可恢复错误。迁移的是“接口与证据纪律”,不是把课堂成功率直接外推到家庭或工业部署。
本章小结
统一 VLA 可以吸收 2023 recipe 的多种模块,但仍需要独立可执行性、反馈、数据覆盖和实时预算验收。Foundation model 的统一表示越强,系统越应透明报告什么仍由专用 data、controller 或 safety layer 提供。
总结与延伸
一张表回收整套 Recipe
下面的表将四个主要系统按输入、输出和失败模式放在一起。它比按论文年份记忆更有用,因为后续任何机器人 foundation model 都必须覆盖这些功能,只是实现可能被合并进同一模型。
| 系统 | 核心输入 | 核心输出 | 主要失败模式 |
|---|---|---|---|
| RT-1 | 六帧视觉、语言任务、离线示范 | 离散化实时动作 | 新场景、多因素变化、长时 context 与 dataset coverage |
| SayCan | 高层目标、skill list、affordance scores | 下一项 grounded skill | skill library 太小、affordance 失准、执行失败 |
| Inner Monologue | scene、success、用户反馈、历史计划 | 更新 belief 与下一步 plan | detector / caption 错误、反馈 ontology 不全 |
| DIAL | 小量人类语言、大量 offline trajectories、VLM | 扩展 language labels 与 policy | label noise、行为覆盖不足、组合泛化证据有限 |
最终结论
第一,机器人 scaling 的核心资源不是单一 episode count,而是任务、环境、语言和 embodiment 的多样覆盖。第二,Transformer 的真正价值之一是 token interface 与高容量 sequence model,但实时预算迫使视觉压缩、短历史和小模型部署。第三,LLM 最适合通过受 grounding 约束的 planner 接入机器人,而不是直接把语言概率当动作。第四,feedback 和 VLM relabeling 能把外部 foundation-model prior 注入系统,却不能凭空创造未采集物理技能。
最值得带走的一句话
2023 年的 robotics foundation-model recipe 不是“把机器人接上 LLM”,而是:用大型多样离线数据训练可实时执行的 skill model,用语言连接计划与反馈,用 affordance 保持 grounding,再让外部 foundation models 持续改善语义接口。
拓展阅读
以下资料均在课堂日期前公开,并直接构成本讲证据链。阅读顺序建议是 RT-1 的 skill/data 层、SayCan 的 planner、Inner Monologue 的 feedback,最后用 DIAL 回到数据接口。
- Brohan et al., RT-1: Robotics Transformer for Real-World Control at Scale:多任务模仿、架构、data scaling 与 ablation。
- Ahn et al., Do As I Can, Not As I Say:LLM usefulness 与 affordance grounding。
- Huang et al., Inner Monologue:scene、success 与 active feedback 的闭环规划。
- Jang et al., BC-Z:语言条件多任务模仿和 zero-shot task generalization。
- Xiao et al., Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models:DIAL 与 VLM relabeling。
课后自检
十个自检问题
- 为什么本讲只能说“towards a robotics foundation model”,不能说已经证明 emergence?
- Offline robot learning 如何解耦 data generation 与 consumption,又引入什么 distribution-shift 风险?
- RT-1 的 TokenLearner、六帧历史、256 bins 分别解决什么资源约束?
- 为什么 task diversity 的减少比同等 episode reduction 更伤 generalization?
- SayCan 中 LM score 与 affordance score 各自不能替代什么?
- Planning success 与 execution success 为什么必须分开报告?
- Inner Monologue 的 passive、active、success feedback 有何不同?
- DIAL 为什么能扩展语言覆盖,却不能创造未采集技能?
- “少量 label noise okay”依赖哪些 dataset 条件,不能被怎样误读?
- 六帧已接近 context limit 时,分钟级任务需要怎样的 memory architecture?