跳转至

Lecture31

LaTeX 源码

\makecscover

讲座定位:多模态不是在 LLM 外面再挂一个视觉模块

这节课的跨度很大:前半段回顾 BERT、GPT-3、ChatGPT 三个语言模型“时刻”,中段讨论 Transformer 架构、训练系统、alignment 与数据工程,后半段才进入 BLIP-2、LLaVA、CogVLM、CogAgent、图像扩散与视频生成。这样的安排不是离题,而是在回答一个贯穿全课的问题:当模型能力从 text 扩展到 image、GUI 和 video 时,哪些来自 LLM 的规律仍然成立,哪些必须换表示、目标函数或系统路径?

来源修复与课堂边界

旧稿把课堂日期写成 2026 年 4 月 4 日,并加入 monitoring dashboard、drift detection、automatic rollback、fairness governance 等大量课程中不存在的内容。本讲现以官方 CS25 V4 课程页、2024 年 5 月 9 日课堂、Stanford Online 官方录像 cYfKQ6YG9Qo、官方 en-US 人工字幕和 31 个录像恢复 teaching states 为课堂主干。官方页面和视频描述均未提供可验证的独立 slide deck,因此录像共享屏幕是视觉 source of truth。

\lecturefigure{slide-01-title.jpg}{官方课堂标题:From Large Language Models to Large Multi-modality Models}{Stanford Online 官方录像 00:02:31}

标题中的 “Large Multi-modality Models” 是 2024 年课堂用语。它不表示所有 modality 已被统一解决,而是强调模型研究已经从单一语言接口扩展到视觉理解、图像生成、GUI action 和视频。讲者所在团队的 CogVLM、CogAgent、CogView 与 CogVideo 是案例,不是整门课的唯一结论。

时间边界必须保留

本讲展示的 benchmark、产品能力、下载量和“一两年内”的预测都属于 2024-05-09 的课堂快照。后来的模型版本、排行榜变化或产业结果不能倒灌进课堂事实;若用于拓展,只能显式标成 post-lecture evidence。

四段路线图与阅读问题

课程先问 why、再问 how、接着问 what、最后问 where。读者不应把四部分看成并列综述:LLM 的 objective 和 scaling 解释为什么系统工程变得重要;系统与数据解释为什么 VLM 可以迅速复用语言底座;视觉表示的缺陷又解释为什么生成侧从 autoregression 转向 diffusion。

\lecturefigure{slide-02-outline.jpg}{课程路线图:历史、训练技术、视觉语言模型与研究方向}{Stanford Online 官方录像 00:03:29}

带着四个问题读完全课

  1. Objective:不同 modality 应该共享 autoregressive objective,还是使用专门的 diffusion / contrastive objective?
  2. Architecture:投影层、Q-Former、vision experts 与 cross attention 分别解决什么接口问题?
  3. Systems:ZeRO(Zero Redundancy Optimizer,在 data-parallel ranks 间分片 optimizer/gradient/parameter states)、parallelism、long context 与高分辨率 token 如何改变可训练问题的边界?
  4. Data:当通用 web data 接近饱和,如何把 compute 转换成更高质量、可验证的数据?

\teachervoice{00:02:31--00:04:35,Ming Ding 提醒听众本讲会跨越多个并不熟悉的子领域。他的目标不是给每个模型做完整 survey,而是沿 Transformer 社区的时间线解释研究重心为什么移动。}

证据账本:机制、结果、判断与预测

同一张 slide 可能同时包含论文结构图、课堂判断和产品结果。为了避免“图上写了”被误读为普遍事实,本讲采用四层证据账本。

四层证据读法

层次 例子 正确读法
标准机制 cross entropy、attention、DDPM、DPO 给出公式、变量与假设
具体系统 ZeRO、Megatron、CogVLM、MM-DiT 说明接口、资源路径与版本
课堂结果 benchmark table、web-agent trace、速度数字 只支持展示的设置和 protocol
讲者判断/预测 loss 决定能力、video 将成热点 保留日期、语气与反例空间

本章小结

这是一堂“从 LLM 规律迁移到 multimodality”的课,不是 Cog 系列产品说明书。读者需要同时追踪 objective、architecture、systems 与 data,并始终区分标准机制、课堂实验、讲者判断和未来预测。

三个 LLM moments:目标函数、规模与对齐

讲者用 BERT、GPT-3、ChatGPT 三个时刻压缩五年语言模型史。它们分别改变了研究者对 self-supervision、scale 和 task adaptation 的理解。关键不是记住年份,而是看研究瓶颈如何从“设计更好的任务”迁移到“分配计算”,再迁移到“用少量高质量数据改变行为”。

BERT moment:理解与生成曾被认为需要不同目标

2018--2021 年常见分工是:masked language modeling(MLM)负责理解,autoregressive modeling 负责生成,T5 用 encoder--decoder 兼顾两者。GLM 的 blank infilling 则把被遮盖 span 内部改成自回归生成,试图在一个 decoder-style objective 中覆盖不同任务。

\lecturefigure{slide-03-language-modeling.jpg}{BERT 时刻:MLM、autoregression、T5 与 GLM 的任务视角}{Stanford Online 官方录像 00:07:00}

设原序列为 \(x=(x_1,\ldots,x_n)\),遮盖 span 集合为 \(M\)。GLM 的核心可写成对被遮盖 token 的条件自回归:

\[ \mathcal{L}_{\text{GLM}} =-\sum_{m\in M}\sum_{j=1}^{|m|} \log p_\theta\!\left(x_{m,j}\mid x_{\setminus M},x_{m,<j}\right). \]

这里 \(x_{\setminus M}\) 是可见上下文,\(x_{m,<j}\) 是当前 span 内已生成 token。若遮盖几乎覆盖全序列,目标接近 GPT;若遮盖较小 span,则保留双向可见上下文。

Objective 的真正作用

预训练 objective 决定模型在训练时能看到什么条件、预测什么变量以及误差怎样传播。它不直接等于“理解”或“生成”能力;下游 fine-tuning、prompt format、data mixture 和 inference procedure 都会改变最终行为。

\teachervoice{00:05:00--00:08:55,讲者把 GLM 放在“社区信念会快速改变”的历史里:当年大家努力发明 self-supervised task,后来发现 task adaptation 可以很便宜,研究价值的判断随规模和数据条件变化。}

GPT-3 moment:scaling law 变成预算分配器

第二个时刻不是“参数越多越好”的口号,而是用可拟合曲线把 loss 与参数、数据、计算联系起来。常见经验形式为

\[ L(N,D)\approx L_\infty+aN^{-\alpha}+bD^{-\beta}, \]

其中 \(N\) 是参数量,\(D\) 是训练 token 数,\(L_\infty\) 是不可约 loss,\(a,b,\alpha,\beta\) 由实验拟合。它允许团队在固定 compute \(C\) 下比较“加参数”与“加 token”的边际收益。

\lecturefigure{slide-04-scaling-law.jpg}{GPT-3 时刻:用 scaling curves 分配参数、数据与计算}{Stanford Online 官方录像 00:09:19}

若一次 dense Transformer 训练的主要 FLOPs 近似为

\[ C\approx 6ND, \]

那么给定预算时,\(N\)\(D\) 不能同时无限增长。这里的 \(6\) 是常用粗略常数,真实成本还受 sequence length、attention、activation recomputation、parallel efficiency 和 kernels 影响。

Scaling law 不是性能保证书

拟合曲线只在观测到的模型族、数据分布、tokenizer、optimizer 和训练区间内成立。数据质量下降、重复率上升、分布外任务或系统效率恶化时,增加名义 compute 不保证按同一指数提升。

\teachervoice{00:09:19--00:10:00,讲者把 scaling law 形容成工程预算工具:老板给四倍资源时,需要决定资源落在参数还是 token,而不是只宣布“模型更大”。}

ChatGPT moment:task adaptation 便宜,但知识从哪里来?

第三张 slide 把 InstructGPT 的人类偏好提升与“下游性能由 pretraining loss 决定”的经验图放在一起。前者说明 alignment 能显著改变人类评价;后者试图说明同等预训练 loss 下,较小但训练更充分的模型可能追上较大但 under-trained 的模型。

\lecturefigure{slide-05-alignment-pretraining-loss.jpg}{ChatGPT 时刻:alignment 改行为,pretraining loss 承载基础能力}{Stanford Online 官方录像 00:13:05}

交叉熵与 perplexity 的关系是

\[ H=-\frac{1}{T}\sum_{t=1}^{T}\log p_\theta(x_t\mid x_{<t}), \qquad \operatorname{PPL}=e^H. \]

perplexity 可直观理解为“模型每个 token 面前的有效选择数”,但不同 tokenizer、语料和 domain 的 PPL 不可直接横比。

“同 loss 同能力”不是普遍定理

课堂提出的是强经验判断。即使平均 pretraining loss 相近,architecture、tokenizer、data mixture、optimization trajectory、context length 与 evaluation format 仍可造成能力差异。2024 年 9 月之后的工作也给出 same-loss、different-downstream 的反例,因此本讲只保留其预算与 over-training 直觉。

\teachervoice{00:10:00--00:13:18,讲者明确把所谓 emergent ability 重新解释为 loss 曲线现象。这是他的研究立场,不应改写成社区已经证明的因果结论。}

本章小结

BERT moment 关注训练目标,GPT-3 moment 关注规模与预算,ChatGPT moment 关注低成本行为适配。三者共同把研究问题从“哪种任务最聪明”转成“知识由何种数据和计算获得、行为又怎样被高质量反馈塑形”。

Transformer 架构与训练系统:能力边界由资源路径决定

在多模态模型出现前,语言底座必须先被稳定训练。讲者的核心判断是:现代 LLM 的许多关键改进不是全新网络,而是对 decoder path、normalization、KV memory、parameter routing 与 distributed execution 的持续修整。理解这些术语,是后面理解 high-resolution VLM 和 video scaling 的前提。

现代 decoder-only recipe 的术语消化

前一章说明了 objective、scale 与 alignment 怎样移动研究瓶颈;本节进一步问:当 decoder-only LLM 成为共同底座后,工程团队究竟改了计算图的哪些位置,又分别换来了什么稳定性、容量或 inference memory。下面这张 slide 把常见 architecture updates 压在一页里,读图时不要只数名词,而要区分它们作用于 residual path、position、KV sharing、MLP 还是 routing。

\lecturefigure{slide-06-transformer-architecture.jpg}{现代 Transformer 常见更新:decoder-only、pre-norm、RoPE、GQA、GLU 与 MoE}{Stanford Online 官方录像 00:16:10}

标准 causal self-attention 为

\[ Q=XW_Q,\quad K=XW_K,\quad V=XW_V,\qquad \operatorname{Attn}(X)=\operatorname{softmax}\!\left(\frac{QK^\top}{\sqrt{d_h}}+M\right)V, \]

其中 \(M\) 是 causal mask。GQA(Grouped-Query Attention)让多组 query heads 共享更少的 key/value heads,主要减少 KV cache,而不是减少所有 attention FLOPs。

密集术语表:它们解决的是不同瓶颈

术语 核心机制 课程关系
Decoder-only 统一 causal generation path 便于规模化预训练与统一接口
Pre-norm 在子层前做 LayerNorm 改善深层残差训练稳定性
RoPE \(Q,K\) 上旋转编码相对位置 为长上下文和外推提供位置结构
GQA 多个 query heads 共享 KV heads 缩小 inference KV cache
SwiGLU/GLU 用门控乘法替代普通 MLP 激活 改变 feed-forward 容量与优化
MoE 每个 token 只激活部分 experts 增加总参数而控制 active compute

\teachervoice{00:13:18--00:17:45,讲者强调这些改进大多是长期累积而非突然出现的“新 Transformer”。他的玩笑是 architecture innovation 很少,但这不等于每个改动都无关紧要。}

DeepSpeed 与 ZeRO:先算清一份参数占多少显存

训练系统的第一课不是背 ZeRO-1/2/3,而是做 resource accounting。对混合精度 AdamW,一个参数常需要 FP16/BF16 parameter、gradient,以及 FP32 master weight、first moment \(m\)、second moment \(v\)。粗略字节数为

\[ B_{\text{per-param}}\approx 2_{\theta}+2_g+4_{\theta_{32}}+4_m+4_v=16\ \text{bytes}. \]

十亿参数仅这些 states 就约 16 GB,尚未计 activation、temporary buffers、fragmentation 与 communication workspace。

\lecturefigure{slide-07-deepspeed.jpg}{DeepSpeed:optimizer states、activation checkpointing 与 ZeRO 分片}{Stanford Online 官方录像 00:19:30}

首次定义:sharding、optimizer state 与 activation checkpointing

Sharding(分片)是把原本每张卡复制的一类状态切到不同 data-parallel ranks;optimizer state 是 Adam/AdamW 的 \(m,v\) 与常见 FP32 master weights;activation checkpointing 只保存少量 forward activations,backward 时重算其余部分,和保存模型文件的 model checkpointing 不是一件事。

ZeRO-1 分片 optimizer state,ZeRO-2 再分片 gradients,ZeRO-3 连 parameters 也分片。若 data-parallel world size 为 \(p\),理想状态占用近似按 \(1/p\) 缩小,但换来 all-gather、reduce-scatter 等 collectives(多 GPU 通信原语)。

混合精度训练的显存核算清单
bytes = parameter_low_precision
bytes += gradient_low_precision
bytes += master_parameter_fp32
bytes += adam_first_moment_fp32
bytes += adam_second_moment_fp32
bytes += saved_activations_or_recompute_budget
bytes += communication_and_kernel_workspace
report(bytes_per_rank, sharding_stage, world_size)

\teachervoice{00:17:45--00:21:13,讲者特别指出显存大头常来自 Adam states,而 activation checkpointing 的代价是 backward 重算。把“省显存”写成免费优化会丢掉系统事实。}

Megatron:tensor 与 pipeline parallelism 分别切什么

ZeRO 沿 data-parallel ranks 分片状态;Megatron 的 tensor parallelism(TP)在一层内部切 hidden dimensions/heads,pipeline parallelism(PP)沿层深切 stages。两者解决的维度不同,通信模式也不同。

\lecturefigure{slide-08-megatron.jpg}{Megatron:tensor parallel 与 pipeline parallel 的切分方式}{Stanford Online 官方录像 00:21:13}

若线性层 \(Y=XW\) 按列切 \(W=[W_1,\ldots,W_p]\),每个 rank 计算 \(Y_i=XW_i\),后续可能需要 all-gather;按行切则局部结果需要 all-reduce 求和。PP 的利用率受 micro-batch 数 \(m\) 与 stage 数 \(p\) 影响,朴素 bubble fraction 可粗略写成

\[ \rho_{\text{bubble}}\approx \frac{p-1}{m+p-1}. \]

interleaving、1F1B 与 ZeroBubble 类调度都在减少空闲,但会增加排程复杂度和通信约束。

Collectives 不是一个模糊的“同步”

All-reduce 汇总并把结果发回每个 rank;reduce-scatter 汇总后只保留各自分片;all-gather 收集所有分片;broadcast 从一个 rank 发送给所有 rank。不同 sharding/parallelism 方案的性能差异,常来自这些操作的频率、消息大小和拓扑匹配。

\teachervoice{00:20:00--00:22:50,讲者把超大模型训练概括为 engineering work,并用“MLP 不重要,ML6 重要”的玩笑强调:没有 systems knowledge,架构纸面 FLOPs 无法变成有效训练。}

Long context:full attention 仍然要支付二次复杂度

长上下文 slide 对比早期 CogLTX 的显式 retrieval/rehearsal 结构与 2024 年 full-attention context parallelism。所谓 lossless 指不通过 sparse attention 改写 attention pattern,不代表计算没有代价。

\lecturefigure{slide-09-long-context.jpg}{Lossless 128K:context parallel、Ring Attention 与 Ulysses}{Stanford Online 官方录像 00:24:27}

对 sequence length \(n\)、head dimension \(d_h\),完整 score matrix 的主要计算为

\[ \mathcal{O}(n^2d_h), \]

单卡显式存储也可达 \(\mathcal{O}(n^2)\)。context parallelism 把 sequence 分到 \(p\) 个 ranks,局部 activation 约降到 \(\mathcal{O}(nd/p)\),但必须轮转或交换 \(K,V\) blocks,并处理 causal load imbalance。

长上下文的隐藏成本是 prefill

Q&A 中讲者把 inference 分成 prefill 与 decode。长文档常只生成短答案,但 prefill 仍要读取并处理整段 context,可能耗时数秒到一分钟。更长窗口不是“免费 memory”,还会增加 latency、KV cache、communication 与无关信息干扰。

\teachervoice{01:08:10--01:10:30,讲者接受某些文档理解场景用较长 prefill 换取短回答,但没有声称所有交互应用都能容忍这一 latency。}

本章小结

现代 LLM recipe 同时包含 architecture updates 与 distributed systems。ZeRO 切状态,TP 切层内张量,PP 切层,context parallelism 切序列;每次减少单卡显存,都通过 collectives、重算、bubble 或 latency 支付代价。这些系统路径会在 high-resolution image 与 video 中再次出现。

Alignment 与数据工程:行为适配不是知识凭空生成

语言底座训练完成后,SFT 与 preference optimization 决定模型怎样回答。讲者把这部分与 data engineering 放在一起,因为 alignment 的关键变量不是算法名字,而是 instruction、answer、preference pair 的质量、来源与覆盖。

SFT:高质量答案需要 domain experts

SFT(Supervised Fine-Tuning)仍是普通 teacher-forced cross entropy。给 instruction--response 对 \((x,y)\),目标为

\[ \mathcal{L}_{\text{SFT}}=-\sum_{t=1}^{|y|}\log \pi_\theta(y_t\mid x,y_{<t}). \]

困难在数据:若希望模型写出可靠代码解释,标注者必须能写出可靠代码解释,而不是只完成低成本选择题。

\lecturefigure{slide-10-sft.jpg}{SFT:expert annotation、distillation 与 weak-to-strong 问题}{Stanford Online 官方录像 00:27:01}

Teacher-generated data 的两层边界

更强模型可以快速生成 instruction data,但学生会继承 teacher 的偏差、风格和盲区;若目标是独立竞争,依赖封闭 teacher 还带来许可、可复现性与 data provenance 问题。Weak-to-Strong 讨论的是弱监督下能否超过 supervisor,不等于“复制 teacher outputs 就必然超过 teacher”。

\teachervoice{00:25:00--00:28:24,讲者反复强调 SFT 不是普通 crowdsourcing。高质量答案需要真正懂 domain 的人,这一点比把数据量写成一个数字更重要。}

RLHF 与 DPO:算法变简单,偏好假设没有消失

SFT 教模型模仿目标答案,却没有显式比较两个都“像答案”的输出。Preference optimization 因此回答下一个问题:当 chosen 与 rejected 只在帮助性、风格或安全性上有差别时,怎样把成对判断变成 policy update。PPO-based RLHF 与 DPO 的差异在优化路径,不在于是否需要定义偏好。

PPO-style RLHF 通常先训练 reward model \(r_\phi(x,y)\),再优化带 KL regularization 的 policy:

\[ \max_\theta\ \mathbb{E}_{y\sim\pi_\theta(\cdot\mid x)}[r_\phi(x,y)] -\beta D_{\mathrm{KL}}\!\left(\pi_\theta\,\|\,\pi_{\text{ref}}\right). \]

DPO 直接用 chosen/rejected pair \((y^+,y^-)\) 优化

\[ \mathcal{L}_{\text{DPO}} =-\log\sigma\!\left(\beta\left[ \log\frac{\pi_\theta(y^+\mid x)}{\pi_{\text{ref}}(y^+\mid x)} -\log\frac{\pi_\theta(y^-\mid x)}{\pi_{\text{ref}}(y^-\mid x)} \right]\right). \]

\lecturefigure{slide-11-rlhf.jpg}{RLHF 与 DPO:reward model、PPO 难度和 pairwise objective}{Stanford Online 官方录像 00:28:24}

DPO 没有消灭 reward modeling

DPO 不显式训练独立 reward model,但 preference pairs 仍隐式定义“什么更好”。pair 是否 on-policy、annotator 是否一致、prompt 是否覆盖真实使用、chosen/rejected 是否只差风格,都会改变学到的 reward geometry。

\teachervoice{00:28:24--00:30:00,讲者认为 PPO 在 reward model 足够好时可能很强,但工程实现困难;他把 DPO 作为更易用的替代,同时口头提醒 pair quality 和 on-policy 性。}

Data–algorithm–architecture 可以编码相似 bias

这张 slide 是整节课最重要的研究方法论。CogQA 的 multi-hop question answering 曾使用 graph neural network,另一路使用 MCTS;当 long-context GPT 和 chain-of-thought 能把相关 documents 一次放入 context 时,同一个任务可改写成 data/context-level problem。

\lecturefigure{slide-12-data-algorithm-architecture.jpg}{数据、算法与架构的可交换性:从 CogQA 到 long-context reasoning}{Stanford Online 官方录像 00:34:16}

三种实现同一归纳偏置的层次

  1. Architecture:把 graph structure、memory 或 routing 写进网络结构。
  2. Algorithm:在 inference 时用 search、MCTS、retrieval 或 verifier 组织计算。
  3. Data/context:把中间证据、失败路径或完整 documents 放入训练样本与上下文,让通用模型学习 procedure。

越靠数据层通常越通用,但需要更强模型、更长 context 和更高质量样本。

选择 data、algorithm 或 architecture 的决策框架
if behavior_is_narrow_and_examples_are_available:
    encode_with_data_and_evaluation()
elif inference_needs_verifiable_search:
    add_algorithmic_search_or_tools()
elif bottleneck_is_general_and_repeats_across_tasks:
    consider_architecture_change()
always_measure(compute, latency, coverage, failure_modes)

\teachervoice{00:30:00--00:34:20,讲者为 data work 辩护:cleaning、filtering、synthesizing 不是“低级劳动”,而是当前模型公司最核心的研究工程。}

\teachervoice{01:10:30--01:12:30,Q&A 中他又补了一层:许多具体行为可以用 data 解决,但若有人找到能普遍增强拟合能力的 architecture update,仍然非常有价值。}

本章小结

SFT、RLHF、DPO 都不能脱离数据质量讨论。更一般地,同一 inductive bias 可以写进 architecture、algorithm 或 data/context;最简单的层次不一定最便宜,因为它可能要求更大 compute、更长 context 和更可靠 evaluation。

视觉语言接口:从 Q-Former 到线性投影

把 image 接入 LLM 的第一个问题不是“模型看懂了吗”,而是视觉 encoder 的连续特征怎样进入 language model 的 token space。BLIP-2 与 LLaVA 给出两种典型桥接方式:一个使用可学习 queries 和 Q-Former 压缩/对齐,一个直接线性投影视觉 token。

BLIP-2:用 Q-Former 查询冻结视觉空间

BLIP-2 把 frozen image encoder 与 frozen LLM 之间放入 Q-Former。令视觉特征为 \(V\in\mathbb{R}^{m\times d_v}\),可学习 queries 为 \(Q_0\in\mathbb{R}^{q\times d}\),cross attention 为

\[ Q'=\operatorname{softmax}\!\left(\frac{(Q_0W_Q)(VW_K)^\top}{\sqrt d}\right)VW_V. \]

\(q\ll m\) 时,Q-Former 同时做信息瓶颈与空间对齐,再把少量 query outputs 送入 LLM。

\lecturefigure{slide-13-blip2.jpg}{BLIP-2:Q-Former 桥接 frozen image encoder 与 frozen LLM}{Stanford Online 官方录像 00:36:18}

Q-Former 解决两个不同问题

一是compression:从大量 image patches 提炼固定数量 queries;二是alignment:把 CLIP-like feature space 转到 LLM 可消费的 embedding space。它不是让 LLM 自己重新学习全部视觉 backbone。

\teachervoice{00:35:00--00:36:55,讲者把 BLIP-2 称为有效连接 CLIP 与 LLM 的先驱,重点在“两个冻结空间之间需要可训练桥”。}

LLaVA:简单 projection 为什么成为强 baseline

LLaVA 使用 vision encoder \(f_v\) 和 projection \(W_p\)

\[ H_v=f_v(I),\qquad Z_v=H_vW_p, \]

再把 \(Z_v\) 与 text embeddings 拼接输入 LLM。它减少了额外模块,容易 end-to-end instruction tuning,因此很快成为 VLM 常见 baseline。

\lecturefigure{slide-14-llava.jpg}{LLaVA:以 projection 对齐视觉特征与语言 embedding}{Stanford Online 官方录像 00:36:55}

Linear projection 简单,不等于信息无损

projection 只保证维度匹配。视觉 encoder 的分辨率、patch size、pretraining objective、projector capacity 和 instruction data 决定哪些细节能进入 LLM;小文字、OCR、grounding 与 GUI icons 往往首先暴露瓶颈。

接口 taxonomy:压缩、对齐、保留与高分辨率

在进入 Cog 系列前,可以用四个问题比较所有 VLM bridge:多少视觉 token 被保留?视觉与语言是否共享参数?是否会破坏原语言能力?高分辨率输入的 cost 在哪里支付?

VLM bridge 对照表

方法 视觉接口 参数路径 主要权衡
BLIP-2 Q-Former queries bridge 可训练,backbones 可冻结 压缩强,但 query bottleneck 明显
LLaVA linear/MLP projector 视觉 token 进入 LLM path 简单强基线,高分辨率成本高
CogVLM vision experts image/text token 走部分不同参数 尝试保留语言行为,参数更多
CogAgent high-res cross attention 轻量高分辨率旁路 面向 GUI/OCR,系统更复杂
Vary 多视觉词表/feature ensemble 多 encoder 特征合并 OCR 更强,接口与训练成本上升
GLM-4V slide stride convolution 压缩后 mixed training 结构简单,结果依赖数据与 protocol

本章小结

多模态接口的本质是 information bottleneck 与 parameter sharing。Q-Former 显式查询和压缩,LLaVA 直接投影;后续模型则围绕“保留语言能力”和“处理高分辨率细节”继续分化。

CogVLM、CogAgent 与 GLM-4V:分开参数路径还是压缩输入

这一章集中分析讲者团队展示的视觉理解模型。重点不是比较模型名,而是看三类瓶颈:image alignment 是否覆盖语言能力、high-resolution screenshot 如何控制 token cost、OCR/grounding benchmark 是否能代表真实 GUI agent。

CogVLM:vision experts 避免覆盖 language path

CogVLM 的动机是:若所有 image-text alignment gradient 都更新原 LLM parameters,基础语言行为可能被覆盖。它为视觉 token 增加独立 attention/MLP experts,同时保留 text token 的原路径。可抽象为

\[ h'_{i}=h_i+\begin{cases} F_{\text{vision}}(h_i), & i\in\mathcal{I}_{\text{image}},\\ F_{\text{text}}(h_i), & i\in\mathcal{I}_{\text{text}}. \end{cases} \]

\lecturefigure{slide-15-cogvlm-architecture.jpg}{CogVLM:以 vision experts 分离视觉与语言参数路径}{Stanford Online 官方录像 00:38:44}

“保留语言行为”需要怎样验证

结构上保留 text expert 只能提供机制假设。真正验证需要在 multimodal tuning 前后比较 language-only perplexity、instruction following、reasoning、safety 和 domain tasks;不能仅凭参数没有完全共享就断言无遗忘。

\teachervoice{00:37:25--00:39:27,讲者把 CogVLM 的设计目标明确说成 keep all language behavior。讲义保留这个目标,但不把它升级成未经完整语言回归测试的结论。}

CogVLM 结果页:雷达图先问 protocol,再问面积

结果 slide 汇总 image captioning、grounding、VQA 和综合 VLM benchmarks,并给出开源链接。读图时应先确认每个轴的 metric、model size、input resolution、prompting 与 test split,再比较单项,而不是只比较雷达图覆盖面积。

\lecturefigure{slide-16-cogvlm-benchmarks.jpg}{CogVLM 的课堂时 benchmark 汇总与开源信息}{Stanford Online 官方录像 00:39:27}

Benchmark table 不等于 production robustness

VQA accuracy、caption score、grounding IoU 与 LLaVA-Bench 测量的问题不同;它们不能直接推出 GUI reliability、OCR 长尾、幻觉率、adversarial robustness 或真实用户任务成功率。下载量也只说明 adoption,不说明 correctness。

CogAgent:高分辨率旁路为何必要

网页 screenshot 包含大量小文字、icons 和坐标关系。若把分辨率提高 \(s\) 倍,而 patch size 不变,二维 token 数近似提高 \(s^2\) 倍;full attention cost 可能进一步接近 \(s^4\) 倍。CogAgent 用 cross-attention high-resolution branch,让高分辨率特征不必全部扩展到 LLM hidden width。

\lecturefigure{slide-17-cogagent-architecture.jpg}{CogAgent:为 GUI/OCR 增加 high-resolution cross-attention branch}{Stanford Online 官方录像 00:40:13}

若低分辨率 language tokens 为 \(H_l\in\mathbb{R}^{n\times d}\),高分辨率 features 为 \(H_h\in\mathbb{R}^{m\times d_h}\),旁路可写成

\[ \widetilde H_l=H_l+\operatorname{CrossAttn}(H_lW_Q,H_hW_K,H_hW_V), \]

其目标是让 \(m\) 个细粒度 features 被查询,而不是全部成为等价的 LLM sequence tokens。

\teachervoice{01:15:00--01:16:15,Q&A 中讲者直接区分 CogAgent 与 CogVLM:前者从后者 fine-tune/扩展而来,专门面向 high-resolution web screen,并用较轻 cross-attention 控制成本。}

Web trace:模型输出的是 grounded action,不是“会用浏览器”四个字

示例任务要求搜索 CVPR 2023 best paper。slide 展示从 screenshot 理解、定位搜索框、输入 query、读取结果到继续点击的多步 trace。一个 action 通常需要 type 与 coordinates/text,例如

\[ a_t=(\text{action\_type},x_t,y_t,\text{text}_t), \qquad p(a_t\mid I_t,g,h_{<t}). \]

\lecturefigure{slide-18-cogagent-web-demo.jpg}{CogAgent web navigation:从 screenshot 到 action sequence}{Stanford Online 官方录像 00:41:19}

GUI agent 的最小可审计 action schema
observation = capture_screenshot()
action = model.predict(goal, observation, history)
validate(action.type, action.coordinates, action.text)
execute_in_sandbox(action)
record(observation, action, result, failure_reason)
stop_only_when(goal_is_verified)

单条成功 trace 不估计可靠性

真实 GUI agent 还需测量 repeated trials、layout shift、small-text OCR、unexpected popups、permission boundary、irreversible actions 和 recovery。课堂 demo 证明接口可行,不证明 autonomous browsing 已经稳健。

Vary:增加 vision vocabulary 以服务 OCR

Vary 把不同视觉 features 组合为更丰富的 vision vocabulary,目标是补足通用 CLIP features 对 document/OCR 细节的不足。可抽象为

\[ Z=\operatorname{Project}\!\left([f_{\text{general}}(I);f_{\text{ocr}}(I)]\right), \]

其中两个 encoder 的 inductive bias 不同,合并后再接 LLM。

\lecturefigure{slide-19-vary.jpg}{Vary:ensemble vision features 以扩大视觉词表}{Stanford Online 官方录像 00:41:46}

Vision vocabulary 不是离散文字词表

这里的 vocabulary 指可表达的视觉 feature patterns:layout、small text、objects、regions 与文档结构。增加专用 encoder 可能提升 OCR,但也增加训练、部署、feature alignment 与维护成本。

GLM-4V:简单 stride convolution 与 mixed training

课堂展示的 GLM-4V 结构回到较简单的 LLaVA-style path,只把 projector 换成 stride convolution,以压缩高分辨率 feature map。若输入 feature map 为 \(H\times W\),stride 为 \(s\),token 数近似从 \(HW\) 降到

\[ n_v\approx \frac{H}{s}\frac{W}{s}. \]

随后 text/image data 做 mixed training,以减少多模态训练对 language behavior 的破坏。

\lecturefigure{slide-20-glm4v-architecture.jpg}{课堂展示的 GLM-4V:stride convolution 与 text-image mixed training}{Stanford Online 官方录像 00:42:34}

\teachervoice{00:41:46--00:43:00,讲者特意说最新模型反而使用更简单的 architecture。这个例子支持他的 data thesis:更复杂 bridge 并不自动带来更强最终系统。}

GLM-4V 结果表:每一列回答不同问题

表中同时出现 MMBench、MME、MMMU、MathVista、MMVet、DocVQA、OCRBench 等。它们覆盖 general perception、knowledge/reasoning、math/diagram、document OCR 等不同能力,不能求一个未经定义的“总分”。

\lecturefigure{slide-21-glm4v-results.jpg}{GLM-4V 的课堂时多 benchmark 结果表}{Stanford Online 官方录像 00:43:00}

读多模态 benchmark 表的顺序

先确认 model/version 和输入分辨率,再确认 zero-shot/few-shot、prompt、test split 与 metric;然后按任务族比较,而不是跨列直接平均。若某模型 OCR 强但 MMMU 弱,结论是能力分布不同,不是简单的“谁更智能”。

课堂时 GLM-4V 与后续版本不能混用

这张 slide 早于后续稳定 technical reports。讲义只记录当时展示的 architecture 和 table,不用后来 GLM-4V/GLM-4.1V 的能力反向证明 2024 年版本。

本章小结

CogVLM 用 experts 分离参数路径,CogAgent 用 high-resolution cross attention 控制 GUI/OCR 成本,Vary 扩充视觉 features,GLM-4V 用 stride convolution 压缩输入。它们都在回答同一问题:怎样把视觉细节送入 LLM,同时控制遗忘、token 数和系统成本。

Autoregressive image modeling:统一接口为何没有赢得所有任务

如果 image 可以离散成 tokens,最自然的想法是沿用 GPT:text-to-image、image-to-text、image completion 都只是不同 token 排列与 mask。这条路线具有接口统一的美感,但 high-resolution sequence length、tokenizer information loss 和 sequential decoding 让它在生成质量与速度上面对 diffusion 的强竞争。

CogView/DALL-E/Parti:先把图像变成离散序列

设 image tokenizer 把图像 \(I\) 编成 codes \(z=(z_1,\ldots,z_m)\),文本 tokens 为 \(x\)。text-to-image 的 factorization 为

\[ p(z\mid x)=\prod_{i=1}^{m}p(z_i\mid x,z_{<i}). \]

训练只需把 text 与 image tokens 拼成一个 sequence,但 image token 数可能达到数千,生成必须串行走完全部位置。

\lecturefigure{slide-22-autoregressive-text-to-image.jpg}{Autoregressive text-to-image:image tokenizer 加 GPT sequence}{Stanford Online 官方录像 00:46:47}

Image tokenizer 同时提供压缩和损失

VQ tokenizer 把连续像素压成有限 codebook,显著缩短序列;但细文字、纹理、几何和颜色精度可能在编码阶段丢失。后面的 Transformer 无法恢复 tokenizer 从未保留的信息。

\teachervoice{00:45:00--00:49:32,讲者把 CogView 与 DALL-E/Parti 放在同一简单 recipe:先离散化,再 autoregress。简单是优点,也是速度和细节瓶颈的来源。}

Universal modeling:能做所有方向,不等于每个方向最好

同一个 sequence model 可以通过排列和 mask 表达多种任务:

\[ \begin{aligned} \text{text}\rightarrow\text{image}:&\ [x;z],\\ \text{image}\rightarrow\text{text}:&\ [z;x],\\ \text{masked image}:&\ [z_{\text{visible}};z_{\text{target}}]. \end{aligned} \]

这确实统一了 API,但 image understanding 可能不如保留连续 features 的 VLM,image generation 又可能不如 diffusion。

\lecturefigure{slide-23-universal-modeling.jpg}{Universal vision-language modeling:排列统一与性能折中}{Stanford Online 官方录像 00:49:32}

统一 objective 与统一最优解是两件事

一个模型能表达多任务 likelihood,不代表有限参数、有限数据和有限 compute 下会同时达到各 specialized systems 的 Pareto frontier。共享表示会带来 transfer,也会带来 interference 和不合适的 bottleneck。

\teachervoice{00:49:32--00:52:11,讲者对自己参与的 universal modeling 路线给出很克制的评价:它实现了统一,但 image generation 不如 diffusion,image understanding 也不如连续视觉特征 VLM。}

本章小结

Autoregressive image modeling 最大优势是接口统一和成熟的 language-model machinery;最大问题是离散 tokenizer 损失、长序列串行生成和二维空间关系的线性化。它并非不可能生成好图,而是 practical frontier 转向了更适配并行图像计算的 diffusion。

Diffusion 与 Transformer:目标函数换了,系统经验仍然复用

Diffusion 不按 token 顺序预测图像,而是在多个 noise levels 上学习去噪 vector field。它让每一步都处理整张 latent,GPU utilization 通常优于 batch-one autoregressive decoding;随后 DiT 又把 denoiser 从 U-Net 换回 Transformer,显示“objective 改变”不等于 Transformer 退出。

DDPM:forward 加噪,reverse 学去噪

上一章的 autoregressive model 必须沿 image-token sequence 串行生成;本节改换问题表述,不再问“下一个 token 是什么”,而是问“给定某个 noise level,怎样把整张 noisy latent 推回更干净的方向”。读公式时要同时区分人为定义的 forward corruption 与模型学习的 reverse denoising。

定义 noise schedule \(\beta_t\)\(\alpha_t=1-\beta_t\)\(\bar\alpha_t=\prod_{s=1}^{t}\alpha_s\),forward process 有闭式采样:

\[ q(x_t\mid x_0)=\mathcal{N}\!\left(\sqrt{\bar\alpha_t}x_0,(1-\bar\alpha_t)I\right), \quad x_t=\sqrt{\bar\alpha_t}x_0+\sqrt{1-\bar\alpha_t}\epsilon. \]

模型常预测 \(\epsilon\)

\[ \mathcal{L}_{\text{simple}}=\mathbb{E}_{x_0,t,\epsilon} \left[\|\epsilon-\epsilon_\theta(x_t,t,c)\|_2^2\right], \]

其中 \(c\) 是 text condition。

\lecturefigure{slide-24-diffusion-ddpm.jpg}{DDPM:noise schedule、denoising network 与并行整图计算}{Stanford Online 官方录像 00:52:11}

为什么 diffusion 更容易吃满 GPU

每个 denoising step 同时更新整张 latent,矩阵规模大、并行度高;autoregressive image model 在 batch 很小时每步只产生一个 token,kernel launch 和 memory movement 难以充分摊销。diffusion 仍需多 steps,但每步硬件利用率通常更好。

\teachervoice{01:12:30--01:15:00,Q&A 中讲者拒绝把结论说成“不可能”:足够大的 autoregressive model 也能生成高质量图像;他更确定的是 sequential latency 与二维远距离关系带来的 practical disadvantage。}

Relay Diffusion:跨分辨率不能只复制同一个独立噪声

同一 nominal noise level 在不同 resolution 上的视觉模糊程度不同,因为自然图像信号具有空间相关性,而 standard Gaussian noise 常按 pixel 独立。Relay Diffusion 用 correlated/block noise 匹配尺度,使 coarse-to-fine stages 在频率和 SNR 上更一致。

\lecturefigure{slide-25-relay-diffusion.jpg}{Relay Diffusion:解耦 noise schedule、network 与 resolution}{Stanford Online 官方录像 00:54:49}

若 block size 为 \(k\),可把高分辨率 noise 写成低分辨率 noise 的上采样与 residual:

\[ \epsilon_h=U_k(\epsilon_l)+\lambda\epsilon_{\text{res}}, \]

并通过 \(\lambda\) 调整不同频段的 variance,使 coarse stage 与 fine stage 的 signal-to-noise ratio 更可比。它不是简单 resize image,而是重新定义跨分辨率的 stochastic path。

“SNR 对齐”依赖 schedule 与 data spectrum

block-correlated noise 的有效性要在具体 resolution、latent encoder、noise schedule 和训练数据上验证。它提供机制解释,不意味着所有 coarse-to-fine diffusion 都可直接复用同一超参数。

\teachervoice{00:52:11--00:55:16,讲者强调低分辨率与高分辨率在相同独立 noise 下并不具有相同感知难度,Relay 的核心是把 resolution 从 schedule 中解耦。}

CogView3:scale-up 与 distillation 都是系统组成

Relay Diffusion 解决的是跨分辨率 schedule;要把这一机制变成可用 text-to-image system,还必须同时扩大模型与数据,并把昂贵 teacher sampling 压缩到更少 steps。CogView3 正是这一步系统化扩展,并在 slide 上报告 distilled model 的 \(1024\!\times\!1024\) 图像生成速度。速度数字必须同时绑定硬件、实现、sampling step、batch 与质量设置。

\lecturefigure{slide-26-cogview3.jpg}{CogView3:扩大 Relay Diffusion 并通过 distillation 加速}{Stanford Online 官方录像 00:55:16}

Distillation 的目标不是只减少参数

Diffusion distillation 常把多步 teacher trajectory 压成更少 sampling steps。真正优化对象是 end-to-end latency 与 quality tradeoff;参数量不变也可能通过减少 function evaluations 大幅加速。

DiT:把 denoiser 换成 Transformer

DiT 将 latent patches 当作 tokens,并用 adaptive LayerNorm 接入 timestep/class condition。若普通 normalization 为 \(\operatorname{LN}(h)\),adaLN 可写成

\[ \operatorname{adaLN}(h;c)=\gamma(c)\odot\operatorname{LN}(h)+\beta(c), \]

其中 \(c\) 由 timestep 和条件 embedding 产生。这样每层都能根据 noise level 调整 feature scale 与 shift。

\lecturefigure{slide-27-diffusion-transformer.jpg}{DiT:以 Transformer blocks 和 adaptive normalization 替代 U-Net}{Stanford Online 官方录像 00:57:02}

AdaLN 与 cross attention 的差别

cross attention 让 image tokens 查询一组 condition tokens;adaLN 则把 condition 压成每层 scale/shift/gate。前者保留 token-level 对齐,后者更像全局调制。实际系统可同时使用两者。

\teachervoice{00:55:16--00:57:43,讲者注意到 timestep 输入只是很小的 condition,却可能通过大 MLP 生成每层调制参数;他把这视为仍有简化空间的工程设计。}

Stable Diffusion 3 与 MM-DiT:text/image experts 再次出现

MM-DiT 为 text 和 image tokens 保留分开的 parameter paths,再通过 attention 交互。可抽象为

\[ Q_t=H_tW_Q^{(t)},\quad Q_i=H_iW_Q^{(i)}, \]

而 joint attention 在拼接的 \(K,V\) 上交换信息。它与 CogVLM 的共同思想是 modality-specific transformations,不同之处在于任务是 diffusion denoising 而非 autoregressive response。

\lecturefigure{slide-28-stable-diffusion3-mmdit.jpg}{Stable Diffusion 3:MM-DiT 的 text/image expert paths}{Stanford Online 官方录像 00:57:43}

相似模块名不等于相同训练问题

CogVLM 的 vision experts 服务 image-conditioned language modeling;MM-DiT 的 modality paths 服务 rectified flow/diffusion denoising。参数分流是共享设计模式,但 loss、sequence、condition 和 evaluation 完全不同。

本章小结

Diffusion 赢得 practical image generation,主要来自整图并行、连续 latent 与更合适的空间建模路径。Relay 处理跨分辨率 noise,distillation 减少 sampling steps,DiT/MM-DiT 又把 Transformer 引回 denoiser。目标函数和系统路径共同决定最终效率。

Video generation 与研究议程:把预测写成可验证问题

视频把前面所有瓶颈叠加:token/latent 更多、temporal consistency 更难、high-resolution 更贵、data coverage 与 caption quality 更差。讲者没有给出 Sora 的内部结论,而是从公开现象拆出一套 2024 年的工程假设,并据此提出研究方向。

Sora-like recipe:3D latents、scale、context 与 data

课堂以 CogVideo 为早期 autoregressive text-to-video 参照,再把 Sora-like improvement 分成 deflickering、image quality、resolution、long-context infrastructure 与 recaption/coverage。若视频 latent 大小为 \(T\times H\times W\),naive token 数为

\[ n_v=T\frac{H}{p_h}\frac{W}{p_w}, \]

full attention 的二次成本会迅速爆炸,因此 3D latent compression、factorized attention、parallelism 与 data pipeline 都是必要条件。

\lecturefigure{slide-29-video-generation.jpg}{Video generation:从 CogVideo 到 Sora-like scaling recipe}{Stanford Online 官方录像 00:58:29}

五个工程因素分别解决什么

\sloppy | 因素 | 主要问题 | 不能自动保证的能力 | | --- | --- | --- | | 3D latent encoder | 压缩时空并减少 flicker | 真实物理与长期因果 | | Model/data scale | 提升视觉质量和覆盖 | 无偏、安全、可控 | | High resolution | 保存文字与细节 | 正确动作与几何 | | Long-context infra | 承载更多 frames/tokens | 有效利用所有 context | | Recaption 与 coverage | 改善 text-video supervision | 从 raw video 学到物理规律 |

\teachervoice{00:57:54--01:04:00,讲者把这些因素称为对 Sora-like progress 的总结,不是 controlled ablation。讲义因此把它们写成可检验 hypotheses,而不是已知内部配方。}

2024 年预测:识别、视频理解与 embodied AI

前一节拆解的是模型和数据怎样扩大 video generation;这里转向更不确定的 research forecast。预测 slide 认为高层视觉识别会更便宜,video understanding 会成为新热点,embodied AI 会产生亮眼 demo 但短期难进入日常生活。正确记录方式是保留 2024 年 5 月的时间、资源假设与“可能”语气,而不是事后只挑选命中的句子。

\lecturefigure{slide-30-research-predictions.jpg}{2024 年课堂预测:视觉识别、video understanding 与 embodied AI}{Stanford Online 官方录像 01:04:00}

Prediction 不是 benchmark result

“一两年”“80% solved”“无法很快影响现实生活”都不是可直接测量的标准。要验收预测,必须重新定义 task distribution、cost、accuracy、long-tail、deployment environment 与时间点。

\teachervoice{01:00:00--01:04:00,讲者同时表达乐观与限制:视觉识别会快速便宜化,但 video model 仍有 hallucination/counting 问题;embodied AI 会有惊艳 demo,却可能昂贵且难以日常部署。}

研究建议:按资源与目标选择问题

最后一页不是“选题排行榜”,而是把 career objective、compute access 和 research risk 联系起来。video datasets/benchmarks 适合资源较少但能组织 evaluation 的团队;speech 被认为需求高但投入不足;architecture/optimizer 可能影响大但要求硬件与系统能力;compute-to-data 则是 web corpus 逐渐饱和后的核心方向。

\lecturefigure{slide-31-research-advice.jpg}{按目标与资源选择研究问题:video、speech、systems、architecture 与 data}{Stanford Online 官方录像 01:07:34}

把建议改写成决策矩阵

\sloppy | 方向 | 主要资产 | 主要风险 | 可验证交付 | | --- | --- | --- | --- | | 视频数据/评测 | collection、annotation、evaluation | 泄漏、shortcut、覆盖不足 | dataset card、held-out test、error taxonomy | | Speech/audio | 用户场景与多语言数据 | 隐私、噪声、实时延迟 | ASR、TTS 与对话端到端指标 | | 系统协作 | GPU 拓扑与 kernel 知识 | 复现与硬件依赖 | 吞吐、延迟、利用率与成本 | | 架构/优化器 | 大规模 controlled runs | 计算昂贵、结论不稳 | matched-compute scaling/ablation | | Compute-to-data | verifier、execution、search | feedback bias、synthetic collapse | provenance、verification rate、novelty |

多模态研究项目的发布前检查
freeze_task_definition_and_data_split()
record_model_version_resolution_and_prompt()
report_compute_latency_memory_and_cost()
separate_demo_success_from_repeated_trial_rate()
audit_shortcuts_leakage_and_long_tail_failures()
publish_provenance_metrics_and_negative_results()

\teachervoice{01:05:00--01:08:10,讲者称 speech AI 被低估,并建议做算法的人尽早与 systems researchers 合作,因为最好的算法必须映射到当代硬件。}

本章小结

Video generation 不是把 image model 多跑几帧,而是时空压缩、并行训练、long context、数据覆盖和评价共同组成的系统问题。研究建议也应按资源与可验证交付理解,而不是把课堂预测当成确定路线图。

Q&A 延伸:课堂 slide 没写出的限制

Q&A 没有新增独立 visual state,却补上了几条决定技术结论是否可靠的限定:long context 的 prefill cost、data 与 architecture 的非零和关系、diffusion 优势的不确定性、CogAgent 的高分辨率来源,以及视频能否从 raw signal 学到物理。

Long context、data 与 architecture 的三条平衡线

第一,长上下文可减少外部 retrieval pipeline,但 prefill latency 与无关 token 干扰仍然存在。第二,data 可以表达许多 task-specific biases,但 general architecture improvement 仍可能改变所有任务的 compute frontier。第三,把全部 documents 或 reasoning branches 放入 context 需要模型学会利用,而不是只扩大窗口。

课堂 Q&A 的工程结论

  1. 对长文档短回答,允许较慢 prefill 可能合理;实时 agent 则未必。
  2. 对具体行为,先尝试 data/evaluation;对跨任务重复瓶颈,再考虑 architecture。
  3. 若 reasoning procedure 包含失败路径,把它们显式放入 context 可能比只保留 beam score 更有信息,但仍需实验。

\teachervoice{01:18:10--01:19:59,讲者倾向把 alternative paths 与 failure information 一并放入 context,让模型学习比较,而不是只用 hard-coded beam probability;这是一条经验,不是 universal theorem。}

Video understanding 不会自动获得物理世界

当前 VLM/video model 多依赖 text-image 或 text-video pairs。若 training signal 主要来自人工 annotation,模型学到的是人类描述覆盖的现象,不必然从 raw motion 中恢复 conservation、contact、object permanence 或 causal interventions。

“看过很多视频”不等于“学会物理”

要从未标注视频学习物理,可能需要 temporal prediction、masked video modeling、world-model objectives、interaction data 或可验证 simulation。仅扩大 annotated pairs,仍可能学到语言 shortcut 与表面相关性。

\teachervoice{01:16:15--01:18:10,讲者明确说如果数据源不包含 physical rules,现有 pair-based pretraining 不会自动学出它们;他把新的 video self-supervision 视为必要研究问题。}

本章小结

Q&A 把主讲中的 headline 还原成带条件的工程判断:context 有延迟,data 不能消灭 architecture,diffusion 没有数学上击败 autoregression,GUI demo 不代表可靠 agent,video quantity 也不等于 physical understanding。

总结与延伸

这节课最值得保留的不是模型清单,而是一个三层判断框架。第一层是 representation/objective:language token、continuous vision feature、discrete image code 与 noisy latent 各自保留什么信息。第二层是 architecture/systems:projection、experts、cross attention、ZeRO、parallelism 与 long context 怎样把表示映射到可训练硬件。第三层是 data/evaluation:instruction、preference、caption、GUI trace、video coverage 与 benchmark 如何定义模型最终学到的行为。

三条主线的统一

课程的最终统一图景

  1. LLM 提供通用序列底座:scaling、alignment 与 systems 让大模型成为可复用接口。
  2. Multimodality 暴露接口瓶颈:视觉细节、高分辨率、二维空间与视频时间结构迫使模型改变 bridge、objective 和 compression。
  3. Data 决定行为边界:architecture 能提高可拟合范围,但 benchmark、annotation、recaption、verification 与 failure coverage 决定系统实际上学会什么。

最容易犯的三种归纳错误

不要把同 pretraining loss 写成同能力定理;不要把一条 GUI trace 写成 agent reliability;不要把 diffusion 的 practical advantage 写成 autoregression 的不可能性证明。三种错误都来自把课堂证据层级抹平。

复现实验 checklist

若要复现本讲任一模型,至少应同时发布 architecture version、data mixture/provenance、resolution/tokenization、training compute、inference steps、prompt/evaluation protocol 与 repeated-trial failures。只发布 headline score,会让 data、algorithm、architecture 三者无法区分。

跨 LLM/VLM/diffusion 的统一复现清单
pin(code_commit, model_checkpoint, tokenizer_or_vae)
document(data_sources, filters, synthetic_fraction, licenses)
report(train_flops, gpu_hours, parallelism, peak_memory)
report(input_resolution, context_length, sampling_steps)
freeze(prompts, decoding, benchmark_version, test_split)
publish(ablations, confidence_intervals, failures, costs)

自测问题

未转换的 LaTeX 环境:multicols
\begin{multicols}{2}
\footnotesize

1. sep}{0pt}
     \setlength{\parskip}{0pt}
2. GLM blank infilling 与纯 MLM、纯 autoregression 的条件信息有何不同?
3. 为什么 scaling law 是预算分配器,而不是性能保证书?
4. perplexity 为什么不能跨 tokenizer 直接比较?
5. GQA 主要减少哪一类 inference memory?
6. ZeRO-1/2/3 分别 sharding 什么?
7. activation checkpointing 与 model checkpointing 有何区别?
8. TP、PP、context parallelism 分别切哪一维?
9. 为什么 long context 的主要交互成本可能在 prefill?
10. DPO 没有独立 reward model,为何仍依赖 reward assumptions?
11. CogQA 例子怎样体现 data/algorithm/architecture 可交换?
12. BLIP-2 的 Q-Former 同时完成哪两类工作?
13. LLaVA projection 简单,但为什么 OCR 仍可能差?
14. CogVLM vision experts 想保护什么能力?
15. CogAgent 为什么需要高分辨率旁路?
16. 单条 web trace 不能证明哪些能力?
17. Vary 与 GLM-4V 对 OCR bottleneck 的处理有何不同?
18. image tokenizer 给 autoregressive generation 带来什么得失?
19. diffusion 为什么通常比 batch-one AR decoding 更能利用 GPU?
20. Relay Diffusion 为什么要改变跨 resolution 的 noise correlation?
21. adaLN 与 cross attention 的 condition 路径有何不同?
22. Sora-like recipe 中哪些是表示问题,哪些是 systems/data 问题?
23. 为什么 annotated video pairs 不保证学到 physical rules?


\end{multicols}

拓展阅读

未转换的 LaTeX 环境:multicols
\begin{multicols}{2}
\footnotesize

- sep}{0.15em}
    \setlength{\parskip}{0pt}
- Du et al., [GLM: General Language Model Pretraining with Autoregressive Blank Infilling](https://arxiv.org/abs/2103.10360):理解目标函数统一。
- Rajbhandari et al., [ZeRO](https://arxiv.org/abs/1910.02054);Shoeybi et al., [Megatron-LM](https://arxiv.org/abs/1909.08053):理解状态分片与模型并行。
- Rafailov et al., [Direct Preference Optimization](https://arxiv.org/abs/2305.18290):理解 pairwise preference objective。
- Li et al., [BLIP-2](https://arxiv.org/abs/2301.12597);Liu et al., [LLaVA](https://arxiv.org/abs/2304.08485):比较 Q-Former 与 projection bridge。
- Wang et al., [CogVLM](https://arxiv.org/abs/2311.03079);Hong et al., [CogAgent](https://arxiv.org/abs/2312.08914):理解 vision experts 与 GUI high-resolution path。
- Ho et al., [DDPM](https://arxiv.org/abs/2006.11239);Peebles and Xie, [DiT](https://arxiv.org/abs/2212.09748);Esser et al., [Stable Diffusion 3](https://arxiv.org/abs/2403.03206):从 diffusion objective 到 Transformer denoiser。
- Snell et al., [Same Pre-training Loss, Better Downstream](https://arxiv.org/abs/2409.01236):作为课堂“loss 决定能力”强主张的 post-lecture 反例阅读。


\end{multicols}