Lecture31
\makecscover
讲座定位:多模态不是在 LLM 外面再挂一个视觉模块
这节课的跨度很大:前半段回顾 BERT、GPT-3、ChatGPT 三个语言模型“时刻”,中段讨论 Transformer 架构、训练系统、alignment 与数据工程,后半段才进入 BLIP-2、LLaVA、CogVLM、CogAgent、图像扩散与视频生成。这样的安排不是离题,而是在回答一个贯穿全课的问题:当模型能力从 text 扩展到 image、GUI 和 video 时,哪些来自 LLM 的规律仍然成立,哪些必须换表示、目标函数或系统路径?
来源修复与课堂边界
旧稿把课堂日期写成 2026 年 4 月 4 日,并加入 monitoring dashboard、drift detection、automatic rollback、fairness governance 等大量课程中不存在的内容。本讲现以官方 CS25 V4 课程页、2024 年 5 月 9 日课堂、Stanford Online 官方录像 cYfKQ6YG9Qo、官方 en-US 人工字幕和 31 个录像恢复 teaching states 为课堂主干。官方页面和视频描述均未提供可验证的独立 slide deck,因此录像共享屏幕是视觉 source of truth。
\lecturefigure{slide-01-title.jpg}{官方课堂标题:From Large Language Models to Large Multi-modality Models}{Stanford Online 官方录像 00:02:31}
标题中的 “Large Multi-modality Models” 是 2024 年课堂用语。它不表示所有 modality 已被统一解决,而是强调模型研究已经从单一语言接口扩展到视觉理解、图像生成、GUI action 和视频。讲者所在团队的 CogVLM、CogAgent、CogView 与 CogVideo 是案例,不是整门课的唯一结论。
时间边界必须保留
本讲展示的 benchmark、产品能力、下载量和“一两年内”的预测都属于 2024-05-09 的课堂快照。后来的模型版本、排行榜变化或产业结果不能倒灌进课堂事实;若用于拓展,只能显式标成 post-lecture evidence。
四段路线图与阅读问题
课程先问 why、再问 how、接着问 what、最后问 where。读者不应把四部分看成并列综述:LLM 的 objective 和 scaling 解释为什么系统工程变得重要;系统与数据解释为什么 VLM 可以迅速复用语言底座;视觉表示的缺陷又解释为什么生成侧从 autoregression 转向 diffusion。
\lecturefigure{slide-02-outline.jpg}{课程路线图:历史、训练技术、视觉语言模型与研究方向}{Stanford Online 官方录像 00:03:29}
带着四个问题读完全课
- Objective:不同 modality 应该共享 autoregressive objective,还是使用专门的 diffusion / contrastive objective?
- Architecture:投影层、Q-Former、vision experts 与 cross attention 分别解决什么接口问题?
- Systems:ZeRO(Zero Redundancy Optimizer,在 data-parallel ranks 间分片 optimizer/gradient/parameter states)、parallelism、long context 与高分辨率 token 如何改变可训练问题的边界?
- Data:当通用 web data 接近饱和,如何把 compute 转换成更高质量、可验证的数据?
\teachervoice{00:02:31--00:04:35,Ming Ding 提醒听众本讲会跨越多个并不熟悉的子领域。他的目标不是给每个模型做完整 survey,而是沿 Transformer 社区的时间线解释研究重心为什么移动。}
证据账本:机制、结果、判断与预测
同一张 slide 可能同时包含论文结构图、课堂判断和产品结果。为了避免“图上写了”被误读为普遍事实,本讲采用四层证据账本。
四层证据读法
| 层次 | 例子 | 正确读法 |
|---|---|---|
| 标准机制 | cross entropy、attention、DDPM、DPO | 给出公式、变量与假设 |
| 具体系统 | ZeRO、Megatron、CogVLM、MM-DiT | 说明接口、资源路径与版本 |
| 课堂结果 | benchmark table、web-agent trace、速度数字 | 只支持展示的设置和 protocol |
| 讲者判断/预测 | loss 决定能力、video 将成热点 | 保留日期、语气与反例空间 |
本章小结
这是一堂“从 LLM 规律迁移到 multimodality”的课,不是 Cog 系列产品说明书。读者需要同时追踪 objective、architecture、systems 与 data,并始终区分标准机制、课堂实验、讲者判断和未来预测。
三个 LLM moments:目标函数、规模与对齐
讲者用 BERT、GPT-3、ChatGPT 三个时刻压缩五年语言模型史。它们分别改变了研究者对 self-supervision、scale 和 task adaptation 的理解。关键不是记住年份,而是看研究瓶颈如何从“设计更好的任务”迁移到“分配计算”,再迁移到“用少量高质量数据改变行为”。
BERT moment:理解与生成曾被认为需要不同目标
2018--2021 年常见分工是:masked language modeling(MLM)负责理解,autoregressive modeling 负责生成,T5 用 encoder--decoder 兼顾两者。GLM 的 blank infilling 则把被遮盖 span 内部改成自回归生成,试图在一个 decoder-style objective 中覆盖不同任务。
\lecturefigure{slide-03-language-modeling.jpg}{BERT 时刻:MLM、autoregression、T5 与 GLM 的任务视角}{Stanford Online 官方录像 00:07:00}
设原序列为 \(x=(x_1,\ldots,x_n)\),遮盖 span 集合为 \(M\)。GLM 的核心可写成对被遮盖 token 的条件自回归:
这里 \(x_{\setminus M}\) 是可见上下文,\(x_{m,<j}\) 是当前 span 内已生成 token。若遮盖几乎覆盖全序列,目标接近 GPT;若遮盖较小 span,则保留双向可见上下文。
Objective 的真正作用
预训练 objective 决定模型在训练时能看到什么条件、预测什么变量以及误差怎样传播。它不直接等于“理解”或“生成”能力;下游 fine-tuning、prompt format、data mixture 和 inference procedure 都会改变最终行为。
\teachervoice{00:05:00--00:08:55,讲者把 GLM 放在“社区信念会快速改变”的历史里:当年大家努力发明 self-supervised task,后来发现 task adaptation 可以很便宜,研究价值的判断随规模和数据条件变化。}
GPT-3 moment:scaling law 变成预算分配器
第二个时刻不是“参数越多越好”的口号,而是用可拟合曲线把 loss 与参数、数据、计算联系起来。常见经验形式为
其中 \(N\) 是参数量,\(D\) 是训练 token 数,\(L_\infty\) 是不可约 loss,\(a,b,\alpha,\beta\) 由实验拟合。它允许团队在固定 compute \(C\) 下比较“加参数”与“加 token”的边际收益。
\lecturefigure{slide-04-scaling-law.jpg}{GPT-3 时刻:用 scaling curves 分配参数、数据与计算}{Stanford Online 官方录像 00:09:19}
若一次 dense Transformer 训练的主要 FLOPs 近似为
那么给定预算时,\(N\) 与 \(D\) 不能同时无限增长。这里的 \(6\) 是常用粗略常数,真实成本还受 sequence length、attention、activation recomputation、parallel efficiency 和 kernels 影响。
Scaling law 不是性能保证书
拟合曲线只在观测到的模型族、数据分布、tokenizer、optimizer 和训练区间内成立。数据质量下降、重复率上升、分布外任务或系统效率恶化时,增加名义 compute 不保证按同一指数提升。
\teachervoice{00:09:19--00:10:00,讲者把 scaling law 形容成工程预算工具:老板给四倍资源时,需要决定资源落在参数还是 token,而不是只宣布“模型更大”。}
ChatGPT moment:task adaptation 便宜,但知识从哪里来?
第三张 slide 把 InstructGPT 的人类偏好提升与“下游性能由 pretraining loss 决定”的经验图放在一起。前者说明 alignment 能显著改变人类评价;后者试图说明同等预训练 loss 下,较小但训练更充分的模型可能追上较大但 under-trained 的模型。
\lecturefigure{slide-05-alignment-pretraining-loss.jpg}{ChatGPT 时刻:alignment 改行为,pretraining loss 承载基础能力}{Stanford Online 官方录像 00:13:05}
交叉熵与 perplexity 的关系是
perplexity 可直观理解为“模型每个 token 面前的有效选择数”,但不同 tokenizer、语料和 domain 的 PPL 不可直接横比。
“同 loss 同能力”不是普遍定理
课堂提出的是强经验判断。即使平均 pretraining loss 相近,architecture、tokenizer、data mixture、optimization trajectory、context length 与 evaluation format 仍可造成能力差异。2024 年 9 月之后的工作也给出 same-loss、different-downstream 的反例,因此本讲只保留其预算与 over-training 直觉。
\teachervoice{00:10:00--00:13:18,讲者明确把所谓 emergent ability 重新解释为 loss 曲线现象。这是他的研究立场,不应改写成社区已经证明的因果结论。}
本章小结
BERT moment 关注训练目标,GPT-3 moment 关注规模与预算,ChatGPT moment 关注低成本行为适配。三者共同把研究问题从“哪种任务最聪明”转成“知识由何种数据和计算获得、行为又怎样被高质量反馈塑形”。
Transformer 架构与训练系统:能力边界由资源路径决定
在多模态模型出现前,语言底座必须先被稳定训练。讲者的核心判断是:现代 LLM 的许多关键改进不是全新网络,而是对 decoder path、normalization、KV memory、parameter routing 与 distributed execution 的持续修整。理解这些术语,是后面理解 high-resolution VLM 和 video scaling 的前提。
现代 decoder-only recipe 的术语消化
前一章说明了 objective、scale 与 alignment 怎样移动研究瓶颈;本节进一步问:当 decoder-only LLM 成为共同底座后,工程团队究竟改了计算图的哪些位置,又分别换来了什么稳定性、容量或 inference memory。下面这张 slide 把常见 architecture updates 压在一页里,读图时不要只数名词,而要区分它们作用于 residual path、position、KV sharing、MLP 还是 routing。
\lecturefigure{slide-06-transformer-architecture.jpg}{现代 Transformer 常见更新:decoder-only、pre-norm、RoPE、GQA、GLU 与 MoE}{Stanford Online 官方录像 00:16:10}
标准 causal self-attention 为
其中 \(M\) 是 causal mask。GQA(Grouped-Query Attention)让多组 query heads 共享更少的 key/value heads,主要减少 KV cache,而不是减少所有 attention FLOPs。
密集术语表:它们解决的是不同瓶颈
| 术语 | 核心机制 | 课程关系 |
|---|---|---|
| Decoder-only | 统一 causal generation path | 便于规模化预训练与统一接口 |
| Pre-norm | 在子层前做 LayerNorm | 改善深层残差训练稳定性 |
| RoPE | 在 \(Q,K\) 上旋转编码相对位置 | 为长上下文和外推提供位置结构 |
| GQA | 多个 query heads 共享 KV heads | 缩小 inference KV cache |
| SwiGLU/GLU | 用门控乘法替代普通 MLP 激活 | 改变 feed-forward 容量与优化 |
| MoE | 每个 token 只激活部分 experts | 增加总参数而控制 active compute |
\teachervoice{00:13:18--00:17:45,讲者强调这些改进大多是长期累积而非突然出现的“新 Transformer”。他的玩笑是 architecture innovation 很少,但这不等于每个改动都无关紧要。}
DeepSpeed 与 ZeRO:先算清一份参数占多少显存
训练系统的第一课不是背 ZeRO-1/2/3,而是做 resource accounting。对混合精度 AdamW,一个参数常需要 FP16/BF16 parameter、gradient,以及 FP32 master weight、first moment \(m\)、second moment \(v\)。粗略字节数为
十亿参数仅这些 states 就约 16 GB,尚未计 activation、temporary buffers、fragmentation 与 communication workspace。
\lecturefigure{slide-07-deepspeed.jpg}{DeepSpeed:optimizer states、activation checkpointing 与 ZeRO 分片}{Stanford Online 官方录像 00:19:30}
首次定义:sharding、optimizer state 与 activation checkpointing
Sharding(分片)是把原本每张卡复制的一类状态切到不同 data-parallel ranks;optimizer state 是 Adam/AdamW 的 \(m,v\) 与常见 FP32 master weights;activation checkpointing 只保存少量 forward activations,backward 时重算其余部分,和保存模型文件的 model checkpointing 不是一件事。
ZeRO-1 分片 optimizer state,ZeRO-2 再分片 gradients,ZeRO-3 连 parameters 也分片。若 data-parallel world size 为 \(p\),理想状态占用近似按 \(1/p\) 缩小,但换来 all-gather、reduce-scatter 等 collectives(多 GPU 通信原语)。
bytes = parameter_low_precision
bytes += gradient_low_precision
bytes += master_parameter_fp32
bytes += adam_first_moment_fp32
bytes += adam_second_moment_fp32
bytes += saved_activations_or_recompute_budget
bytes += communication_and_kernel_workspace
report(bytes_per_rank, sharding_stage, world_size)
\teachervoice{00:17:45--00:21:13,讲者特别指出显存大头常来自 Adam states,而 activation checkpointing 的代价是 backward 重算。把“省显存”写成免费优化会丢掉系统事实。}
Megatron:tensor 与 pipeline parallelism 分别切什么
ZeRO 沿 data-parallel ranks 分片状态;Megatron 的 tensor parallelism(TP)在一层内部切 hidden dimensions/heads,pipeline parallelism(PP)沿层深切 stages。两者解决的维度不同,通信模式也不同。
\lecturefigure{slide-08-megatron.jpg}{Megatron:tensor parallel 与 pipeline parallel 的切分方式}{Stanford Online 官方录像 00:21:13}
若线性层 \(Y=XW\) 按列切 \(W=[W_1,\ldots,W_p]\),每个 rank 计算 \(Y_i=XW_i\),后续可能需要 all-gather;按行切则局部结果需要 all-reduce 求和。PP 的利用率受 micro-batch 数 \(m\) 与 stage 数 \(p\) 影响,朴素 bubble fraction 可粗略写成
interleaving、1F1B 与 ZeroBubble 类调度都在减少空闲,但会增加排程复杂度和通信约束。
Collectives 不是一个模糊的“同步”
All-reduce 汇总并把结果发回每个 rank;reduce-scatter 汇总后只保留各自分片;all-gather 收集所有分片;broadcast 从一个 rank 发送给所有 rank。不同 sharding/parallelism 方案的性能差异,常来自这些操作的频率、消息大小和拓扑匹配。
\teachervoice{00:20:00--00:22:50,讲者把超大模型训练概括为 engineering work,并用“MLP 不重要,ML6 重要”的玩笑强调:没有 systems knowledge,架构纸面 FLOPs 无法变成有效训练。}
Long context:full attention 仍然要支付二次复杂度
长上下文 slide 对比早期 CogLTX 的显式 retrieval/rehearsal 结构与 2024 年 full-attention context parallelism。所谓 lossless 指不通过 sparse attention 改写 attention pattern,不代表计算没有代价。
\lecturefigure{slide-09-long-context.jpg}{Lossless 128K:context parallel、Ring Attention 与 Ulysses}{Stanford Online 官方录像 00:24:27}
对 sequence length \(n\)、head dimension \(d_h\),完整 score matrix 的主要计算为
单卡显式存储也可达 \(\mathcal{O}(n^2)\)。context parallelism 把 sequence 分到 \(p\) 个 ranks,局部 activation 约降到 \(\mathcal{O}(nd/p)\),但必须轮转或交换 \(K,V\) blocks,并处理 causal load imbalance。
长上下文的隐藏成本是 prefill
Q&A 中讲者把 inference 分成 prefill 与 decode。长文档常只生成短答案,但 prefill 仍要读取并处理整段 context,可能耗时数秒到一分钟。更长窗口不是“免费 memory”,还会增加 latency、KV cache、communication 与无关信息干扰。
\teachervoice{01:08:10--01:10:30,讲者接受某些文档理解场景用较长 prefill 换取短回答,但没有声称所有交互应用都能容忍这一 latency。}
本章小结
现代 LLM recipe 同时包含 architecture updates 与 distributed systems。ZeRO 切状态,TP 切层内张量,PP 切层,context parallelism 切序列;每次减少单卡显存,都通过 collectives、重算、bubble 或 latency 支付代价。这些系统路径会在 high-resolution image 与 video 中再次出现。
Alignment 与数据工程:行为适配不是知识凭空生成
语言底座训练完成后,SFT 与 preference optimization 决定模型怎样回答。讲者把这部分与 data engineering 放在一起,因为 alignment 的关键变量不是算法名字,而是 instruction、answer、preference pair 的质量、来源与覆盖。
SFT:高质量答案需要 domain experts
SFT(Supervised Fine-Tuning)仍是普通 teacher-forced cross entropy。给 instruction--response 对 \((x,y)\),目标为
困难在数据:若希望模型写出可靠代码解释,标注者必须能写出可靠代码解释,而不是只完成低成本选择题。
\lecturefigure{slide-10-sft.jpg}{SFT:expert annotation、distillation 与 weak-to-strong 问题}{Stanford Online 官方录像 00:27:01}
Teacher-generated data 的两层边界
更强模型可以快速生成 instruction data,但学生会继承 teacher 的偏差、风格和盲区;若目标是独立竞争,依赖封闭 teacher 还带来许可、可复现性与 data provenance 问题。Weak-to-Strong 讨论的是弱监督下能否超过 supervisor,不等于“复制 teacher outputs 就必然超过 teacher”。
\teachervoice{00:25:00--00:28:24,讲者反复强调 SFT 不是普通 crowdsourcing。高质量答案需要真正懂 domain 的人,这一点比把数据量写成一个数字更重要。}
RLHF 与 DPO:算法变简单,偏好假设没有消失
SFT 教模型模仿目标答案,却没有显式比较两个都“像答案”的输出。Preference optimization 因此回答下一个问题:当 chosen 与 rejected 只在帮助性、风格或安全性上有差别时,怎样把成对判断变成 policy update。PPO-based RLHF 与 DPO 的差异在优化路径,不在于是否需要定义偏好。
PPO-style RLHF 通常先训练 reward model \(r_\phi(x,y)\),再优化带 KL regularization 的 policy:
DPO 直接用 chosen/rejected pair \((y^+,y^-)\) 优化
\lecturefigure{slide-11-rlhf.jpg}{RLHF 与 DPO:reward model、PPO 难度和 pairwise objective}{Stanford Online 官方录像 00:28:24}
DPO 没有消灭 reward modeling
DPO 不显式训练独立 reward model,但 preference pairs 仍隐式定义“什么更好”。pair 是否 on-policy、annotator 是否一致、prompt 是否覆盖真实使用、chosen/rejected 是否只差风格,都会改变学到的 reward geometry。
\teachervoice{00:28:24--00:30:00,讲者认为 PPO 在 reward model 足够好时可能很强,但工程实现困难;他把 DPO 作为更易用的替代,同时口头提醒 pair quality 和 on-policy 性。}
Data–algorithm–architecture 可以编码相似 bias
这张 slide 是整节课最重要的研究方法论。CogQA 的 multi-hop question answering 曾使用 graph neural network,另一路使用 MCTS;当 long-context GPT 和 chain-of-thought 能把相关 documents 一次放入 context 时,同一个任务可改写成 data/context-level problem。
\lecturefigure{slide-12-data-algorithm-architecture.jpg}{数据、算法与架构的可交换性:从 CogQA 到 long-context reasoning}{Stanford Online 官方录像 00:34:16}
三种实现同一归纳偏置的层次
- Architecture:把 graph structure、memory 或 routing 写进网络结构。
- Algorithm:在 inference 时用 search、MCTS、retrieval 或 verifier 组织计算。
- Data/context:把中间证据、失败路径或完整 documents 放入训练样本与上下文,让通用模型学习 procedure。
越靠数据层通常越通用,但需要更强模型、更长 context 和更高质量样本。
if behavior_is_narrow_and_examples_are_available:
encode_with_data_and_evaluation()
elif inference_needs_verifiable_search:
add_algorithmic_search_or_tools()
elif bottleneck_is_general_and_repeats_across_tasks:
consider_architecture_change()
always_measure(compute, latency, coverage, failure_modes)
\teachervoice{00:30:00--00:34:20,讲者为 data work 辩护:cleaning、filtering、synthesizing 不是“低级劳动”,而是当前模型公司最核心的研究工程。}
\teachervoice{01:10:30--01:12:30,Q&A 中他又补了一层:许多具体行为可以用 data 解决,但若有人找到能普遍增强拟合能力的 architecture update,仍然非常有价值。}
本章小结
SFT、RLHF、DPO 都不能脱离数据质量讨论。更一般地,同一 inductive bias 可以写进 architecture、algorithm 或 data/context;最简单的层次不一定最便宜,因为它可能要求更大 compute、更长 context 和更可靠 evaluation。
视觉语言接口:从 Q-Former 到线性投影
把 image 接入 LLM 的第一个问题不是“模型看懂了吗”,而是视觉 encoder 的连续特征怎样进入 language model 的 token space。BLIP-2 与 LLaVA 给出两种典型桥接方式:一个使用可学习 queries 和 Q-Former 压缩/对齐,一个直接线性投影视觉 token。
BLIP-2:用 Q-Former 查询冻结视觉空间
BLIP-2 把 frozen image encoder 与 frozen LLM 之间放入 Q-Former。令视觉特征为 \(V\in\mathbb{R}^{m\times d_v}\),可学习 queries 为 \(Q_0\in\mathbb{R}^{q\times d}\),cross attention 为
\(q\ll m\) 时,Q-Former 同时做信息瓶颈与空间对齐,再把少量 query outputs 送入 LLM。
\lecturefigure{slide-13-blip2.jpg}{BLIP-2:Q-Former 桥接 frozen image encoder 与 frozen LLM}{Stanford Online 官方录像 00:36:18}
Q-Former 解决两个不同问题
一是compression:从大量 image patches 提炼固定数量 queries;二是alignment:把 CLIP-like feature space 转到 LLM 可消费的 embedding space。它不是让 LLM 自己重新学习全部视觉 backbone。
\teachervoice{00:35:00--00:36:55,讲者把 BLIP-2 称为有效连接 CLIP 与 LLM 的先驱,重点在“两个冻结空间之间需要可训练桥”。}
LLaVA:简单 projection 为什么成为强 baseline
LLaVA 使用 vision encoder \(f_v\) 和 projection \(W_p\):
再把 \(Z_v\) 与 text embeddings 拼接输入 LLM。它减少了额外模块,容易 end-to-end instruction tuning,因此很快成为 VLM 常见 baseline。
\lecturefigure{slide-14-llava.jpg}{LLaVA:以 projection 对齐视觉特征与语言 embedding}{Stanford Online 官方录像 00:36:55}
Linear projection 简单,不等于信息无损
projection 只保证维度匹配。视觉 encoder 的分辨率、patch size、pretraining objective、projector capacity 和 instruction data 决定哪些细节能进入 LLM;小文字、OCR、grounding 与 GUI icons 往往首先暴露瓶颈。
接口 taxonomy:压缩、对齐、保留与高分辨率
在进入 Cog 系列前,可以用四个问题比较所有 VLM bridge:多少视觉 token 被保留?视觉与语言是否共享参数?是否会破坏原语言能力?高分辨率输入的 cost 在哪里支付?
VLM bridge 对照表
| 方法 | 视觉接口 | 参数路径 | 主要权衡 |
|---|---|---|---|
| BLIP-2 | Q-Former queries | bridge 可训练,backbones 可冻结 | 压缩强,但 query bottleneck 明显 |
| LLaVA | linear/MLP projector | 视觉 token 进入 LLM path | 简单强基线,高分辨率成本高 |
| CogVLM | vision experts | image/text token 走部分不同参数 | 尝试保留语言行为,参数更多 |
| CogAgent | high-res cross attention | 轻量高分辨率旁路 | 面向 GUI/OCR,系统更复杂 |
| Vary | 多视觉词表/feature ensemble | 多 encoder 特征合并 | OCR 更强,接口与训练成本上升 |
| GLM-4V slide | stride convolution | 压缩后 mixed training | 结构简单,结果依赖数据与 protocol |
本章小结
多模态接口的本质是 information bottleneck 与 parameter sharing。Q-Former 显式查询和压缩,LLaVA 直接投影;后续模型则围绕“保留语言能力”和“处理高分辨率细节”继续分化。
CogVLM、CogAgent 与 GLM-4V:分开参数路径还是压缩输入
这一章集中分析讲者团队展示的视觉理解模型。重点不是比较模型名,而是看三类瓶颈:image alignment 是否覆盖语言能力、high-resolution screenshot 如何控制 token cost、OCR/grounding benchmark 是否能代表真实 GUI agent。
CogVLM:vision experts 避免覆盖 language path
CogVLM 的动机是:若所有 image-text alignment gradient 都更新原 LLM parameters,基础语言行为可能被覆盖。它为视觉 token 增加独立 attention/MLP experts,同时保留 text token 的原路径。可抽象为
\lecturefigure{slide-15-cogvlm-architecture.jpg}{CogVLM:以 vision experts 分离视觉与语言参数路径}{Stanford Online 官方录像 00:38:44}
“保留语言行为”需要怎样验证
结构上保留 text expert 只能提供机制假设。真正验证需要在 multimodal tuning 前后比较 language-only perplexity、instruction following、reasoning、safety 和 domain tasks;不能仅凭参数没有完全共享就断言无遗忘。
\teachervoice{00:37:25--00:39:27,讲者把 CogVLM 的设计目标明确说成 keep all language behavior。讲义保留这个目标,但不把它升级成未经完整语言回归测试的结论。}
CogVLM 结果页:雷达图先问 protocol,再问面积
结果 slide 汇总 image captioning、grounding、VQA 和综合 VLM benchmarks,并给出开源链接。读图时应先确认每个轴的 metric、model size、input resolution、prompting 与 test split,再比较单项,而不是只比较雷达图覆盖面积。
\lecturefigure{slide-16-cogvlm-benchmarks.jpg}{CogVLM 的课堂时 benchmark 汇总与开源信息}{Stanford Online 官方录像 00:39:27}
Benchmark table 不等于 production robustness
VQA accuracy、caption score、grounding IoU 与 LLaVA-Bench 测量的问题不同;它们不能直接推出 GUI reliability、OCR 长尾、幻觉率、adversarial robustness 或真实用户任务成功率。下载量也只说明 adoption,不说明 correctness。
CogAgent:高分辨率旁路为何必要
网页 screenshot 包含大量小文字、icons 和坐标关系。若把分辨率提高 \(s\) 倍,而 patch size 不变,二维 token 数近似提高 \(s^2\) 倍;full attention cost 可能进一步接近 \(s^4\) 倍。CogAgent 用 cross-attention high-resolution branch,让高分辨率特征不必全部扩展到 LLM hidden width。
\lecturefigure{slide-17-cogagent-architecture.jpg}{CogAgent:为 GUI/OCR 增加 high-resolution cross-attention branch}{Stanford Online 官方录像 00:40:13}
若低分辨率 language tokens 为 \(H_l\in\mathbb{R}^{n\times d}\),高分辨率 features 为 \(H_h\in\mathbb{R}^{m\times d_h}\),旁路可写成
其目标是让 \(m\) 个细粒度 features 被查询,而不是全部成为等价的 LLM sequence tokens。
\teachervoice{01:15:00--01:16:15,Q&A 中讲者直接区分 CogAgent 与 CogVLM:前者从后者 fine-tune/扩展而来,专门面向 high-resolution web screen,并用较轻 cross-attention 控制成本。}
Web trace:模型输出的是 grounded action,不是“会用浏览器”四个字
示例任务要求搜索 CVPR 2023 best paper。slide 展示从 screenshot 理解、定位搜索框、输入 query、读取结果到继续点击的多步 trace。一个 action 通常需要 type 与 coordinates/text,例如
\lecturefigure{slide-18-cogagent-web-demo.jpg}{CogAgent web navigation:从 screenshot 到 action sequence}{Stanford Online 官方录像 00:41:19}
observation = capture_screenshot()
action = model.predict(goal, observation, history)
validate(action.type, action.coordinates, action.text)
execute_in_sandbox(action)
record(observation, action, result, failure_reason)
stop_only_when(goal_is_verified)
单条成功 trace 不估计可靠性
真实 GUI agent 还需测量 repeated trials、layout shift、small-text OCR、unexpected popups、permission boundary、irreversible actions 和 recovery。课堂 demo 证明接口可行,不证明 autonomous browsing 已经稳健。
Vary:增加 vision vocabulary 以服务 OCR
Vary 把不同视觉 features 组合为更丰富的 vision vocabulary,目标是补足通用 CLIP features 对 document/OCR 细节的不足。可抽象为
其中两个 encoder 的 inductive bias 不同,合并后再接 LLM。
\lecturefigure{slide-19-vary.jpg}{Vary:ensemble vision features 以扩大视觉词表}{Stanford Online 官方录像 00:41:46}
Vision vocabulary 不是离散文字词表
这里的 vocabulary 指可表达的视觉 feature patterns:layout、small text、objects、regions 与文档结构。增加专用 encoder 可能提升 OCR,但也增加训练、部署、feature alignment 与维护成本。
GLM-4V:简单 stride convolution 与 mixed training
课堂展示的 GLM-4V 结构回到较简单的 LLaVA-style path,只把 projector 换成 stride convolution,以压缩高分辨率 feature map。若输入 feature map 为 \(H\times W\),stride 为 \(s\),token 数近似从 \(HW\) 降到
随后 text/image data 做 mixed training,以减少多模态训练对 language behavior 的破坏。
\lecturefigure{slide-20-glm4v-architecture.jpg}{课堂展示的 GLM-4V:stride convolution 与 text-image mixed training}{Stanford Online 官方录像 00:42:34}
\teachervoice{00:41:46--00:43:00,讲者特意说最新模型反而使用更简单的 architecture。这个例子支持他的 data thesis:更复杂 bridge 并不自动带来更强最终系统。}
GLM-4V 结果表:每一列回答不同问题
表中同时出现 MMBench、MME、MMMU、MathVista、MMVet、DocVQA、OCRBench 等。它们覆盖 general perception、knowledge/reasoning、math/diagram、document OCR 等不同能力,不能求一个未经定义的“总分”。
\lecturefigure{slide-21-glm4v-results.jpg}{GLM-4V 的课堂时多 benchmark 结果表}{Stanford Online 官方录像 00:43:00}
读多模态 benchmark 表的顺序
先确认 model/version 和输入分辨率,再确认 zero-shot/few-shot、prompt、test split 与 metric;然后按任务族比较,而不是跨列直接平均。若某模型 OCR 强但 MMMU 弱,结论是能力分布不同,不是简单的“谁更智能”。
课堂时 GLM-4V 与后续版本不能混用
这张 slide 早于后续稳定 technical reports。讲义只记录当时展示的 architecture 和 table,不用后来 GLM-4V/GLM-4.1V 的能力反向证明 2024 年版本。
本章小结
CogVLM 用 experts 分离参数路径,CogAgent 用 high-resolution cross attention 控制 GUI/OCR 成本,Vary 扩充视觉 features,GLM-4V 用 stride convolution 压缩输入。它们都在回答同一问题:怎样把视觉细节送入 LLM,同时控制遗忘、token 数和系统成本。
Autoregressive image modeling:统一接口为何没有赢得所有任务
如果 image 可以离散成 tokens,最自然的想法是沿用 GPT:text-to-image、image-to-text、image completion 都只是不同 token 排列与 mask。这条路线具有接口统一的美感,但 high-resolution sequence length、tokenizer information loss 和 sequential decoding 让它在生成质量与速度上面对 diffusion 的强竞争。
CogView/DALL-E/Parti:先把图像变成离散序列
设 image tokenizer 把图像 \(I\) 编成 codes \(z=(z_1,\ldots,z_m)\),文本 tokens 为 \(x\)。text-to-image 的 factorization 为
训练只需把 text 与 image tokens 拼成一个 sequence,但 image token 数可能达到数千,生成必须串行走完全部位置。
\lecturefigure{slide-22-autoregressive-text-to-image.jpg}{Autoregressive text-to-image:image tokenizer 加 GPT sequence}{Stanford Online 官方录像 00:46:47}
Image tokenizer 同时提供压缩和损失
VQ tokenizer 把连续像素压成有限 codebook,显著缩短序列;但细文字、纹理、几何和颜色精度可能在编码阶段丢失。后面的 Transformer 无法恢复 tokenizer 从未保留的信息。
\teachervoice{00:45:00--00:49:32,讲者把 CogView 与 DALL-E/Parti 放在同一简单 recipe:先离散化,再 autoregress。简单是优点,也是速度和细节瓶颈的来源。}
Universal modeling:能做所有方向,不等于每个方向最好
同一个 sequence model 可以通过排列和 mask 表达多种任务:
这确实统一了 API,但 image understanding 可能不如保留连续 features 的 VLM,image generation 又可能不如 diffusion。
\lecturefigure{slide-23-universal-modeling.jpg}{Universal vision-language modeling:排列统一与性能折中}{Stanford Online 官方录像 00:49:32}
统一 objective 与统一最优解是两件事
一个模型能表达多任务 likelihood,不代表有限参数、有限数据和有限 compute 下会同时达到各 specialized systems 的 Pareto frontier。共享表示会带来 transfer,也会带来 interference 和不合适的 bottleneck。
\teachervoice{00:49:32--00:52:11,讲者对自己参与的 universal modeling 路线给出很克制的评价:它实现了统一,但 image generation 不如 diffusion,image understanding 也不如连续视觉特征 VLM。}
本章小结
Autoregressive image modeling 最大优势是接口统一和成熟的 language-model machinery;最大问题是离散 tokenizer 损失、长序列串行生成和二维空间关系的线性化。它并非不可能生成好图,而是 practical frontier 转向了更适配并行图像计算的 diffusion。
Diffusion 与 Transformer:目标函数换了,系统经验仍然复用
Diffusion 不按 token 顺序预测图像,而是在多个 noise levels 上学习去噪 vector field。它让每一步都处理整张 latent,GPU utilization 通常优于 batch-one autoregressive decoding;随后 DiT 又把 denoiser 从 U-Net 换回 Transformer,显示“objective 改变”不等于 Transformer 退出。
DDPM:forward 加噪,reverse 学去噪
上一章的 autoregressive model 必须沿 image-token sequence 串行生成;本节改换问题表述,不再问“下一个 token 是什么”,而是问“给定某个 noise level,怎样把整张 noisy latent 推回更干净的方向”。读公式时要同时区分人为定义的 forward corruption 与模型学习的 reverse denoising。
定义 noise schedule \(\beta_t\)、\(\alpha_t=1-\beta_t\)、\(\bar\alpha_t=\prod_{s=1}^{t}\alpha_s\),forward process 有闭式采样:
模型常预测 \(\epsilon\):
其中 \(c\) 是 text condition。
\lecturefigure{slide-24-diffusion-ddpm.jpg}{DDPM:noise schedule、denoising network 与并行整图计算}{Stanford Online 官方录像 00:52:11}
为什么 diffusion 更容易吃满 GPU
每个 denoising step 同时更新整张 latent,矩阵规模大、并行度高;autoregressive image model 在 batch 很小时每步只产生一个 token,kernel launch 和 memory movement 难以充分摊销。diffusion 仍需多 steps,但每步硬件利用率通常更好。
\teachervoice{01:12:30--01:15:00,Q&A 中讲者拒绝把结论说成“不可能”:足够大的 autoregressive model 也能生成高质量图像;他更确定的是 sequential latency 与二维远距离关系带来的 practical disadvantage。}
Relay Diffusion:跨分辨率不能只复制同一个独立噪声
同一 nominal noise level 在不同 resolution 上的视觉模糊程度不同,因为自然图像信号具有空间相关性,而 standard Gaussian noise 常按 pixel 独立。Relay Diffusion 用 correlated/block noise 匹配尺度,使 coarse-to-fine stages 在频率和 SNR 上更一致。
\lecturefigure{slide-25-relay-diffusion.jpg}{Relay Diffusion:解耦 noise schedule、network 与 resolution}{Stanford Online 官方录像 00:54:49}
若 block size 为 \(k\),可把高分辨率 noise 写成低分辨率 noise 的上采样与 residual:
并通过 \(\lambda\) 调整不同频段的 variance,使 coarse stage 与 fine stage 的 signal-to-noise ratio 更可比。它不是简单 resize image,而是重新定义跨分辨率的 stochastic path。
“SNR 对齐”依赖 schedule 与 data spectrum
block-correlated noise 的有效性要在具体 resolution、latent encoder、noise schedule 和训练数据上验证。它提供机制解释,不意味着所有 coarse-to-fine diffusion 都可直接复用同一超参数。
\teachervoice{00:52:11--00:55:16,讲者强调低分辨率与高分辨率在相同独立 noise 下并不具有相同感知难度,Relay 的核心是把 resolution 从 schedule 中解耦。}
CogView3:scale-up 与 distillation 都是系统组成
Relay Diffusion 解决的是跨分辨率 schedule;要把这一机制变成可用 text-to-image system,还必须同时扩大模型与数据,并把昂贵 teacher sampling 压缩到更少 steps。CogView3 正是这一步系统化扩展,并在 slide 上报告 distilled model 的 \(1024\!\times\!1024\) 图像生成速度。速度数字必须同时绑定硬件、实现、sampling step、batch 与质量设置。
\lecturefigure{slide-26-cogview3.jpg}{CogView3:扩大 Relay Diffusion 并通过 distillation 加速}{Stanford Online 官方录像 00:55:16}
Distillation 的目标不是只减少参数
Diffusion distillation 常把多步 teacher trajectory 压成更少 sampling steps。真正优化对象是 end-to-end latency 与 quality tradeoff;参数量不变也可能通过减少 function evaluations 大幅加速。
DiT:把 denoiser 换成 Transformer
DiT 将 latent patches 当作 tokens,并用 adaptive LayerNorm 接入 timestep/class condition。若普通 normalization 为 \(\operatorname{LN}(h)\),adaLN 可写成
其中 \(c\) 由 timestep 和条件 embedding 产生。这样每层都能根据 noise level 调整 feature scale 与 shift。
\lecturefigure{slide-27-diffusion-transformer.jpg}{DiT:以 Transformer blocks 和 adaptive normalization 替代 U-Net}{Stanford Online 官方录像 00:57:02}
AdaLN 与 cross attention 的差别
cross attention 让 image tokens 查询一组 condition tokens;adaLN 则把 condition 压成每层 scale/shift/gate。前者保留 token-level 对齐,后者更像全局调制。实际系统可同时使用两者。
\teachervoice{00:55:16--00:57:43,讲者注意到 timestep 输入只是很小的 condition,却可能通过大 MLP 生成每层调制参数;他把这视为仍有简化空间的工程设计。}
Stable Diffusion 3 与 MM-DiT:text/image experts 再次出现
MM-DiT 为 text 和 image tokens 保留分开的 parameter paths,再通过 attention 交互。可抽象为
而 joint attention 在拼接的 \(K,V\) 上交换信息。它与 CogVLM 的共同思想是 modality-specific transformations,不同之处在于任务是 diffusion denoising 而非 autoregressive response。
\lecturefigure{slide-28-stable-diffusion3-mmdit.jpg}{Stable Diffusion 3:MM-DiT 的 text/image expert paths}{Stanford Online 官方录像 00:57:43}
相似模块名不等于相同训练问题
CogVLM 的 vision experts 服务 image-conditioned language modeling;MM-DiT 的 modality paths 服务 rectified flow/diffusion denoising。参数分流是共享设计模式,但 loss、sequence、condition 和 evaluation 完全不同。
本章小结
Diffusion 赢得 practical image generation,主要来自整图并行、连续 latent 与更合适的空间建模路径。Relay 处理跨分辨率 noise,distillation 减少 sampling steps,DiT/MM-DiT 又把 Transformer 引回 denoiser。目标函数和系统路径共同决定最终效率。
Video generation 与研究议程:把预测写成可验证问题
视频把前面所有瓶颈叠加:token/latent 更多、temporal consistency 更难、high-resolution 更贵、data coverage 与 caption quality 更差。讲者没有给出 Sora 的内部结论,而是从公开现象拆出一套 2024 年的工程假设,并据此提出研究方向。
Sora-like recipe:3D latents、scale、context 与 data
课堂以 CogVideo 为早期 autoregressive text-to-video 参照,再把 Sora-like improvement 分成 deflickering、image quality、resolution、long-context infrastructure 与 recaption/coverage。若视频 latent 大小为 \(T\times H\times W\),naive token 数为
full attention 的二次成本会迅速爆炸,因此 3D latent compression、factorized attention、parallelism 与 data pipeline 都是必要条件。
\lecturefigure{slide-29-video-generation.jpg}{Video generation:从 CogVideo 到 Sora-like scaling recipe}{Stanford Online 官方录像 00:58:29}
五个工程因素分别解决什么
\sloppy | 因素 | 主要问题 | 不能自动保证的能力 | | --- | --- | --- | | 3D latent encoder | 压缩时空并减少 flicker | 真实物理与长期因果 | | Model/data scale | 提升视觉质量和覆盖 | 无偏、安全、可控 | | High resolution | 保存文字与细节 | 正确动作与几何 | | Long-context infra | 承载更多 frames/tokens | 有效利用所有 context | | Recaption 与 coverage | 改善 text-video supervision | 从 raw video 学到物理规律 |
\teachervoice{00:57:54--01:04:00,讲者把这些因素称为对 Sora-like progress 的总结,不是 controlled ablation。讲义因此把它们写成可检验 hypotheses,而不是已知内部配方。}
2024 年预测:识别、视频理解与 embodied AI
前一节拆解的是模型和数据怎样扩大 video generation;这里转向更不确定的 research forecast。预测 slide 认为高层视觉识别会更便宜,video understanding 会成为新热点,embodied AI 会产生亮眼 demo 但短期难进入日常生活。正确记录方式是保留 2024 年 5 月的时间、资源假设与“可能”语气,而不是事后只挑选命中的句子。
\lecturefigure{slide-30-research-predictions.jpg}{2024 年课堂预测:视觉识别、video understanding 与 embodied AI}{Stanford Online 官方录像 01:04:00}
Prediction 不是 benchmark result
“一两年”“80% solved”“无法很快影响现实生活”都不是可直接测量的标准。要验收预测,必须重新定义 task distribution、cost、accuracy、long-tail、deployment environment 与时间点。
\teachervoice{01:00:00--01:04:00,讲者同时表达乐观与限制:视觉识别会快速便宜化,但 video model 仍有 hallucination/counting 问题;embodied AI 会有惊艳 demo,却可能昂贵且难以日常部署。}
研究建议:按资源与目标选择问题
最后一页不是“选题排行榜”,而是把 career objective、compute access 和 research risk 联系起来。video datasets/benchmarks 适合资源较少但能组织 evaluation 的团队;speech 被认为需求高但投入不足;architecture/optimizer 可能影响大但要求硬件与系统能力;compute-to-data 则是 web corpus 逐渐饱和后的核心方向。
\lecturefigure{slide-31-research-advice.jpg}{按目标与资源选择研究问题:video、speech、systems、architecture 与 data}{Stanford Online 官方录像 01:07:34}
把建议改写成决策矩阵
\sloppy | 方向 | 主要资产 | 主要风险 | 可验证交付 | | --- | --- | --- | --- | | 视频数据/评测 | collection、annotation、evaluation | 泄漏、shortcut、覆盖不足 | dataset card、held-out test、error taxonomy | | Speech/audio | 用户场景与多语言数据 | 隐私、噪声、实时延迟 | ASR、TTS 与对话端到端指标 | | 系统协作 | GPU 拓扑与 kernel 知识 | 复现与硬件依赖 | 吞吐、延迟、利用率与成本 | | 架构/优化器 | 大规模 controlled runs | 计算昂贵、结论不稳 | matched-compute scaling/ablation | | Compute-to-data | verifier、execution、search | feedback bias、synthetic collapse | provenance、verification rate、novelty |
freeze_task_definition_and_data_split()
record_model_version_resolution_and_prompt()
report_compute_latency_memory_and_cost()
separate_demo_success_from_repeated_trial_rate()
audit_shortcuts_leakage_and_long_tail_failures()
publish_provenance_metrics_and_negative_results()
\teachervoice{01:05:00--01:08:10,讲者称 speech AI 被低估,并建议做算法的人尽早与 systems researchers 合作,因为最好的算法必须映射到当代硬件。}
本章小结
Video generation 不是把 image model 多跑几帧,而是时空压缩、并行训练、long context、数据覆盖和评价共同组成的系统问题。研究建议也应按资源与可验证交付理解,而不是把课堂预测当成确定路线图。
Q&A 延伸:课堂 slide 没写出的限制
Q&A 没有新增独立 visual state,却补上了几条决定技术结论是否可靠的限定:long context 的 prefill cost、data 与 architecture 的非零和关系、diffusion 优势的不确定性、CogAgent 的高分辨率来源,以及视频能否从 raw signal 学到物理。
Long context、data 与 architecture 的三条平衡线
第一,长上下文可减少外部 retrieval pipeline,但 prefill latency 与无关 token 干扰仍然存在。第二,data 可以表达许多 task-specific biases,但 general architecture improvement 仍可能改变所有任务的 compute frontier。第三,把全部 documents 或 reasoning branches 放入 context 需要模型学会利用,而不是只扩大窗口。
课堂 Q&A 的工程结论
- 对长文档短回答,允许较慢 prefill 可能合理;实时 agent 则未必。
- 对具体行为,先尝试 data/evaluation;对跨任务重复瓶颈,再考虑 architecture。
- 若 reasoning procedure 包含失败路径,把它们显式放入 context 可能比只保留 beam score 更有信息,但仍需实验。
\teachervoice{01:18:10--01:19:59,讲者倾向把 alternative paths 与 failure information 一并放入 context,让模型学习比较,而不是只用 hard-coded beam probability;这是一条经验,不是 universal theorem。}
Video understanding 不会自动获得物理世界
当前 VLM/video model 多依赖 text-image 或 text-video pairs。若 training signal 主要来自人工 annotation,模型学到的是人类描述覆盖的现象,不必然从 raw motion 中恢复 conservation、contact、object permanence 或 causal interventions。
“看过很多视频”不等于“学会物理”
要从未标注视频学习物理,可能需要 temporal prediction、masked video modeling、world-model objectives、interaction data 或可验证 simulation。仅扩大 annotated pairs,仍可能学到语言 shortcut 与表面相关性。
\teachervoice{01:16:15--01:18:10,讲者明确说如果数据源不包含 physical rules,现有 pair-based pretraining 不会自动学出它们;他把新的 video self-supervision 视为必要研究问题。}
本章小结
Q&A 把主讲中的 headline 还原成带条件的工程判断:context 有延迟,data 不能消灭 architecture,diffusion 没有数学上击败 autoregression,GUI demo 不代表可靠 agent,video quantity 也不等于 physical understanding。
总结与延伸
这节课最值得保留的不是模型清单,而是一个三层判断框架。第一层是 representation/objective:language token、continuous vision feature、discrete image code 与 noisy latent 各自保留什么信息。第二层是 architecture/systems:projection、experts、cross attention、ZeRO、parallelism 与 long context 怎样把表示映射到可训练硬件。第三层是 data/evaluation:instruction、preference、caption、GUI trace、video coverage 与 benchmark 如何定义模型最终学到的行为。
三条主线的统一
课程的最终统一图景
- LLM 提供通用序列底座:scaling、alignment 与 systems 让大模型成为可复用接口。
- Multimodality 暴露接口瓶颈:视觉细节、高分辨率、二维空间与视频时间结构迫使模型改变 bridge、objective 和 compression。
- Data 决定行为边界:architecture 能提高可拟合范围,但 benchmark、annotation、recaption、verification 与 failure coverage 决定系统实际上学会什么。
最容易犯的三种归纳错误
不要把同 pretraining loss 写成同能力定理;不要把一条 GUI trace 写成 agent reliability;不要把 diffusion 的 practical advantage 写成 autoregression 的不可能性证明。三种错误都来自把课堂证据层级抹平。
复现实验 checklist
若要复现本讲任一模型,至少应同时发布 architecture version、data mixture/provenance、resolution/tokenization、training compute、inference steps、prompt/evaluation protocol 与 repeated-trial failures。只发布 headline score,会让 data、algorithm、architecture 三者无法区分。
pin(code_commit, model_checkpoint, tokenizer_or_vae)
document(data_sources, filters, synthetic_fraction, licenses)
report(train_flops, gpu_hours, parallelism, peak_memory)
report(input_resolution, context_length, sampling_steps)
freeze(prompts, decoding, benchmark_version, test_split)
publish(ablations, confidence_intervals, failures, costs)
自测问题
未转换的 LaTeX 环境:multicols
\begin{multicols}{2}
\footnotesize
1. sep}{0pt}
\setlength{\parskip}{0pt}
2. GLM blank infilling 与纯 MLM、纯 autoregression 的条件信息有何不同?
3. 为什么 scaling law 是预算分配器,而不是性能保证书?
4. perplexity 为什么不能跨 tokenizer 直接比较?
5. GQA 主要减少哪一类 inference memory?
6. ZeRO-1/2/3 分别 sharding 什么?
7. activation checkpointing 与 model checkpointing 有何区别?
8. TP、PP、context parallelism 分别切哪一维?
9. 为什么 long context 的主要交互成本可能在 prefill?
10. DPO 没有独立 reward model,为何仍依赖 reward assumptions?
11. CogQA 例子怎样体现 data/algorithm/architecture 可交换?
12. BLIP-2 的 Q-Former 同时完成哪两类工作?
13. LLaVA projection 简单,但为什么 OCR 仍可能差?
14. CogVLM vision experts 想保护什么能力?
15. CogAgent 为什么需要高分辨率旁路?
16. 单条 web trace 不能证明哪些能力?
17. Vary 与 GLM-4V 对 OCR bottleneck 的处理有何不同?
18. image tokenizer 给 autoregressive generation 带来什么得失?
19. diffusion 为什么通常比 batch-one AR decoding 更能利用 GPU?
20. Relay Diffusion 为什么要改变跨 resolution 的 noise correlation?
21. adaLN 与 cross attention 的 condition 路径有何不同?
22. Sora-like recipe 中哪些是表示问题,哪些是 systems/data 问题?
23. 为什么 annotated video pairs 不保证学到 physical rules?
\end{multicols}
拓展阅读
未转换的 LaTeX 环境:multicols
\begin{multicols}{2}
\footnotesize
- sep}{0.15em}
\setlength{\parskip}{0pt}
- Du et al., [GLM: General Language Model Pretraining with Autoregressive Blank Infilling](https://arxiv.org/abs/2103.10360):理解目标函数统一。
- Rajbhandari et al., [ZeRO](https://arxiv.org/abs/1910.02054);Shoeybi et al., [Megatron-LM](https://arxiv.org/abs/1909.08053):理解状态分片与模型并行。
- Rafailov et al., [Direct Preference Optimization](https://arxiv.org/abs/2305.18290):理解 pairwise preference objective。
- Li et al., [BLIP-2](https://arxiv.org/abs/2301.12597);Liu et al., [LLaVA](https://arxiv.org/abs/2304.08485):比较 Q-Former 与 projection bridge。
- Wang et al., [CogVLM](https://arxiv.org/abs/2311.03079);Hong et al., [CogAgent](https://arxiv.org/abs/2312.08914):理解 vision experts 与 GUI high-resolution path。
- Ho et al., [DDPM](https://arxiv.org/abs/2006.11239);Peebles and Xie, [DiT](https://arxiv.org/abs/2212.09748);Esser et al., [Stable Diffusion 3](https://arxiv.org/abs/2403.03206):从 diffusion objective 到 Transformer denoiser。
- Snell et al., [Same Pre-training Loss, Better Downstream](https://arxiv.org/abs/2409.01236):作为课堂“loss 决定能力”强主张的 post-lecture 反例阅读。
\end{multicols}