- 生成 4 个 Token 为何不一定要跑 4 次大模型?Speculative Decoding 的提议、验证与接受
从自回归解码的串行瓶颈出发,手算 draft–verify 接受过程,推导精确采样修正,追踪张量形状,并给出可检查实现、指标与失败边界。
16 分钟 中文 - 一个长 Prompt 为何让所有流式输出停顿?Chunked Prefill 的 Token 预算
从 prefill 阻塞 decode 的延迟尖峰出发,手算 token budget 下的分块调度,解释 KV 递增、优先级、容量保护与当前 vLLM 配置验证。
14 分钟 中文 - 请求不断到达时为何还要等整批结束?Continuous Batching 的逐轮调度
从静态批处理的尾部空洞出发,手算逐迭代请求替换,解释 prefill/decode 混合、token 预算、KV 容量、延迟指标与可验证的 vLLM 配置。
15 分钟 中文 - KV Cache 还有空间为何新请求却进不来?PagedAttention 的块表与碎片控制
从变长生成的显存碎片出发,手算逻辑块到物理块的映射,解释 PagedAttention 的动态增长、Copy-on-Write、调度契约与服务端验证。
16 分钟 中文 - 注意力公式没变,为何还能快几倍?FlashAttention 的分块、在线 Softmax 与 IO
从显存读写瓶颈出发,手算分块在线 Softmax,解释 FlashAttention 如何不物化 L×L 矩阵、保持精确结果,并用 PyTorch 2.14 SDPA 验证后端与性能。
13 分钟 中文 - 模型按层切开后 GPU 为何仍在等待?GPipe、1F1B 与 Micro-batch 调度
从流水线气泡出发,手算 GPipe 与 1F1B 的时间线、激活驻留和梯度累积,解释 stage 边界契约、PyTorch PipelineStage/Schedule1F1B 用法与调试方法。
16 分钟 中文 - 一层 MLP 太宽而放不下时怎样切?列并行、行并行与块尾归约
从 FSDP2 仍需临时聚齐单层参数出发,手算 Transformer MLP 的列并行与行并行,解释局部张量形状、通信位置、反向传播与 PyTorch DTensor 落地。
13 分钟 中文 - 每张卡为何还要保留完整模型?FSDP2 的参数全聚合、梯度归约分片与显存峰值
从普通 DDP 的复制成本出发,手算 FSDP2 如何分片参数、梯度和优化器状态,拆解 all-gather、reduce-scatter、reshard、分组边界与分布式 checkpoint。
16 分钟 中文
返回