2026
67 篇文章
- 生成 4 个 Token 为何不一定要跑 4 次大模型?Speculative Decoding 的提议、验证与接受
- 一个长 Prompt 为何让所有流式输出停顿?Chunked Prefill 的 Token 预算
- 请求不断到达时为何还要等整批结束?Continuous Batching 的逐轮调度
- KV Cache 还有空间为何新请求却进不来?PagedAttention 的块表与碎片控制
- 注意力公式没变,为何还能快几倍?FlashAttention 的分块、在线 Softmax 与 IO
- 模型按层切开后 GPU 为何仍在等待?GPipe、1F1B 与 Micro-batch 调度
- 一层 MLP 太宽而放不下时怎样切?列并行、行并行与块尾归约
- 每张卡为何还要保留完整模型?FSDP2 的参数全聚合、梯度归约分片与显存峰值
- 模型放不下一张卡时究竟该切什么?数据并行、张量并行与流水线并行的边界
- 大 Batch 放不进显存怎么办?梯度累积的精确归一化与 DDP no_sync
- 激活占满显存时该丢掉什么?Activation Checkpointing 的重算、边界与随机数状态
- 半精度为何会让梯度变成 0 或 NaN?Autocast、FP16/BF16 与 GradScaler
- 训练步数相同为何学习进度不同?Token 学习率时钟、Warmup 与 Cosine Decay
- 同一批短句为何被最长句拖慢?动态 Padding、长度分桶与 Token-based Batching
- 短文拼进同一窗口会互相偷看吗?Sequence Packing 的边界掩码
- 网页占九成就该训练九成吗?数据混合权重、温度采样与 Token 预算
- 十亿段语料怎样避免反复背诵?精确去重、MinHash 与评测污染
- 整数编号怎样变成可学习语义?Token Embedding、梯度累加与权重绑定
- 词表装不下所有单词怎么办?BPE 的高频合并、字节回退与长度代价
- 一句文本怎样变成训练信号?因果语言模型的标签右移与 Next-Token Loss
- 长序列为何不必让每个 token 看见全部历史?滑动窗口、块稀疏与全局 token
- 模型能接收 32K 就真的会用 32K 吗?RoPE 位置插值、频率缩放与长上下文验证
- 词相同但顺序不同,注意力怎样辨别位置?从正弦编码到 RoPE
- 每生成一个词为何又重算全文?KV Cache 的增量解码
- 目标序列为何既要看过去又要看源文?Transformer Decoder 的三条信息流
- 注意力之后为何还要逐位置变换?Transformer Block 的 FFN、残差与 Pre-LN
- 所有词怎样一次看见彼此?Transformer 的缩放点积自注意力与掩码
- 整句话为何不能只压成一个向量?Encoder–Decoder 的加性注意力与对齐
- 旧信息何时该忘、何时该写入?LSTM 的门控与加法记忆路径
- 固定窗口为何记不住更早的信息?RNN 的隐状态、时间展开与梯度链
- 同一个目标该交给哪层负责?FPN 的尺度分配与跨层去重
- 小物体为何在深层特征里消失?FPN 的自顶向下路径与横向连接
- 特征图减半为何会凭空改变图案?池化、步幅卷积与抗混叠下采样
- 一张图像为何不该先拉平?卷积的局部连接、权重共享与感受野
- 网络加深后训练误差为何反而升高?残差连接的恒等捷径与梯度分流
- 同一个张量究竟该沿哪条轴标准化?BatchNorm 与 LayerNorm 的训练/推理差异
- 梯度方向反复横跳怎么办?Momentum 与 Adam 如何重塑更新步长
- 网络加深后信号为何消失?Xavier 与 He 初始化如何守住方差
- 一个标量误差怎样找到所有参数?计算图、链式法则与反向传播
- 叠得更深为何仍只是一条直线?激活函数如何让神经网络表达 XOR
- 局部邻域怎样拼成可外推的图?UMAP 的模糊边权与交叉熵
- 高维邻居挤进二维后为何成团?t-SNE 的困惑度与重尾相似度
- 只保留邻域配方,弯曲流形怎样展开?LLE 的重构权重与谱嵌入
- 卷起来的二维面怎样被摊平?Isomap 的测地距离与经典 MDS
- 两条弯曲带在原空间难分,谱聚类怎样用图拉普拉斯把它们展开?
- 不预先选定粒度,样本怎样长成一棵簇树?层次聚类的 linkage 与树状图
- 弯曲簇与噪声点怎样同时识别?DBSCAN 的密度连通
- 一个样本能同时像两个簇吗?高斯混合模型与 EM 软聚类
- 高维数据怎样压成几个方向?PCA 的最大方差、重构误差与 SVD
- 没有标签怎样自动分组?K 均值的分配—更新循环与失败几何
- 两团高斯数据为何产生直线边界?从共享协方差到 LDA
- 只统计词频,朴素贝叶斯怎样判断垃圾邮件?从先验到对数似然
- 不显式增加维度,SVM 怎样画出弯曲边界?从核技巧到 RBF
- 能分开数据的直线有很多,SVM 为什么选择最大间隔?
- XGBoost 为何要看二阶梯度?从叶权重到正则化分裂增益
- 后一棵树怎样修正前一棵?从残差到梯度提升树
- 多棵不稳定的树为何能更可靠?随机森林的 Bagging、特征子采样与 OOB 估计
- 决策树怎样选出第一条规则?从基尼不纯度到剪枝
- 不训练参数也能分类吗?K 近邻的距离投票与维度灾难
- 一条直线怎样输出分类概率?从对数几率到逻辑回归决策边界
- 权重为何会越学越小?从过拟合到 L2 正则化与岭回归
- 训练误差很低为何仍失效?用学习曲线诊断欠拟合与过拟合
- 一批样本如何完成一次参数更新?从全批量到小批量 SGD
- 为什么分类器不直接优化准确率?从 0-1 损失到二元交叉熵
- 为什么不能用测试集调模型?一次看懂训练、验证与数据泄漏
- 机器学习究竟在学什么?从样本、假设到经验风险最小化
- 从零理解等变网络与不变网络