- 训练步数相同为何学习进度不同?Token 学习率时钟、Warmup 与 Cosine Decay
从可变长度 batch 让每步 token 数漂移出发,手算 token 进度下的 warmup 与余弦衰减,实现可恢复的 PyTorch 学习率控制器,并解释预算、调用顺序与调试方法。
12 分钟 中文 - 同一批短句为何被最长句拖慢?动态 Padding、长度分桶与 Token-based Batching
从变长样本的二次注意力浪费出发,手算长度分桶收益,实现当前 PyTorch 动态 padding 与 token 预算批处理,并解释 loss 归一化、分布式与编译形状陷阱。
15 分钟 中文 - 短文拼进同一窗口会互相偷看吗?Sequence Packing 的边界掩码
从固定上下文窗口的 padding 浪费出发,手算 sequence packing,分别构造块对角因果注意力、跨文档 loss 屏蔽与位置编号,并给出可验证的 PyTorch 实现。
14 分钟 中文 - 网页占九成就该训练九成吗?数据混合权重、温度采样与 Token 预算
从数据量比例压倒小语种出发,手算温度平滑,区分文档与 token 采样,并用 PyTorch 构造可复现、可审计的多来源预训练批次。
13 分钟 中文 - 十亿段语料怎样避免反复背诵?精确去重、MinHash 与评测污染
从重复网页造成的隐式加权出发,手算 Jaccard 与 MinHash,构造可审计的精确—近重复去重流水线,并处理数据切分、阈值和分布式工程陷阱。
12 分钟 中文 - 整数编号怎样变成可学习语义?Token Embedding、梯度累加与权重绑定
从 token id 的无序性出发,手算 Embedding 查表和重复行梯度,追踪 LM Head 的词表 logits,并用 PyTorch 2.14 正确实现权重绑定。
12 分钟 中文 - 词表装不下所有单词怎么办?BPE 的高频合并、字节回退与长度代价
从整词词表的未知词问题出发,手算 BPE 合并与编码顺序,解释字节级覆盖、词表—序列长度权衡,并用 Tokenizers 0.23.2 构建可复现流水线。
11 分钟 中文 - 一句文本怎样变成训练信号?因果语言模型的标签右移与 Next-Token Loss
从原始 token 序列出发,手算标签错位与交叉熵,追踪 logits、padding 和文档边界,并用 PyTorch 2.14 写出可检查的语言模型训练步。
14 分钟 中文
返回