第 4 页,共显示 8 / 73 篇文章
按年份查看 →
- 目标序列为何既要看过去又要看源文?Transformer Decoder 的三条信息流
从条件生成的信息边界出发,组装因果自注意力、交叉注意力与 FFN,并拆解并行训练和逐 token 生成。
18 分钟 中文 - 注意力之后为何还要逐位置变换?Transformer Block 的 FFN、残差与 Pre-LN
从注意力只负责位置混合的局限出发,拆解逐位置前馈网络、两条残差路径,并比较 Pre-LN 与 Post-LN 的数据流和梯度路径。
22 分钟 中文 - 所有词怎样一次看见彼此?Transformer 的缩放点积自注意力与掩码
从循环注意力的串行瓶颈出发,手算 Query、Key、Value 的缩放点积,解释多头分工、位置编码与两类掩码,并对齐 PyTorch 2.13 当前 API。
22 分钟 中文 - 整句话为何不能只压成一个向量?Encoder–Decoder 的加性注意力与对齐
从定长上下文瓶颈出发,手算 Bahdanau 加性注意力的能量、掩码与加权和,并用 PyTorch 2.13 实现可检查的序列到序列训练和自回归推理。
17 分钟 中文 - 旧信息何时该忘、何时该写入?LSTM 的门控与加法记忆路径
从普通 RNN 的梯度连乘出发,手算 LSTM 的遗忘、写入与输出门,拆解加法记忆路径,并用 PyTorch 2.13 对齐实现与变长序列训练。
25 分钟 中文 - 固定窗口为何记不住更早的信息?RNN 的隐状态、时间展开与梯度链
从变长序列的固定窗口局限出发,手算 RNN 隐状态,拆解时间反向传播的梯度乘积,并用 PyTorch 2.13 验证张量契约与工程边界。
24 分钟 中文 - 同一个目标该交给哪层负责?FPN 的尺度分配与跨层去重
从密集检测的责任歧义出发,手算 FCOS 尺度范围、中心采样与跨层 NMS,并用 PyTorch 与 torchvision 0.28 检查训练—推理坐标契约。
22 分钟 中文 - 小物体为何在深层特征里消失?FPN 的自顶向下路径与横向连接
从深层语义与浅层定位的冲突出发,手算特征金字塔融合,追踪张量形状,并用 PyTorch 2.13 与 torchvision 0.26 实现可调试 FPN。
23 分钟 中文