neural-network 标签归档

共 1 篇文章 · 返回首页

【Transformer 与注意力机制】08.5 神经网络基础:神经元、反向传播手算与 MLP 训练

神经网络训练就是前向、损失、反向、更新四步循环。本文用一个可手算的标量网络逐步推出反向传播梯度,再推广到两层 MLP 的矩阵求导,给出 NumPy 手写与 PyTorch 对照实现和真实训练曲线,最后说明固定窗口 MLP 为什么处理不好序列、RNN 改了哪一条边。