AI经典论文精读2026-09-18《DDPM》:把图像生成拆成一千步去噪,损失函数为什么只剩预测噪声从一步生成的难题出发,拆解 DDPM 的前向加噪链、反向去噪链与变分下界,讲清训练目标为什么能简化成一行预测噪声的均方误差,并用 CIFAR-10、LSUN 的表格与率失真实验读懂它的样本质量、采样代价与能力边界。1
AI经典论文精读2026-09-11《LeNet-5》:局部连接与权重共享如何把图像识别变成可微系统从全连接网络的参数膨胀、缺乏平移等变性与忽略空间拓扑三大缺陷出发,拆解 LeNet-5 的卷积核、非完全连接、子采样与欧氏 RBF 结构,并用 MNIST 历史数据与多模型开销读懂经典 CNN 的能力与边界。
AI经典论文精读2026-09-08《反向传播》:误差如何教会隐藏层学习表征从隐藏层没有目标值这个具体难题出发,逐步读懂反向传播如何用链式法则分配误差、更新权重,并判断它在对称性与家谱实验中真正证明了什么。3
AI经典论文精读2026-09-04《U-Net》:编码器—解码器如何同时保留上下文与像素定位从滑动窗口的速度与上下文矛盾出发,拆解 U-Net 的跳跃连接、加权损失、重叠分块与数据增强,并用原论文实验和 3D U-Net、nnU-Net 读懂它的边界。
AI经典论文精读2026-09-01《BERT》:双向上下文如何变成统一的语言理解接口从左向右语言模型的信息缺口出发,拆解 BERT 的掩码语言模型、下一句预测、统一输入接口与微调方法,并用 GLUE、SQuAD、SWAG 和消融实验读懂它的贡献与边界。1
AI经典论文精读2026-08-28《Dropout》:随机丢掉单元,如何把过拟合变成可训练的模型平均从 thinned network、权重缩放与共适应出发,读懂 Dropout 如何在训练时近似指数多个子网络,并用 MNIST、SVHN、TIMIT 实验和贝叶斯对照分清它的收益与边界。
AI经典论文精读2026-08-25《Batch Normalization》:一个 mini-batch 如何改变深度网络的训练从 mini-batch 统计量、反向传播与训练/推理切换出发,读懂 Batch Normalization 如何加速训练,并准确拆开原论文的 14 倍步数与 ImageNet 4.9% 结果。1
AI经典论文精读2026-08-21《ImageNet Classification with Deep Convolutional Neural Networks》:AlexNet 如何把大规模图像分类变成可训练系统从 ReLU、双 GPU、数据增强与 dropout 出发,读懂 AlexNet 如何把百万级图像分类变成可训练系统,并学会区分单模型、集成、预训练和消融实验的真实含义。1
AI经典论文精读2026-08-18《Auto-Encoding Variational Bayes》:VAE 如何把不可解的后验变成可训练的随机梯度从 ELBO、重参数化技巧与 AEVB 算法出发,读懂 VAE 如何把不可解的连续潜变量后验变成可用小批量随机梯度训练的问题,并用原论文实验与 IWAE、β-VAE 分清它的能力边界。1
AI经典论文精读2026-08-16《Adam: A Method for Stochastic Optimization》:自适应步长如何把方向与尺度分开从一阶动量、二阶矩估计与偏差修正出发,读懂 Adam 如何逐坐标调节步长,并用原论文实验、AMSGrad 反例和 AdamW 分清它的能力与边界。21
AI经典论文精读2026-08-14「Long Short-Term Memory」:LSTM 如何把长期依赖变成可训练的记忆单元从 CEC、输入门与输出门出发,读懂 LSTM 如何保住长期梯度,再用 1000 步人工任务、forget gate 与 seq2seq 结果判断它解决了什么、付出了什么代价。
AI经典论文精读2026-08-14《Distributed Representations of Words and Phrases and their Compositionality》:Word2Vec 如何把上下文变成词向量从 Skip-gram 的局部预测出发,读懂负采样、子采样和短语 token 如何把词的共现关系变成可计算的向量结构,并学会把训练速度、类比准确率与方法边界放在一起判断。