AI经典论文精读2026-09-04《U-Net》:编码器—解码器如何同时保留上下文与像素定位从滑动窗口的速度与上下文矛盾出发,拆解 U-Net 的跳跃连接、加权损失、重叠分块与数据增强,并用原论文实验和 3D U-Net、nnU-Net 读懂它的边界。
AI经典论文精读2026-09-01《BERT》:双向上下文如何变成统一的语言理解接口从左向右语言模型的信息缺口出发,拆解 BERT 的掩码语言模型、下一句预测、统一输入接口与微调方法,并用 GLUE、SQuAD、SWAG 和消融实验读懂它的贡献与边界。1
AI经典论文精读2026-08-28《Dropout》:随机丢掉单元,如何把过拟合变成可训练的模型平均从 thinned network、权重缩放与共适应出发,读懂 Dropout 如何在训练时近似指数多个子网络,并用 MNIST、SVHN、TIMIT 实验和贝叶斯对照分清它的收益与边界。
AI经典论文精读2026-08-25《Batch Normalization》:一个 mini-batch 如何改变深度网络的训练从 mini-batch 统计量、反向传播与训练/推理切换出发,读懂 Batch Normalization 如何加速训练,并准确拆开原论文的 14 倍步数与 ImageNet 4.9% 结果。1
AI经典论文精读2026-08-21《ImageNet Classification with Deep Convolutional Neural Networks》:AlexNet 如何把大规模图像分类变成可训练系统从 ReLU、双 GPU、数据增强与 dropout 出发,读懂 AlexNet 如何把百万级图像分类变成可训练系统,并学会区分单模型、集成、预训练和消融实验的真实含义。1
AI经典论文精读2026-08-18《Auto-Encoding Variational Bayes》:VAE 如何把不可解的后验变成可训练的随机梯度从 ELBO、重参数化技巧与 AEVB 算法出发,读懂 VAE 如何把不可解的连续潜变量后验变成可用小批量随机梯度训练的问题,并用原论文实验与 IWAE、β-VAE 分清它的能力边界。1
AI经典论文精读2026-08-16《Adam: A Method for Stochastic Optimization》:自适应步长如何把方向与尺度分开从一阶动量、二阶矩估计与偏差修正出发,读懂 Adam 如何逐坐标调节步长,并用原论文实验、AMSGrad 反例和 AdamW 分清它的能力与边界。21
AI经典论文精读2026-08-14「Long Short-Term Memory」:LSTM 如何把长期依赖变成可训练的记忆单元从 CEC、输入门与输出门出发,读懂 LSTM 如何保住长期梯度,再用 1000 步人工任务、forget gate 与 seq2seq 结果判断它解决了什么、付出了什么代价。
AI经典论文精读2026-08-14《Distributed Representations of Words and Phrases and their Compositionality》:Word2Vec 如何把上下文变成词向量从 Skip-gram 的局部预测出发,读懂负采样、子采样和短语 token 如何把词的共现关系变成可计算的向量结构,并学会把训练速度、类比准确率与方法边界放在一起判断。
AI经典论文精读2026-08-13《Playing Atari with Deep Reinforcement Learning》:DQN 如何把像素变成可训练的 Q 值从 Bellman 目标、经验回放和四帧状态出发,读懂 DQN 为什么能在 Atari 像素输入上稳定训练,并学会检查深度强化学习论文的目标偏差、样本相关性与实验对齐。1
AI经典论文精读2026-08-12《Generative Adversarial Nets》:GAN 如何用判别器把生成分布推向真实分布从生成器与判别器的 minimax 博弈出发,读懂 GAN 的最优判别器、JS 散度、训练算法、实验数字,以及它用采样便利性换来的训练稳定性代价。
AI经典论文精读2026-08-11《Deep Residual Learning for Image Recognition》:ResNet 如何让更深的网络重新变得可训练从 degradation problem、残差公式与 shortcut 数据流出发,读懂 ResNet 为什么先修复深层网络的可优化性,再让深度带来准确率收益。