💬 观点Andrej Karpathy
Deep Neural Nets: 33 years ago and 33 years from now — Karpathy 复现 33 年前的经典神经网络论文,探讨深度学习进步的本质。
Karpathy 复现 33 年前的经典神经网络论文,探讨深度学习进步的本质。
2022-03-14原文
本文为要点摘要,完整细节以原文为准。
🧭 一图看懂
由原文自动提炼 · 以原文为准点击任一分支,查看这一点的一句话解读
复现 1989 年 LeCun 手写数字识别…
Karpathy 用 PyTorch 复现 1989 年 LeCun 的端到端反向传播数字识别网络
- 原始网络用 Lisp 实现,数据集 7291 张 16x16…
- 复现代码在 karpathy/lecun1989-repro 仓库
⚙️ 流程拆解
STEP 1复现原始网络
STEP 2训练并对比结果
STEP 3替换损失函数
STEP 4改用 AdamW
STEP 5加入数据增强
🔗 涉及的概念与玩家
- Yann LeCun人物
- Andrej Karpathy人物
- PyTorch产品
- MNIST概念
- SGD方法
- AdamW方法
- 交叉熵方法
- 数据增强方法
- Andrej Karpathy—使用→PyTorch
- Andrej Karpathy—复现论文→Yann LeCun
- PyTorch—用于模拟→MNIST
- SGD—被替换为→AdamW
- 交叉熵—结合使用→数据增强
Andrej Karpathy 通过复现 Yann LeCun 等人 1989 年的手写邮编识别论文,进行了一次关于深度学习进展的案例研究。
- 论文的现代性:尽管数据集和网络规模极小,但该论文的结构(数据集、架构、损失函数、优化、实验结果)与当今的深度学习论文高度相似,展现了其前瞻性。这对开发者意味着,核心的研究范式具有长久的生命力。
- 复现的挑战与速度飞跃:由于原始数据集丢失等细节模糊,精确复现几乎不可能。但硬件和软件(如 PyTorch)的进步使得训练时间从当年的 3 天缩短至约 90 秒。这揭示了工具链的演进为实验迭代带来了革命性的加速。
- “时间旅行”式改进:利用现代知识(如交叉熵损失、AdamW 优化器、数据增强)可以显著提升原模型的性能,降低测试误差。这表明,过去三十多年的算法与工程积累,是推动性能边界的关键,而不仅仅是算力。
原文:Deep Neural Nets: 33 years ago and 33 years from now · 作者 Andrej Karpathy
🕸 顺着图谱继续读
- A Recipe for Training Neural Networks — Andrej Karpathy 分享神经网络训练的系统化避坑指南,从数据到模型逐2019-04-25 · 共同涉及 Andrej Karpathy、SGD、数据增强
- Why Specialization Is Inevitable — 通用AI模型不够用,垂直领域定制才是未来。2026-06-30 · 共同涉及 Yann LeCun
- LFM2.5-Encoders for Fast Long-Context Inference on CPU — Liquid AI 发布 LFM2.5 编码器,实现 CPU 上高效长上下文推理2026-07-28 · 共同涉及 PyTorch
- Profiling in PyTorch (Part 3): Attention is all you — 用 PyTorch Profiler 分析注意力机制性能瓶颈,优化 Transf2026-07-10 · 共同涉及 PyTorch