深度学习从拆箱开始——序言

为什么要写这个专栏 笔者在上学期学习了COMP3314, 一门传统机器学习课程。然而,传统机器学习在特征提取和模型设计上都需要大量的人工干预,难以适应复杂的现实世界数据。相比之下,深度学习通过多层神经网络自动学习数据的特征表示,在图像识别、自然语言处理等领域取得了革命性的突破。这个专栏旨在记录笔者从零开始学习深度学习的过程,分享理论推导和实战经验,希望能帮助同样对深度学习感兴趣的读者快速入门并深入理解这一领域。 路线图 本专栏按五个阶段展开,每个阶段穿插理论篇和实战篇。后续文章发布后,会回来更新本章的目录链接。 阶段零:准备工作 了解机器学习和深度学习 安装 PyTorch 和相关工具 阶段一:从统计到机器学习 理论:从假设检验到交叉验证——统计学和机器学习 实战:梯度下降——从线性回归到逻辑回归 阶段二:打开黑盒 理论:一个神经元的数学——从感知机到激活函数 理论:反向传播——深度学习的灵魂 实战:用 NumPy 写一个 MLP 阶段三:CNN 与视觉 理论:卷积与滤波——从 Sobel 到 Conv2D 理论:为什么 ResNet 能训练 152 层——残差连接的数学 实战:PyTorch 手写图像分类器(CIFAR-10) 阶段四:序列与 Transformer 理论:RNN 的困境——长程依赖与梯度消失 理论:Attention 的诞生——Seq2Seq 如何打破瓶颈 实战:Transformer 全拆解——Self-Attention、Multi-Head 与位置编码 阶段五:走向前沿与多模态 理论:ViT——当图像变成 Token 概念:CLIP——图文对比学习与 Zero-shot 综述:从 VLM 到 VLA——视觉-语言-动作模型浅析

📅 June 15, 2026 · ⏱️ 3 min · 📝 约 521 字 · 👁️ 次阅读
Comments