为什么要写这个专栏

笔者在上学期学习了COMP3314, 一门传统机器学习课程。然而,传统机器学习在特征提取和模型设计上都需要大量的人工干预,难以适应复杂的现实世界数据。相比之下,深度学习通过多层神经网络自动学习数据的特征表示,在图像识别、自然语言处理等领域取得了革命性的突破。这个专栏旨在记录笔者从零开始学习深度学习的过程,分享理论推导和实战经验,希望能帮助同样对深度学习感兴趣的读者快速入门并深入理解这一领域。

路线图

本专栏按五个阶段展开,每个阶段穿插理论篇实战篇。后续文章发布后,会回来更新本章的目录链接。

阶段零:准备工作

  • 了解机器学习和深度学习
  • 安装 PyTorch 和相关工具

阶段一:从统计到机器学习

  • 理论:从假设检验到交叉验证——统计学和机器学习
  • 实战:梯度下降——从线性回归到逻辑回归

阶段二:打开黑盒

  • 理论:一个神经元的数学——从感知机到激活函数
  • 理论:反向传播——深度学习的灵魂
  • 实战:用 NumPy 写一个 MLP

阶段三:CNN 与视觉

  • 理论:卷积与滤波——从 Sobel 到 Conv2D
  • 理论:为什么 ResNet 能训练 152 层——残差连接的数学
  • 实战:PyTorch 手写图像分类器(CIFAR-10)

阶段四:序列与 Transformer

  • 理论:RNN 的困境——长程依赖与梯度消失
  • 理论:Attention 的诞生——Seq2Seq 如何打破瓶颈
  • 实战:Transformer 全拆解——Self-Attention、Multi-Head 与位置编码

阶段五:走向前沿与多模态

  • 理论:ViT——当图像变成 Token
  • 概念:CLIP——图文对比学习与 Zero-shot
  • 综述:从 VLM 到 VLA——视觉-语言-动作模型浅析