线性代数基础(一):向量与空间

前言 这是"线性代数基础"专栏的第一篇。这个专栏的目的很明确:补齐看懂本站进阶数学文章所需的基础。读完本文(以及后续两篇),你应该能顺畅读懂《矩阵微积分如何服务反向传播》和《Softmax 与缩放点积的数学》。 我们从一个最朴素的问题开始:什么是向量? 它为什么值得花一整篇来讨论? 向量:从几何到坐标 向量有两种看待方式,二者等价,互为补充: 几何视角:向量是空间中带方向和长度的箭头。它表示"从一点移动到另一点"。 代数视角:向量是 $\mathbb{R}^n$ 中的一个有序数组,如 $v = (v_1, v_2, \dots, v_n)$。其中 $n$ 是维度。 在深度学习中,我们几乎总是用数组(张量)表示向量:一个词嵌入是几百维的向量,一张图片展开后是几万维的向量。几何直觉在低维(2D/3D)依然成立,只是"看不见",但公式可以推广到任意维度。 向量的基本运算 对向量 $u, v$ 和标量 $c$: 加法:$(u + v)_i = u_i + v_i$。几何上就是"首尾相接"(平行四边形法则)。 数乘:$(cv)_i = c v_i$。几何上是把箭头拉伸($|c| > 1$)或压缩($|c| < 1$),$c < 0$ 时反向。 这两个运算非常重要,因为"对加法和数乘封闭"正是下一篇文章里"向量空间"定义的核心。 点积与范数 点积(内积) 两个 $n$ 维向量 $a$、$b$ 的点积定义为对应分量乘积之和: $$ a \cdot b = \sum_{i=1}^{n} a_i b_i $$它的几何形式揭示了本质: $$ a \cdot b = \|a\| \|b\| \cos\theta $$其中 $\theta$ 是两个向量之间的夹角,$\|a\|$ 是 $a$ 的模长(范数)。也就是说,点积同时度量了两个向量的长度和方向一致性:夹角越小,点积越大。 ...

📅 August 4, 2026 · ⏱️ 11 min · 📝 约 1718 字 · 👁️ 次阅读

线性代数基础(二):矩阵与线性变换

前言 上一篇讲了向量。这一篇把向量"组织"起来——矩阵。矩阵是连接向量与线性变换的桥梁,也是神经网络里几乎所有计算(全连接层、注意力中的 $QK^\top$、反向传播的梯度回传)的载体。 读完本文,你会理解三件事:矩阵乘法到底在算什么、为什么神经网络一层是 $z = Wx + b$、以及 Jacobian 为什么能写成矩阵。 矩阵:数与表 矩阵是排成矩形的数表。一个 $m \times n$ 矩阵有 $m$ 行、$n$ 列: $$ A = \begin{bmatrix} a_{11} & a_{12} & \dots & a_{1n} \\ a_{21} & a_{22} & \dots & a_{2n} \\ \vdots & \vdots & \ddots & \vdots \\ a_{m1} & a_{m2} & \dots & a_{mn} \end{bmatrix} $$几个常用特例: 单位阵 $I$:对角线上全为 1,其余为 0。作用类似乘法里的"1"($IA = AI = A$)。 对角阵:非对角线全为 0。相当于对每个分量独立缩放。 零矩阵:全为 0。 转置 $A^\top$:把行列互换,$(A^\top)_{ij} = A_{ji}$。 对称矩阵:$A = A^\top$。它很重要,在特征值篇会看到它有多好用。 矩阵乘法 两个矩阵 $A$($m \times k$)和 $B$($k \times n$)可以相乘,结果 $C = AB$ 是 $m \times n$ 矩阵,其中: ...

📅 August 4, 2026 · ⏱️ 11 min · 📝 约 1734 字 · 👁️ 次阅读

线性代数基础(三):特征值与分解

前言 前两篇讲了向量和矩阵。这一篇回答一个更深刻的问题:矩阵这个变换,有没有"主轴"? 沿着某个方向,变换可能只是单纯地拉伸(方向不变、长度变);沿着另一个方向,可能完全不动。抓住这些"不改变方向"的方向,矩阵的行为就一目了然了。 这就是特征值与特征向量的思想。它在深度学习里极其重要——梯度消失/爆炸、LoRA、PCA、甚至注意力里的缩放,背后都有它的影子。 特征值与特征向量 定义 对 $n \times n$ 矩阵 $A$,如果存在非零向量 $v$ 和标量 $\lambda$ 使得: $$ Av = \lambda v $$则 $\lambda$ 称为 $A$ 的特征值,$v$ 是它对应的特征向量。 几何意义:$v$ 是变换 $A$ 的"主轴"方向——被 $A$ 作用后方向不变,只是长度缩放 $\lambda$ 倍。$\lambda > 1$ 拉伸,$0 < \lambda < 1$ 压缩,$\lambda < 0$ 反向。 如何求特征值 把定义移项:$(A - \lambda I)v = 0$。非零解存在的条件是矩阵不可逆,即: $$ \det(A - \lambda I) = 0 $$这就是特征多项式,是 $\lambda$ 的一个 $n$ 次多项式,有 $n$ 个根(计重数)。 例:求 $A = \begin{bmatrix} 2 & 1 \\ 1 & 2 \end{bmatrix}$ 的特征值与特征向量。 ...

📅 August 4, 2026 · ⏱️ 12 min · 📝 约 1907 字 · 👁️ 次阅读

线性代数进阶:矩阵微积分如何服务反向传播

前言 这一篇不是基础线性代数笔记。矩阵乘法、转置、逆矩阵、特征值这些基础概念默认你已经见过。我们只关心一个更具体的问题:为什么深度学习里的反向传播经常要用矩阵微积分来描述? 在标量函数里,导数告诉我们“输入变化一点,输出会怎么变”。但神经网络里大量对象都不是标量:输入是向量,权重是矩阵,中间特征是高维张量,损失函数最后才压成一个标量。因此,普通的一元导数不够用,我们需要用 Jacobian、梯度向量和链式法则来描述这些对象之间的局部关系。 从标量导数到 Jacobian 设一个函数把向量 $x \in \mathbb{R}^n$ 映射到向量 $y \in \mathbb{R}^m$: $$ y = f(x) $$它的 Jacobian 矩阵定义为: $$ \begin{aligned} J_f(x) &= \frac{\partial y}{\partial x} \\\\ &= \begin{bmatrix} \frac{\partial y_1}{\partial x_1} & \cdots & \frac{\partial y_1}{\partial x_n} \\\\ \vdots & \ddots & \vdots \\\\ \frac{\partial y_m}{\partial x_1} & \cdots & \frac{\partial y_m}{\partial x_n} \end{bmatrix} \end{aligned} $$Jacobian 的含义不是“又多了一个复杂矩阵”,而是:它描述了函数 $f$ 在某一点附近的局部线性近似。 $$ f(x + \Delta x) \approx f(x) + J_f(x)\Delta x $$这就是 AI 中 Jacobian 最重要的直觉:非线性网络在局部可以近似看成线性变换。 ...

📅 August 1, 2026 · ⏱️ 9 min · 📝 约 1361 字 · 👁️ 次阅读
Comments