前言

本节从多元函数的基本结构出发,逐步建立极限、连续性、可微性、链式法则和方向导数的统一框架。与一元函数相比,多元函数的自变量可以从无穷多个方向趋近某一点,因此“沿某一条曲线成立”通常不能直接推出多元结论。

全文使用以下记号:

  • $\mathbf{x}=(x_1,x_2,\dots,x_n)$ 表示 $\mathbb{R}^n$ 中的点或向量;
  • $X\subset\mathbb{R}^n$ 表示函数的定义域;
  • $f:X\to\mathbb{R}^m$ 表示从 $n$ 维空间到 $m$ 维空间的函数;
  • 当 $m=1$ 时,称 $f$ 为标量值函数(scalar-valued function);
  • 当 $m>1$ 时,称 $f$ 为向量值函数(vector-valued function)。

2.1 多元函数

定义域、陪域和值域

对函数 $f:X\to Y$:

  • $X$ 称为函数的定义域(domain);
  • $Y$ 称为函数的陪域(codomain);
  • 值域(range)是函数实际取得的所有值: $$ f(X)=\{f(x):x\in X\}. $$

定义域和陪域都是函数定义的一部分。值域则由函数的实际取值决定,因此通常只是陪域的一个子集。

例 2.1:设

$$ f:(-1,2)\to\mathbb{R},\qquad f(x)=x^2. $$

则定义域为 $(-1,2)$,陪域为 $\mathbb{R}$。由于 $x$ 可以取到 $0$,但不能取到 $4$,函数的值域为

$$ [0,4). $$

函数组合

设 $f:X\to Y$,$g:Y\to Z$。如果 $f$ 的输出属于 $g$ 的定义域,则可以定义复合函数

$$ g\circ f:X\to Z,\qquad (g\circ f)(x)=g(f(x)). $$

函数复合的运算顺序是从右向左读取,先计算 $f(x)$,再将结果代入 $g$。一般来说,函数复合不满足交换律。

例 2.2:设

$$ f(x,y)=(2x,2y),\qquad g(x,y)=(x+1,y+1). $$

则

$$ (f\circ g)(x,y)=(2x+2,2y+2), $$

而

$$ (g\circ f)(x,y)=(2x+1,2y+1). $$

因此 $f\circ g\neq g\circ f$。

单射、满射与双射

设 $f:X\to Y$。

单射(injective,或 one-to-one):如果对任意不同的 $a,b\in X$,都有

$$ f(a)\neq f(b), $$

则称 $f$ 为单射。单射意味着不同的输入不会产生相同的输出。

满射(surjective,或 onto):如果对每个 $y\in Y$,都存在 $x\in X$ 使得

$$ f(x)=y, $$

则称 $f$ 为满射。满射意味着值域等于陪域。

双射(bijective):如果函数同时是单射和满射,则称其为双射。

双射函数存在逆函数 $f^{-1}:Y\to X$,并满足

$$ f^{-1}\circ f=\operatorname{id}_X,\qquad f\circ f^{-1}=\operatorname{id}_Y. $$

例 2.3:设

$$ f:\mathbb{R}^2\to\mathbb{R}^2,\qquad f(x,y)=(x+y,x-y). $$

令

$$ (u,v)=(x+y,x-y). $$

将两式相加、相减可得

$$ x=\frac{u+v}{2},\qquad y=\frac{u-v}{2}. $$

我们发现,对于任意 $(u,v)\in\mathbb{R}^2$,都存在唯一的 $(x,y)\in\mathbb{R}^2$ 使得 $f(x,y)=(u,v)$。 因此 $f$ 是双射,且

$$ f^{-1}(u,v)=\left(\frac{u+v}{2},\frac{u-v}{2}\right). $$

相比之下,函数 $f:\mathbb{R}^3\to\mathbb{R}$,$f(\mathbf{v})=\|\mathbf{v}\|$ 既不是单射,也不是满射。它不是单射,因为例如 $\|\mathbf{v}\|=\|-\mathbf{v}\|$;它不是满射,因为范数不可能取负值,而陪域包含负实数。

向量值函数与分量函数

设 $f:X\to\mathbb{R}^m$,其中 $X\subset\mathbb{R}^n$。由于 $f(\mathbf{x})$ 有 $m$ 个坐标,可以写成

$$ f(\mathbf{x})= \bigl(f_1(\mathbf{x}),f_2(\mathbf{x}),\dots,f_m(\mathbf{x})\bigr). $$

其中每个 $f_j:X\to\mathbb{R}$ 称为 $f$ 的分量函数(component function)。

例 2.4:设

$$ f(x,y)=(x^2+y^2,2xy,1). $$

则分量函数为

$$ f_1(x,y)=x^2+y^2,\qquad f_2(x,y)=2xy,\qquad f_3(x,y)=1. $$

图像、等高曲线与水平曲线

设 $f:X\to\mathbb{R}$,其中 $X\subset\mathbb{R}^2$。函数的 图像(graph) 定义为

$$ \operatorname{Graph}(f) =\{(x,y,f(x,y))\in\mathbb{R}^3:(x,y)\in X\}. $$

因此,图像是三维空间中的曲面。在底面点 $(x,y)$ 上,曲面的高度为 $f(x,y)$。

固定一个常数 $c$:

  • 图像与水平平面 $z=c$ 的交集称为高度为 $c$ 的等高曲线(contour curve);
  • 将这条交线投影到 $xy$ 平面后得到的集合 $$ \{(x,y)\in X:f(x,y)=c\} $$ 称为函数的水平曲线(level curve)。

水平曲线把三维曲面的信息压缩到二维平面中。绘制多条不同高度的水平曲线,可以帮助判断曲面的上升、下降、对称性和局部形状。

二次曲面

三维空间中的 二次曲面(quadric surface) 由一个二次方程定义:

$$ Ax^2+Bxy+Cxz+Dy^2+Eyz+Fz^2 +Gx+Hy+Iz+J=0. $$

常见的标准形式如下。

椭球面(ellipsoid)

$$ \frac{x^2}{a^2}+\frac{y^2}{b^2}+\frac{z^2}{c^2}=1. $$

当 $a=b=c$ 时,椭球面退化为球面。三个参数分别控制曲面沿三个坐标轴方向的尺度。

以原点为中心、沿三个坐标轴方向尺度不同的椭球面
椭球面是封闭曲面;与坐标平面平行的非退化截面均为椭圆。

椭圆抛物面(elliptic paraboloid)

$$ \frac{z}{c}=\frac{x^2}{a^2}+\frac{y^2}{b^2}. $$

它是函数

$$ z=c\left(\frac{x^2}{a^2}+\frac{y^2}{b^2}\right) $$

的图像,沿 $z$ 轴方向开口。水平截面通常是椭圆。

沿正 z 轴方向开口的椭圆抛物面
椭圆抛物面只有一个顶点;当高度固定时,水平截面为椭圆。

双曲抛物面(hyperbolic paraboloid)

$$ \frac{z}{c}=\frac{y^2}{b^2}-\frac{x^2}{a^2}. $$

两个方向上的曲率符号相反,曲面具有鞍形结构,因此通常称为鞍面。

一个方向向上弯曲、另一个方向向下弯曲的双曲抛物面
双曲抛物面在两个主方向上的弯曲方向相反,原点附近呈鞍形。

椭圆锥面(elliptic cone)

$$ \frac{z^2}{c^2} =\frac{x^2}{a^2}+\frac{y^2}{b^2}. $$

它由两个相对的锥面组成,顶点位于原点。

以原点为顶点、沿正负 z 轴展开的双锥面
椭圆锥面由上下两个锥面组成;除顶点外,水平截面为椭圆。

单叶双曲面(hyperboloid of one sheet)

$$ \frac{x^2}{a^2} +\frac{y^2}{b^2} -\frac{z^2}{c^2}=1. $$

沿 $z$ 轴方向的截面体现出连续的“腰部”结构,因此称为单叶双曲面。

中部收窄且上下连通的单叶双曲面
单叶双曲面整体连通,在 $z=0$ 附近形成最窄的椭圆形腰部。

双叶双曲面(hyperboloid of two sheets)

$$ \frac{x^2}{a^2} +\frac{y^2}{b^2} -\frac{z^2}{c^2}=-1. $$

它由两个彼此分离的部分组成,沿 $z$ 轴方向展开。

沿正负 z 轴分离展开的双叶双曲面
双叶双曲面由两个互不连通的分支组成,靠近原点的区域没有曲面。

2.2 极限与连续性

$\mathbb{R}^n$ 中的开球与闭球

设 $\mathbf{a}\in\mathbb{R}^n$,$r>0$。以 $\mathbf{a}$ 为中心、半径为 $r$ 的开球(open ball),其定义为

$$ B(\mathbf{a},r) =\{\mathbf{x}\in\mathbb{R}^n:\|\mathbf{x}-\mathbf{a}\|\lt r\}. $$

相应的闭球(closed ball),其定义为

$$ \overline{B}(\mathbf{a},r) =\{\mathbf{x}\in\mathbb{R}^n:\|\mathbf{x}-\mathbf{a}\|\leq r\}. $$

这里的 $\Vert{}x-a\Vert{}$ 表示 $\mathbb{R}^n$ 中的欧氏距离(Euclidean distance)。 在 $\mathbb{R}^2$ 中,开球是圆的内部,闭球是圆盘;在 $\mathbb{R}^3$ 中,开球是球体内部,闭球还包含球面。

内点、边界点、内部与边界

设 $X\subset\mathbb{R}^n$。

如果 $\mathbf{a}\in X$ 且存在 $r>0$ 使得

$$ B(\mathbf{a},r)\subset X, $$

则称 $\mathbf{a}$ 是 $X$ 的内点(interior point)。所有内点组成的集合称为 $X$ 的内部(interior)。

点 $\mathbf{a}\in\mathbb{R}^n$ 称为 $X$ 的边界点(boundary point),如果以 $\mathbf{a}$ 为中心的每一个开球都同时包含 $X$ 中的点和 $X$ 外的点。所有边界点组成的集合记作

$$ \partial X. $$

内点必须属于 $X$,边界点则不一定属于 $X$。例如,开圆盘的圆周不是开圆盘的元素,但圆周上的每一点都是其边界点。

开集与闭集

如果 $X$ 中每一点都是 $X$ 的内点,则称 $X$ 为开集(open set)。

如果补集

$$ \mathbb{R}^n\setminus X $$

是开集,则称 $X$ 为闭集(closed set)。

一个重要判据是:

$X\subset\mathbb{R}^n$ 是闭集,当且仅当 $X$ 包含它的全部边界点。

几个典型例子:

  • $\varnothing$ 和 $\mathbb{R}^2$ 既是开集也是闭集;
  • $\{(x,y):x+y\lt 1\}$ 是开集,但不是闭集;
  • $\{(x,y):xy=1\}$ 是闭集,但不是开集;
  • $\{(x,y):0\leq x\lt 1,\ 0\lt y\leq1\}$ 既不是开集,也不是闭集。

“开”和“闭”不是互相排斥的性质;一个集合可以同时具有两种性质,也可以两种性质都不具有。

聚点与孤立点

设 $X\subset\mathbb{R}^n$。如果对任意 $\delta>0$,都存在 $\mathbf{x}\in X$ 满足

$$ \mathbf{x}\in B(\mathbf{a},\delta),\qquad \mathbf{x}\neq\mathbf{a}, $$

则称 $\mathbf{a}$ 为 $X$ 的聚点(limit point 或 accumulation point)。

聚点不必属于 $X$。如果 $\mathbf{a}\in X$ 且不是 $X$ 的聚点,则称 $\mathbf{a}$ 为 $X$ 的孤立点(isolated point)。等价地,存在 $\delta>0$ 使得

$$ B(\mathbf{a},\delta)\cap X=\{\mathbf{a}\}. $$

聚点的概念在极限定义中不可缺少,因为极限研究的是函数在点附近的行为,而不依赖函数在该点的取值。

多元函数极限的定义

设 $f:X\to\mathbb{R}^m$,其中 $X\subset\mathbb{R}^n$,且 $\mathbf{a}$ 是 $X$ 的聚点。若存在 $\mathbf{L}\in\mathbb{R}^m$,使得对任意 $\varepsilon>0$,都存在 $\delta>0$,满足

$$ \mathbf{x}\in X,\qquad 0<\|\mathbf{x}-\mathbf{a}\|<\delta \quad\Longrightarrow\quad \|f(\mathbf{x})-\mathbf{L}\|<\varepsilon, $$

则称

$$ \lim_{\mathbf{x}\to\mathbf{a}}f(\mathbf{x})=\mathbf{L}. $$

这里的条件 $0\lt\|\mathbf{x}-\mathbf{a}\|$ 排除了 $\mathbf{x}=\mathbf{a}$。因此,极限只描述函数在 $\mathbf{a}$ 附近的行为,并不要求 $f(\mathbf{a})$ 已经定义,也不要求它等于 $\mathbf{L}$。

从几何上看,当 $\mathbf{x}$ 足够接近 $\mathbf{a}$ 时,$f(\mathbf{x})$ 必须落在以 $\mathbf{L}$ 为中心、半径 $\varepsilon$ 的开球内:

$$ f(\mathbf{x})\in B(\mathbf{L},\varepsilon). $$

极限的唯一性与代数运算

如果多元函数的极限存在,则极限值唯一。也就是说,同一个函数不可能在同一个聚点处有两个不同的极限。

设

$$ \lim_{\mathbf{x}\to\mathbf{a}}f(\mathbf{x})=\mathbf{L}, \qquad \lim_{\mathbf{x}\to\mathbf{a}}g(\mathbf{x})=\mathbf{M}. $$

则有以下运算规律:

$$ \lim_{\mathbf{x}\to\mathbf{a}}(f\pm g)(\mathbf{x}) =\mathbf{L}\pm\mathbf{M}, $$$$ \lim_{\mathbf{x}\to\mathbf{a}}(cf)(\mathbf{x}) =c\mathbf{L}. $$

当 $f$、$g$ 为标量值函数时,还有

$$ \lim_{\mathbf{x}\to\mathbf{a}}(fg)(\mathbf{x}) =LM, $$

以及在 $M\neq0$ 时

$$ \lim_{\mathbf{x}\to\mathbf{a}} \left(\frac{f}{g}\right)(\mathbf{x}) =\frac{L}{M}. $$

例 2.5:

$$ \lim_{(x,y)\to(0,0)} \frac{2x^2+xy+2}{x+y+1} =\frac{2}{1}=2. $$

分母在原点附近保持非零,且分子、分母都是多项式,所以可以直接使用极限的代数运算。

用不同路径判断极限不存在

多元极限要求从所有可能的方向趋近目标点。证明极限不存在时,常用两种方法:

  1. 限制函数在某条经过目标点的曲线上,证明限制后的极限不存在;
  2. 选择两条经过目标点的曲线,证明沿两条曲线得到不同的极限。

例 2.6:考虑

$$ F(x,y)=\frac{x+y^3}{x^3+y^2}. $$

沿 $y=0$ 趋近原点时,

$$ F(x,0)=\frac{x}{x^3}=\frac{1}{x^2}, $$

其值不趋于有限数;沿 $x=0$ 趋近原点时,

$$ F(0,y)=\frac{y^3}{y^2}=y\to0. $$

两条路径的行为不一致,因此

$$ \lim_{(x,y)\to(0,0)} \frac{x+y^3}{x^3+y^2} $$

不存在。

例 2.7:考虑

$$ G(x,y,z) =\frac{2x^2+y^2-3z^2}{x^2+y^2+z^2}. $$

沿三个坐标轴分别得到

$$ G(x,0,0)=2,\qquad G(0,y,0)=1,\qquad G(0,0,z)=-3. $$

由于这些路径给出的极限不同,三元极限不存在。

需要注意:沿有限条路径得到相同的结果,仍不足以证明多元极限存在;它只能用于证明极限不存在。

夹逼定理

设 $f,g,h:X\to\mathbb{R}$,且对 $X$ 中所有点都有

$$ f(\mathbf{x})\leq g(\mathbf{x})\leq h(\mathbf{x}). $$

如果

$$ \lim_{\mathbf{x}\to\mathbf{a}}f(\mathbf{x}) =\lim_{\mathbf{x}\to\mathbf{a}}h(\mathbf{x}) =L, $$

则

$$ \lim_{\mathbf{x}\to\mathbf{a}}g(\mathbf{x})=L. $$

例 2.8:

$$ 0\leq \frac{x^4+y^4}{x^2+y^2} \leq \frac{(x^2+y^2)^2}{x^2+y^2} =x^2+y^2. $$

右端在 $(x,y)\to(0,0)$ 时趋于 $0$,因此由夹逼定理,

$$ \lim_{(x,y)\to(0,0)} \frac{x^4+y^4}{x^2+y^2}=0. $$

向量值函数的分量极限

设

$$ f=(f_1,f_2,\dots,f_m):X\to\mathbb{R}^m. $$

则

$$ \lim_{\mathbf{x}\to\mathbf{a}}f(\mathbf{x}) =(L_1,L_2,\dots,L_m) $$

当且仅当对每个 $j=1,2,\dots,m$ 都有

$$ \lim_{\mathbf{x}\to\mathbf{a}}f_j(\mathbf{x})=L_j. $$

因此,向量值函数的极限可以逐个分量计算。

连续性

设 $f:X\to\mathbb{R}^m$。如果 $\mathbf{a}\in X$ 是孤立点,或者

$$ \lim_{\mathbf{x}\to\mathbf{a}}f(\mathbf{x})=f(\mathbf{a}), $$

则称 $f$ 在 $\mathbf{a}$ 连续(continuous)。如果 $f$ 在定义域中的每一点都连续,则称 $f$ 为连续函数。

连续性与极限的核心区别在于:极限可以研究不包含目标点的邻域,而连续性要求目标点属于定义域,并且函数值与极限相等。

例 2.9:设

$$ f(x,y)= \begin{cases} x+2y,&(x,y)\neq(0,0),\\ 1,&(x,y)=(0,0). \end{cases} $$

当 $(x,y)\to(0,0)$ 且 $(x,y)\neq(0,0)$ 时,

$$ f(x,y)=x+2y\to0. $$

但是 $f(0,0)=1$,所以

$$ \lim_{(x,y)\to(0,0)}f(x,y)\neq f(0,0). $$

因此 $f$ 在原点不连续。

连续函数的运算与复合

若 $f,g:X\to\mathbb{R}^m$ 在 $\mathbf{a}$ 连续,则:

  • $f+g$ 在 $\mathbf{a}$ 连续;
  • $cf$ 在 $\mathbf{a}$ 连续,其中 $c\in\mathbb{R}$;
  • 当 $m=1$ 时,$fg$ 在 $\mathbf{a}$ 连续;
  • 当 $m=1$ 且 $g(\mathbf{a})\neq0$ 时,$f/g$ 在 $\mathbf{a}$ 连续。

此外,若 $f:X\to Y$ 在 $\mathbf{a}$ 的极限为 $\mathbf{L}\in Y$,且 $g:Y\to\mathbb{R}^k$ 在 $\mathbf{L}$ 连续,则

$$ \lim_{\mathbf{x}\to\mathbf{a}}(g\circ f)(\mathbf{x}) =g(\mathbf{L}). $$

因此,连续函数的复合仍然连续。

例如,指数函数、三角函数、多项式、范数以及在分母不为零处定义的有理函数都是连续函数。向量值函数只要每个分量函数连续,就连续。

2.3 多元函数的微分

偏导数

设 $f:X\to\mathbb{R}$,其中 $X\subset\mathbb{R}^n$,且 $\mathbf{a}$ 是 $X$ 的内点。设 $\mathbf{e}_j$ 是第 $j$ 个标准向量。$f$ 在 $\mathbf{a}$ 处关于 $x_j$ 的 偏导数(partial derivative) 定义为

$$ \frac{\partial f}{\partial x_j}(\mathbf{a}) =\lim_{h\to0} \frac{f(\mathbf{a}+h\mathbf{e}_j)-f(\mathbf{a})}{h}. $$

也常记作

$$ f_{x_j}(\mathbf{a}) \quad\text{或}\quad D_{x_j}f(\mathbf{a}). $$

计算偏导数时,只改变一个变量,其余变量视为常数。

例 2.10:若

$$ f(x,y)=x^2y, $$

则

$$ f_x(x,y)=2xy,\qquad f_y(x,y)=x^2. $$

所以

$$ f_x(2,3)=12. $$

例 2.11:设

$$ f(x,y,z) =2x^2yz-\sin(y^2+z^2)+e^{2x-z}. $$

分别对 $x$、$y$、$z$ 求偏导,得到

$$ f_x=4xyz+2e^{2x-z}, $$$$ f_y=2x^2z-2y\cos(y^2+z^2), $$$$ f_z=2x^2y-2z\cos(y^2+z^2)-e^{2x-z}. $$

切平面

设 $f:X\to\mathbb{R}$,其中 $X\subset\mathbb{R}^2$,且 $(a,b)$ 是定义域的内点。若图像

$$ z=f(x,y) $$

在点

$$ (a,b,f(a,b)) $$

处存在切平面,并且偏导数存在,则切平面方程为

$$ z=f(a,b) +f_x(a,b)(x-a) +f_y(a,b)(y-b). $$

它是函数在 $(a,b)$ 附近的一阶线性近似。

例 2.12:设

$$ f(x,y)=\sqrt{3-x^2-y^2}. $$

在 $(1,1)$ 处有 $f(1,1)=1$,并且

$$ f_x(x,y)=\frac{-x}{\sqrt{3-x^2-y^2}}, \qquad f_y(x,y)=\frac{-y}{\sqrt{3-x^2-y^2}}. $$

因此

$$ f_x(1,1)=f_y(1,1)=-1. $$

切平面为

$$ z=1-(x-1)-(y-1), $$

即

$$ x+y+z=3. $$

隐式曲面与梯度法向量

若曲面 $S$ 可以表示为

$$ F(x,y,z)=c, $$

且 $S$ 在点 $\mathbf{a}$ 处存在切平面,并且

$$ \nabla F(\mathbf{a})\neq\mathbf{0}, $$

则梯度

$$ \nabla F(\mathbf{a}) =\bigl(F_x(\mathbf{a}),F_y(\mathbf{a}),F_z(\mathbf{a})\bigr) $$

是该点切平面的一个法向量。

这给出了隐式曲面求法向量的直接方法:先把曲面写成 $F=c$,再计算 $\nabla F$。

可微性的定义

设 $f:X\to\mathbb{R}$,其中 $X\subset\mathbb{R}^n$ 是开集。假设 $f$ 在 $\mathbf{a}$ 处的各个偏导数存在。定义线性函数

$$ h(\mathbf{x}) =f(\mathbf{a}) +\sum_{j=1}^n \frac{\partial f}{\partial x_j}(\mathbf{a})(x_j-a_j). $$

如果

$$ \lim_{\mathbf{x}\to\mathbf{a}} \frac{f(\mathbf{x})-h(\mathbf{x})} {\|\mathbf{x}-\mathbf{a}\|}=0, $$

则称 $f$ 在 $\mathbf{a}$ 可微(differentiable)。

这个定义要求函数与其线性近似之间的误差,相对于输入距离 $\|\mathbf{x}-\mathbf{a}\|$ 而言趋于 $0$。因此,可微性不仅要求偏导数存在,还要求所有方向上的局部变化能够由同一个线性映射统一描述。

梯度与导数矩阵

标量值函数的 梯度(gradient) 定义为

$$ \nabla f(\mathbf{a}) =\operatorname{grad}f(\mathbf{a}) =\left( \frac{\partial f}{\partial x_1}(\mathbf{a}), \frac{\partial f}{\partial x_2}(\mathbf{a}), \dots, \frac{\partial f}{\partial x_n}(\mathbf{a}) \right). $$

利用梯度,线性近似可以写成

$$ h(\mathbf{x}) =f(\mathbf{a}) +\nabla f(\mathbf{a})\cdot(\mathbf{x}-\mathbf{a}). $$

导数矩阵定义为 $1\times n$ 的矩阵

$$ Df(\mathbf{a}) =\begin{pmatrix} f_{x_1}(\mathbf{a})& f_{x_2}(\mathbf{a})& \cdots& f_{x_n}(\mathbf{a}) \end{pmatrix}. $$

因此

$$ \nabla f(\mathbf{a})\cdot(\mathbf{x}-\mathbf{a}) =Df(\mathbf{a})(\mathbf{x}-\mathbf{a}). $$

梯度通常视为列向量或几何向量,而 $Df$ 按照矩阵乘法约定写成行矩阵。两者包含相同的偏导数信息,但书写位置不同。

可微性的充分条件与连续性

若 $f$ 在包含 $\mathbf{a}$ 的某个开集上具有连续偏导数,则 $f$ 在 $\mathbf{a}$ 可微。这是判断可微性的一个常用充分条件。

需要区分以下三个层次:

  1. 偏导数存在,不足以保证函数可微;
  2. 偏导数在邻域内连续,可以推出函数可微;
  3. 函数可微,可以推出函数连续。

因此,“连续偏导数推出可微”不是充要条件,而是充分条件;可微函数一定连续,但连续函数不一定可微。

向量值函数与 Jacobian 矩阵

设

$$ f=(f_1,f_2,\dots,f_m):X\to\mathbb{R}^m, $$

其中 $X\subset\mathbb{R}^n$ 是开集。如果所有偏导数存在,则 $f$ 的 Jacobian 矩阵(Jacobian matrix) 定义为

$$ Df(\mathbf{x})= \begin{pmatrix} \dfrac{\partial f_1}{\partial x_1} & \dfrac{\partial f_1}{\partial x_2} & \cdots & \dfrac{\partial f_1}{\partial x_n} \\[6pt] \dfrac{\partial f_2}{\partial x_1} & \dfrac{\partial f_2}{\partial x_2} & \cdots & \dfrac{\partial f_2}{\partial x_n} \\ \vdots&\vdots&\ddots&\vdots\\ \dfrac{\partial f_m}{\partial x_1} & \dfrac{\partial f_m}{\partial x_2} & \cdots & \dfrac{\partial f_m}{\partial x_n} \end{pmatrix}. $$

它是一个 $m\times n$ 矩阵。第 $i$ 行记录第 $i$ 个分量函数的导数,第 $j$ 列对应输入变量 $x_j$。

向量值函数在 $\mathbf{a}$ 处可微,是指

$$ \lim_{\mathbf{x}\to\mathbf{a}} \frac{\|f(\mathbf{x})-f(\mathbf{a})-Df(\mathbf{a})(\mathbf{x}-\mathbf{a})\|} {\|\mathbf{x}-\mathbf{a}\|}=0. $$

向量值函数可微,当且仅当每个分量函数都可微。若每个分量函数在邻域内具有连续偏导数,则向量值函数可微。

例 2.13:设

$$ f(x,y)=(x^2+y,\sin x\cos y). $$

则

$$ Df(x,y)= \begin{pmatrix} 2x&1\\ \cos x\cos y&-\sin x\sin y \end{pmatrix}. $$

导数的代数运算

设 $f,g:X\to\mathbb{R}^m$ 在 $\mathbf{a}$ 处可微,则:

$$ D(f+g)(\mathbf{a}) =Df(\mathbf{a})+Dg(\mathbf{a}), $$$$ D(cf)(\mathbf{a})=cDf(\mathbf{a}). $$

当 $f,g$ 为标量值函数时,

$$ D(fg)(\mathbf{a}) =g(\mathbf{a})Df(\mathbf{a}) +f(\mathbf{a})Dg(\mathbf{a}), $$

以及当 $g(\mathbf{a})\neq0$ 时,

$$ D\left(\frac{f}{g}\right)(\mathbf{a}) =\frac{ g(\mathbf{a})Df(\mathbf{a}) -f(\mathbf{a})Dg(\mathbf{a}) }{g(\mathbf{a})^2}. $$

这些公式与一元微积分中的和法则、数乘法则、积法则和商法则一致,只是导数由数变成了矩阵。

高阶偏导数与混合偏导定理

对偏导数再次求偏导,可以得到高阶偏导数。例如,对 $f(x,y)$ 可以定义

$$ f_{xx},\qquad f_{xy},\qquad f_{yx},\qquad f_{yy}. $$

一般地,

$$ \frac{\partial^2 f}{\partial x_j\partial x_i} =f_{x_ix_j} =\frac{\partial}{\partial x_j} \left(\frac{\partial f}{\partial x_i}\right). $$

更高阶偏导数按同样方式递归定义。

例 2.14:设

$$ f(x,y)=2x^3y^4. $$

则

$$ f_x=6x^2y^4,\qquad f_y=8x^3y^3, $$

并且

$$ f_{xx}=12xy^4,\qquad f_{xy}=f_{yx}=24x^2y^3,\qquad f_{yy}=24x^3y^2. $$

若 $f$ 属于 $C^k$,即所有阶数不超过 $k$ 的偏导数都存在且连续,则偏导数的次序可以交换。更具体地,若 $(j_1,\dots,j_k)$ 是 $(i_1,\dots,i_k)$ 的一个排列,则

$$ f_{x_{i_1}x_{i_2}\cdots x_{i_k}} =f_{x_{j_1}x_{j_2}\cdots x_{j_k}}. $$

特别地,属于 $C^2$ 的函数满足

$$ f_{xy}=f_{yx}. $$

这里的连续性条件不能省略。仅知道两个混合偏导数都存在,并不能在一般情况下保证它们相等。

$C^k$ 函数与光滑函数

设 $X\subset\mathbb{R}^n$ 是开集。

  • $f$ 属于 $C^k$,表示所有阶数不超过 $k$ 的偏导数存在且连续;
  • $f$ 是 光滑函数(smooth function) 或属于 $C^\infty$,表示任意阶偏导数都存在且连续。

对向量值函数,只需要求其每个分量函数满足相应条件。

2.4 链式法则与方向导数

一元参数曲线下的链式法则

设 $f:Y\to\mathbb{R}$,其中 $Y\subset\mathbb{R}^n$;设

$$ g:X\to\mathbb{R}^n,\qquad g(t)=\bigl(x_1(t),x_2(t),\dots,x_n(t)\bigr). $$

如果 $f$ 在 $g(t_0)$ 可微,且 $g$ 在 $t_0$ 可微,则复合函数 $f\circ g$ 可微,并且

$$ \frac{d}{dt}(f\circ g)(t_0) =\sum_{j=1}^n \frac{\partial f}{\partial x_j}(g(t_0)) \frac{dx_j}{dt}(t_0). $$

矩阵形式为

$$ \frac{d}{dt}(f\circ g)(t_0) =Df(g(t_0))Dg(t_0). $$

这说明链式法则本质上是导数矩阵的乘法。

例 2.15:设

$$ f(x,y)=\sin(x+y)+2x^2, \qquad g(t)=\bigl(2t^2,1-t^3\bigr). $$

令

$$ x(t)=2t^2,\qquad y(t)=1-t^3. $$

则

$$ \frac{\partial f}{\partial x} =\cos(x+y)+4x,\qquad \frac{\partial f}{\partial y} =\cos(x+y), $$

以及

$$ \frac{dx}{dt}=4t,\qquad \frac{dy}{dt}=-3t^2. $$

代入链式法则,得到

$$ \frac{d}{dt}(f\circ g) =(4t-3t^2)\cos(2t^2+1-t^3)+32t^3. $$

一般链式法则

设

$$ g:X\to\mathbb{R}^n,\qquad f:Y\to\mathbb{R}^k, $$

其中 $X\subset\mathbb{R}^m$,$Y\subset\mathbb{R}^n$,且 $g(X)\subset Y$。若 $g$ 在 $\mathbf{a}$ 可微,$f$ 在 $g(\mathbf{a})$ 可微,则 $h=f\circ g$ 在 $\mathbf{a}$ 可微,并且

$$ Dh(\mathbf{a}) =Df(g(\mathbf{a}))Dg(\mathbf{a}). $$

矩阵维度也能帮助检查公式是否正确:

$$ Dg(\mathbf{a})\in\mathbb{R}^{n\times m}, \qquad Df(g(\mathbf{a}))\in\mathbb{R}^{k\times n}, $$

所以

$$ Dh(\mathbf{a})\in\mathbb{R}^{k\times m}. $$

例 2.16:设

$$ f(x,y)=(x+y,2x^2), \qquad g(x,y,z)=(x-y^2+z,1). $$

在 $(2,3,4)$ 处,

$$ g(2,3,4)=(-3,1). $$

有

$$ Df(-3,1)= \begin{pmatrix} 1&1\\ -12&0 \end{pmatrix}, \qquad Dg(2,3,4)= \begin{pmatrix} 1&-6&1\\ 0&0&0 \end{pmatrix}. $$

因此

$$ D(f\circ g)(2,3,4)= \begin{pmatrix} 1&-6&1\\ -12&72&-12 \end{pmatrix}. $$

极坐标中的偏导数变换

设

$$ x=r\cos\theta,\qquad y=r\sin\theta, $$

并把 $f$ 看作 $r,\theta$ 的函数。这里 $r>0$,因为 $r=0$ 是可取半径集合 $[0,\infty)$ 的端点,不能直接使用关于 $r$ 的双侧偏导数公式。

由链式法则,

$$ \frac{\partial f}{\partial r} =\cos\theta\frac{\partial f}{\partial x} +\sin\theta\frac{\partial f}{\partial y}, $$$$ \frac{\partial f}{\partial\theta} =-r\sin\theta\frac{\partial f}{\partial x} +r\cos\theta\frac{\partial f}{\partial y}. $$

反解可得

$$ \frac{\partial f}{\partial x} =\cos\theta\frac{\partial f}{\partial r} -\frac{\sin\theta}{r}\frac{\partial f}{\partial\theta}, $$$$ \frac{\partial f}{\partial y} =\sin\theta\frac{\partial f}{\partial r} +\frac{\cos\theta}{r}\frac{\partial f}{\partial\theta}. $$

这些公式描述了同一个函数在笛卡尔坐标和极坐标下的偏导数之间的关系。它们不是两个不同函数的导数,而是同一函数采用不同坐标参数化后的表达。

方向导数

设 $f:X\to\mathbb{R}$,$\mathbf{a}$ 是 $X$ 的内点,$\mathbf{u}\in\mathbb{R}^n$ 是单位向量。$f$ 在 $\mathbf{a}$ 沿 $\mathbf{u}$ 方向的 方向导数(directional derivative) 定义为

$$ D_{\mathbf{u}}f(\mathbf{a}) =\lim_{h\to0} \frac{f(\mathbf{a}+h\mathbf{u})-f(\mathbf{a})}{h}. $$

单位向量条件非常重要,因为它使 $h$ 表示实际移动的距离。如果给定的方向向量 $\mathbf{v}\neq\mathbf{0}$ 不是单位向量,应先单位化:

$$ \mathbf{u}=\frac{\mathbf{v}}{\|\mathbf{v}\|}. $$

例 2.17:设

$$ f(x,y)=x^2y,\qquad \mathbf{a}=(1,2),\qquad \mathbf{u}=\left(\frac1{\sqrt2},\frac1{\sqrt2}\right). $$

梯度为

$$ \nabla f(x,y)=(2xy,x^2), $$

所以

$$ \nabla f(1,2)=(4,1). $$

可微函数的方向导数公式

如果 $f$ 在 $\mathbf{a}$ 可微,则任意单位向量 $\mathbf{u}$ 下的方向导数都存在,并且

$$ D_{\mathbf{u}}f(\mathbf{a}) =\nabla f(\mathbf{a})\cdot\mathbf{u}. $$

对于上面的例子,

$$ D_{\mathbf{u}}f(1,2) =(4,1)\cdot \left(\frac1{\sqrt2},\frac1{\sqrt2}\right) =\frac5{\sqrt2}. $$

可微性是该公式成立的充分背景。反过来,即使函数沿每一个方向的方向导数都存在,也不能据此推出函数可微。

梯度与最大方向导数

设 $f$ 在 $\mathbf{a}$ 可微且

$$ \nabla f(\mathbf{a})\neq\mathbf{0}. $$

由柯西不等式,

$$ D_{\mathbf{u}}f(\mathbf{a}) =\nabla f(\mathbf{a})\cdot\mathbf{u} \leq \|\nabla f(\mathbf{a})\|\,\|\mathbf{u}\| =\|\nabla f(\mathbf{a})\|. $$

因此:

  • 当 $\mathbf{u}$ 与 $\nabla f(\mathbf{a})$ 同方向时,方向导数取得最大值 $\|\nabla f(\mathbf{a})\|$;
  • 当 $\mathbf{u}$ 与 $\nabla f(\mathbf{a})$ 反方向时,方向导数取得最小值 $-\|\nabla f(\mathbf{a})\|$;
  • 梯度方向是函数增长最快的方向;
  • 反梯度方向是函数下降最快的方向。

例 2.18:假设山体表面由

$$ f(x,y)=6-2x^2-3y^2-3xy $$

表示,并且当前位置的水平坐标为 $(1,0)$。有

$$ \nabla f(x,y)=(-4x-3y,-6y-3x), $$

因此

$$ \nabla f(1,0)=(-4,-3). $$

如果希望以最快速度上升,应沿方向 $(-4,-3)$ 移动。

小结

第二章的主要逻辑可以概括为:

  1. 多元函数:明确输入空间、输出空间、值域以及函数复合;向量值函数可以分解为分量函数;
  2. 几何表示:标量值函数可以通过图像、等高曲线和水平曲线理解,二次曲面给出了典型的三维几何模型;
  3. 极限与连续性:多元极限必须对所有趋近路径成立,夹逼定理和路径比较是常用工具;
  4. 微分:偏导数描述坐标方向上的局部变化,可微性要求这些局部信息组成统一的线性近似;
  5. 梯度与 Jacobian 矩阵:梯度是标量值函数导数的向量表示,Jacobian 矩阵推广到向量值函数;
  6. 高阶偏导数:在连续性条件满足时,混合偏导数的次序可以交换;
  7. 链式法则:复合函数的导数由导数矩阵相乘得到;
  8. 方向导数:可微时,方向导数等于梯度与单位方向向量的点积,梯度方向给出最快上升方向。

需要重点区分三组概念:

  • 偏导数存在与可微性:前者一般不能推出后者;
  • 可微性与连续性:可微可以推出连续,但反向结论通常不成立;
  • 沿部分路径成立与多元极限存在:不同路径给出不同结果可以否定极限,但有限条路径结果相同不能单独证明极限存在。