偏导数

来自Local Chinese Wikipedia
跳转到导航 跳转到搜索

数学中,偏导数(英语:partial derivative)的定义是:一个多变量的函数(或称多元函数),对其中一个变量(导数微分,而保持其他变量恒定[注 1]

偏导数的作用与价值在向量分析微分几何以及机器学习领域中受到广泛认可。

函数<math>f</math>关于变量<math>x</math>的偏导数写为<math>f_x^{\prime}</math>或<math>\frac{\partial f}{\partial x}</math>。偏导数符号<math>\partial</math>是全导数符号<math> d</math>的变体,由阿德里安-马里·勒让德引入,并在雅可比的重新引入后得到普遍接受。

简介[编辑]

f = x2 + xy + y2的图像。我们希望求出函数在点(1, 1)的对x的偏导数;对应的切线与xOz平面平行。
这是上图中y = 1时的图像片段。

假设 <math>f</math> 是一个多元函数。例如:

<math> z = f(x, y) = x^2 + xy + y^2</math>

因为曲面上的每一点都有无穷多条切线,描述这种函数的导数相当困难。偏导数就是选择其中一条切线,并求出它的斜率。通常,最感兴趣的是垂直于 <math>y</math> 轴(平行于<math>xOz</math> 平面)的切线,以及垂直于 <math>x</math> 轴(平行于<math>yOz</math> 平面)的切线。

一种求出这些切线的好办法是把其他变量视为常数。例如,欲求出以上的函数在点 <math>(1,1)</math> 的与 <math>xOz</math> 平面平行的切线。右图中显示了函数的图像以及这个平面。左图中显示了函数在平面 <math>y=1</math> 上是什么样的。我们把变量 <math>y</math> 视为常数,通过对方程求导,我们可以发现 <math>f</math> 在点 <math>(x,y)</math> 的导数,记为:

<math>\frac{\partial f}{\partial x} = 2x+y</math>

于是在点 <math>(1,1)</math> 的 <math>xOz</math> 平面平行的切线的斜率是3。

<math>\frac{\partial f}{\partial x} = 3</math>

在点 <math>(1,1)</math>,或称“<math>f</math> 在 <math>(1,1)</math> 的关于 <math>x</math> 的偏导数是3”。

定义[编辑]

函数 <math>f</math> 可以解释为 <math>y</math> 为自变量而 <math>x</math> 为常数的函数:

<math>f(x,y) = f_x(y) = \,\! x^2 + xy + y^2</math>。

也就是说,每一个 <math>x</math> 的值定义了一个函数,记为<math>f_x</math>,它是一个一元函数。也就是说:

<math>f_x(y) = x^2 + xy + y^2</math>。

一旦选择了一个 <math>x</math> 的值,例如 <math>a</math>,那么 <math>f(a,y)</math> 便定义了一个函数 <math>f_a</math>,把 <math>y</math> 映射到<math>a^2+ay+y^2</math>:

<math>f_a(y) = a^2 + ay + y^2</math>。

在这个表达式中,<math>a</math> 是常数,而不是变量,因此 <math>f_a</math> 是只有一个变量的函数,这个变量是 <math>y</math>。这样,便可以使用一元函数的导数的定义:

<math>f_a'(y)= a + 2y</math>

以上的步骤适用于任何 <math>a</math> 的选择。把这些导数合并起来,便得到了一个函数,它描述了 <math>f</math> 在 <math>y</math> 方向上的变化:

<math>\frac{\partial f}{\partial y}(x,y) = x + 2y</math>

这就是 <math>f</math> 关于 <math>y</math> 的偏导数,在这里,<math>\partial</math> 是一个弯曲的 <math>d</math>,称为偏导数符号。为了把它与字母 <math>d</math> 区分,<math>\partial</math> 有时读作“der”、“del”、“dah”或“偏”,而不是“dee”。

一般地,函数 <math>f(x_1,\cdots,x_n)</math> 在点 <math>(a_1,\cdots,a_n)</math> 关于 <math>x_i</math>的偏导数定义为:

<math>\frac{\partial f}{\partial x_i}(a_1,\ldots,a_n) = \lim_{h \to 0}\frac{f(a_1,\ldots,a_i+h,\ldots,a_n) - f(a_1,\ldots,a_n)}{h}</math>

在以上的差商中,除了 <math>x_i</math> 以外的所有变量都是固定的。这个固定值的选择决定了一个一元函数<math>f_{a_1,\ldots,a_{i-1},a_{i+1},\ldots,a_n}(x_i) = f(a_1,\ldots,a_{i-1},x_i,a_{i+1},\ldots,a_n)</math>,根据定义,

<math>\frac{df_{a_1,\ldots,a_{i-1},a_{i+1},\ldots,a_n}}{dx_i}(a_1,\ldots,a_n) = \frac{\partial f}{\partial x_i}(a_1,\ldots,a_n)</math>

这个表达式说明了偏导数的计算可以化为一元导数的计算。

多变量函数的一个重要的例子,是欧几里德空间 <math>\mathbb{R}^n</math>(例如 <math>\mathbb{R}^2</math> 或 <math>\mathbb{R}^3</math>)上的标量值函数 <math>f(x_1,\cdots,x_n)</math>。在这种情况下,<math>f</math> 关于每一个变量 <math>x_j</math> 具有偏导数 <math>\frac{\partial f}{\partial x_j}</math>。在点 <math>a</math>,这些偏导数定义了一个向量:

<math>\nabla f(a) = \left(\frac{\partial f}{\partial x_1}(a), \ldots, \frac{\partial f}{\partial x_n}(a)\right)</math>

这个向量称为 <math>f</math> 在点 <math>a</math> 的梯度。如果 <math>f</math> 在定义域中的每一个点都是可微的,那么梯度便是一个向量值函数 <math>\nabla f</math>,它把点 <math>a</math> 映射到向量 <math>\nabla f(a)</math>。这样,梯度便决定了一个向量场

一个常见的符号滥用是在欧几里得空间 <math>\mathbb{R}^3</math> 中用单位向量 <math>\mathbf{\hat{i}}, \mathbf{\hat{j}}, \mathbf{\hat{k}}</math>来定义Nabla算子(<math>\nabla</math>)如下:

<math>\nabla = \bigg[{\frac{\partial}{\partial x}} \bigg] \mathbf{\hat{i}} + \bigg[{\frac{\partial}{\partial y}}\bigg] \mathbf{\hat{j}} + \bigg[{\frac{\partial}{\partial z}}\bigg] \mathbf{\hat{k}}</math>

或者,更一般地,对于n维欧几里得空间 <math>\mathbb{R}^n</math> 的坐标<math>(x_1, x_2, x_3,...,x_n)</math>和单位向量(<math>\mathbf{\hat{e}_1}, \mathbf{\hat{e}_2}, \mathbf{\hat{e}_3}, \dots , \mathbf{\hat{e}_n}</math>):

<math>\nabla = \sum_{j=1}^n \bigg[{\frac{\partial}{\partial x_j}}\bigg] \mathbf{\hat{e}_j} = \bigg[{\frac{\partial}{\partial x_1}}\bigg] \mathbf{\hat{e}_1} + \bigg[{\frac{\partial}{\partial x_2}}\bigg] \mathbf{\hat{e}_2} + \bigg[{\frac{\partial}{\partial x_3}}\bigg] \mathbf{\hat{e}_3} + \dots + \bigg[{\frac{\partial}{\partial x_n}}\bigg] \mathbf{\hat{e}_n}</math>

例子[编辑]

File:Cone 3d.png
圆锥的体积与它的高度和半径有关

考虑一个圆锥体积 <math>V</math>;它与高度 <math>h</math> 和半径 <math>r</math> 有以下的关系:

<math>V(r, h) = \frac{\pi r^2 h}{3}</math>。

<math>V</math> 关于 <math>r</math> 的偏导数为:

<math>\frac{ \partial V}{\partial r} = \frac{ 2 \pi r h}{3}</math>,它描述了高度固定而半径变化时,圆锥的体积的变化率。

<math>V</math> 关于 <math>h</math> 的偏导数为:

<math>\frac{ \partial V}{\partial h} = \frac{\pi r^2}{3}</math>,它描述了半径固定而高度变化时,圆锥的体积的变化率。

现在考虑 <math>V</math> 关于 <math>r</math> 和 <math>h</math> 的全导数。它们分别是:

<math>\frac{\operatorname dV}{\operatorname dr} = \overbrace{\frac{2 \pi r h}{3}}^\frac{ \partial V}{\partial r} + \overbrace{\frac{\pi r^2}{3}}^\frac{ \partial V}{\partial h}\frac{\partial h}{\partial r}</math>

以及

<math>\frac{\operatorname dV}{\operatorname dh} = \overbrace{\frac{\pi r^2}{3}}^\frac{ \partial V}{\partial h} + \overbrace{\frac{2 \pi r h}{3}}^\frac{ \partial V}{\partial r}\frac{\partial r}{\partial h}</math>

现在假设,由于某些原因,高度和半径的比 <math>k</math> 需要是固定的:

<math>k = \frac{h}{r} = \frac{\partial h}{\partial r}</math>

这便给出了关于 <math>r</math> 的全导数:

<math>\frac{\operatorname dV}{\operatorname dr} = \frac{2 \pi r h}{3} + k\frac{\pi r^2}{3}</math>

可以化简为:

<math>\frac{\operatorname dV}{\operatorname dr} = k\pi r^2</math>

类似地,关于 <math>h</math> 的全导数是:

<math>\frac{\operatorname dV}{\operatorname dh} = \pi r^2</math>

含有未知函数的偏导数的方程,称为偏导数方程,它在物理学工程学,以及其它应用科学中经常会见到。

与关于 <math>r</math> 和 <math>h</math> 二者相关的全导数是由雅可比矩阵给出的,它的形式为梯度向量<math>\nabla V =(\frac{\partial V}{\partial r},\frac{\partial V}{\partial h}) = (\frac{2}{3}\pi rh, \frac{1}{3}\pi r^2)</math>。

记法[编辑]

在以下的例子中,设 <math>f</math> 为 <math>x</math>、<math>y</math> 和 <math>z</math> 的函数。

<math>f</math> 的一阶偏导数为:

<math>\frac{ \partial f}{ \partial x} = f_x = \partial_x f</math>

二阶偏导数为:

<math>\frac{ \partial^2 f}{ \partial x^2} = f_{xx} = \partial_{xx} f</math>

二阶混合偏导数为:

<math>\frac{\partial^2 f}{\partial y \, \partial x} = \frac{\partial}{\partial y} \left( \frac{\partial f}{\partial x} \right) = f_{xy} = \partial_{yx} f</math>

高阶偏导数为:

<math>\frac{ \partial^{i+j+k} f}{ \partial x^i\, \partial y^j\, \partial z^k } = f^{(i, j, k)}</math>

当处理多变量函数时,有些变量可能互相有关,这样就需要明确指定哪些变量是固定的。在诸如统计力学的领域中,<math>f</math> 关于 <math>x</math> 的偏导数,把 <math>y</math> 和 <math>z</math> 视为常数,通常记为:

<math>\left( \frac{\partial f}{\partial x} \right)_{y,z}</math>

正式定义和性质[编辑]

像导数一样,偏导数也是定义为一个极限。设 <math>U</math> 为 <math>\mathbb{R}^n</math> 的一个开子集,<math>f:U\rightarrow \mathbb{R}</math> 是一个函数。我们定义 <math>f</math> 在点 <math>\mathbf{a}=(a_1,\cdots,a_n) \in U</math>关于第 <math>i</math> 个变量 <math>x_i</math> 的偏导数为:

<math>\frac{ \partial }{\partial x_i }f(\mathbf{a}) =

\lim_{h \rightarrow 0}{ f(a_1, \dots , a_{i-1}, a_i+h, a_{i+1}, \dots ,a_n) - f(a_1, \dots ,a_n) \over h }</math>

即使在某个给定的点 <math>a</math>,所有的偏导数 <math>\frac{\partial f}{\partial x_i}(a)</math>都存在,函数仍然不一定在该点连续。然而,如果所有的偏导数在 <math>a</math> 的一个邻域内存在并连续,那么 <math>f</math> 在该邻域内完全可微分,且全导数是连续的。在这种情况下,我们称 <math>f</math> 是一个C1函数。

偏导数<math>\frac{\partial f}{\partial x}</math>可以视为定义在 <math>U</math> 内的另外一个函数,并可以再次求偏导数。如果所有的混合二阶偏导数在某个点(或集合)连续,我们便称 <math>f</math> 为在该点(或集合)的一个C2函数;在这种情况下,根据克莱罗定理,偏导数可以互相交换:

<math>\frac{\partial^2f}{\partial x_i\, \partial x_j} = \frac{\partial^2f} {\partial x_j\, \partial x_i}</math>。

参考文献[编辑]

  • Thomas, George Brinton; Finney, Ross L. Calculus and analytic geometry 8. ed. Reading, Mass.: Addison-Wesley. 1992: 833-840. ISBN 978-0-201-52929-6. 

注释[编辑]

  1. 相对于全导数,在其中所有变量都允许变化

参见[编辑]