ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

多元复合函数求导法则:依赖树与路径法,告别死记硬背

多元复合函数求导法则:依赖树与路径法,告别死记硬背 做老师的这几年每学期讲到“多元复合函数的求导法则”教室里总会出现同一类表情一元复合函数求导还行一遇到多元分不清哪个该用全导数、哪个该用偏导数甚至画到一半就不知道该往哪个方向乘。最常见的说法是“我会算但一遇到复杂一点的链式结构就把自己绕进去”。“多元复合函数求导法则”在考研数学、理工科高数、以及后续的微分方程、最优化、机器学习里都是绕不开的基础工具它的价值不在于背下几个公式而在于建立一套能把“变量之间怎么传依赖”这件事看清楚的思维方法。这篇文章我就把自己的一套拆解思路摊开讲先搞定依赖关系怎么画再分别拆解一元与多元复合、多元与多元复合、混合形式这三种情形最后落到雅可比矩阵和几道完整例题上。全程不用套公式硬背画图加路径相乘就够了。1. 从一元链式法则看到多元依赖关系1.1 先从一元场景找回手感在进入多元之前我建议你先在一元框架下停留半分钟。设 (yf(u))(ug(x))那么[ \frac{dy}{dx}\frac{df}{du}\cdot \frac{du}{dx}f(u)g(x)。 ]这是大一上学期就学过的链式法则。很多人用熟了但对它背后的逻辑其实没有深想(y) 不直接依赖 (x)而是通过 (u) 间接依赖。你可以把求导理解为“沿着依赖路径逐层求变化率”。(u) 变了多少(y) 就跟着按比例变(x) 变了多少(u) 就跟着按比例变。两层比例一乘就是 (x) 变化对 (y) 变化的总贡献。这个朴素的“路径相乘”观点在多元场景里会被直接放大。因为多元的问题不是多了几个变量而是多了几条依赖路径。比如 (zf(x,y))而 (x,y) 又分别依赖 (t)那么 (t) 的变化就会通过两条路同时传到 (z)一条是 (t\to x\to z)一条是 (t\to y\to z)。两条路的贡献要加在一起。你看一元里的“一条链”到多元就成了“一张网”。1.2 变量一多关键不是公式而是“依赖关系”多元复合函数求导有一大堆公式教材里通常这样列如果 (zf(x,y))(xx(t))(yy(t))那么[ \frac{dz}{dt} \frac{\partial z}{\partial x}\frac{dx}{dt}\frac{\partial z}{\partial y}\frac{dy}{dt}。 ]再换一种如果 (xx(s,t))(yy(s,t))那就有[ \frac{\partial z}{\partial s} \frac{\partial z}{\partial x}\frac{\partial x}{\partial s}\frac{\partial z}{\partial y}\frac{\partial y}{\partial s} \quad \frac{\partial z}{\partial t} \frac{\partial z}{\partial x}\frac{\partial x}{\partial t}\frac{\partial z}{\partial y}\frac{\partial y}{\partial t}。 ]再换成混合形式公式还能更多。真正的问题在于很多同学把学习重点放在“记住公式的长相”上而不是“拆清楚变量依赖关系”上。公式永远背不完但依赖关系图能帮你把一切重新推导出来。我的建议是拿到题目先画一张变量依赖树树的根是最终因变量叶是最终自变量中间层是被依赖的中间变量。然后看需要求的是哪个自变量的导数把所有从“根”到这个自变量的路径列出来每条路径上的偏导连乘再把所有路径加起来。这就是我认为最通用、最难出错的求解方式。2. 画变量依赖树多元复合求导的通用地图2.1 画树的第一步先分清“谁被谁影响”画依赖树没有太多门槛但有一个地方绝对不能马虎先想清楚谁是自变量谁是中间变量谁是最终函数。举个例子(zf(x,y))其中 (x\sin t)(yt^2)。这里 (z) 是最终函数(x,y) 是中间变量(t) 是最终自变量。依赖树这样画z ├── x │ └── t └── y └── t如果写成另一题(zf(x,y,t))而 (xs^2t)(yst)这里 (s,t) 才是最终自变量。依赖树应该是z ├── x │ ├── s │ └── t ├── y │ ├── s │ └── t └── t直接依赖注意最后一行经常被忽略(z) 的表达式里直接出现了 (t)所以 (t) 既是 (x,y) 的中间变量上游也是 (z) 的直接自变量。(s) 则只能通过 (x,y) 两边传到 (z)。这张图会让后面所有操作都变得很直观。2.2 路径法把每条路径的偏导链全部相乘依赖树画好后求导就是一个机械动作。求某一个自变量对最终函数的偏导数先找到所有从根节点走到该自变量的路径对每一条路径把相邻两层之间的偏导数依次相乘最后把所有路径的结果加起来。还是用上面的例子求 (\partial z/\partial t)。从 (z) 到 (t) 的路径有(z \to x \to t)贡献为 (f_x \cdot x_t)也就是 (\frac{\partial f}{\partial x}\frac{\partial x}{\partial t})(z \to y \to t)贡献为 (f_y \cdot y_t)也就是 (\frac{\partial f}{\partial y}\frac{\partial y}{\partial t})(z \to t) 直接路径贡献为 (f_t)。所以[ \frac{\partial z}{\partial t} f_x \cdot \frac{\partial x}{\partial t} f_y \cdot \frac{\partial y}{\partial t} f_t。 ]这个公式不用背路径一画自然就出来了。如果有同学问“为什么 (f_t) 也要加(t) 明明已经被 (x,y) 包含了”答案就是依赖树里 (z\to t) 是一条独立路径表达的是 (z) 作为 (t) 的显式函数时的那部分贡献和 (x,y) 通过 (t) 变化的间接贡献完全不是一回事。两者不能合并成一项。2.3 一个“路径树”到底画到什么程度常见的问题是到底要画多细才算正确我一般用一条原则相邻两层之间不能跳过变量。你能确定 (z) 直接关于 (x) 的函数关系就画 (z\to x)如果 (x) 一身变量只有 (t)就画 (x\to t)。如果某个中间变量本身既是多个更小变量的函数它就得拆到能拆的最小层。比如 (x x(u,v))而 (u,v) 又都是 (s) 的函数那么 (x) 下面还要画 (u,v)不能直接画 (x\to s)否则一下子就丢掉了中间层。路径画得越细偏导乘起来就越不会漏项。还有一点要提醒画完图后看清题目要求。要求 (dz/dt) 时如果最终变量里没有任何偏导符号说明 (t) 是唯一自变量要求 (\partial z/\partial t) 时往往还有其他自变量被固定着。有效的依赖树是一样的但结果可能差出一条直接路径或一些交叉项。3. 三种复合类型拆解公式怎么来又怎么记3.1 多元函数复合一元函数zf(x,y), xx(t), yy(t)这是最常见的基础型也是很多教材讲链式法则的第一种。设 (zf(x,y)) 可微(xx(t))、(yy(t)) 都在 (t) 处可导则 (z) 作为 (t) 的复合函数可导并且[ \frac{dz}{dt} \frac{\partial f}{\partial x}\frac{dx}{dt}\frac{\partial f}{\partial y}\frac{dy}{dt}。 ]这里的符号需要特别强调等号左边是 (dz/dt)是全导数右边写的是 (\partial f/\partial x) 或简化写成 (f_x)这是在“固定 (y) 不动”的情况下把 (z) 看作 (x,y) 两个独立变量的函数所求的偏导数。等号右边的 (\partial f/\partial x) 不是随便写出来的它代表 (x) 本身发生变化时 (z) 的敏感度而 (y) 保持不动。正因为 (y) 保持不动(y) 对 (t) 的依赖造成的额外影响才会由后面那一项单独承担。用大白话说(t) 变化会让 (x) 变也让 (y) 变(x) 变会带动 (z)(y) 变也会带动 (z)。两条路线互不干扰相加就是总的 (dz/dt)。3.2 多元函数复合多元函数zf(x,y), xx(s,t), yy(s,t)再升一级中间变量 (x,y) 都同时依赖 (s,t) 两个自变量。此时“从 (z) 到你要求的那个自变量”可能有多条路径必须分别求偏导。[ \frac{\partial z}{\partial s} \frac{\partial f}{\partial x}\frac{\partial x}{\partial s}\frac{\partial f}{\partial y}\frac{\partial y}{\partial s} ] [ \frac{\partial z}{\partial t} \frac{\partial f}{\partial x}\frac{\partial x}{\partial t}\frac{\partial f}{\partial y}\frac{\partial y}{\partial t}。 ]你可能会问为什么这里不是 (dz/ds)而是 (\partial z/\partial s)因为在 (s) 变化时(t) 被固定住了(z) 是通过 (x,y) 这两个中间变量间接表达了关于 (s,t) 的函数但最终函数 (z) 本身在这个复合结构下仍然是有两个自变量的函数所以用偏导符号。如果你硬要写成 (dz/ds)除非题目额外说明其中一个变量被消去否则书写不规范也容易误导自己。这样一个结构如果展开成矩阵形式就会更整齐。我们定义行向量 ([f_x, f_y])中间变量对自变量的求导构成一个 (2\times 2) 的矩阵链式法则本质上就是矩阵乘法。关于这一点下个章节再展开。3.3 混合形式中间变量里还掺着自变量混合形式说白了就是最终函数里既有中间变量又直接写着自变量。典型的结构如下设 (zf(x,y,t))其中 (y\varphi(x,t))。注意(t) 在这里有两个身份它既是 (z) 的自变量也会通过 (y) 间接影响 (z)。(x) 也一样它既是 (z) 的自变量也会通过 (y) 间接影响 (z)。画依赖树z ├── x │ └── y路径z - y - x ├── y │ ├── x │ └── t └── t但这样画有重复更清晰的做法是z ├── x ├── y │ ├── x │ └── t └── t于是[ \frac{\partial z}{\partial x} f_x f_y \cdot \frac{\partial y}{\partial x} ] [ \frac{\partial z}{\partial t} f_t f_y \cdot \frac{\partial y}{\partial t}。 ]注意这里我剔除了 (\partial x/\partial x) 和 (\partial t/\partial t) 这类等于 1 或 0 的项。在路径法里如果 (x) 到 (x) 的“路径”就是自己那么这条路径的偏导其实就是 1(t) 对自身求偏导也是 1但 (x) 对 (t) 求偏导、(t) 对 (x) 求偏导都是 0所以不会出现 (f_x) 被重复计算的问题。很多同学在这个结构里会犯糊涂把 (f_x) 和 (f_y \varphi_x) 中的一部分合并导致系数算错。我的建议还是照旧把依赖树画出来路径一条条列出来答案自然稳。还有一个典型混合结构是(wf(x_1,\dots,x_n))其中每个 (x_i) 都是参数 (t_1,\dots,t_m) 的函数但 (f) 又显式地含有某个参数。只要你能画出依赖树不管怎么混合都不会出错。真正要小心的反而是“把函数记号里的变量和路径上的变量对应错”。3.4 全微分形式不变性另一个角度看问题多元复合求导还有一个隐藏工具叫全微分形式不变性。对 (zf(x,y))无论 (x,y) 是自变量还是中间变量都有[ dz f_x dx f_y dy。 ]这个等式在 (x,y) 为中间变量时依然成立。比如上面混合形式的例子 (zf(x,y,t))不管内部结构多复杂总有[ dz f_x dx f_y dy f_t dt。 ]如果 (y\varphi(x,t))又有 (dy \varphi_x dx \varphi_t dt)。把 (dy) 代进去[ dz f_x dx f_y(\varphi_x dx\varphi_t dt) f_t dt (f_xf_y\varphi_x)dx (f_tf_y\varphi_t)dt。 ]于是立刻得到 (\partial z/\partial x) 和 (\partial z/\partial t)。这种做法的好处是把链式法则转成代数替换适合习惯算微分的同学。缺点是一旦变量很多式子会变得冗长我自己更常用依赖树加路径法但在简化推导偏微分方程时全微分形式确实能省不少事。4. 雅可比矩阵视角链式法则是一次线性映射的接力4.1 从导数向量到雅可比矩阵如果说树图是小学数学里的“分类计数”那雅可比矩阵就是给多元复合求导一个系统化的线性代数解释。设 (zf(x_1,\dots,x_n))(x_ix_i(t_1,\dots,t_m))。把所有偏导数按位置排成矩阵[ J_f \begin{bmatrix} \dfrac{\partial f}{\partial x_1} \cdots \dfrac{\partial f}{\partial x_n} \end{bmatrix} ]这是一行矩阵因为 (f) 是一个标量函数它的一阶偏导信息全部放在这个行向量里。中间变量组对自变量的偏导可以组成一个 (n\times m) 矩阵[ J_x \begin{bmatrix} \dfrac{\partial x_1}{\partial t_1} \cdots \dfrac{\partial x_1}{\partial t_m}\ \vdots \ddots \vdots\ \dfrac{\partial x_n}{\partial t_1} \cdots \dfrac{\partial x_n}{\partial t_m} \end{bmatrix} ]那么复合函数 (z(t_1,\dots,t_m)) 对自变量的梯度行向量就是[ J_z J_f \cdot J_x。 ]这正好是“路径法”的矩阵表达中间变量那条路径上的每一项都由相应偏导相乘再对同一个自变量求和。4.2 矩阵乘积与路径法完全等价来看一个具体例子(zf(x,y))(xx(s,t))(yy(s,t))。那么[ J_f \begin{bmatrix} f_x f_y \end{bmatrix} ][ J_x \begin{bmatrix} x_s x_t\ y_s y_t \end{bmatrix}。 ]矩阵乘法[ \begin{bmatrix} f_x f_y \end{bmatrix} \begin{bmatrix} x_s x_t\ y_s y_t \end{bmatrix}\begin{bmatrix} f_x x_s f_y y_s f_x x_t f_y y_t \end{bmatrix}。 ]第一项就是 (\partial z/\partial s)第二项就是 (\partial z/\partial t)。路径法里“每条路径相乘再相加”在这里就是“行乘列的对应乘积累加”。两个视角完全一致只是符号系统更统一了。如果中间变量再多几个比如 (wf(u,v,w))每个 (u,v,w) 都依赖 (s,t)那么 (J_f) 是 (1\times 3)(J_x) 是 (3\times 2)相乘依然是 (1\times 2)。规律的记忆成本几乎为零行数对上行数、列数对下列数乘法能成立说明复合形式在维度上是自洽的。4.3 为什么这个视角值得掌握很多同学觉得雅可比是“学了线性代数之后才有用”的东西其实不然。它最重要的价值在于告诉你一件事多元复合函数的导数不是一个孤立数值而是一个线性变换。你对中间变量做一次线性逼近再对最终函数做一次线性逼近复合之后的线性逼近就是这两个线性变换的复合。这个想法在后面学多元函数的极值、曲面的切平面、神经网络反向传播时尤其有用。反向传播里的核心公式 ( \frac{\partial L}{\partial W} \frac{\partial L}{\partial a}\frac{\partial a}{\partial z}\frac{\partial z}{\partial W} ) 本质上和 (J_f \cdot J_x) 是一回事情。只不过神经网络里中间层特别多矩阵乘法一直叠下去而已。你要是能在学多元复合函数求导的时候就把这套矩阵视角建立起来后来接触深度学习里的梯度回传会轻松得多。当然如果只是应付期末考试我建议你优先熟练路径法矩阵视角作为验证和理解工具。两条路都走一遍正确率会翻倍。5. 三个完整实操例按部就班走一遍5.1 例子一链式法则直接算 dz/dt题目设 (z x^2 y e^{xy})其中 (xt^2)(yt^3)求 (\frac{dz}{dt}) 在 (t1) 处的值。先画依赖树z ├── x → t └── y → t路径有两条所以[ \frac{dz}{dt} z_x\frac{dx}{dt}z_y\frac{dy}{dt}。 ]计算偏导数[ z_x 2xy y e^{xy}\quad z_y x^2 x e^{xy}。 ]当 (t1) 时(x1)(y1)所以 (z_x 2e)(z_y 1e)。又[ \frac{dx}{dt}2t2\quad \frac{dy}{dt}3t^23。 ]代入[ \frac{dz}{dt}(2e)\cdot 2(1e)\cdot 3 42e33e75e。 ]如果想验证可以直接把 (xt^2, yt^3) 代进原函数[ z t^4 t^3? ]不对(x^2 y (t^2)^2 \cdot t^3 t^7)(e^{xy}e^{t^5})。于是[ \frac{dz}{dt}7t^65t^4 e^{t^5}。 ]在 (t1) 处正好是 (75e)。两条路结果一致说明链式法则没有用错。这个验证步骤虽然简单但特别适合用来排查符号错误。5.2 例子二极坐标下算二维拉普拉斯算子这个例子是多元复合函数求导的经典压轴题思路不难但计算量大能很好地检验你是不是真的懂“对中间变量再求导时还要继续用链式法则”。极坐标关系是[ x r\cos\theta\quad y r\sin\theta。 ]反过来(r^2x^2y^2)(\theta\arctan\frac{y}{x})。设 (u) 是 (r,\theta) 的可微函数则 (u) 通过 (r,\theta) 成为 (x,y) 的复合函数。要先求一阶偏导[ \frac{\partial u}{\partial x}\frac{\partial u}{\partial r}\frac{\partial r}{\partial x} \frac{\partial u}{\partial \theta}\frac{\partial \theta}{\partial x}。 ]其中[ \frac{\partial r}{\partial x}\frac{x}{r}\cos\theta \quad \frac{\partial \theta}{\partial x}-\frac{\sin\theta}{r}。 ]所以[ u_x u_r\cos\theta - u_\theta\frac{\sin\theta}{r}。 ]同理[ u_y u_r\sin\theta u_\theta\frac{\cos\theta}{r}。 ]这里要强调(u_r) 仍然被看作 (r,\theta) 的函数而不是一个已经算完的数字。现在求二阶偏导 (u_{xx})[ u_{xx}\frac{\partial}{\partial x}\left(u_r\cos\theta - u_\theta\frac{\sin\theta}{r}\right)。 ]这个式子要分两项分别用链式法则。第一项[ \frac{\partial}{\partial x}(u_r\cos\theta)\left(u_{rr}\frac{\partial r}{\partial x}u_{r\theta}\frac{\partial \theta}{\partial x}\right)\cos\theta u_r\left(-\sin\theta\right)\frac{\partial \theta}{\partial x}。 ]也就是[ (u_{rr}\cos\theta - u_{r\theta}\frac{\sin\theta}{r})\cos\theta u_r \frac{\sin^2\theta}{r}。 ]第二项[ \frac{\partial}{\partial x}\left(-u_\theta\frac{\sin\theta}{r}\right)-\left(u_{\theta r}\frac{\partial r}{\partial x}u_{\theta\theta}\frac{\partial \theta}{\partial x}\right)\frac{\sin\theta}{r}u_\theta \frac{\partial}{\partial x}\left(\frac{\sin\theta}{r}\right)。 ]再算[ \frac{\partial}{\partial x}\left(\frac{\sin\theta}{r}\right)\frac{\cos\theta \cdot \frac{-\sin\theta}{r}\cdot r - \sin\theta \cdot \cos\theta}{r^2}-\frac{2\sin\theta\cos\theta}{r^2}。 ]把这些整理到一起再类似地算 (u_{yy})最后相加会得到极坐标形式的拉普拉斯算子[ u_{xx}u_{yy}u_{rr}\frac{1}{r}u_r\frac{1}{r^2}u_{\theta\theta}。 ]这个过程里最容易出错的地方是对 (u_r) 求 (x) 的偏导时忘记 (u_r) 本身还要再走一次链式。很多同学第一遍写 (u_{xx})会把 (u_{rr}) 那部分写到一半就停住因为脑子里还停留在“(u_r) 已经求完了”的错觉。遇到这种题目我推荐把每次偏导都看作是“对一个与 (r,\theta) 有关的函数求偏导”不要因为字母多就慌乱。5.3 例子三混合形式与偏微分方程里的链式求导来看一道偏微分方程里高频出现的变换题设[ u(x,t)f(\xi,\eta)\quad \xixt\quad \etax-t。 ]求 (u_{tt}-u_{xx})。依赖关系是u ├── ξ │ ├── x │ └── t └── η ├── x └── t先求一阶[ u_t f_\xi \cdot \xi_t f_\eta \cdot \eta_t f_\xi - f_\eta ][ u_x f_\xi \cdot \xi_x f_\eta \cdot \eta_x f_\xi f_\eta。 ]再求二阶。注意 (f_\xi, f_\eta) 仍然是关于 (\xi,\eta) 的函数求 (t) 的偏导时分寸不能乱[ u_{tt}\frac{\partial}{\partial t}(f_\xi - f_\eta)(f_{\xi\xi}\xi_t f_{\xi\eta}\eta_t) - (f_{\eta\xi}\xi_t f_{\eta\eta}\eta_t)。 ]把 (\xi_t1)(\eta_t-1) 代入[ u_{tt}f_{\xi\xi} - 2f_{\xi\eta} f_{\eta\eta}。 ]这里我用到了混合偏导相等的条件也就是 (f_{\xi\eta}f_{\eta\xi})只要二阶偏导连续就成立。同理[ u_{xx}f_{\xi\xi} 2f_{\xi\eta} f_{\eta\eta}。 ]于是[ u_{tt}-u_{xx}(f_{\xi\xi} - 2f_{\xi\eta} f_{\eta\eta}) - (f_{\xi\xi} 2f_{\xi\eta} f_{\eta\eta})-4f_{\xi\eta}。 ]如果 (f_{\xi\eta}0)那么 (u_{tt}-u_{xx}0)这正是标准的一维波动方程。这个结论在数理方程中非常核心。你看混合形式不是“更难的链式法则”只是把多个干扰路径放进了同一个表达式路径法照常能用。6. 高频翻车点与自查清单6.1 四大常见错误我批改过多届作业发现翻车点其实很固定。第一条(dz/dt) 和 (\partial z/\partial t) 混用。比如 (zf(x,y,t))其中 (xx(t))(yy(t))有些同学会写[ \frac{dz}{dt}\frac{\partial z}{\partial t} \frac{\partial z}{\partial x}\frac{dx}{dt}\frac{\partial z}{\partial y}\frac{dy}{dt} ]这是对的但如果题干里没有显式给出 (\partial z/\partial t)只是说 (zf(x,y))(xx(t))(yy(t))这时候再写 (\partial z/\partial t) 就是画蛇添足因为 (z) 并不直接含有 (t)。判断方法是看 (z) 的表达式里是否真的写着 (t)。第二条在求偏导时搞混“当前变量是谁”。比如 (zf(x,y))(xx(s,t))(yy(s,t))求 (\partial z/\partial s) 时有人会顺手写出 (\partial x/\partial s \partial y/\partial s)漏掉了 (f_x, f_y) 这两个权重。这是对依赖树不敏感的表现。记住对 (s) 求偏导路径是 (z\to x\to s) 和 (z\to y\to s)每段路径都要有对应的偏导因子。第三条二阶偏导时把中间变量当成常数。回到 5.2 的极坐标例子里这是一个非常隐蔽的坑。(u_r) 不是常数它是一个函数求 (u_{xx}) 时(u_r) 还要继续对 (x) 用链式法则。很多同学算到一半就停了结果少掉一大串项。第四条符号下标的含义不清。比如 (f_x) 和 (f_y) 这样的记号虽然简洁但如果中间变量也叫 (x,y)很容易造成混淆。在实际做题时我建议在 (f_x) 下方标注“固定另一个变量”或者干脆写成 (f_1, f_2)用位置来表明对第几个变量求偏导。这样在中间变量名字很多时不容易乱。6.2 自查清单与补救习惯我在黑板上经常列一个“三元自查清单”依赖树画全了吗尤其是有没有漏掉“显式直接依赖”的路径。每条路径的偏导因子中每个符号代表对哪个变量求偏导最终结果中的自变量是不是题目要的自变量全导和偏导符号有没有写对求二阶偏导时一阶偏导结果是否还要继续关于老变量再复合一次如果四步都对错误率基本能降到很低。平时练习时我还会强迫自己“一题两法”先用路径法算一遍再用全微分代入法或矩阵法验算一遍。不用每题都验但挑几道结构复杂的题做双轨验证对理解非常有帮助。比如前面 5.1 那种题配合直接代入法验算5.3 那种题配合微分形式验算练过之后就不会再怕复合函数了。6.3 还有一个高阶但实用的提醒当变量依赖关系不明确时先别急着套公式。比如题目说“设 (zf(x,y))而 (yy(x))”要求 (dz/dx)。它到底是让你把 (z) 看成 (x) 的一元函数求全导还是说 (x,y) 仍然独立如果没说清楚就容易引起争议。做题时发现题干有歧义我会先按依赖树推理一遍再回到式子本身去确认(y) 是否真的可以表示成 (x) 的函数表达式里有没有其他隐含变量。这不是套路而是一种严谨的习惯对后面学隐函数定理、微分几何里的局部坐标变换特别关键。7. 一点心得和你们交个底讲了这么多最后我想说点自己的体会。我其实很反感“公式背下来就会了”这种学法因为在多元复合函数求导这个知识点上公式只是依赖树的压缩写法。你用路径法把树画熟练以后公式你自己都能现场推出来而且不容易记错。我自己的操作习惯是这样的任何一道复合求导题先在草稿纸上快速画依赖树哪怕只是三秒的事。然后从最终函数出发沿路径写到需要求导的自变量。写完所有路径后再看一眼每条路径上有没有跳层、有没有漏层。这个“画图—列路径—相乘相加”的三步走让我在很多复杂场景下依然能保证正确率比如拉普拉斯算子在各种坐标系下的推导、神经网络反向传播里的链式梯度、以及偏微分方程里自变量变换的化简。以上这些领域看起来一个比一个“高级”但里面使用的链式法则都很朴素。如果你正在准备期末考试或考研我建议你把依赖树画图法当成默认解题工具。第一遍做题慢一点不要紧重点是要在头脑里建立起“变量如何传导”的画面。一旦建立了这个画面多元复合函数求导就不是背公式的事而是一个“看清楚每条路、算清楚每段变化率”的逻辑问题。最后再分享一个小技巧写完答案后随手检查一下量纲或极端情况。比如 (x,y) 都退化成常数时全导数应当变成 0中间变量都不依赖自变量时偏导结果应当只剩显式项。这些“退化检查”成本极低却能精准抓住大多数粗心错误。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进