跳到正文
格致开物MATHWIKI

导数:修订间差异

AIContentBot留言 | 贡献
扩充定义、推导、算例、边界条件与原创 SVG 配图(AI 辅助整理,算例已复算)
AIContentBot留言 | 贡献
扩充双语数学百科:定义条件、证明算例、历史来源与 AI 编者评注;补齐学科导航
第1行: 第1行:
导数描述函数在某一点的瞬时变化率。对实函数 <math>f</math>,如果差商有有限极限,定义
'''导数'''(derivative)是函数在一点附近的变化量与自变量变化量之比的极限。对于在 <math>a</math> 附近有定义的实函数 <math>f</math>,如果
<math display="block">f'(a)=\lim_{h\to0}\frac{f(a+h)-f(a)}{h}.</math>
<math display="block">f'(a)=\lim_{h\to0}\frac{f(a+h)-f(a)}h</math>
此时称 <math>f</math> 在 <math>a</math> 可导。导数也表示函数图像在该点的切线斜率;若输入是时间、输出是位置,它的单位就是长度除以时间。
存在并且是有限实数,就称函数在 <math>a</math> 可导。导数既描述瞬时变化率,也描述局部线性近似中的系数;对于函数图像,它是非竖直切线的斜率。导数的值、函数本身的值与一段区间上的平均变化率,是三个不同的量。


== 从割线走向切线 ==
== 平均变化率怎样变成局部变化率 ==
差商是两点间的平均变化率。令第二个点向第一个点靠近,若割线斜率趋向同一个有限数,就得到导数。
若物体的位置函数为 <math>s(t)=t^2</math> 米,其中时间 <math>t</math> 以秒计,从 1 秒到 2 秒的平均速度是 <math>(4-1)/(2-1)=3</math> 米每秒。但这个结果把整个一秒区间的运动压缩成了一个平均数,并不能说明 1 秒时恰好以多快的速度运动。


[[File:Gezhi-derivative-tangent.svg|frame|center|alt=抛物线y等于x平方在点一一的切线,以及经过点一一和二四的割线|对 y=x²,割线斜率为 3,点 (1,1) 处切线斜率为 2;二者描述不同尺度的变化。]]
1 秒到 <math>1+h</math> 秒的平均速度为 <math>2+h</math>。无论正的时间增量缩小,还是从左侧取负增量靠近,差商都趋于 2。因此瞬时速度为 2 米每秒。求导不是把 <math>h=0</math> 直接代入差商,而是先对所有非零小增量计算,再考察其极限。
例如 <math>f(x)=x^2</math>,直接由定义计算:
<math display="block">\frac{(a+h)^2-a^2}{h}=2a+h\quad(h\ne0),\qquad f'(a)=2a.</math>
<math>a=1</math> 处导数为 2,因此切线方程是 <math>y-1=2(x-1)</math>。从 1 到 2 的平均变化率却是 3;平均速率不能直接当成端点处的瞬时速率。


== 导数给出局部线性近似 ==
[[File:Gezhi-derivative-tangent.svg|frame|center|alt=抛物线在一一处的切线与连接一一和二四的割线|对 y=x²,图示割线斜率为 3,切线斜率为 2。割线概括一段变化,切线描述一点附近的一阶变化。]]
可导等价于存在展开式
<math display="block">f(a+h)=f(a)+f'(a)h+o(h),</math>
其中余项 <math>o(h)</math> 除以 <math>h</math> 后趋于 0。这比“切线碰到曲线”更精确:当增量足够小时,一次函数给出主导变化。


例如 <math>\sqrt{4.04}\approx2+\frac14\times0.04=2.01</math>。这里使用 <math>f'(4)=1/4</math>,近似适用于 4 附近,不能把同一条切线当成整个平方根函数。对 <math>x^2</math>,一次近似的误差恰好是 <math>h^2</math>。
在定义中同时考察左右两边非常重要。只用正增量得到的是右导数;左右导数若存在但不相等,通常的双侧导数就不存在。区间端点经常单独讨论单侧导数,应明确约定,不把端点外没有定义的方向偷偷纳入计算。


== 运算法则及一个复合例子 ==
=== 算例一:平方函数、切线与误差 ===
在相关函数可导、分母非零的点,有
对任意实数 <math>a</math>,
<math display="block">(fg)'=f'g+fg',\qquad \left(\frac fg\right)'=\frac{f'g-fg'}{g^2}.</math>
<math display="block">\frac{(a+h)^2-a^2}{h}=2a+h\quad(h\ne0),</math>
复合函数遵循链式法则:
所以 <math>f'(a)=2a</math>。在 <math>a=1</math> 处的切线是 <math>y-1=2(x-1)</math>。当输入从 1 变到 1.03,切线给出的预测值是 1.06,而真实函数值为 1.0609,误差恰好为 <math>0.03^2=0.0009</math>
<math display="block">\frac{d}{dx}f(g(x))=f'(g(x))g'(x).</math>
例如对 <math>y=\sin(x^2)</math>,先对外层正弦求导,再乘以内层平方的导数,得到 <math>y'=2x\cos(x^2)</math>。只写 <math>\cos(x^2)</math> 会漏掉内部变量变化的速度。三角函数的这些导数公式采用弧度制。


== 连续不一定可导 ==
这个误差计算比“切线紧贴曲线”更具体:一阶变化是 <math>2h</math>,遗漏的是二阶量 <math>h^2</math>。导数把函数在所选位置的主要变化压缩为一个线性系数,但并不把曲线在远处也变成直线。导数为负时函数在该点附近的一阶响应方向相反;导数为零时只说明一阶项消失,更高阶项仍可能决定变化。
可导必连续:由差商趋于有限数可得 <math>f(a+h)-f(a)\to0</math>。反过来不成立。<math>f(x)=|x|</math> 在 0 连续,但左差商为 −1,右差商为 1,所以没有导数。


某一点 <math>f'(a)=0</math> 也不保证该点是极值。<math>f(x)=x^3</math> 在 0 的导数为 0,却穿过原点继续增加。内点可导的局部极值必须满足导数为零,但这是必要条件而非充分条件;端点或不可导点也可能取得极值。
== 可导的等价表述:线性主项加小余项 ==
由差商定义,可导等价于存在实数 <math>A</math> 与余项 <math>r(h)</math>,使
<math display="block">f(a+h)=f(a)+Ah+r(h),\qquad \frac{r(h)}h\longrightarrow0.</math>
此时 <math>A=f'(a)</math>,常把余项写成 <math>o(h)</math>。证明是直接的:若导数存在,令 <math>r(h)=f(a+h)-f(a)-f'(a)h</math>,除以 <math>h</math> 即趋于零;反之,把此展开式除以非零 <math>h</math>,差商便趋于 <math>A</math>


== 从点的斜率到区间的变化 ==
这也完整证明了“可导必连续”。差商在足够小邻域内有界,而 <math>f(a+h)-f(a)</math> 等于差商乘以 <math>h</math>,所以增量趋于零。连续只要求函数值接近原值;可导进一步要求这种接近能够由一个线性主项描述。前者弱于后者,不能倒置。
若函数在区间内处处可导且导数始终为正,则由中值定理可知它在该区间严格递增。单独知道某一点导数为正,不足以断言整个区间递增。


[[优化]] 中,导数用于寻找驻点并分析增长方向;在 [[微分方程]] 中,未知函数与其变化率构成约束。具体应用还需要考虑定义域、单位和边界条件。
多元微积分仍沿用局部线性近似这条思路,只是一个系数变成了线性映射。仅仅存在各坐标方向的偏导数,并不足以保证存在一个统一处理所有方向的线性近似;这也是[[线性代数]]与微积分自然连接的地方。


== 延伸阅读 ==
== 求导法则为何成立 ==
* [https://openstax.org/books/calculus-volume-1/pages/3-1-defining-the-derivative OpenStax,《Calculus Volume 1》§3.1]:导数与差商。
若 <math>f,g</math> 在同一点可导,和法则来自极限的线性性。乘积法则则需要把增量拆开:
* [[极限]] · [[积分]] · [[优化]]
<math display="block">\begin{aligned}
&f(a+h)g(a+h)-f(a)g(a)\\
&=[f(a+h)-f(a)]g(a+h)+f(a)[g(a+h)-g(a)].
\end{aligned}</math>
除以 <math>h</math> 并令其趋零。由于可导保证连续,<math>g(a+h)\to g(a)</math>,所以得到 <math>(fg)'=f'g+fg'</math>。这说明乘积的变化有来自两个因子的贡献,不能写成两个导数的乘积。商法则还要求分母在该点非零:
<math display="block">\left(\frac fg\right)'=\frac{f'g-fg'}{g^2}.</math>
 
链式法则描述复合变化。设 <math>g</math> 在 <math>a</math> 可导,<math>f</math> 在 <math>b=g(a)</math> 可导;则
<math display="block">(f\circ g)'(a)=f'(g(a))g'(a).</math>
一个不需要除以可能为零的内部增量的证明是:把外层变化写成 <math>f(b+k)-f(b)=f'(b)k+\eta(k)k</math>,其中 <math>\eta(k)\to0</math>,并令 <math>\eta(0)=0</math>。代入 <math>k=g(a+h)-g(a)</math>。内层连续保证 <math>k\to0</math>,而 <math>k/h\to g'(a)</math> 且局部有界,因此余项除以 <math>h</math> 后趋零,得到结论。此证明也覆盖某些增量使 <math>g(a+h)=g(a)</math> 的情形。
 
这些法则与常见函数的导数有系统教材依据,参见 [https://openstax.org/books/calculus-volume-1/pages/3-3-differentiation-rules OpenStax §3.3]、[https://openstax.org/books/calculus-volume-1/pages/3-6-the-chain-rule §3.6];本节展开推导用于说明各条件在何处被使用。
 
=== 算例二:复合函数和单位 ===
设某周期信号为 <math>q(t)=5\sin(2t^2)</math>,时间以秒计,正弦内的相位以弧度计,系数应具有使相位无量纲的单位。外层函数对相位的导数为 <math>5\cos(2t^2)</math>,内层相位变化率为 <math>4t</math>,所以
<math display="block">q'(t)=20t\cos(2t^2).</math>
在 <math>t=0</math> 时变化率为零,但信号并非恒为零。漏掉 <math>4t</math> 就把“每单位相位的变化”误当成“每单位时间的变化”。三角函数的标准导数公式采用弧度制;若输入使用度数,转换因子也属于链式法则的一部分。
 
=== 算例三:平方根近似及误差上界 ===
函数 <math>f(x)=\sqrt{x}</math> 在 <math>x>0</math> 可导,<math>f'(4)=1/4</math>。因此 <math>\sqrt{4.04}</math> 的线性估计是 <math>2+0.04/4=2.01</math>。若再利用 <math>f''(x)=-1/(4x^{3/2})</math>,在 <math>[4,4.04]</math> 上有 <math>|f''(x)|\le1/32</math>。泰勒余项估计给出
<math display="block">|f(4.04)-2.01|\le\frac12\frac1{32}(0.04)^2=0.000025.</math>
负的二阶导数还说明切线高估了函数值。这个结论同时给出近似数、误差和高估方向;只给若干小数位而不说明误差,信息并不完整。
 
== 从一点推到区间:中值定理的作用 ==
导数是局部量,要得出整个区间的结论,需要额外定理。对 <math>a<b</math>,拉格朗日中值定理要求 <math>f</math> 在闭区间 <math>[a,b]</math> 连续,并在开区间 <math>(a,b)</math> 可导;它保证存在 <math>c\in(a,b)</math>,满足
<math display="block">f(b)-f(a)=f'(c)(b-a).</math>
证明的主要步骤是减去连接两端点的直线,得到端点值相等的函数,再用罗尔定理。罗尔定理利用闭区间连续函数取得最大最小值;若函数不恒定,就有一个内点极值,而该处可导使左右差商迫使导数为零。这是证明概要,其中用到了闭区间上的极值定理。
 
若区间内处处 <math>f'>0</math>,对任意两个点应用中值定理,可知函数严格递增;若处处 <math>f'=0</math>,函数在该区间为常数。条件中的“区间”不能随意删掉:在不连通的定义域上,不同分支可以各有不同常数,所有点的导数仍为零。
 
内点可导的局部极值必须满足 <math>f'=0</math>,但逆命题不成立。例如 <math>x^3</math> 在 0 的导数为零,却从负值穿过 0 继续增加。函数 <math>|x|</math> 在 0 达到最小值,却不可导;闭区间上的端点也可能取得最大最小值。因而寻找[[优化]]问题的最优值时,驻点、不可导点和边界都需要检查。
 
== 三种边界:尖点、竖直切线与不连续的导数 ==
<math>f(x)=|x|</math> 在 0 连续,但左差商为 −1,右差商为 1,因此不可导。对 <math>f(x)=x^{1/3}</math>,原点的差商为 <math>h^{-2/3}</math>,趋于正无穷;几何上可以谈竖直切线,但它不是有限导数。把“切线存在”直接当成“实数导数存在”,会漏掉这一差别。
 
可导也不保证导数连续。定义 <math>f(0)=0</math>,非零点取 <math>f(x)=x^2\sin(1/x)</math>。在 0 的差商是 <math>h\sin(1/h)</math>,由绝对值不超过 <math>|h|</math> 可知导数为零;在非零点,
<math display="block">f'(x)=2x\sin(1/x)-\cos(1/x).</math>
后一个余弦项持续振荡,所以导数在 0 不连续。这一例子区分了可导与连续可导,也说明导数存在并不意味着邻近斜率平稳变化。
 
数值差商还有不同的限制:步长太大产生截断误差,步长太小则可能把测量或舍入误差放大,因为噪声被除以小数。真实数据中的“求导”通常需要明确步长、平滑假设或误差模型,不能把解析函数的精确公式原样套到噪声记录上。
 
== 隐式关系中的变化率 ==
有时变量关系不是显式写成 <math>y=f(x)</math>,而是由方程共同规定。例如圆 <math>x^2+y^2=25</math> 的上半部分在 <math>y>0</math> 时局部确定一个可导函数。对两边关于 <math>x</math> 求导,链式法则给出 <math>2x+2yy'=0</math>,所以 <math>y'=-x/y</math>。在点 <math>(3,4)</math>,斜率为 <math>-3/4</math>,切线方程为 <math>y-4=-(3/4)(x-3)</math>。
 
这个过程并不意味着在圆的所有点都能用同一个可导的单值函数表示纵坐标。到 <math>(5,0)</math> 时,分母为零,几何切线竖直;上下半圆也在这里接合。隐式求导得到的式子有使用范围,需要先确认所讨论的分支与非零条件。更一般的隐函数定理系统回答何时能够从一个关系局部解出可导函数。
 
类似地,若半径 <math>R(t)>0</math> 随时间变化,圆面积 <math>A(t)=\pi R(t)^2</math> 的变化率为 <math>A'=2\pi RR'</math>。半径为 3 米、径向增长率为每秒 0.2 米时,面积增长率为每秒 <math>1.2\pi</math> 平方米。不能把面积对半径的导数 <math>2\pi R</math> 直接当成面积对时间的导数;两种自变量带来不同单位,链式法则负责连接它们。
 
== 反函数的导数为何是倒数 ==
设 <math>f</math> 在 <math>a</math> 的某个邻域连续可导,并且 <math>f'(a)\ne0</math>;由反函数定理,可以进一步缩小邻域,使它一一对应并有可导的局部反函数,记为 <math>g</math>,满足 <math>g(f(x))=x</math>。对这个恒等式求导,链式法则给出 <math>g'(f(a))f'(a)=1</math>,于是 <math>g'(f(a))=1/f'(a)</math>。这个推导在反函数可导已得到保证后说明导数的数值;不能仅靠形式求导就自动证明反函数存在且可导。
 
几何上,交换横纵坐标把一条切线的斜率变成其倒数。以正半轴的平方函数和平方根函数为例,平方函数在 2 的导数为 4,因此平方根函数在 4 的导数为 <math>1/4</math>。若原导数为零,倒数规则失效:立方函数在原点可导且一一对应,但其反函数立方根在原点没有有限导数。
 
== 高阶导数记录的是哪一种变化 ==
二阶导数是导数函数的导数。对于位置函数,它描述速度的变化率,即加速度;对于一般图像,正的二阶导数意味着斜率在增加,不意味着函数值一定为正或函数一定在增加。例如 <math>f(x)=x^2</math> 在负半轴上正在下降,但斜率从很负逐步增加到零,二阶导数始终为正。
 
若某内点一阶导数为零,而二阶导数连续且在该点为正,可以在邻域内利用斜率变化或泰勒展开证明它是严格局部最小值。若二阶导数为零,判别没有结论:<math>x^4</math> 在零点有最小值,<math>-x^4</math> 有最大值,<math>x^3</math> 则都不是。判据没有识别出来,与数学对象没有该性质,是两回事。
 
导数为正是严格递增的充分条件,却不是必要条件。立方函数在整条实轴严格递增,零点的导数仍为零。与此同时,单点导数为正只约束足够接近该点时的线性响应,不能据此断言很远的函数值也继续增加。把局部结论扩展到区间,必须检查中值定理使用范围内的条件。
 
导数也可以描述误差传播。若真实输入为 <math>a</math>,测量误差为较小的 <math>h</math>,输出误差的一阶近似是 <math>f'(a)h</math>。导数绝对值大,意味着同样的输入误差可能被放大;绝对值小,则局部输出对输入较不敏感。不过一阶项为零时,应继续检查高阶项,而不能说所有误差都消失了。
 
例如用球半径估计体积,<math>V=4\pi R^3/3</math>,小半径误差给出 <math>\Delta V\approx4\pi R^2\Delta R</math>。除以体积后得到相对误差近似 <math>\Delta V/V\approx3\Delta R/R</math>。因此半径百分之一的相对误差,可能造成约百分之三的体积相对误差;这个结论适用于误差足够小的一阶近似,不是任意误差下的精确比例。
 
若输入变成新的时间单位,导数数值也会相应改变。把以秒计的时间换为以分钟计的变量,同一段运动每分钟的位置变化率是每秒数值的六十倍。图像看起来相同并不意味着导数的数值相同,因为横轴单位改变了斜率。导数是一种关于所选自变量的量,报告时应保留“相对于什么变化”。
 
这些解释使导数与[[数学建模]]中的灵敏度分析相连。灵敏度描述已选模型内的局部响应,不是因果关系的自动证明:如果函数只是统计拟合,导数只能直接解释拟合关系的变化,是否对应现实干预效果还需要额外假设。
 
== 历史与相关方向 ==
切线和极值问题早于现代导数定义。费马研究求极值的方法,巴罗研究切线与求积之间的关系;十七世纪牛顿从运动与流数出发,莱布尼茨发展微分符号和运算法则。今天以差商极限为基础的定义,是这些计算方法与后来的分析基础共同发展的结果,不适合归结为某个人在某一天“发现了斜率”。相关人物工作可核对 [https://mathshistory.st-andrews.ac.uk/Biographies/Fermat/ MacTutor:Fermat]、[https://mathshistory.st-andrews.ac.uk/Biographies/Barrow/ Barrow] 及 [https://mathshistory.st-andrews.ac.uk/Biographies/Leibniz/ Leibniz]。
 
导数进一步通向高阶变化率、多元的梯度与雅可比矩阵、[[微分方程]]以及用切线求根的[[牛顿法]]。这些方向共享局部线性化思想,但各自还需要检查可导性、初始条件、收敛性或维数;概念相连不代表条件自动相同。
 
== English overview ==
<div lang="en" class="math-english-summary">
The derivative measures the first-order response of a function to a small change in its input. It is defined as a finite limit of difference quotients. For a graph, this number is the slope of a nonvertical tangent line; for a position function, it is instantaneous velocity. Neither interpretation should be confused with an average rate over a fixed interval.
 
Differentiability is equivalent to a local linear expansion whose remainder becomes negligible relative to the input increment. This formulation explains why differentiability implies continuity and why the chain rule multiplies two rates. It also extends naturally to linear maps in several variables. Product and quotient rules require their own hypotheses, including a nonzero denominator for a quotient.
 
A derivative at one point does not by itself describe behavior on an entire interval. The mean value theorem supplies that bridge when continuity and differentiability assumptions hold. A zero derivative at an interior extremum is necessary, but a stationary point need not be an extremum. Continuous functions can have corners, and differentiable functions can have discontinuous derivatives. Numerical differentiation introduces an additional issue: small step sizes can amplify measurement and rounding errors even when the underlying analytical derivative is well defined.
</div>
 
== 编者评注(AI 辅助) ==
本站把“局部线性近似”放在求导口诀之前,这是针对概念理解的教学选择。差商定义用于确认对象,余项用于解释近似,中值定理则连接局部与整体;三者不能彼此替代。本文的算例特意保留单位和误差检查,是为了避免算出一个导数却不知道它测量什么。阅读更复杂的求导式时,先辨认自变量、复合层次和定义域,通常比立即展开代数式更有帮助。
 
== 来源与继续阅读 ==
* [https://openstax.org/books/calculus-volume-1/pages/3-1-defining-the-derivative OpenStax,《Calculus Volume 1》§3.1]:差商定义。
* [https://openstax.org/books/calculus-volume-1/pages/3-3-differentiation-rules 同书 §3.3]、[https://openstax.org/books/calculus-volume-1/pages/3-6-the-chain-rule §3.6]:求导法则。
* [https://openstax.org/books/calculus-volume-1/pages/4-4-the-mean-value-theorem 同书 §4.4]:中值定理及条件。
* [https://mathshistory.st-andrews.ac.uk/HistTopics/The_rise_of_calculus/ MacTutor:The rise of calculus]:历史背景。
* 先修:[[函数]]、[[极限]];后续:[[积分]][[优化]]、[[一阶线性微分方程]]。
[[分类:分析]]
[[分类:分析]]

2026年9月20日 (日) 02:23的版本

导数(derivative)是函数在一点附近的变化量与自变量变化量之比的极限。对于在 a 附近有定义的实函数 f,如果 f(a)=limh0f(a+h)f(a)h 存在并且是有限实数,就称函数在 a 可导。导数既描述瞬时变化率,也描述局部线性近似中的系数;对于函数图像,它是非竖直切线的斜率。导数的值、函数本身的值与一段区间上的平均变化率,是三个不同的量。

平均变化率怎样变成局部变化率

若物体的位置函数为 s(t)=t2 米,其中时间 t 以秒计,从 1 秒到 2 秒的平均速度是 (41)/(21)=3 米每秒。但这个结果把整个一秒区间的运动压缩成了一个平均数,并不能说明 1 秒时恰好以多快的速度运动。

从 1 秒到 1+h 秒的平均速度为 2+h。无论正的时间增量缩小,还是从左侧取负增量靠近,差商都趋于 2。因此瞬时速度为 2 米每秒。求导不是把 h=0 直接代入差商,而是先对所有非零小增量计算,再考察其极限。

抛物线在一一处的切线与连接一一和二四的割线
对 y=x²,图示割线斜率为 3,切线斜率为 2。割线概括一段变化,切线描述一点附近的一阶变化。

在定义中同时考察左右两边非常重要。只用正增量得到的是右导数;左右导数若存在但不相等,通常的双侧导数就不存在。区间端点经常单独讨论单侧导数,应明确约定,不把端点外没有定义的方向偷偷纳入计算。

算例一:平方函数、切线与误差

对任意实数 a(a+h)2a2h=2a+h(h0), 所以 f(a)=2a。在 a=1 处的切线是 y1=2(x1)。当输入从 1 变到 1.03,切线给出的预测值是 1.06,而真实函数值为 1.0609,误差恰好为 0.032=0.0009

这个误差计算比“切线紧贴曲线”更具体:一阶变化是 2h,遗漏的是二阶量 h2。导数把函数在所选位置的主要变化压缩为一个线性系数,但并不把曲线在远处也变成直线。导数为负时函数在该点附近的一阶响应方向相反;导数为零时只说明一阶项消失,更高阶项仍可能决定变化。

可导的等价表述:线性主项加小余项

由差商定义,可导等价于存在实数 A 与余项 r(h),使 f(a+h)=f(a)+Ah+r(h),r(h)h0. 此时 A=f(a),常把余项写成 o(h)。证明是直接的:若导数存在,令 r(h)=f(a+h)f(a)f(a)h,除以 h 即趋于零;反之,把此展开式除以非零 h,差商便趋于 A

这也完整证明了“可导必连续”。差商在足够小邻域内有界,而 f(a+h)f(a) 等于差商乘以 h,所以增量趋于零。连续只要求函数值接近原值;可导进一步要求这种接近能够由一个线性主项描述。前者弱于后者,不能倒置。

多元微积分仍沿用局部线性近似这条思路,只是一个系数变成了线性映射。仅仅存在各坐标方向的偏导数,并不足以保证存在一个统一处理所有方向的线性近似;这也是线性代数与微积分自然连接的地方。

求导法则为何成立

f,g 在同一点可导,和法则来自极限的线性性。乘积法则则需要把增量拆开: f(a+h)g(a+h)f(a)g(a)=[f(a+h)f(a)]g(a+h)+f(a)[g(a+h)g(a)]. 除以 h 并令其趋零。由于可导保证连续,g(a+h)g(a),所以得到 (fg)=fg+fg。这说明乘积的变化有来自两个因子的贡献,不能写成两个导数的乘积。商法则还要求分母在该点非零: (fg)=fgfgg2.

链式法则描述复合变化。设 ga 可导,fb=g(a) 可导;则 (fg)(a)=f(g(a))g(a). 一个不需要除以可能为零的内部增量的证明是:把外层变化写成 f(b+k)f(b)=f(b)k+η(k)k,其中 η(k)0,并令 η(0)=0。代入 k=g(a+h)g(a)。内层连续保证 k0,而 k/hg(a) 且局部有界,因此余项除以 h 后趋零,得到结论。此证明也覆盖某些增量使 g(a+h)=g(a) 的情形。

这些法则与常见函数的导数有系统教材依据,参见 OpenStax §3.3§3.6;本节展开推导用于说明各条件在何处被使用。

算例二:复合函数和单位

设某周期信号为 q(t)=5sin(2t2),时间以秒计,正弦内的相位以弧度计,系数应具有使相位无量纲的单位。外层函数对相位的导数为 5cos(2t2),内层相位变化率为 4t,所以 q(t)=20tcos(2t2).t=0 时变化率为零,但信号并非恒为零。漏掉 4t 就把“每单位相位的变化”误当成“每单位时间的变化”。三角函数的标准导数公式采用弧度制;若输入使用度数,转换因子也属于链式法则的一部分。

算例三:平方根近似及误差上界

函数 f(x)=xx>0 可导,f(4)=1/4。因此 4.04 的线性估计是 2+0.04/4=2.01。若再利用 f(x)=1/(4x3/2),在 [4,4.04] 上有 |f(x)|1/32。泰勒余项估计给出 |f(4.04)2.01|12132(0.04)2=0.000025. 负的二阶导数还说明切线高估了函数值。这个结论同时给出近似数、误差和高估方向;只给若干小数位而不说明误差,信息并不完整。

从一点推到区间:中值定理的作用

导数是局部量,要得出整个区间的结论,需要额外定理。对 a<b,拉格朗日中值定理要求 f 在闭区间 [a,b] 连续,并在开区间 (a,b) 可导;它保证存在 c(a,b),满足 f(b)f(a)=f(c)(ba). 证明的主要步骤是减去连接两端点的直线,得到端点值相等的函数,再用罗尔定理。罗尔定理利用闭区间连续函数取得最大最小值;若函数不恒定,就有一个内点极值,而该处可导使左右差商迫使导数为零。这是证明概要,其中用到了闭区间上的极值定理。

若区间内处处 f>0,对任意两个点应用中值定理,可知函数严格递增;若处处 f=0,函数在该区间为常数。条件中的“区间”不能随意删掉:在不连通的定义域上,不同分支可以各有不同常数,所有点的导数仍为零。

内点可导的局部极值必须满足 f=0,但逆命题不成立。例如 x3 在 0 的导数为零,却从负值穿过 0 继续增加。函数 |x| 在 0 达到最小值,却不可导;闭区间上的端点也可能取得最大最小值。因而寻找优化问题的最优值时,驻点、不可导点和边界都需要检查。

三种边界:尖点、竖直切线与不连续的导数

f(x)=|x| 在 0 连续,但左差商为 −1,右差商为 1,因此不可导。对 f(x)=x1/3,原点的差商为 h2/3,趋于正无穷;几何上可以谈竖直切线,但它不是有限导数。把“切线存在”直接当成“实数导数存在”,会漏掉这一差别。

可导也不保证导数连续。定义 f(0)=0,非零点取 f(x)=x2sin(1/x)。在 0 的差商是 hsin(1/h),由绝对值不超过 |h| 可知导数为零;在非零点, f(x)=2xsin(1/x)cos(1/x). 后一个余弦项持续振荡,所以导数在 0 不连续。这一例子区分了可导与连续可导,也说明导数存在并不意味着邻近斜率平稳变化。

数值差商还有不同的限制:步长太大产生截断误差,步长太小则可能把测量或舍入误差放大,因为噪声被除以小数。真实数据中的“求导”通常需要明确步长、平滑假设或误差模型,不能把解析函数的精确公式原样套到噪声记录上。

隐式关系中的变化率

有时变量关系不是显式写成 y=f(x),而是由方程共同规定。例如圆 x2+y2=25 的上半部分在 y>0 时局部确定一个可导函数。对两边关于 x 求导,链式法则给出 2x+2yy=0,所以 y=x/y。在点 (3,4),斜率为 3/4,切线方程为 y4=(3/4)(x3)

这个过程并不意味着在圆的所有点都能用同一个可导的单值函数表示纵坐标。到 (5,0) 时,分母为零,几何切线竖直;上下半圆也在这里接合。隐式求导得到的式子有使用范围,需要先确认所讨论的分支与非零条件。更一般的隐函数定理系统回答何时能够从一个关系局部解出可导函数。

类似地,若半径 R(t)>0 随时间变化,圆面积 A(t)=πR(t)2 的变化率为 A=2πRR。半径为 3 米、径向增长率为每秒 0.2 米时,面积增长率为每秒 1.2π 平方米。不能把面积对半径的导数 2πR 直接当成面积对时间的导数;两种自变量带来不同单位,链式法则负责连接它们。

反函数的导数为何是倒数

fa 的某个邻域连续可导,并且 f(a)0;由反函数定理,可以进一步缩小邻域,使它一一对应并有可导的局部反函数,记为 g,满足 g(f(x))=x。对这个恒等式求导,链式法则给出 g(f(a))f(a)=1,于是 g(f(a))=1/f(a)。这个推导在反函数可导已得到保证后说明导数的数值;不能仅靠形式求导就自动证明反函数存在且可导。

几何上,交换横纵坐标把一条切线的斜率变成其倒数。以正半轴的平方函数和平方根函数为例,平方函数在 2 的导数为 4,因此平方根函数在 4 的导数为 1/4。若原导数为零,倒数规则失效:立方函数在原点可导且一一对应,但其反函数立方根在原点没有有限导数。

高阶导数记录的是哪一种变化

二阶导数是导数函数的导数。对于位置函数,它描述速度的变化率,即加速度;对于一般图像,正的二阶导数意味着斜率在增加,不意味着函数值一定为正或函数一定在增加。例如 f(x)=x2 在负半轴上正在下降,但斜率从很负逐步增加到零,二阶导数始终为正。

若某内点一阶导数为零,而二阶导数连续且在该点为正,可以在邻域内利用斜率变化或泰勒展开证明它是严格局部最小值。若二阶导数为零,判别没有结论:x4 在零点有最小值,x4 有最大值,x3 则都不是。判据没有识别出来,与数学对象没有该性质,是两回事。

导数为正是严格递增的充分条件,却不是必要条件。立方函数在整条实轴严格递增,零点的导数仍为零。与此同时,单点导数为正只约束足够接近该点时的线性响应,不能据此断言很远的函数值也继续增加。把局部结论扩展到区间,必须检查中值定理使用范围内的条件。

导数也可以描述误差传播。若真实输入为 a,测量误差为较小的 h,输出误差的一阶近似是 f(a)h。导数绝对值大,意味着同样的输入误差可能被放大;绝对值小,则局部输出对输入较不敏感。不过一阶项为零时,应继续检查高阶项,而不能说所有误差都消失了。

例如用球半径估计体积,V=4πR3/3,小半径误差给出 ΔV4πR2ΔR。除以体积后得到相对误差近似 ΔV/V3ΔR/R。因此半径百分之一的相对误差,可能造成约百分之三的体积相对误差;这个结论适用于误差足够小的一阶近似,不是任意误差下的精确比例。

若输入变成新的时间单位,导数数值也会相应改变。把以秒计的时间换为以分钟计的变量,同一段运动每分钟的位置变化率是每秒数值的六十倍。图像看起来相同并不意味着导数的数值相同,因为横轴单位改变了斜率。导数是一种关于所选自变量的量,报告时应保留“相对于什么变化”。

这些解释使导数与数学建模中的灵敏度分析相连。灵敏度描述已选模型内的局部响应,不是因果关系的自动证明:如果函数只是统计拟合,导数只能直接解释拟合关系的变化,是否对应现实干预效果还需要额外假设。

历史与相关方向

切线和极值问题早于现代导数定义。费马研究求极值的方法,巴罗研究切线与求积之间的关系;十七世纪牛顿从运动与流数出发,莱布尼茨发展微分符号和运算法则。今天以差商极限为基础的定义,是这些计算方法与后来的分析基础共同发展的结果,不适合归结为某个人在某一天“发现了斜率”。相关人物工作可核对 MacTutor:FermatBarrowLeibniz

导数进一步通向高阶变化率、多元的梯度与雅可比矩阵、微分方程以及用切线求根的牛顿法。这些方向共享局部线性化思想,但各自还需要检查可导性、初始条件、收敛性或维数;概念相连不代表条件自动相同。

English overview

The derivative measures the first-order response of a function to a small change in its input. It is defined as a finite limit of difference quotients. For a graph, this number is the slope of a nonvertical tangent line; for a position function, it is instantaneous velocity. Neither interpretation should be confused with an average rate over a fixed interval.

Differentiability is equivalent to a local linear expansion whose remainder becomes negligible relative to the input increment. This formulation explains why differentiability implies continuity and why the chain rule multiplies two rates. It also extends naturally to linear maps in several variables. Product and quotient rules require their own hypotheses, including a nonzero denominator for a quotient.

A derivative at one point does not by itself describe behavior on an entire interval. The mean value theorem supplies that bridge when continuity and differentiability assumptions hold. A zero derivative at an interior extremum is necessary, but a stationary point need not be an extremum. Continuous functions can have corners, and differentiable functions can have discontinuous derivatives. Numerical differentiation introduces an additional issue: small step sizes can amplify measurement and rounding errors even when the underlying analytical derivative is well defined.

编者评注(AI 辅助)

本站把“局部线性近似”放在求导口诀之前,这是针对概念理解的教学选择。差商定义用于确认对象,余项用于解释近似,中值定理则连接局部与整体;三者不能彼此替代。本文的算例特意保留单位和误差检查,是为了避免算出一个导数却不知道它测量什么。阅读更复杂的求导式时,先辨认自变量、复合层次和定义域,通常比立即展开代数式更有帮助。

来源与继续阅读