微分学的基本思想就是“丢掉高阶无穷小”。但是牛顿说过:“在数学中最微小的误差也不可忽略。”于是我们要问:“高阶无穷小为什么可以忽略?”为了说明“丢掉高阶无穷小”的确是可行的,必须建立严格的微分理论。
无穷小
首先我们需要严格刻画“无穷小”这个概念。无穷小显然不能通过“某个实数”这样静态地来刻画,它的“无限接近”只能通过动态的方式来被表达。因此很自然,我们必须用数列的极限或者函数的极限来描述它。任何一个在极限过程中趋向0的数列或者函数(它们是一回事)都是无穷小。
无穷小有许多种,n→+∞时,n1是无穷小,n1001也是无穷小,en1也是无穷小。我们从直观上(图像上)就能发现,如果n的步调一致,它们趋向0的速度是不一样的。为了描述这种速度的不同,我们可以把两个无穷小作比较,把它们相除看它们比值的极限。如果比值是0,意味着分子上的更快些;如果比值是无穷,那么分母上的更快些;如果比值是个有界实数,意味着它们速度差不多;特别地,如果比值是1,意味着它们速度完全相同。严格地来说,如果有limf(x)g(x)=0,就说g(x)是比f(x)“高阶”的无穷小,并把这个表达式简写为g(x)=o(f(x))。如果要更直接地看这意味着什么,我们可以把g(x)看作某个α(x)⋅f(x),其中α(x)是一个在极限过程中趋向0的函数。也就是说,某个函数的高阶无穷小就等价于这个函数乘上一个无穷小。
微分与微分记号d
我们研究的话题是,当自变量变化时函数值如何变化。更精确地,如何用正实数h刻画f(x+h)−f(x),尤其是当h可以小于任意给定的正数的时候。
“连续性”是最粗糙的刻画,它只向我们揭示当h逼近0的时候f(x+h)−f(h)也逼近0。为了更精确地描述这个过程,我们要考虑“更高阶”的变化因素。给表达式除上h。如果对于x0,存在极限
h→0limhf(x0+h)−f(x0)
存在,我们就说f(x)在x0处可导,并把这个极限记为f′(x0),称为f(x)在x0处的导数。
根据极限的运算法则,f′(x0)=h→0limhf(x0+h)−f(x0)可以移项,写作
h→0limhf(x0+h)−f(x0)−f′(x0)h=0
用h的高阶无穷小来表示,就得到(所谓高阶无穷小,就是这个函数可以看成某个函数本身乘上了某个无穷小量,有定义式h→0limho(h)=0)
f(x0+h)−f(x0)=f′(x0)h+o(h)
(3)式的含义是:如果f(x)在x0处可导,那么当自变量从x0变到x0+h时,函数值的变化就一定可以分解成两部分。第一部分就等于h与一个常量的乘积;第二部分是一个比h更快地趋向无穷小的量,即h的高阶无穷小。f(x0+h)−f(x)完全描述了函数值的整个变化,称为全改变量,记为Δfx=x0;第一部分f′(x0)h与自变量的变化量呈线性关系,称为线性改变量。
我们发现,这样的函数可以用比“连续”更精确的方式来描述。它向我们揭示了,“可导”的函数值的变化量一定是某个线性改变量与某个高阶小量的和。
于是,我们就把线性改变量称为函数在这点处的“微分”,记为dfx=x0。对于所有可导函数,都可以写出
Δf=df+o(h)
如果有(4)式,就说f在这一点处是可微的。
所以微分记号d的定义是:把记号d放在某个可导函数前,表示这个函数在某点处变化时的线性改变量。可见,df不是“某个实数”,而是某个“无穷小量函数”,它是一个函数,一个关于h的线性函数。
唯一性
我们知道由f可导可以推出(4)式,即“可导”可以推出“可微”。而假如已知可微,即已知f(x0+h)−f(x0)=f′(x0)h+o(h),那么两边同时除以h可以得到hf(x0+h)−f(x0)=f′(x0)+ho(h),两边同时让h→0,得到h→0limhf(x0+h)−f(x0)=f′(x0),可见可微可以推出可导。
综上,可导与可微是等价的。
从上述过程中也可以发现,假如有某个常数使得
f(x0+h)−f(x0)=Ah+o(h)
那么一定有
A=f′(x0)
即只要函数可微,df的这个函数就是唯一确定的。
微分的运算法则
微分记号d本质上是个函数,函数可以有对应的运算法则,这就是微分的运算法则。微分的计算法则可以理解为一个形式上的法则,即左右两边的“形式”是恒等的,可以在计算的过程中做从左到右或者从右到左的替换。而我们在证明这些法则的过程中,没有必要用到除了微分定义以外的任何工具,是微分的定义决定了微分的运算法则。
导数与微商的代换
我们考虑函数f(x)≡x。此时也有Δf=df+o(h),只不过Δf就等于h,df也等于h,因此o(h)这一项就是0了。所以h就可以同时被写成Δx或者dx。因此我们可以写出
df=f′dx
由于df,dx都只不过是关于h的线性函数,并且始终不等于0,因此一切实数中对于等式成立的恒等变形都是成立的。比如,我们而可以写出
dxdf=f′
这代表导数实际上就是函数的微分与自变量的微分相除。df可以用导数和dx相乘来表示;导数可以用df与dx相除来表示。
线性代换
如果f(x),g(x)可微,那么做代换
d(αf+βg)=αdf+βdg
Δ(αf+βg)x=x0=αf(x0+h)+βg(x0+h)−αf(x0)−βg(x0)=α[f(x0+h)−f(x0)]+β[g(x0+h)−g(x0)]=α[f′(x0)h+o(h)]+β[g′(x0)h+o(h)]=αdfx=x0+βdgx=x0+o(h)
因此d(αf+βg)x=x0=αdfx=x0+βdgx=x0
Leibniz's Rule代换
如果f(x),g(x)可微,那么可以做代换
d(fg)=g⋅df+f⋅dg
Δ(fg)x=x0=f(x0+h)g(x0+h)−f(x0)g(x0=[f(x0)+f′(x0)h+o(h)][g(x0)+g′(x0)h+o(h)]−f(x0)g(x0)=f(x0)g′(x0)h+g(x0)f′(x0)h+o(h)=g(x0)(df)x=x0+f(x0)(dg)x=x0+o(h)
因此d(fg)x=x0=g(x0)(df)x=x0+f(x0)(dg)x=x0
除法代换
如果f(x),g(x)可微且g(x)=0,那么可以做代换
d(gf)=g2df⋅g−dg⋅f
Δ(gf)x=x0=g(x0+h)f(x0+h)−g(x0)f(x0)=g(x0+h)g(x0)f(x0+h)g(x0)−f(x0)g(x0+h)=g(x0)[g(x0)+g′(x0)h+o(h)]g(x0)[f(x0)+f′(x0)h+o(h)]−f(x0)[g(x0)+g′(x0)h+o(h)]=g2(x0)+g(x0)⋅g′(x0)h+o(h)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)+o(h)=[g2(x0)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)+o(h)]⋅g2(x0)+g(x0)⋅g′(x0)h+o(h)g2(x0)=[g2(x0)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)+o(h)][1−g2(x0)+g(x0)⋅g′(x0)h+o(h)g(x0)⋅g′(x0)h+o(h)]=[g2(x0)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)+o(h)][1−g2(x0)+g(x0)⋅g′(x0)h+o(h)g(x0)⋅g′(x0)h+o(h)]=g2(x0)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)−g2(x0)(g2(x0)+g(x0)g′(x0)h+o(h))(f′(x0)g(x0)−g′(x0)f(x0))g(x0)g′(x0)h2+o(h)=g2(x0)f′(x0)h⋅g(x0)−g′(x0)h⋅f(x0)+o(h)
因此d(gf)x=x0=g2df⋅g−dg⋅fx=x0
链式法则代换
如果f(x),u(x)可微,那么可以做代换
dxdf=dudf⋅dxdu
f要能看作u的函数,则f是内嵌了u的关于x的复合函数,即证d(f(u(x0)))=f′(u(x0))u′(x0)dx
Δ(f(u(x)))x=x0=f(u(x0+h))−f(u(x0))=f(u(x0)+u′(x0)h+o(h))−f(u(x0))=f′(u(x0))[u′(x0)h+o(h)]+o(u′(x0)h+o(h))=f′(u(x0))u′(x0)h+o(h)
根据微分的定义我们知道u′(x0)dx可以代换为d(u(x))x=x0,因此
d(f(u(x)))=f′(u(x))u′(x)dx
可以写作
d(f(u(x)))=f′(u(x))d(u(x))
可见在一个微分表达式中我们可以直接把自变量x通通替换成一个关于x的函数,则原来成立的表达式现在依然成立。这称为一阶微分形式不变性,可以理解为求微分与选用的自变量无关。
微分是对变化的函数值的一种描述,这种描述止步于线性,并以导数的方式表现出来。事实上我们知道,对于函数值的变化还有更精确的描述。我们的“逼近”可以拓展到n阶无穷小,这就是微分学的顶峰——Taylor公式。如果从Taylor公式的视角来看微分,就会发现微分只不过是我们用来表示一阶Taylor公式时用的一个简便记号而已。如果愿意,我们也可以用某个记号来简便表达Taylor公式的前两项、前三项,来得到一个二阶、三阶的“微分”。
正是由于这样,所以在一元微积分中并不需要争论d的含义究竟是某个记号,还是某个线性函数,还是某个线性映射,我们知道它是刻画函数变化量的其中一部分就好了。我们看到了,在等式中我们可以把微分就当作某个“函数”来运算,它可以被除到分母上,可以左右调换位置,只要我们的操作是符合我们严格证明了的法则的,就不必提心吊胆。我们也看到了,微分的运算也可以原模原样地运用在积分和微分方程中。到头来,微分只是我们为了方便而用来书写简便的一个函数,有什么神秘的呢?