R 2 \mathbb{R}^2 R 2 の点を x = ( x , y ) \boldsymbol x = (x,y) x = ( x , y ) と書き、ユークリッドノルムを ∥ x ∥ = x 2 + y 2 \|\boldsymbol x\| = \sqrt{x^2+y^2} ∥ x ∥ = x 2 + y 2 とします。a ∈ R 2 \boldsymbol a \in \mathbb{R}^2 a ∈ R 2 と r > 0 r>0 r > 0 に対し B ( a , r ) = { x ∈ R 2 : ∥ x − a ∥ < r } B(\boldsymbol a, r) = \{\boldsymbol x \in \mathbb{R}^2 : \|\boldsymbol x - \boldsymbol a\| < r\} B ( a , r ) = { x ∈ R 2 : ∥ x − a ∥ < r } を開球 (開円板)と呼び、U ⊂ R 2 U \subset \mathbb{R}^2 U ⊂ R 2 が開集合 であるとは、任意の a ∈ U \boldsymbol a \in U a ∈ U に対しある r > 0 r>0 r > 0 が存在して B ( a , r ) ⊂ U B(\boldsymbol a,r) \subset U B ( a , r ) ⊂ U となることをいいます。以下、f f f の定義域は常に開集合 U U U とします。これは「a \boldsymbol a a の全方向に少し動く余地がある」ことを保証するためで、微分を論じるときに必須の仮定です。
f : U → R f: U \to \mathbb{R} f : U → R に対し、そのグラフ は G f = { ( x , y , f ( x , y ) ) ∈ R 3 : ( x , y ) ∈ U } G_f = \{(x,y,f(x,y)) \in \mathbb{R}^3 : (x,y) \in U\} G f = {( x , y , f ( x , y )) ∈ R 3 : ( x , y ) ∈ U } という空間内の曲面です。曲面を紙の上で見るために、c ∈ R c \in \mathbb{R} c ∈ R に対する等位集合 (等高線)L c = { ( x , y ) ∈ U : f ( x , y ) = c } L_c = \{(x,y) \in U : f(x,y) = c\} L c = {( x , y ) ∈ U : f ( x , y ) = c } を描くのが常套手段です。地形図の等高線と同じで、線が混み合っているところほど傾きが急になります。
Definition 3.1 (偏微分係数と偏導関数 )
U ⊂ R 2 U \subset \mathbb{R}^2 U ⊂ R 2 を開集合、f : U → R f: U \to \mathbb{R} f : U → R 、a = ( a , b ) ∈ U \boldsymbol a = (a,b) \in U a = ( a , b ) ∈ U とします。極限
∂ f ∂ x ( a , b ) = lim h → 0 f ( a + h , b ) − f ( a , b ) h \frac{\partial f}{\partial x}(a,b) = \lim_{h \to 0} \frac{f(a+h,\, b) - f(a,b)}{h} ∂ x ∂ f ( a , b ) = h → 0 lim h f ( a + h , b ) − f ( a , b ) が存在するとき、f f f は a \boldsymbol a a で x x x について偏微分可能といい、この値を x x x に関する偏微分係数 と呼びます。y y y についても同様に
∂ f ∂ y ( a , b ) = lim k → 0 f ( a , b + k ) − f ( a , b ) k \frac{\partial f}{\partial y}(a,b) = \lim_{k \to 0} \frac{f(a,\, b+k) - f(a,b)}{k} ∂ y ∂ f ( a , b ) = k → 0 lim k f ( a , b + k ) − f ( a , b ) で定めます。両方が存在するとき、単に a \boldsymbol a a で偏微分可能 といいます。U U U の各点で偏微分可能なとき、対応 ( x , y ) ↦ ∂ f / ∂ x ( x , y ) (x,y) \mapsto \partial f/\partial x\,(x,y) ( x , y ) ↦ ∂ f / ∂ x ( x , y ) を偏導関数 と呼び、f x f_x f x とも書きます(f y f_y f y も同様)。
定義の右辺は、b b b を固定した 1 変数関数 φ ( t ) = f ( t , b ) \varphi(t) = f(t,b) φ ( t ) = f ( t , b ) の t = a t=a t = a における微分係数にほかなりません。つまり偏微分とは、曲面を平面 y = b y=b y = b で切った切り口の曲線の傾きです。したがって計算では、他の変数を定数とみなして 1 変数の微分公式をそのまま使えば よいことになります。
たとえば f ( x , y ) = x 2 y 3 + e x y f(x,y) = x^2y^3 + e^{xy} f ( x , y ) = x 2 y 3 + e x y とすると、x x x で偏微分するときは y y y を定数と見て
f x ( x , y ) = 2 x y 3 + y e x y , f y ( x , y ) = 3 x 2 y 2 + x e x y f_x(x,y) = 2xy^3 + y\,e^{xy}, \qquad f_y(x,y) = 3x^2y^2 + x\,e^{xy} f x ( x , y ) = 2 x y 3 + y e x y , f y ( x , y ) = 3 x 2 y 2 + x e x y となり、( 1 , 1 ) (1,1) ( 1 , 1 ) では f x ( 1 , 1 ) = 2 + e f_x(1,1) = 2 + e f x ( 1 , 1 ) = 2 + e 、f y ( 1 , 1 ) = 3 + e f_y(1,1) = 3 + e f y ( 1 , 1 ) = 3 + e です。e x y e^{xy} e x y の項では、合成関数の微分により内側 x y xy x y の x x x 偏微分 y y y が掛かる点に注意してください。
Note
「他の変数を固定する」という言い方は、どの変数を固定したかが文脈から分かる場合にのみ意味を持ちます。熱力学で ( ∂ U / ∂ T ) V (\partial U/\partial T)_V ( ∂ U / ∂ T ) V のように固定する変数を明記するのはこのためです。この記事では独立変数は常に x , y x, y x , y ですから、曖昧さは生じません。
さて、偏微分は x x x 軸方向と y y y 軸方向という 2 本の直線に沿った情報 しか見ていません。これがどれほど弱い情報かを見ます。
Example 3.2 (偏微分可能なのに連続でない関数 )
f ( x , y ) = { x y x 2 + y 2 ( ( x , y ) ≠ ( 0 , 0 ) ) 0 ( ( x , y ) = ( 0 , 0 ) ) f(x,y) = \begin{cases} \dfrac{xy}{x^2+y^2} & ((x,y) \ne (0,0)) \\[2mm] 0 & ((x,y) = (0,0)) \end{cases} f ( x , y ) = ⎩ ⎨ ⎧ x 2 + y 2 x y 0 (( x , y ) = ( 0 , 0 )) (( x , y ) = ( 0 , 0 )) とします。まず原点での偏微分を計算します。f ( h , 0 ) = 0 / ( h 2 ) = 0 f(h,0) = 0/(h^2) = 0 f ( h , 0 ) = 0/ ( h 2 ) = 0 なので
f x ( 0 , 0 ) = lim h → 0 f ( h , 0 ) − f ( 0 , 0 ) h = lim h → 0 0 − 0 h = 0 f_x(0,0) = \lim_{h\to 0}\frac{f(h,0)-f(0,0)}{h} = \lim_{h\to 0}\frac{0-0}{h} = 0 f x ( 0 , 0 ) = h → 0 lim h f ( h , 0 ) − f ( 0 , 0 ) = h → 0 lim h 0 − 0 = 0 であり、同じく f ( 0 , k ) = 0 f(0,k)=0 f ( 0 , k ) = 0 から f y ( 0 , 0 ) = 0 f_y(0,0)=0 f y ( 0 , 0 ) = 0 です。つまり f f f は原点で偏微分可能で、両方の偏微分係数は 0 0 0 です。
ところが f f f は原点で連続ではありません。直線 y = x y = x y = x に沿って原点に近づけると、x ≠ 0 x \ne 0 x = 0 に対し
f ( x , x ) = x ⋅ x x 2 + x 2 = 1 2 f(x,x) = \frac{x\cdot x}{x^2+x^2} = \frac{1}{2} f ( x , x ) = x 2 + x 2 x ⋅ x = 2 1 なので極限は 1 / 2 1/2 1/2 、x x x 軸に沿えば f ( x , 0 ) = 0 f(x,0)=0 f ( x , 0 ) = 0 なので極限は 0 0 0 です。2 つの近づき方で値が異なるので、Remark 2.1 により lim ( x , y ) → ( 0 , 0 ) f ( x , y ) \lim_{(x,y)\to(0,0)} f(x,y) lim ( x , y ) → ( 0 , 0 ) f ( x , y ) は存在せず、とくに f ( 0 , 0 ) = 0 f(0,0)=0 f ( 0 , 0 ) = 0 に一致しません。
実際この f f f は極座標で f ( r cos θ , r sin θ ) = 1 2 sin 2 θ f(r\cos\theta, r\sin\theta) = \frac{1}{2}\sin 2\theta f ( r cos θ , r sin θ ) = 2 1 sin 2 θ となり、r r r に依らず角度だけで値が決まります。原点をどれだけ拡大しても同じ模様が見えるので、原点で値が定まりようがありません。
この例は、偏微分可能性を「微分可能」の定義に採用してはいけないことを決定的に示しています。連続でない関数を微分可能と呼ぶわけにはいきません。
Definition 4.1 (全微分可能 )
U ⊂ R 2 U \subset \mathbb{R}^2 U ⊂ R 2 を開集合、f : U → R f: U \to \mathbb{R} f : U → R 、a ∈ U \boldsymbol a \in U a ∈ U とします。ある実数の組 ( p , q ) (p,q) ( p , q ) が存在して、h = ( h , k ) \boldsymbol h = (h,k) h = ( h , k ) に対し
lim h → 0 ∣ f ( a + h ) − f ( a ) − ( p h + q k ) ∣ ∥ h ∥ = 0 \lim_{\boldsymbol h \to \boldsymbol 0} \frac{\bigl|\,f(\boldsymbol a + \boldsymbol h) - f(\boldsymbol a) - (p\,h + q\,k)\,\bigr|}{\|\boldsymbol h\|} = 0 h → 0 lim ∥ h ∥ f ( a + h ) − f ( a ) − ( p h + q k ) = 0 が成り立つとき、f f f は a \boldsymbol a a で全微分可能 (単に微分可能)であるといいます。このとき線形写像 h ↦ p h + q k \boldsymbol h \mapsto p h + q k h ↦ p h + q k を f f f の a \boldsymbol a a における微分 と呼びます。同じことを
f ( a + h ) = f ( a ) + p h + q k + o ( ∥ h ∥ ) ( h → 0 ) f(\boldsymbol a + \boldsymbol h) = f(\boldsymbol a) + p\,h + q\,k + o(\|\boldsymbol h\|) \qquad (\boldsymbol h \to \boldsymbol 0) f ( a + h ) = f ( a ) + p h + q k + o ( ∥ h ∥ ) ( h → 0 ) とも書きます。
分母が ∥ h ∥ \|\boldsymbol h\| ∥ h ∥ である点が要です。誤差が単に 0 0 0 に近づくだけでは足りず、h \boldsymbol h h が原点に近づく速さより速く 0 0 0 にならなければなりません。そして極限は h → 0 \boldsymbol h \to \boldsymbol 0 h → 0 の全方向で取られているので、この定義は最初からあらゆる方向を同時に制御しています。Example 3.2 の失敗が起きないのはこのためです。
Definition 4.2 (方向微分 )
u ∈ R 2 \boldsymbol u \in \mathbb{R}^2 u ∈ R 2 を ∥ u ∥ = 1 \|\boldsymbol u\| = 1 ∥ u ∥ = 1 なるベクトルとします。極限
D u f ( a ) = lim t → 0 f ( a + t u ) − f ( a ) t D_{\boldsymbol u} f(\boldsymbol a) = \lim_{t \to 0} \frac{f(\boldsymbol a + t\boldsymbol u) - f(\boldsymbol a)}{t} D u f ( a ) = t → 0 lim t f ( a + t u ) − f ( a ) が存在するとき、これを u \boldsymbol u u 方向の方向微分係数 と呼びます。u = ( 1 , 0 ) \boldsymbol u = (1,0) u = ( 1 , 0 ) のときが f x ( a ) f_x(\boldsymbol a) f x ( a ) 、u = ( 0 , 1 ) \boldsymbol u = (0,1) u = ( 0 , 1 ) のときが f y ( a ) f_y(\boldsymbol a) f y ( a ) です。
Proposition 4.3 (全微分可能性から出てくるもの )
f f f が a ∈ U \boldsymbol a \in U a ∈ U で全微分可能で、Definition 4.1 の条件が組 ( p , q ) (p,q) ( p , q ) について成り立つとします。このとき次が成り立ちます。
f f f は a \boldsymbol a a で連続である。
任意の単位ベクトル u = ( u 1 , u 2 ) \boldsymbol u = (u_1,u_2) u = ( u 1 , u 2 ) について方向微分係数が存在し、D u f ( a ) = p u 1 + q u 2 D_{\boldsymbol u} f(\boldsymbol a) = p\,u_1 + q\,u_2 D u f ( a ) = p u 1 + q u 2 である。とくに f f f は a \boldsymbol a a で偏微分可能で p = f x ( a ) , q = f y ( a ) p = f_x(\boldsymbol a),\ q = f_y(\boldsymbol a) p = f x ( a ) , q = f y ( a ) である。
したがって条件を満たす組 ( p , q ) (p,q) ( p , q ) はただ 1 つに定まる。
Proof(Proposition 4.3) h ≠ 0 \boldsymbol h \ne \boldsymbol 0 h = 0 に対し誤差項を
R ( h ) = f ( a + h ) − f ( a ) − ( p h + q k ) R(\boldsymbol h) = f(\boldsymbol a+\boldsymbol h) - f(\boldsymbol a) - (p h + q k) R ( h ) = f ( a + h ) − f ( a ) − ( p h + q k ) と置きます。Definition 4.1 の仮定は ∣ R ( h ) ∣ / ∥ h ∥ → 0 |R(\boldsymbol h)|/\|\boldsymbol h\| \to 0 ∣ R ( h ) ∣/∥ h ∥ → 0 です。
(1) ∥ h ∥ → 0 \|\boldsymbol h\| \to 0 ∥ h ∥ → 0 のとき ∣ R ( h ) ∣ = ∣ R ( h ) ∣ ∥ h ∥ ⋅ ∥ h ∥ → 0 ⋅ 0 = 0 |R(\boldsymbol h)| = \frac{|R(\boldsymbol h)|}{\|\boldsymbol h\|}\cdot \|\boldsymbol h\| \to 0 \cdot 0 = 0 ∣ R ( h ) ∣ = ∥ h ∥ ∣ R ( h ) ∣ ⋅ ∥ h ∥ → 0 ⋅ 0 = 0 です(収束する 2 つの量の積)。また ∣ p h + q k ∣ ≤ ∣ p ∣ ∣ h ∣ + ∣ q ∣ ∣ k ∣ ≤ ( ∣ p ∣ + ∣ q ∣ ) ∥ h ∥ → 0 |ph+qk| \le |p||h| + |q||k| \le (|p|+|q|)\|\boldsymbol h\| \to 0 ∣ p h + q k ∣ ≤ ∣ p ∣∣ h ∣ + ∣ q ∣∣ k ∣ ≤ ( ∣ p ∣ + ∣ q ∣ ) ∥ h ∥ → 0 です。ここで ∣ h ∣ ≤ ∥ h ∥ |h| \le \|\boldsymbol h\| ∣ h ∣ ≤ ∥ h ∥ と ∣ k ∣ ≤ ∥ h ∥ |k| \le \|\boldsymbol h\| ∣ k ∣ ≤ ∥ h ∥ を使いました。よって
f ( a + h ) − f ( a ) = ( p h + q k ) + R ( h ) → 0 f(\boldsymbol a + \boldsymbol h) - f(\boldsymbol a) = (ph+qk) + R(\boldsymbol h) \to 0 f ( a + h ) − f ( a ) = ( p h + q k ) + R ( h ) → 0 となり、lim h → 0 f ( a + h ) = f ( a ) \lim_{\boldsymbol h \to \boldsymbol 0} f(\boldsymbol a+\boldsymbol h) = f(\boldsymbol a) lim h → 0 f ( a + h ) = f ( a ) 、すなわち f f f は a \boldsymbol a a で連続です。
(2) t ≠ 0 t \ne 0 t = 0 に対し h = t u \boldsymbol h = t\boldsymbol u h = t u と取ります。∥ h ∥ = ∣ t ∣ ∥ u ∥ = ∣ t ∣ \|\boldsymbol h\| = |t|\,\|\boldsymbol u\| = |t| ∥ h ∥ = ∣ t ∣ ∥ u ∥ = ∣ t ∣ に注意すると
f ( a + t u ) − f ( a ) t = t ( p u 1 + q u 2 ) + R ( t u ) t = p u 1 + q u 2 + R ( t u ) t \frac{f(\boldsymbol a + t\boldsymbol u) - f(\boldsymbol a)}{t} = \frac{t(p u_1 + q u_2) + R(t\boldsymbol u)}{t} = p u_1 + q u_2 + \frac{R(t\boldsymbol u)}{t} t f ( a + t u ) − f ( a ) = t t ( p u 1 + q u 2 ) + R ( t u ) = p u 1 + q u 2 + t R ( t u ) です。最後の項は ∣ R ( t u ) t ∣ = ∣ R ( t u ) ∣ ∥ t u ∥ \left|\frac{R(t\boldsymbol u)}{t}\right| = \frac{|R(t\boldsymbol u)|}{\|t\boldsymbol u\|} t R ( t u ) = ∥ t u ∥ ∣ R ( t u ) ∣ であり、t → 0 t \to 0 t → 0 のとき t u → 0 t\boldsymbol u \to \boldsymbol 0 t u → 0 なので、仮定よりこれは 0 0 0 に収束します。よって D u f ( a ) = p u 1 + q u 2 D_{\boldsymbol u}f(\boldsymbol a) = pu_1+qu_2 D u f ( a ) = p u 1 + q u 2 が存在します。u = ( 1 , 0 ) \boldsymbol u=(1,0) u = ( 1 , 0 ) と u = ( 0 , 1 ) \boldsymbol u=(0,1) u = ( 0 , 1 ) を代入して f x ( a ) = p f_x(\boldsymbol a)=p f x ( a ) = p 、f y ( a ) = q f_y(\boldsymbol a)=q f y ( a ) = q を得ます。
(3) (2) により p , q p,q p , q は f f f の偏微分係数として決まってしまうので、条件を満たす組は一意です。
∎ この命題により、全微分可能なら微分は必ず h ↦ f x ( a ) h + f y ( a ) k \boldsymbol h \mapsto f_x(\boldsymbol a)h + f_y(\boldsymbol a)k h ↦ f x ( a ) h + f y ( a ) k の形をしています。そこで次のベクトルに名前を付けます。
∇ f ( a ) = ( f x ( a ) , f y ( a ) ) ( 勾配ベクトル、グラディエント ) \nabla f(\boldsymbol a) = \bigl(f_x(\boldsymbol a),\, f_y(\boldsymbol a)\bigr) \quad (\text{勾配ベクトル、グラディエント}) ∇ f ( a ) = ( f x ( a ) , f y ( a ) ) ( 勾配ベクトル、グラディエント ) これを使うと全微分可能性は f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + o ( ∥ h ∥ ) f(\boldsymbol a+\boldsymbol h) = f(\boldsymbol a) + \langle \nabla f(\boldsymbol a), \boldsymbol h\rangle + o(\|\boldsymbol h\|) f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + o ( ∥ h ∥ ) と書けます。逆は成り立ちません。偏微分係数が存在して勾配ベクトルが書けても、それが一次近似を与えるとは限らないのです。
Example 4.4 (連続かつ偏微分可能だが全微分可能でない関数 )
f ( x , y ) = ∣ x y ∣ f(x,y) = \sqrt{|xy|} f ( x , y ) = ∣ x y ∣ とします。相加相乗平均の不等式から ∣ x ∣ ∣ y ∣ ≤ ∣ x ∣ + ∣ y ∣ 2 ≤ ∥ x ∥ \sqrt{|x||y|} \le \frac{|x|+|y|}{2} \le \|\boldsymbol x\| ∣ x ∣∣ y ∣ ≤ 2 ∣ x ∣ + ∣ y ∣ ≤ ∥ x ∥ なので、x → 0 \boldsymbol x \to \boldsymbol 0 x → 0 のとき f ( x ) → 0 = f ( 0 ) f(\boldsymbol x) \to 0 = f(\boldsymbol 0) f ( x ) → 0 = f ( 0 ) となり、f f f は原点で連続です。
偏微分は Example 3.2 と同様で、f ( h , 0 ) = ∣ h ⋅ 0 ∣ = 0 f(h,0) = \sqrt{|h\cdot 0|} = 0 f ( h , 0 ) = ∣ h ⋅ 0∣ = 0 より
f x ( 0 , 0 ) = lim h → 0 0 − 0 h = 0 , f_x(0,0) = \lim_{h\to0}\frac{0-0}{h} = 0, f x ( 0 , 0 ) = h → 0 lim h 0 − 0 = 0 , 同様に f y ( 0 , 0 ) = 0 f_y(0,0)=0 f y ( 0 , 0 ) = 0 です。よって候補となる一次近似は h ↦ 0 \boldsymbol h \mapsto 0 h ↦ 0 、つまり平面 z = 0 z=0 z = 0 しかありません。
ところがこの候補は一次近似になっていません。h = ( t , t ) \boldsymbol h = (t,t) h = ( t , t ) (t ≠ 0 t \ne 0 t = 0 )と取ると f ( t , t ) = t 2 = ∣ t ∣ f(t,t) = \sqrt{t^2} = |t| f ( t , t ) = t 2 = ∣ t ∣ 、∥ h ∥ = 2 ∣ t ∣ \|\boldsymbol h\| = \sqrt{2}\,|t| ∥ h ∥ = 2 ∣ t ∣ なので
∣ f ( h ) − f ( 0 ) − 0 ∣ ∥ h ∥ = ∣ t ∣ 2 ∣ t ∣ = 1 2 \frac{|f(\boldsymbol h) - f(\boldsymbol 0) - 0|}{\|\boldsymbol h\|} = \frac{|t|}{\sqrt{2}\,|t|} = \frac{1}{\sqrt{2}} ∥ h ∥ ∣ f ( h ) − f ( 0 ) − 0∣ = 2 ∣ t ∣ ∣ t ∣ = 2 1 となり、t → 0 t \to 0 t → 0 としても 0 0 0 に収束しません。Proposition 4.3 (3) より一次近似の候補は上の 1 つだけでしたから、f f f は原点で全微分可能ではありません。
幾何的には、この曲面は原点で「谷が折れている」形をしています。x x x 軸と y y y 軸に沿った切り口はどちらも平坦なのに、斜め方向の切り口は ∣ t ∣ |t| ∣ t ∣ という角を持つグラフになっているのです。
では全微分可能性はどうやって確かめればよいのでしょうか。毎回 o ( ∥ h ∥ ) o(\|\boldsymbol h\|) o ( ∥ h ∥ ) を評価するのは大変です。次の定理が実用上ほとんどすべてを片付けてくれます。
Theorem 4.5 (C¹ 級ならば全微分可能 )
U ⊂ R 2 U \subset \mathbb{R}^2 U ⊂ R 2 を開集合、f : U → R f: U \to \mathbb{R} f : U → R 、a = ( a , b ) ∈ U \boldsymbol a = (a,b) \in U a = ( a , b ) ∈ U とします。偏導関数 f x , f y f_x, f_y f x , f y が a \boldsymbol a a のある近傍 B ( a , r ) ⊂ U B(\boldsymbol a, r) \subset U B ( a , r ) ⊂ U の各点で存在し、かつ a \boldsymbol a a で連続であるとします。このとき f f f は a \boldsymbol a a で全微分可能です。
とくに f x , f y f_x, f_y f x , f y が U U U 全体で存在して連続なとき(このとき f f f は U U U 上 C 1 C^1 C 1 級であるといいます)、f f f は U U U の各点で全微分可能です。
Proof(Theorem 4.5) ∥ h ∥ = ∥ ( h , k ) ∥ < r \|\boldsymbol h\| = \|(h,k)\| < r ∥ h ∥ = ∥ ( h , k ) ∥ < r とします。差を 2 段階に分解します。
f ( a + h , b + k ) − f ( a , b ) = [ f ( a + h , b + k ) − f ( a , b + k ) ] ⏟ ( I ) + [ f ( a , b + k ) − f ( a , b ) ] ⏟ ( I I ) f(a+h,b+k) - f(a,b) = \underbrace{\bigl[f(a+h,b+k) - f(a,b+k)\bigr]}_{(\mathrm{I})} + \underbrace{\bigl[f(a,b+k) - f(a,b)\bigr]}_{(\mathrm{II})} f ( a + h , b + k ) − f ( a , b ) = ( I ) [ f ( a + h , b + k ) − f ( a , b + k ) ] + ( II ) [ f ( a , b + k ) − f ( a , b ) ] ( I ) (\mathrm{I}) ( I ) は第 2 変数を b + k b+k b + k に固定した 1 変数関数 s ↦ f ( s , b + k ) s \mapsto f(s, b+k) s ↦ f ( s , b + k ) の差です。∥ h ∥ < r \|\boldsymbol h\| < r ∥ h ∥ < r なので a a a と a + h a+h a + h を結ぶ線分上の点 ( s , b + k ) (s,b+k) ( s , b + k ) はすべて B ( a , r ) B(\boldsymbol a,r) B ( a , r ) に入り、そこで f x f_x f x が存在します。よってこの 1 変数関数は微分可能で、平均値の定理(平均値の定理とテイラーの定理 の ラグランジュの平均値の定理(Theorem 3.3)[Mean Value Theorems and Taylor's Theorem] )より、ある θ 1 ∈ ( 0 , 1 ) \theta_1 \in (0,1) θ 1 ∈ ( 0 , 1 ) が存在して
( I ) = f x ( a + θ 1 h , b + k ) h . (\mathrm{I}) = f_x(a+\theta_1 h,\ b+k)\, h . ( I ) = f x ( a + θ 1 h , b + k ) h . ( I I ) (\mathrm{II}) ( II ) についても同様に、ある θ 2 ∈ ( 0 , 1 ) \theta_2 \in (0,1) θ 2 ∈ ( 0 , 1 ) が存在して ( I I ) = f y ( a , b + θ 2 k ) k (\mathrm{II}) = f_y(a,\ b+\theta_2 k)\, k ( II ) = f y ( a , b + θ 2 k ) k です。したがって
f ( a + h , b + k ) − f ( a , b ) − f x ( a , b ) h − f y ( a , b ) k = [ f x ( a + θ 1 h , b + k ) − f x ( a , b ) ] h + [ f y ( a , b + θ 2 k ) − f y ( a , b ) ] k . \begin{aligned}
&f(a+h,b+k) - f(a,b) - f_x(a,b)h - f_y(a,b)k \\
&\quad = \bigl[f_x(a+\theta_1 h, b+k) - f_x(a,b)\bigr] h + \bigl[f_y(a, b+\theta_2 k) - f_y(a,b)\bigr] k .
\end{aligned} f ( a + h , b + k ) − f ( a , b ) − f x ( a , b ) h − f y ( a , b ) k = [ f x ( a + θ 1 h , b + k ) − f x ( a , b ) ] h + [ f y ( a , b + θ 2 k ) − f y ( a , b ) ] k . 右辺の 2 つの角括弧をそれぞれ ε 1 ( h ) \varepsilon_1(\boldsymbol h) ε 1 ( h ) 、ε 2 ( h ) \varepsilon_2(\boldsymbol h) ε 2 ( h ) と置きます。∣ θ 1 h ∣ ≤ ∣ h ∣ ≤ ∥ h ∥ |\theta_1 h| \le |h| \le \|\boldsymbol h\| ∣ θ 1 h ∣ ≤ ∣ h ∣ ≤ ∥ h ∥ 、∣ θ 2 k ∣ ≤ ∥ h ∥ |\theta_2 k| \le \|\boldsymbol h\| ∣ θ 2 k ∣ ≤ ∥ h ∥ ですから、h → 0 \boldsymbol h \to \boldsymbol 0 h → 0 のとき点 ( a + θ 1 h , b + k ) (a+\theta_1h, b+k) ( a + θ 1 h , b + k ) と ( a , b + θ 2 k ) (a, b+\theta_2k) ( a , b + θ 2 k ) はともに a \boldsymbol a a に収束します。仮定より f x , f y f_x, f_y f x , f y は a \boldsymbol a a で連続なので ε 1 ( h ) → 0 \varepsilon_1(\boldsymbol h) \to 0 ε 1 ( h ) → 0 、ε 2 ( h ) → 0 \varepsilon_2(\boldsymbol h) \to 0 ε 2 ( h ) → 0 です。よって ∣ h ∣ , ∣ k ∣ ≤ ∥ h ∥ |h|,|k| \le \|\boldsymbol h\| ∣ h ∣ , ∣ k ∣ ≤ ∥ h ∥ を使って
∣ f ( a + h ) − f ( a ) − f x ( a ) h − f y ( a ) k ∣ ∥ h ∥ ≤ ∣ ε 1 ( h ) ∣ + ∣ ε 2 ( h ) ∣ ⟶ 0 \frac{\bigl|f(\boldsymbol a+\boldsymbol h) - f(\boldsymbol a) - f_x(\boldsymbol a)h - f_y(\boldsymbol a)k\bigr|}{\|\boldsymbol h\|} \le |\varepsilon_1(\boldsymbol h)| + |\varepsilon_2(\boldsymbol h)| \longrightarrow 0 ∥ h ∥ f ( a + h ) − f ( a ) − f x ( a ) h − f y ( a ) k ≤ ∣ ε 1 ( h ) ∣ + ∣ ε 2 ( h ) ∣ ⟶ 0 となり、Definition 4.1 の条件が ( p , q ) = ( f x ( a ) , f y ( a ) ) (p,q) = (f_x(\boldsymbol a), f_y(\boldsymbol a)) ( p , q ) = ( f x ( a ) , f y ( a )) で成り立ちます。
∎ 以上で 4 つの条件の関係が出そろいました。
flowchart TD
A["C1 級:f_x, f_y が a の近傍で存在し a で連続"] ==> B["a で全微分可能"]
B ==> C["a で偏微分可能"]
B ==> D["a で連続"] 4 つの条件の含意。矢印はすべて一方向で、逆向きはいずれも成り立ちません
主張 その逆が成り立たない反例 全微分可能 ⇒ \Rightarrow ⇒ 偏微分可能 f ( x , y ) = x y / ( x 2 + y 2 ) f(x,y)=xy/(x^2+y^2) f ( x , y ) = x y / ( x 2 + y 2 ) (原点では 0 0 0 )。原点で偏微分可能だが連続ですらない(Example 3.2 )全微分可能 ⇒ \Rightarrow ⇒ 連続 f ( x , y ) = ∣ x y ∣ f(x,y)=\sqrt{\lvert xy\rvert} f ( x , y ) = ∣ x y ∣ 。原点で連続かつ偏微分可能だが全微分可能でない(Example 4.4 )C 1 C^1 C 1 級 ⇒ \Rightarrow ⇒ 全微分可能f ( x , y ) = r 2 sin ( 1 / r ) f(x,y)=r^2\sin(1/r) f ( x , y ) = r 2 sin ( 1/ r ) 。原点で全微分可能だが f x f_x f x が原点で不連続(Remark 4.6 )
全微分可能性の定義は、そのまま「接平面が引ける」という幾何的条件です。
Definition 5.1 (接平面 )
f f f が a = ( a , b ) \boldsymbol a = (a,b) a = ( a , b ) で全微分可能であるとき、R 3 \mathbb{R}^3 R 3 の平面
z = f ( a , b ) + f x ( a , b ) ( x − a ) + f y ( a , b ) ( y − b ) z = f(a,b) + f_x(a,b)\,(x-a) + f_y(a,b)\,(y-b) z = f ( a , b ) + f x ( a , b ) ( x − a ) + f y ( a , b ) ( y − b ) を、グラフ G f G_f G f の点 ( a , b , f ( a , b ) ) (a,b,f(a,b)) ( a , b , f ( a , b )) における接平面 と呼びます。
接平面の方程式は z − f ( a , b ) = ⟨ ∇ f ( a , b ) , ( x − a , y − b ) ⟩ z - f(a,b) = \langle \nabla f(a,b), (x-a, y-b)\rangle z − f ( a , b ) = ⟨ ∇ f ( a , b ) , ( x − a , y − b )⟩ と書けるので、法線ベクトルは ( f x ( a , b ) , f y ( a , b ) , − 1 ) (f_x(a,b),\, f_y(a,b),\, -1) ( f x ( a , b ) , f y ( a , b ) , − 1 ) です。
Example 5.3 (接平面による一次近似の精度 )
f ( x , y ) = x 2 + y 2 f(x,y) = \sqrt{x^2+y^2} f ( x , y ) = x 2 + y 2 の点 ( 3 , 4 ) (3,4) ( 3 , 4 ) における接平面を求め、3.02 2 + 3.96 2 \sqrt{3.02^2 + 3.96^2} 3.0 2 2 + 3.9 6 2 を近似します。
f f f は原点以外で C 1 C^1 C 1 級です。実際
f x = x x 2 + y 2 , f y = y x 2 + y 2 f_x = \frac{x}{\sqrt{x^2+y^2}}, \qquad f_y = \frac{y}{\sqrt{x^2+y^2}} f x = x 2 + y 2 x , f y = x 2 + y 2 y は原点を除いて連続なので、Theorem 4.5 より ( 3 , 4 ) (3,4) ( 3 , 4 ) で全微分可能です。f ( 3 , 4 ) = 5 f(3,4) = 5 f ( 3 , 4 ) = 5 、f x ( 3 , 4 ) = 3 / 5 = 0.6 f_x(3,4) = 3/5 = 0.6 f x ( 3 , 4 ) = 3/5 = 0.6 、f y ( 3 , 4 ) = 4 / 5 = 0.8 f_y(3,4) = 4/5 = 0.8 f y ( 3 , 4 ) = 4/5 = 0.8 なので接平面は
z = 5 + 0.6 ( x − 3 ) + 0.8 ( y − 4 ) . z = 5 + 0.6(x-3) + 0.8(y-4). z = 5 + 0.6 ( x − 3 ) + 0.8 ( y − 4 ) . ( x , y ) = ( 3.02 , 3.96 ) (x,y) = (3.02, 3.96) ( x , y ) = ( 3.02 , 3.96 ) を代入すると
z = 5 + 0.6 × 0.02 + 0.8 × ( − 0.04 ) = 5 + 0.012 − 0.032 = 4.980. z = 5 + 0.6 \times 0.02 + 0.8 \times (-0.04) = 5 + 0.012 - 0.032 = 4.980 . z = 5 + 0.6 × 0.02 + 0.8 × ( − 0.04 ) = 5 + 0.012 − 0.032 = 4.980. 真の値は 9.1204 + 15.6816 = 24.802 = 4.98016 … \sqrt{9.1204 + 15.6816} = \sqrt{24.802} = 4.98016\ldots 9.1204 + 15.6816 = 24.802 = 4.98016 … です。誤差は約 1.6 × 10 − 4 1.6\times 10^{-4} 1.6 × 1 0 − 4 、変位の大きさは ∥ h ∥ = 0.02 2 + 0.04 2 ≈ 0.0447 \|\boldsymbol h\| = \sqrt{0.02^2+0.04^2} \approx 0.0447 ∥ h ∥ = 0.0 2 2 + 0.0 4 2 ≈ 0.0447 ですから、誤差は ∥ h ∥ \|\boldsymbol h\| ∥ h ∥ の約 0.36 % 0.36\% 0.36% 、∥ h ∥ 2 ≈ 0.002 \|\boldsymbol h\|^2 \approx 0.002 ∥ h ∥ 2 ≈ 0.002 の約 8 % 8\% 8% です。誤差が ∥ h ∥ \|\boldsymbol h\| ∥ h ∥ ではなく ∥ h ∥ 2 \|\boldsymbol h\|^2 ∥ h ∥ 2 の程度になっているのは偶然ではなく、Theorem 7.4 で説明がつきます。
Proposition 5.4 (勾配は最急上昇方向を指す )
f f f が a \boldsymbol a a で全微分可能で ∇ f ( a ) ≠ 0 \nabla f(\boldsymbol a) \ne \boldsymbol 0 ∇ f ( a ) = 0 とします。単位ベクトル u \boldsymbol u u を動かすとき、方向微分係数 D u f ( a ) D_{\boldsymbol u}f(\boldsymbol a) D u f ( a ) は
u = ∇ f ( a ) ∥ ∇ f ( a ) ∥ のとき最大値 ∥ ∇ f ( a ) ∥ \boldsymbol u = \frac{\nabla f(\boldsymbol a)}{\|\nabla f(\boldsymbol a)\|} \quad \text{のとき最大値} \ \ \|\nabla f(\boldsymbol a)\| u = ∥∇ f ( a ) ∥ ∇ f ( a ) のとき最大値 ∥∇ f ( a ) ∥ を取り、その逆向きのとき最小値 − ∥ ∇ f ( a ) ∥ -\|\nabla f(\boldsymbol a)\| − ∥∇ f ( a ) ∥ を取ります。また D u f ( a ) = 0 D_{\boldsymbol u} f(\boldsymbol a) = 0 D u f ( a ) = 0 となるのは u \boldsymbol u u が ∇ f ( a ) \nabla f(\boldsymbol a) ∇ f ( a ) と直交するとき、かつそのときに限ります。
Proof(Proposition 5.4) Proposition 4.3 (2) より D u f ( a ) = ⟨ ∇ f ( a ) , u ⟩ D_{\boldsymbol u}f(\boldsymbol a) = \langle \nabla f(\boldsymbol a), \boldsymbol u\rangle D u f ( a ) = ⟨ ∇ f ( a ) , u ⟩ です。コーシー・シュワルツの不等式より
∣ ⟨ ∇ f ( a ) , u ⟩ ∣ ≤ ∥ ∇ f ( a ) ∥ ∥ u ∥ = ∥ ∇ f ( a ) ∥ |\langle \nabla f(\boldsymbol a), \boldsymbol u\rangle| \le \|\nabla f(\boldsymbol a)\|\,\|\boldsymbol u\| = \|\nabla f(\boldsymbol a)\| ∣ ⟨ ∇ f ( a ) , u ⟩ ∣ ≤ ∥∇ f ( a ) ∥ ∥ u ∥ = ∥∇ f ( a ) ∥ であり、等号成立は u \boldsymbol u u と ∇ f ( a ) \nabla f(\boldsymbol a) ∇ f ( a ) が平行なとき、かつそのときに限ります。∥ u ∥ = 1 \|\boldsymbol u\|=1 ∥ u ∥ = 1 という制約のもとで平行なベクトルは u = ± ∇ f ( a ) / ∥ ∇ f ( a ) ∥ \boldsymbol u = \pm \nabla f(\boldsymbol a)/\|\nabla f(\boldsymbol a)\| u = ± ∇ f ( a ) /∥∇ f ( a ) ∥ の 2 つで、+ + + のとき内積は ∥ ∇ f ( a ) ∥ \|\nabla f(\boldsymbol a)\| ∥∇ f ( a ) ∥ (最大)、− - − のとき − ∥ ∇ f ( a ) ∥ -\|\nabla f(\boldsymbol a)\| − ∥∇ f ( a ) ∥ (最小)です。最後の主張は内積が 0 0 0 であることの言い換えです。
∎ この命題は、勾配降下法をはじめとする最適化手法が「− ∇ f -\nabla f − ∇ f の向きに進む」理由そのものです。また、f f f が C 1 C^1 C 1 級で ∇ f ( a ) ≠ 0 \nabla f(\boldsymbol a) \ne \boldsymbol 0 ∇ f ( a ) = 0 のとき、a \boldsymbol a a を通る等高線に沿って動く曲線 γ \gamma γ を取ると f ( γ ( t ) ) f(\gamma(t)) f ( γ ( t )) は定数なので、次節の連鎖律から ⟨ ∇ f , γ ′ ⟩ = 0 \langle \nabla f, \gamma'\rangle = 0 ⟨ ∇ f , γ ′ ⟩ = 0 、すなわち勾配は等高線に直交します 。等高線が混んでいる場所ほど ∥ ∇ f ∥ \|\nabla f\| ∥∇ f ∥ が大きい、という地形図の直観はこれで正当化されます。
Theorem 6.1 (連鎖律(曲線に沿った微分) )
I ⊂ R I \subset \mathbb{R} I ⊂ R を開区間、γ : I → U \gamma: I \to U γ : I → U 、γ ( t ) = ( x ( t ) , y ( t ) ) \gamma(t) = (x(t), y(t)) γ ( t ) = ( x ( t ) , y ( t )) とし、x , y x, y x , y は t 0 ∈ I t_0 \in I t 0 ∈ I で微分可能とします。さらに f : U → R f: U \to \mathbb{R} f : U → R が a = γ ( t 0 ) \boldsymbol a = \gamma(t_0) a = γ ( t 0 ) で全微分可能とします。このとき合成 g = f ∘ γ g = f \circ \gamma g = f ∘ γ は t 0 t_0 t 0 で微分可能で
g ′ ( t 0 ) = f x ( a ) x ′ ( t 0 ) + f y ( a ) y ′ ( t 0 ) = ⟨ ∇ f ( a ) , γ ′ ( t 0 ) ⟩ g'(t_0) = f_x(\boldsymbol a)\, x'(t_0) + f_y(\boldsymbol a)\, y'(t_0) = \langle \nabla f(\boldsymbol a), \gamma'(t_0)\rangle g ′ ( t 0 ) = f x ( a ) x ′ ( t 0 ) + f y ( a ) y ′ ( t 0 ) = ⟨ ∇ f ( a ) , γ ′ ( t 0 )⟩ が成り立ちます。
Proof(Theorem 6.1) 誤差項を扱いやすくするため、h ≠ 0 \boldsymbol h \ne \boldsymbol 0 h = 0 に対し
E ( h ) = f ( a + h ) − f ( a ) − ⟨ ∇ f ( a ) , h ⟩ ∥ h ∥ , E ( 0 ) = 0 E(\boldsymbol h) = \frac{f(\boldsymbol a+\boldsymbol h) - f(\boldsymbol a) - \langle \nabla f(\boldsymbol a), \boldsymbol h\rangle}{\|\boldsymbol h\|}, \qquad E(\boldsymbol 0) = 0 E ( h ) = ∥ h ∥ f ( a + h ) − f ( a ) − ⟨ ∇ f ( a ) , h ⟩ , E ( 0 ) = 0 と定めます。Definition 4.1 と Proposition 4.3 (2) より E E E は 0 \boldsymbol 0 0 で連続で、すべての h \boldsymbol h h について
f ( a + h ) − f ( a ) = ⟨ ∇ f ( a ) , h ⟩ + E ( h ) ∥ h ∥ f(\boldsymbol a + \boldsymbol h) - f(\boldsymbol a) = \langle \nabla f(\boldsymbol a), \boldsymbol h\rangle + E(\boldsymbol h)\,\|\boldsymbol h\| f ( a + h ) − f ( a ) = ⟨ ∇ f ( a ) , h ⟩ + E ( h ) ∥ h ∥ が成り立ちます(h = 0 \boldsymbol h = \boldsymbol 0 h = 0 でも両辺 0 0 0 で成立)。
t ≠ t 0 t \ne t_0 t = t 0 に対し h ( t ) = γ ( t ) − γ ( t 0 ) \boldsymbol h(t) = \gamma(t) - \gamma(t_0) h ( t ) = γ ( t ) − γ ( t 0 ) と置くと、上式から
g ( t ) − g ( t 0 ) t − t 0 = ⟨ ∇ f ( a ) , h ( t ) t − t 0 ⟩ + E ( h ( t ) ) ⋅ ∥ h ( t ) ∥ ∣ t − t 0 ∣ ⋅ sgn ( t − t 0 ) \frac{g(t)-g(t_0)}{t-t_0} = \Bigl\langle \nabla f(\boldsymbol a),\ \frac{\boldsymbol h(t)}{t-t_0}\Bigr\rangle + E(\boldsymbol h(t))\cdot\frac{\|\boldsymbol h(t)\|}{|t-t_0|}\cdot \operatorname{sgn}(t-t_0) t − t 0 g ( t ) − g ( t 0 ) = ⟨ ∇ f ( a ) , t − t 0 h ( t ) ⟩ + E ( h ( t )) ⋅ ∣ t − t 0 ∣ ∥ h ( t ) ∥ ⋅ sgn ( t − t 0 ) となります。x , y x,y x , y が t 0 t_0 t 0 で微分可能なので h ( t ) t − t 0 → ( x ′ ( t 0 ) , y ′ ( t 0 ) ) = γ ′ ( t 0 ) \frac{\boldsymbol h(t)}{t-t_0} \to (x'(t_0), y'(t_0)) = \gamma'(t_0) t − t 0 h ( t ) → ( x ′ ( t 0 ) , y ′ ( t 0 )) = γ ′ ( t 0 ) であり、第 1 項は内積の連続性より ⟨ ∇ f ( a ) , γ ′ ( t 0 ) ⟩ \langle \nabla f(\boldsymbol a), \gamma'(t_0)\rangle ⟨ ∇ f ( a ) , γ ′ ( t 0 )⟩ に収束します。
第 2 項を評価します。∥ h ( t ) ∥ ∣ t − t 0 ∣ = ∥ h ( t ) t − t 0 ∥ → ∥ γ ′ ( t 0 ) ∥ \frac{\|\boldsymbol h(t)\|}{|t-t_0|} = \left\|\frac{\boldsymbol h(t)}{t-t_0}\right\| \to \|\gamma'(t_0)\| ∣ t − t 0 ∣ ∥ h ( t ) ∥ = t − t 0 h ( t ) → ∥ γ ′ ( t 0 ) ∥ なので、この量は t 0 t_0 t 0 の近くで有界です。一方 x , y x,y x , y は t 0 t_0 t 0 で微分可能ゆえ連続なので h ( t ) → 0 \boldsymbol h(t) \to \boldsymbol 0 h ( t ) → 0 であり、E E E の 0 \boldsymbol 0 0 での連続性から E ( h ( t ) ) → E ( 0 ) = 0 E(\boldsymbol h(t)) \to E(\boldsymbol 0) = 0 E ( h ( t )) → E ( 0 ) = 0 です。有界量と 0 0 0 に収束する量の積は 0 0 0 に収束するので、第 2 項は 0 0 0 に収束します。
以上より g ′ ( t 0 ) g'(t_0) g ′ ( t 0 ) が存在して ⟨ ∇ f ( a ) , γ ′ ( t 0 ) ⟩ \langle \nabla f(\boldsymbol a), \gamma'(t_0)\rangle ⟨ ∇ f ( a ) , γ ′ ( t 0 )⟩ に等しいことが示されました。
∎ 偏導関数 f x , f y f_x, f_y f x , f y がまた U U U 上の関数なので、これらをさらに偏微分できます。記号は
f x y = ∂ 2 f ∂ y ∂ x = ∂ ∂ y ( ∂ f ∂ x ) f_{xy} = \frac{\partial^2 f}{\partial y\,\partial x} = \frac{\partial}{\partial y}\left(\frac{\partial f}{\partial x}\right) f x y = ∂ y ∂ x ∂ 2 f = ∂ y ∂ ( ∂ x ∂ f ) と約束します(先に x x x 、次に y y y )。f x x , f y x , f y y f_{xx}, f_{yx}, f_{yy} f xx , f y x , f y y も同様です。2 階までのすべての偏導関数が存在して連続なとき f f f は C 2 C^2 C 2 級であるといいます。
Theorem 7.1 (シュワルツの定理(偏微分の順序交換) )
U U U を開集合、f : U → R f: U \to \mathbb{R} f : U → R 、a ∈ U \boldsymbol a \in U a ∈ U とします。f x , f y , f x y , f y x f_x, f_y, f_{xy}, f_{yx} f x , f y , f x y , f y x が a \boldsymbol a a のある近傍で存在し、f x y f_{xy} f x y と f y x f_{yx} f y x が a \boldsymbol a a で連続であるとします。このとき
f x y ( a ) = f y x ( a ) f_{xy}(\boldsymbol a) = f_{yx}(\boldsymbol a) f x y ( a ) = f y x ( a ) が成り立ちます。とくに f f f が C 2 C^2 C 2 級ならば、2 階偏導関数は微分の順序に依りません。
C 2 C^2 C 2 級のとき、2 階偏導関数を並べた対称行列
H f ( a ) = ( f x x ( a ) f x y ( a ) f y x ( a ) f y y ( a ) ) = ( f x x ( a ) f x y ( a ) f x y ( a ) f y y ( a ) ) H_f(\boldsymbol a) = \begin{pmatrix} f_{xx}(\boldsymbol a) & f_{xy}(\boldsymbol a) \\ f_{yx}(\boldsymbol a) & f_{yy}(\boldsymbol a)\end{pmatrix} = \begin{pmatrix} f_{xx}(\boldsymbol a) & f_{xy}(\boldsymbol a) \\ f_{xy}(\boldsymbol a) & f_{yy}(\boldsymbol a)\end{pmatrix} H f ( a ) = ( f xx ( a ) f y x ( a ) f x y ( a ) f y y ( a ) ) = ( f xx ( a ) f x y ( a ) f x y ( a ) f y y ( a ) ) をヘッセ行列 と呼びます(対称性は Theorem 7.1 によります)。
Definition 7.3 (ヘッセ行列・臨界点・極値 )
f f f を U U U 上 C 2 C^2 C 2 級とします。上の行列 H f ( a ) H_f(\boldsymbol a) H f ( a ) を a \boldsymbol a a におけるヘッセ行列 と呼びます。また ∇ f ( a ) = 0 \nabla f(\boldsymbol a) = \boldsymbol 0 ∇ f ( a ) = 0 を満たす点 a \boldsymbol a a を 臨界点 (停留点)と呼びます。
f f f が a \boldsymbol a a で極大 であるとは、ある δ > 0 \delta>0 δ > 0 が存在して x ∈ B ( a , δ ) \boldsymbol x \in B(\boldsymbol a,\delta) x ∈ B ( a , δ ) ならば f ( x ) ≤ f ( a ) f(\boldsymbol x) \le f(\boldsymbol a) f ( x ) ≤ f ( a ) となることをいいます(不等号を逆にすれば極小)。x ≠ a \boldsymbol x \ne \boldsymbol a x = a で不等号が真に成り立つときは狭義 の極大・極小といいます。極大でも極小でもない臨界点を鞍点 と呼びます。
f f f が a \boldsymbol a a で全微分可能かつ極値を取るなら ∇ f ( a ) = 0 \nabla f(\boldsymbol a) = \boldsymbol 0 ∇ f ( a ) = 0 です。実際、t ↦ f ( a + t u ) t \mapsto f(\boldsymbol a + t\boldsymbol u) t ↦ f ( a + t u ) は t = 0 t=0 t = 0 で 1 変数関数として極値を取るので、フェルマーの補題(Lemma 2.5)[Mean Value Theorems and Taylor's Theorem] により微分係数 D u f ( a ) D_{\boldsymbol u}f(\boldsymbol a) D u f ( a ) は 0 0 0 になり、u = ( 1 , 0 ) , ( 0 , 1 ) \boldsymbol u=(1,0),(0,1) u = ( 1 , 0 ) , ( 0 , 1 ) を取れば f x ( a ) = f y ( a ) = 0 f_x(\boldsymbol a)=f_y(\boldsymbol a)=0 f x ( a ) = f y ( a ) = 0 です。したがって極値の候補は臨界点に限られます。問題は、臨界点が極大か極小か鞍点かをどう見分けるかです。
Theorem 7.4 (2 変数のテイラーの定理(2 次まで) )
f f f を開集合 U U U 上の C 2 C^2 C 2 級関数、a ∈ U \boldsymbol a \in U a ∈ U とし、B ( a , r ) ⊂ U B(\boldsymbol a, r) \subset U B ( a , r ) ⊂ U とします。∥ h ∥ < r \|\boldsymbol h\| < r ∥ h ∥ < r なる h = ( h , k ) \boldsymbol h = (h,k) h = ( h , k ) に対し次が成り立ちます。
(ラグランジュ剰余)ある θ ∈ ( 0 , 1 ) \theta \in (0,1) θ ∈ ( 0 , 1 ) が存在して
f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 1 2 h T H f ( a + θ h ) h . f(\boldsymbol a+\boldsymbol h) = f(\boldsymbol a) + \langle \nabla f(\boldsymbol a), \boldsymbol h\rangle + \frac{1}{2}\,\boldsymbol h^{\mathsf{T}} H_f(\boldsymbol a + \theta\boldsymbol h)\, \boldsymbol h . f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 2 1 h T H f ( a + θ h ) h .
(ペアノ剰余)h → 0 \boldsymbol h \to \boldsymbol 0 h → 0 のとき
f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 1 2 h T H f ( a ) h + o ( ∥ h ∥ 2 ) . f(\boldsymbol a+\boldsymbol h) = f(\boldsymbol a) + \langle \nabla f(\boldsymbol a), \boldsymbol h\rangle + \frac{1}{2}\,\boldsymbol h^{\mathsf{T}} H_f(\boldsymbol a)\, \boldsymbol h + o(\|\boldsymbol h\|^2). f ( a + h ) = f ( a ) + ⟨ ∇ f ( a ) , h ⟩ + 2 1 h T H f ( a ) h + o ( ∥ h ∥ 2 ) . ここで h T H h = f x x h 2 + 2 f x y h k + f y y k 2 \boldsymbol h^{\mathsf{T}} H \boldsymbol h = f_{xx}h^2 + 2f_{xy}hk + f_{yy}k^2 h T H h = f xx h 2 + 2 f x y hk + f y y k 2 です。
Proof(Theorem 7.4) (1) φ ( t ) = f ( a + t h ) \varphi(t) = f(\boldsymbol a + t\boldsymbol h) φ ( t ) = f ( a + t h ) と置きます。開球は凸なので t ∈ [ 0 , 1 ] t \in [0,1] t ∈ [ 0 , 1 ] に対し a + t h ∈ B ( a , r ) ⊂ U \boldsymbol a + t\boldsymbol h \in B(\boldsymbol a,r) \subset U a + t h ∈ B ( a , r ) ⊂ U であり、φ \varphi φ は [ 0 , 1 ] [0,1] [ 0 , 1 ] を含む開区間で定義されます。C 2 C^2 C 2 級の仮定と Theorem 4.5 により f f f も f x f_x f x も f y f_y f y も全微分可能なので、Theorem 6.1 を曲線 γ ( t ) = a + t h \gamma(t) = \boldsymbol a + t\boldsymbol h γ ( t ) = a + t h (γ ′ ( t ) = h \gamma'(t) = \boldsymbol h γ ′ ( t ) = h )に適用できて
φ ′ ( t ) = f x ( a + t h ) h + f y ( a + t h ) k . \varphi'(t) = f_x(\boldsymbol a+t\boldsymbol h)\,h + f_y(\boldsymbol a+t\boldsymbol h)\,k . φ ′ ( t ) = f x ( a + t h ) h + f y ( a + t h ) k . もう一度、今度は f x f_x f x と f y f_y f y に Theorem 6.1 を適用すると
φ ′ ′ ( t ) = [ f x x h + f x y k ] h + [ f y x h + f y y k ] k = f x x h 2 + 2 f x y h k + f y y k 2 \varphi''(t) = \bigl[f_{xx}h + f_{xy}k\bigr]h + \bigl[f_{yx}h + f_{yy}k\bigr]k = f_{xx}h^2 + 2f_{xy}hk + f_{yy}k^2 φ ′′ ( t ) = [ f xx h + f x y k ] h + [ f y x h + f y y k ] k = f xx h 2 + 2 f x y hk + f y y k 2 (すべて a + t h \boldsymbol a + t\boldsymbol h a + t h での値、最後の等号で Theorem 7.1 を使いました)。すなわち φ ′ ′ ( t ) = h T H f ( a + t h ) h \varphi''(t) = \boldsymbol h^{\mathsf{T}}H_f(\boldsymbol a+t\boldsymbol h)\boldsymbol h φ ′′ ( t ) = h T H f ( a + t h ) h であり、これは t t t の連続関数です。
1 変数のテイラーの定理(平均値の定理とテイラーの定理 の テイラーの定理(ラグランジュの剰余)(Theorem 5.3)[Mean Value Theorems and Taylor's Theorem] )を φ \varphi φ に n = 1 n=1 n = 1 次まで適用すると、ある θ ∈ ( 0 , 1 ) \theta \in (0,1) θ ∈ ( 0 , 1 ) が存在して
φ ( 1 ) = φ ( 0 ) + φ ′ ( 0 ) + 1 2 φ ′ ′ ( θ ) \varphi(1) = \varphi(0) + \varphi'(0) + \frac{1}{2}\varphi''(\theta) φ ( 1 ) = φ ( 0 ) + φ ′ ( 0 ) + 2 1 φ ′′ ( θ ) です。φ ( 1 ) = f ( a + h ) \varphi(1) = f(\boldsymbol a+\boldsymbol h) φ ( 1 ) = f ( a + h ) 、φ ( 0 ) = f ( a ) \varphi(0)=f(\boldsymbol a) φ ( 0 ) = f ( a ) 、φ ′ ( 0 ) = ⟨ ∇ f ( a ) , h ⟩ \varphi'(0) = \langle \nabla f(\boldsymbol a),\boldsymbol h\rangle φ ′ ( 0 ) = ⟨ ∇ f ( a ) , h ⟩ を代入すれば (1) を得ます。
(2) (1) の右辺から 1 2 h T H f ( a ) h \frac12 \boldsymbol h^{\mathsf{T}}H_f(\boldsymbol a)\boldsymbol h 2 1 h T H f ( a ) h を引いた差は
1 2 h T [ H f ( a + θ h ) − H f ( a ) ] h \frac{1}{2}\boldsymbol h^{\mathsf{T}}\bigl[H_f(\boldsymbol a+\theta\boldsymbol h) - H_f(\boldsymbol a)\bigr]\boldsymbol h 2 1 h T [ H f ( a + θ h ) − H f ( a ) ] h です。この角括弧の行列の成分を m i j m_{ij} m ij 、M ( h ) = max i , j ∣ m i j ∣ M(\boldsymbol h) = \max_{i,j}|m_{ij}| M ( h ) = max i , j ∣ m ij ∣ と書くと、∣ h ∣ , ∣ k ∣ ≤ ∥ h ∥ |h|,|k| \le \|\boldsymbol h\| ∣ h ∣ , ∣ k ∣ ≤ ∥ h ∥ より
∣ h T [ ⋅ ] h ∣ ≤ ∑ i , j ∣ m i j ∣ ∣ h i ∣ ∣ h j ∣ ≤ 4 M ( h ) ∥ h ∥ 2 . \bigl|\boldsymbol h^{\mathsf{T}}[\,\cdot\,]\boldsymbol h\bigr| \le \sum_{i,j} |m_{ij}|\,|h_i|\,|h_j| \le 4\,M(\boldsymbol h)\,\|\boldsymbol h\|^2 . h T [ ⋅ ] h ≤ i , j ∑ ∣ m ij ∣ ∣ h i ∣ ∣ h j ∣ ≤ 4 M ( h ) ∥ h ∥ 2 . ∥ θ h ∥ ≤ ∥ h ∥ → 0 \|\theta \boldsymbol h\| \le \|\boldsymbol h\| \to 0 ∥ θ h ∥ ≤ ∥ h ∥ → 0 と 2 階偏導関数の a \boldsymbol a a での連続性より M ( h ) → 0 M(\boldsymbol h) \to 0 M ( h ) → 0 ですから、この差は o ( ∥ h ∥ 2 ) o(\|\boldsymbol h\|^2) o ( ∥ h ∥ 2 ) です。
∎ Example 7.5 (exp(x)cos y の原点まわりの 2 次近似 )
f ( x , y ) = e x cos y f(x,y) = e^x\cos y f ( x , y ) = e x cos y を原点のまわりで 2 次まで展開します。f f f は C ∞ C^\infty C ∞ 級です。
f x = e x cos y , f y = − e x sin y , f x x = e x cos y , f x y = − e x sin y , f y y = − e x cos y . \begin{aligned}
f_x &= e^x\cos y, & f_y &= -e^x\sin y,\\
f_{xx} &= e^x\cos y, & f_{xy} &= -e^x\sin y, & f_{yy} &= -e^x\cos y .
\end{aligned} f x f xx = e x cos y , = e x cos y , f y f x y = − e x sin y , = − e x sin y , f y y = − e x cos y . 原点で値を取ると f ( 0 , 0 ) = 1 f(0,0)=1 f ( 0 , 0 ) = 1 、∇ f ( 0 , 0 ) = ( 1 , 0 ) \nabla f(0,0) = (1,0) ∇ f ( 0 , 0 ) = ( 1 , 0 ) 、H f ( 0 , 0 ) = ( 1 0 0 − 1 ) H_f(0,0) = \begin{pmatrix} 1 & 0\\ 0 & -1\end{pmatrix} H f ( 0 , 0 ) = ( 1 0 0 − 1 ) です。Theorem 7.4 (2) より
e x cos y = 1 + x + 1 2 ( x 2 − y 2 ) + o ( x 2 + y 2 ) . e^x\cos y = 1 + x + \frac{1}{2}\bigl(x^2 - y^2\bigr) + o(x^2+y^2). e x cos y = 1 + x + 2 1 ( x 2 − y 2 ) + o ( x 2 + y 2 ) . 検算しましょう。1 変数の展開 e x = 1 + x + x 2 2 + o ( x 2 ) e^x = 1 + x + \frac{x^2}{2} + o(x^2) e x = 1 + x + 2 x 2 + o ( x 2 ) 、cos y = 1 − y 2 2 + o ( y 2 ) \cos y = 1 - \frac{y^2}{2}+o(y^2) cos y = 1 − 2 y 2 + o ( y 2 ) を掛け合わせて 2 次までを残すと
( 1 + x + x 2 2 ) ( 1 − y 2 2 ) = 1 + x + x 2 2 − y 2 2 + ( 3 次以上 ) \Bigl(1+x+\frac{x^2}{2}\Bigr)\Bigl(1-\frac{y^2}{2}\Bigr) = 1 + x + \frac{x^2}{2} - \frac{y^2}{2} + (\text{3 次以上}) ( 1 + x + 2 x 2 ) ( 1 − 2 y 2 ) = 1 + x + 2 x 2 − 2 y 2 + ( 3 次以上 ) となり一致します。なお f x x + f y y = 0 f_{xx}+f_{yy} = 0 f xx + f y y = 0 であり、e x cos y = Re ( e x + i y ) e^x\cos y = \operatorname{Re}(e^{x+iy}) e x cos y = Re ( e x + i y ) が調和関数であることが 2 次項の形(x 2 x^2 x 2 と y 2 y^2 y 2 の係数が符号だけ違う)に現れています。
臨界点 a \boldsymbol a a では ∇ f ( a ) = 0 \nabla f(\boldsymbol a) = \boldsymbol 0 ∇ f ( a ) = 0 なので、Theorem 7.4 (2) は
f ( a + h ) − f ( a ) = 1 2 h T H f ( a ) h + o ( ∥ h ∥ 2 ) f(\boldsymbol a + \boldsymbol h) - f(\boldsymbol a) = \frac{1}{2}\boldsymbol h^{\mathsf{T}}H_f(\boldsymbol a)\boldsymbol h + o(\|\boldsymbol h\|^2) f ( a + h ) − f ( a ) = 2 1 h T H f ( a ) h + o ( ∥ h ∥ 2 ) となります。増減を決めるのは 2 次形式 Q ( h ) = h T H f ( a ) h Q(\boldsymbol h) = \boldsymbol h^{\mathsf{T}}H_f(\boldsymbol a)\boldsymbol h Q ( h ) = h T H f ( a ) h の符号です。そこでまず 2 次形式を分類します。
Lemma 8.1 (2 変数 2 次形式の符号 )
実数 A , B , C A,B,C A , B , C に対し Q ( h , k ) = A h 2 + 2 B h k + C k 2 Q(h,k) = Ah^2 + 2Bhk + Ck^2 Q ( h , k ) = A h 2 + 2 B hk + C k 2 と置き、Δ = A C − B 2 \Delta = AC - B^2 Δ = A C − B 2 とします。
Δ > 0 \Delta > 0 Δ > 0 かつ A > 0 A > 0 A > 0 ならば、( h , k ) ≠ ( 0 , 0 ) (h,k)\ne(0,0) ( h , k ) = ( 0 , 0 ) なるすべての ( h , k ) (h,k) ( h , k ) に対し Q ( h , k ) > 0 Q(h,k) > 0 Q ( h , k ) > 0 (正定値)。
Δ > 0 \Delta > 0 Δ > 0 かつ A < 0 A < 0 A < 0 ならば、同様に常に Q ( h , k ) < 0 Q(h,k) < 0 Q ( h , k ) < 0 (負定値)。
Δ < 0 \Delta < 0 Δ < 0 ならば、Q ( u ) > 0 Q(\boldsymbol u) > 0 Q ( u ) > 0 となる u \boldsymbol u u と Q ( v ) < 0 Q(\boldsymbol v) < 0 Q ( v ) < 0 となる v \boldsymbol v v がともに存在する(不定値)。
なお Δ > 0 \Delta > 0 Δ > 0 のとき A = 0 A = 0 A = 0 はあり得ません(A = 0 A=0 A = 0 なら Δ = − B 2 ≤ 0 \Delta = -B^2 \le 0 Δ = − B 2 ≤ 0 )。
Proof(Lemma 8.1) (1) A ≠ 0 A \ne 0 A = 0 のとき平方完成すると
Q ( h , k ) = A ( h + B A k ) 2 + A C − B 2 A k 2 = A ( h + B A k ) 2 + Δ A k 2 . Q(h,k) = A\Bigl(h + \frac{B}{A}k\Bigr)^2 + \frac{AC-B^2}{A}k^2 = A\Bigl(h+\frac{B}{A}k\Bigr)^2 + \frac{\Delta}{A}k^2 . Q ( h , k ) = A ( h + A B k ) 2 + A A C − B 2 k 2 = A ( h + A B k ) 2 + A Δ k 2 . A > 0 A>0 A > 0 、Δ > 0 \Delta>0 Δ > 0 なら両項とも 0 0 0 以上です。Q ( h , k ) = 0 Q(h,k)=0 Q ( h , k ) = 0 とすると両項がともに 0 0 0 で、第 2 項から k = 0 k=0 k = 0 、これを第 1 項に入れて A h 2 = 0 Ah^2=0 A h 2 = 0 より h = 0 h=0 h = 0 を得ます。よって ( h , k ) ≠ ( 0 , 0 ) (h,k)\ne(0,0) ( h , k ) = ( 0 , 0 ) なら Q ( h , k ) > 0 Q(h,k)>0 Q ( h , k ) > 0 です。
(2) − Q -Q − Q に (1) を適用します。− Q -Q − Q の係数は ( − A , − B , − C ) (-A,-B,-C) ( − A , − B , − C ) で、判別量は ( − A ) ( − C ) − ( − B ) 2 = Δ > 0 (-A)(-C)-(-B)^2 = \Delta > 0 ( − A ) ( − C ) − ( − B ) 2 = Δ > 0 、かつ − A > 0 -A>0 − A > 0 なので − Q -Q − Q は正定値、すなわち Q Q Q は負定値です。
(3) A ≠ 0 A \ne 0 A = 0 のときは u = ( 1 , 0 ) \boldsymbol u = (1,0) u = ( 1 , 0 ) 、v = ( − B , A ) \boldsymbol v = (-B, A) v = ( − B , A ) (A ≠ 0 A\ne0 A = 0 より v ≠ 0 \boldsymbol v \ne \boldsymbol 0 v = 0 )と取ります。
Q ( 1 , 0 ) = A , Q ( − B , A ) = A B 2 − 2 B ⋅ B A + C A 2 = A ( A C − B 2 ) = A Δ . Q(1,0) = A, \qquad Q(-B,A) = AB^2 - 2B\cdot BA + CA^2 = A(AC - B^2) = A\Delta . Q ( 1 , 0 ) = A , Q ( − B , A ) = A B 2 − 2 B ⋅ B A + C A 2 = A ( A C − B 2 ) = A Δ. Δ < 0 \Delta<0 Δ < 0 なので A A A と A Δ A\Delta A Δ は逆符号です。よって A > 0 A>0 A > 0 なら u = ( 1 , 0 ) \boldsymbol u=(1,0) u = ( 1 , 0 ) で正・v = ( − B , A ) \boldsymbol v=(-B,A) v = ( − B , A ) で負、A < 0 A<0 A < 0 なら役割を入れ替えればよく、いずれにせよ正負両方の値を取ります。
A = 0 A = 0 A = 0 のときは Δ = − B 2 < 0 \Delta = -B^2 < 0 Δ = − B 2 < 0 より B ≠ 0 B \ne 0 B = 0 です。Q ( h , 1 ) = 2 B h + C Q(h,1) = 2Bh + C Q ( h , 1 ) = 2 B h + C は h h h の 1 次関数で B ≠ 0 B\ne0 B = 0 ですから、h h h を大きく取れば正、小さく取れば負になります。
∎ Theorem 8.2 (ヘッセ行列による極値判定 )
f f f を開集合 U U U 上の C 2 C^2 C 2 級関数、a ∈ U \boldsymbol a \in U a ∈ U を臨界点(∇ f ( a ) = 0 \nabla f(\boldsymbol a) = \boldsymbol 0 ∇ f ( a ) = 0 )とし、
Δ = det H f ( a ) = f x x ( a ) f y y ( a ) − f x y ( a ) 2 \Delta = \det H_f(\boldsymbol a) = f_{xx}(\boldsymbol a)f_{yy}(\boldsymbol a) - f_{xy}(\boldsymbol a)^2 Δ = det H f ( a ) = f xx ( a ) f y y ( a ) − f x y ( a ) 2 と置きます。
Δ > 0 \Delta > 0 Δ > 0 かつ f x x ( a ) > 0 f_{xx}(\boldsymbol a) > 0 f xx ( a ) > 0 ならば、f f f は a \boldsymbol a a で狭義の極小。
Δ > 0 \Delta > 0 Δ > 0 かつ f x x ( a ) < 0 f_{xx}(\boldsymbol a) < 0 f xx ( a ) < 0 ならば、f f f は a \boldsymbol a a で狭義の極大。
Δ < 0 \Delta < 0 Δ < 0 ならば、a \boldsymbol a a は鞍点(極大でも極小でもない)。
Δ = 0 \Delta = 0 Δ = 0 のときは、この情報だけでは極大・極小・鞍点のいずれとも決まらない。
Proof(Theorem 8.2) Q ( h ) = h T H f ( a ) h Q(\boldsymbol h) = \boldsymbol h^{\mathsf{T}}H_f(\boldsymbol a)\boldsymbol h Q ( h ) = h T H f ( a ) h 、R ( h ) = f ( a + h ) − f ( a ) − 1 2 Q ( h ) R(\boldsymbol h) = f(\boldsymbol a+\boldsymbol h)-f(\boldsymbol a) - \frac12 Q(\boldsymbol h) R ( h ) = f ( a + h ) − f ( a ) − 2 1 Q ( h ) と置きます。a \boldsymbol a a が臨界点なので Theorem 7.4 (2) より R ( h ) = o ( ∥ h ∥ 2 ) R(\boldsymbol h) = o(\|\boldsymbol h\|^2) R ( h ) = o ( ∥ h ∥ 2 ) です。
(1) Lemma 8.1 (1) より Q Q Q は正定値です。単位円 S = { u : ∥ u ∥ = 1 } S = \{\boldsymbol u : \|\boldsymbol u\|=1\} S = { u : ∥ u ∥ = 1 } は R 2 \mathbb{R}^2 R 2 の有界閉集合、Q Q Q は多項式なので連続ですから、最大値・最小値の定理により m = min u ∈ S Q ( u ) m = \min_{\boldsymbol u \in S} Q(\boldsymbol u) m = min u ∈ S Q ( u ) が存在し、正定値性より m > 0 m>0 m > 0 です。Q Q Q は 2 次の同次式(Q ( t h ) = t 2 Q ( h ) Q(t\boldsymbol h) = t^2Q(\boldsymbol h) Q ( t h ) = t 2 Q ( h ) )なので、h ≠ 0 \boldsymbol h \ne \boldsymbol 0 h = 0 に対し
Q ( h ) = ∥ h ∥ 2 Q ( h ∥ h ∥ ) ≥ m ∥ h ∥ 2 . Q(\boldsymbol h) = \|\boldsymbol h\|^2\, Q\!\left(\frac{\boldsymbol h}{\|\boldsymbol h\|}\right) \ge m\|\boldsymbol h\|^2 . Q ( h ) = ∥ h ∥ 2 Q ( ∥ h ∥ h ) ≥ m ∥ h ∥ 2 . 一方 R ( h ) = o ( ∥ h ∥ 2 ) R(\boldsymbol h) = o(\|\boldsymbol h\|^2) R ( h ) = o ( ∥ h ∥ 2 ) より、ε = m / 4 \varepsilon = m/4 ε = m /4 に対しある δ > 0 \delta>0 δ > 0 が存在して 0 < ∥ h ∥ < δ 0 < \|\boldsymbol h\| < \delta 0 < ∥ h ∥ < δ ならば ∣ R ( h ) ∣ ≤ m 4 ∥ h ∥ 2 |R(\boldsymbol h)| \le \frac{m}{4}\|\boldsymbol h\|^2 ∣ R ( h ) ∣ ≤ 4 m ∥ h ∥ 2 です。よってそのような h \boldsymbol h h に対し
f ( a + h ) − f ( a ) = 1 2 Q ( h ) + R ( h ) ≥ m 2 ∥ h ∥ 2 − m 4 ∥ h ∥ 2 = m 4 ∥ h ∥ 2 > 0 f(\boldsymbol a+\boldsymbol h)-f(\boldsymbol a) = \frac{1}{2}Q(\boldsymbol h) + R(\boldsymbol h) \ge \frac{m}{2}\|\boldsymbol h\|^2 - \frac{m}{4}\|\boldsymbol h\|^2 = \frac{m}{4}\|\boldsymbol h\|^2 > 0 f ( a + h ) − f ( a ) = 2 1 Q ( h ) + R ( h ) ≥ 2 m ∥ h ∥ 2 − 4 m ∥ h ∥ 2 = 4 m ∥ h ∥ 2 > 0 となり、B ( a , δ ) B(\boldsymbol a,\delta) B ( a , δ ) 内の a \boldsymbol a a 以外の点では f f f の値が真に大きくなります。すなわち狭義の極小です。
(2) − f -f − f に (1) を適用します。H − f = − H f H_{-f} = -H_f H − f = − H f なので det H − f = ( − 1 ) 2 det H f = Δ > 0 \det H_{-f} = (-1)^2\det H_f = \Delta > 0 det H − f = ( − 1 ) 2 det H f = Δ > 0 、かつ ( − f ) x x = − f x x > 0 (-f)_{xx} = -f_{xx} > 0 ( − f ) xx = − f xx > 0 です。よって − f -f − f は狭義の極小、すなわち f f f は狭義の極大です。
(3) Lemma 8.1 (3) より Q ( u ) > 0 > Q ( v ) Q(\boldsymbol u)>0>Q(\boldsymbol v) Q ( u ) > 0 > Q ( v ) なる u , v \boldsymbol u,\boldsymbol v u , v が取れます。Q Q Q の同次性から u , v \boldsymbol u,\boldsymbol v u , v は単位ベクトルとしてよいです。g ( t ) = f ( a + t u ) g(t) = f(\boldsymbol a+t\boldsymbol u) g ( t ) = f ( a + t u ) と置くと、t ≠ 0 t \ne 0 t = 0 に対し
g ( t ) − g ( 0 ) = t 2 2 Q ( u ) + R ( t u ) , ∣ R ( t u ) ∣ t 2 → 0 ( t → 0 ) g(t)-g(0) = \frac{t^2}{2}Q(\boldsymbol u) + R(t\boldsymbol u), \qquad \frac{|R(t\boldsymbol u)|}{t^2} \to 0 \ (t\to0) g ( t ) − g ( 0 ) = 2 t 2 Q ( u ) + R ( t u ) , t 2 ∣ R ( t u ) ∣ → 0 ( t → 0 ) なので、∣ t ∣ |t| ∣ t ∣ が十分小さければ ∣ R ( t u ) ∣ ≤ t 2 4 Q ( u ) |R(t\boldsymbol u)| \le \frac{t^2}{4}Q(\boldsymbol u) ∣ R ( t u ) ∣ ≤ 4 t 2 Q ( u ) となり g ( t ) − g ( 0 ) ≥ t 2 4 Q ( u ) > 0 g(t)-g(0) \ge \frac{t^2}{4}Q(\boldsymbol u) > 0 g ( t ) − g ( 0 ) ≥ 4 t 2 Q ( u ) > 0 です。同様に v \boldsymbol v v 方向では f ( a + t v ) − f ( a ) < 0 f(\boldsymbol a + t\boldsymbol v) - f(\boldsymbol a) < 0 f ( a + t v ) − f ( a ) < 0 となります。したがって a \boldsymbol a a のどんな近傍にも f f f の値が f ( a ) f(\boldsymbol a) f ( a ) より大きい点と小さい点の両方が存在し、極大でも極小でもありません。
(4) 反例を並べれば十分です。f ( x , y ) = x 4 + y 4 f(x,y)=x^4+y^4 f ( x , y ) = x 4 + y 4 、g ( x , y ) = − ( x 4 + y 4 ) g(x,y)=-(x^4+y^4) g ( x , y ) = − ( x 4 + y 4 ) 、h ( x , y ) = x 4 − y 4 h(x,y)=x^4-y^4 h ( x , y ) = x 4 − y 4 はいずれも原点が臨界点でヘッセ行列は零行列(Δ = 0 \Delta=0 Δ = 0 )ですが、原点はそれぞれ狭義の極小・狭義の極大・鞍点です(h h h は x x x 軸方向で正、y y y 軸方向で負)。
∎ Example 8.3 (臨界点をすべて求めて判定する )
f ( x , y ) = x 3 − 3 x y + y 3 f(x,y) = x^3 - 3xy + y^3 f ( x , y ) = x 3 − 3 x y + y 3 の極値を調べます。f f f は多項式なので C ∞ C^\infty C ∞ 級です。
臨界点。 f x = 3 x 2 − 3 y = 0 f_x = 3x^2 - 3y = 0 f x = 3 x 2 − 3 y = 0 より y = x 2 y = x^2 y = x 2 、f y = − 3 x + 3 y 2 = 0 f_y = -3x + 3y^2 = 0 f y = − 3 x + 3 y 2 = 0 より x = y 2 x = y^2 x = y 2 です。前者を後者に代入して x = x 4 x = x^4 x = x 4 、すなわち x ( x 3 − 1 ) = 0 x(x^3-1) = 0 x ( x 3 − 1 ) = 0 なので x = 0 x = 0 x = 0 または x = 1 x=1 x = 1 です。y = x 2 y=x^2 y = x 2 より臨界点は ( 0 , 0 ) (0,0) ( 0 , 0 ) と ( 1 , 1 ) (1,1) ( 1 , 1 ) の 2 つです。
ヘッセ行列。 f x x = 6 x f_{xx} = 6x f xx = 6 x 、f x y = − 3 f_{xy} = -3 f x y = − 3 、f y y = 6 y f_{yy} = 6y f y y = 6 y なので
H f ( x , y ) = ( 6 x − 3 − 3 6 y ) , Δ ( x , y ) = 36 x y − 9. H_f(x,y) = \begin{pmatrix} 6x & -3 \\ -3 & 6y\end{pmatrix}, \qquad \Delta(x,y) = 36xy - 9 . H f ( x , y ) = ( 6 x − 3 − 3 6 y ) , Δ ( x , y ) = 36 x y − 9. 判定。 ( 0 , 0 ) (0,0) ( 0 , 0 ) では Δ = − 9 < 0 \Delta = -9 < 0 Δ = − 9 < 0 なので Theorem 8.2 (3) より鞍点です。( 1 , 1 ) (1,1) ( 1 , 1 ) では Δ = 36 − 9 = 27 > 0 \Delta = 36-9 = 27 > 0 Δ = 36 − 9 = 27 > 0 かつ f x x ( 1 , 1 ) = 6 > 0 f_{xx}(1,1)=6>0 f xx ( 1 , 1 ) = 6 > 0 なので同 (1) より狭義の極小で、極小値は f ( 1 , 1 ) = 1 − 3 + 1 = − 1 f(1,1) = 1 - 3 + 1 = -1 f ( 1 , 1 ) = 1 − 3 + 1 = − 1 です。
なお f f f は最小値を持ちません。y = 0 y=0 y = 0 とすると f ( x , 0 ) = x 3 → − ∞ f(x,0)=x^3 \to -\infty f ( x , 0 ) = x 3 → − ∞ (x → − ∞ x \to -\infty x → − ∞ )だからです。極小は「近傍で最小」というだけの局所的な性質であることに注意してください。
Δ = 0 \Delta = 0 Δ = 0 の場合が難しいのは、単に判定法が弱いからではありません。次の例は、直線に沿って調べるだけでは極値判定ができないことを示します。
Example 8.4 (どの直線に沿っても極小、しかし極小でない )
f ( x , y ) = ( y − x 2 ) ( y − 2 x 2 ) = y 2 − 3 x 2 y + 2 x 4 f(x,y) = (y-x^2)(y-2x^2) = y^2 - 3x^2y + 2x^4 f ( x , y ) = ( y − x 2 ) ( y − 2 x 2 ) = y 2 − 3 x 2 y + 2 x 4 とします。
臨界点とヘッセ行列。 f x = − 6 x y + 8 x 3 f_x = -6xy + 8x^3 f x = − 6 x y + 8 x 3 、f y = 2 y − 3 x 2 f_y = 2y - 3x^2 f y = 2 y − 3 x 2 より、原点は臨界点です。f x x = − 6 y + 24 x 2 f_{xx} = -6y+24x^2 f xx = − 6 y + 24 x 2 、f x y = − 6 x f_{xy} = -6x f x y = − 6 x 、f y y = 2 f_{yy} = 2 f y y = 2 なので
H f ( 0 , 0 ) = ( 0 0 0 2 ) , Δ = 0. H_f(0,0) = \begin{pmatrix} 0 & 0 \\ 0 & 2\end{pmatrix}, \qquad \Delta = 0 . H f ( 0 , 0 ) = ( 0 0 0 2 ) , Δ = 0. Theorem 8.2 (4) の判定不能の場合です。
原点を通る直線に沿った振る舞い。 傾き m m m の直線 y = m x y=mx y = m x に沿うと
f ( x , m x ) = m 2 x 2 − 3 m x 3 + 2 x 4 = x 2 ( m 2 − 3 m x + 2 x 2 ) . f(x,mx) = m^2x^2 - 3mx^3 + 2x^4 = x^2\bigl(m^2 - 3mx + 2x^2\bigr). f ( x , m x ) = m 2 x 2 − 3 m x 3 + 2 x 4 = x 2 ( m 2 − 3 m x + 2 x 2 ) . m ≠ 0 m \ne 0 m = 0 なら括弧内は x → 0 x\to0 x → 0 で m 2 > 0 m^2>0 m 2 > 0 に近づくので、∣ x ∣ |x| ∣ x ∣ が十分小さければ f ( x , m x ) > 0 f(x,mx)>0 f ( x , m x ) > 0 です。m = 0 m=0 m = 0 なら f ( x , 0 ) = 2 x 4 > 0 f(x,0)=2x^4>0 f ( x , 0 ) = 2 x 4 > 0 (x ≠ 0 x\ne0 x = 0 )、鉛直な直線 x = 0 x=0 x = 0 上でも f ( 0 , y ) = y 2 > 0 f(0,y)=y^2>0 f ( 0 , y ) = y 2 > 0 (y ≠ 0 y\ne0 y = 0 )です。つまり原点を通るどの直線に沿っても、原点は狭義の極小 です。
それでも原点は極小ではありません。 放物線 y = 3 2 x 2 y = \frac{3}{2}x^2 y = 2 3 x 2 に沿うと
f ( x , 3 2 x 2 ) = ( 3 2 x 2 − x 2 ) ( 3 2 x 2 − 2 x 2 ) = x 2 2 ⋅ ( − x 2 2 ) = − x 4 4 < 0 ( x ≠ 0 ) f\Bigl(x, \tfrac{3}{2}x^2\Bigr) = \Bigl(\tfrac{3}{2}x^2 - x^2\Bigr)\Bigl(\tfrac{3}{2}x^2 - 2x^2\Bigr) = \frac{x^2}{2}\cdot\Bigl(-\frac{x^2}{2}\Bigr) = -\frac{x^4}{4} < 0 \quad (x \ne 0) f ( x , 2 3 x 2 ) = ( 2 3 x 2 − x 2 ) ( 2 3 x 2 − 2 x 2 ) = 2 x 2 ⋅ ( − 2 x 2 ) = − 4 x 4 < 0 ( x = 0 ) です。原点のどんな近傍にもこの放物線上の点が入っているので、f ( x ) < f ( 0 , 0 ) = 0 f(\boldsymbol x) < f(0,0)=0 f ( x ) < f ( 0 , 0 ) = 0 となる点が原点のいくらでも近くにあります。よって原点は極小ではありません(同様に極大でもないので鞍点です)。
からくりは、f f f が負になる領域が 2 本の放物線 y = x 2 y=x^2 y = x 2 と y = 2 x 2 y=2x^2 y = 2 x 2 に挟まれた領域だということです。この領域は原点で「つぶれて」いて、原点を通る直線はどれも、原点の近くではこの領域の外を通ってしまいます。
f が負になる領域 y = x² y = 2x² 原点を通る直線 O f(x, y) = (y − x²)(y − 2x²) が負になる領域。原点を通る直線は、原点の近くではこの領域に入りません この例は「1 変数の問題に落として調べる」という方針の限界を示しています。多変数の極値問題では、原点への近づき方が直線だけではないことを、常に意識してください。
Exercise 9.1 易
f ( x , y ) = x 2 y − y 3 + 3 f(x,y) = x^2y - y^3 + 3 f ( x , y ) = x 2 y − y 3 + 3 について、次に答えてください。
偏導関数 f x , f y f_x, f_y f x , f y を求め、f f f が R 2 \mathbb{R}^2 R 2 全体で全微分可能であることを示してください。
点 ( 2 , 1 ) (2,1) ( 2 , 1 ) における接平面の方程式を求めてください。
それを使って f ( 1.98 , 1.02 ) f(1.98, 1.02) f ( 1.98 , 1.02 ) を近似し、真の値と比べてください。
Solution 1. y y y を定数と見て f x = 2 x y f_x = 2xy f x = 2 x y 、x x x を定数と見て f y = x 2 − 3 y 2 f_y = x^2 - 3y^2 f y = x 2 − 3 y 2 です。どちらも多項式なので R 2 \mathbb{R}^2 R 2 全体で連続、すなわち f f f は C 1 C^1 C 1 級です。Theorem 4.5 より f f f は各点で全微分可能です。
2. f ( 2 , 1 ) = 4 ⋅ 1 − 1 + 3 = 6 f(2,1) = 4\cdot1 - 1 + 3 = 6 f ( 2 , 1 ) = 4 ⋅ 1 − 1 + 3 = 6 、f x ( 2 , 1 ) = 2 ⋅ 2 ⋅ 1 = 4 f_x(2,1) = 2\cdot2\cdot1 = 4 f x ( 2 , 1 ) = 2 ⋅ 2 ⋅ 1 = 4 、f y ( 2 , 1 ) = 4 − 3 = 1 f_y(2,1) = 4 - 3 = 1 f y ( 2 , 1 ) = 4 − 3 = 1 です。Definition 5.1 より
z = 6 + 4 ( x − 2 ) + 1 ⋅ ( y − 1 ) . z = 6 + 4(x-2) + 1\cdot(y-1). z = 6 + 4 ( x − 2 ) + 1 ⋅ ( y − 1 ) . 3. ( x , y ) = ( 1.98 , 1.02 ) (x,y)=(1.98,1.02) ( x , y ) = ( 1.98 , 1.02 ) すなわち h = ( − 0.02 , 0.02 ) \boldsymbol h = (-0.02, 0.02) h = ( − 0.02 , 0.02 ) を代入して
z = 6 + 4 × ( − 0.02 ) + 1 × 0.02 = 6 − 0.08 + 0.02 = 5.94. z = 6 + 4\times(-0.02) + 1\times 0.02 = 6 - 0.08 + 0.02 = 5.94 . z = 6 + 4 × ( − 0.02 ) + 1 × 0.02 = 6 − 0.08 + 0.02 = 5.94. 真の値は f ( 1.98 , 1.02 ) = ( 1.98 ) 2 ( 1.02 ) − ( 1.02 ) 3 + 3 = 3.998808 − 1.061208 + 3 = 5.9376 f(1.98,1.02) = (1.98)^2(1.02) - (1.02)^3 + 3 = 3.998808 - 1.061208 + 3 = 5.9376 f ( 1.98 , 1.02 ) = ( 1.98 ) 2 ( 1.02 ) − ( 1.02 ) 3 + 3 = 3.998808 − 1.061208 + 3 = 5.9376 です。誤差は 0.0024 0.0024 0.0024 で、∥ h ∥ = 0.02 2 ≈ 0.0283 \|\boldsymbol h\| = 0.02\sqrt2 \approx 0.0283 ∥ h ∥ = 0.02 2 ≈ 0.0283 と比べて 1 桁小さく、∥ h ∥ 2 = 0.0008 \|\boldsymbol h\|^2 = 0.0008 ∥ h ∥ 2 = 0.0008 の 3 倍程度です。Theorem 7.4 の 2 次項 1 2 ( f x x h 2 + 2 f x y h k + f y y k 2 ) \frac12(f_{xx}h^2 + 2f_{xy}hk+f_{yy}k^2) 2 1 ( f xx h 2 + 2 f x y hk + f y y k 2 ) を計算すると、f x x ( 2 , 1 ) = 2 f_{xx}(2,1)=2 f xx ( 2 , 1 ) = 2 、f x y ( 2 , 1 ) = 4 f_{xy}(2,1)=4 f x y ( 2 , 1 ) = 4 、f y y ( 2 , 1 ) = − 6 f_{yy}(2,1)=-6 f y y ( 2 , 1 ) = − 6 より 1 2 ( 2 ( 0.0004 ) + 8 ( − 0.0004 ) − 6 ( 0.0004 ) ) = − 0.0024 \frac12(2(0.0004) + 8(-0.0004) - 6(0.0004)) = -0.0024 2 1 ( 2 ( 0.0004 ) + 8 ( − 0.0004 ) − 6 ( 0.0004 )) = − 0.0024 となり、誤差の符号と大きさが説明できます。
Exercise 9.2 標準
f f f を R 2 \mathbb{R}^2 R 2 上の C 1 C^1 C 1 級関数とし、極座標変換 x = r cos θ x = r\cos\theta x = r cos θ 、y = r sin θ y = r\sin\theta y = r sin θ により g ( r , θ ) = f ( r cos θ , r sin θ ) g(r,\theta) = f(r\cos\theta, r\sin\theta) g ( r , θ ) = f ( r cos θ , r sin θ ) と定めます。r > 0 r>0 r > 0 において
g r 2 + 1 r 2 g θ 2 = f x 2 + f y 2 = ∥ ∇ f ∥ 2 g_r^2 + \frac{1}{r^2}g_\theta^2 = f_x^2 + f_y^2 = \|\nabla f\|^2 g r 2 + r 2 1 g θ 2 = f x 2 + f y 2 = ∥∇ f ∥ 2 が成り立つことを示してください(右辺は点 ( r cos θ , r sin θ ) (r\cos\theta, r\sin\theta) ( r cos θ , r sin θ ) での値)。
Solution f f f は C 1 C^1 C 1 級なので Theorem 4.5 より全微分可能であり、Remark 6.2 の連鎖律が使えます。x r = cos θ x_r = \cos\theta x r = cos θ 、y r = sin θ y_r = \sin\theta y r = sin θ 、x θ = − r sin θ x_\theta = -r\sin\theta x θ = − r sin θ 、y θ = r cos θ y_\theta = r\cos\theta y θ = r cos θ ですから
g r = f x cos θ + f y sin θ , g θ = − r f x sin θ + r f y cos θ . g_r = f_x\cos\theta + f_y\sin\theta, \qquad g_\theta = -r f_x\sin\theta + r f_y\cos\theta . g r = f x cos θ + f y sin θ , g θ = − r f x sin θ + r f y cos θ . 第 2 式より 1 r g θ = − f x sin θ + f y cos θ \frac{1}{r}g_\theta = -f_x\sin\theta + f_y\cos\theta r 1 g θ = − f x sin θ + f y cos θ です。c = cos θ c=\cos\theta c = cos θ 、s = sin θ s=\sin\theta s = sin θ と略記して 2 乗の和を計算すると
g r 2 + 1 r 2 g θ 2 = ( f x c + f y s ) 2 + ( − f x s + f y c ) 2 = f x 2 c 2 + 2 f x f y c s + f y 2 s 2 + f x 2 s 2 − 2 f x f y c s + f y 2 c 2 = f x 2 ( c 2 + s 2 ) + f y 2 ( s 2 + c 2 ) = f x 2 + f y 2 . \begin{aligned}
g_r^2 + \frac{1}{r^2}g_\theta^2 &= (f_xc+f_ys)^2 + (-f_xs+f_yc)^2\\
&= f_x^2c^2 + 2f_xf_ycs + f_y^2s^2 + f_x^2s^2 - 2f_xf_ycs + f_y^2c^2\\
&= f_x^2(c^2+s^2) + f_y^2(s^2+c^2) = f_x^2+f_y^2 .
\end{aligned} g r 2 + r 2 1 g θ 2 = ( f x c + f y s ) 2 + ( − f x s + f y c ) 2 = f x 2 c 2 + 2 f x f y cs + f y 2 s 2 + f x 2 s 2 − 2 f x f y cs + f y 2 c 2 = f x 2 ( c 2 + s 2 ) + f y 2 ( s 2 + c 2 ) = f x 2 + f y 2 . 交差項が打ち消し合うのは、( c , s ) (c, s) ( c , s ) と ( − s , c ) (-s, c) ( − s , c ) が正規直交基底をなすからです。この計算は、勾配の大きさが座標の取り方に依らないことを示しています。
Exercise 9.3 難
f ( x , y ) = { x 2 y x 2 + y 2 ( x ≠ 0 ) 0 ( x = 0 ) f(x,y) = \begin{cases} \dfrac{x^2y}{x^2+y^2} & (\boldsymbol x \ne \boldsymbol 0)\\[2mm] 0 & (\boldsymbol x = \boldsymbol 0)\end{cases} f ( x , y ) = ⎩ ⎨ ⎧ x 2 + y 2 x 2 y 0 ( x = 0 ) ( x = 0 ) について、原点における (1) 連続性、(2) すべての方向微分係数の存在、(3) 全微分可能性を調べてください。
Solution (1) 連続。 x 2 ≤ x 2 + y 2 x^2 \le x^2+y^2 x 2 ≤ x 2 + y 2 より、x ≠ 0 \boldsymbol x \ne \boldsymbol 0 x = 0 に対し
∣ f ( x , y ) ∣ = ∣ y ∣ ⋅ x 2 x 2 + y 2 ≤ ∣ y ∣ ≤ ∥ x ∥ |f(x,y)| = |y|\cdot\frac{x^2}{x^2+y^2} \le |y| \le \|\boldsymbol x\| ∣ f ( x , y ) ∣ = ∣ y ∣ ⋅ x 2 + y 2 x 2 ≤ ∣ y ∣ ≤ ∥ x ∥ です。よって x → 0 \boldsymbol x \to \boldsymbol 0 x → 0 のとき f ( x ) → 0 = f ( 0 ) f(\boldsymbol x)\to 0 = f(\boldsymbol 0) f ( x ) → 0 = f ( 0 ) となり、f f f は原点で連続です。
(2) 方向微分はすべて存在。 単位ベクトル u = ( u 1 , u 2 ) \boldsymbol u = (u_1,u_2) u = ( u 1 , u 2 ) と t ≠ 0 t \ne 0 t = 0 に対し
f ( t u ) = t 2 u 1 2 ⋅ t u 2 t 2 ( u 1 2 + u 2 2 ) = t u 1 2 u 2 f(t\boldsymbol u) = \frac{t^2u_1^2\cdot tu_2}{t^2(u_1^2+u_2^2)} = t\,u_1^2u_2 f ( t u ) = t 2 ( u 1 2 + u 2 2 ) t 2 u 1 2 ⋅ t u 2 = t u 1 2 u 2 (u 1 2 + u 2 2 = 1 u_1^2+u_2^2=1 u 1 2 + u 2 2 = 1 を使いました)。よって
D u f ( 0 ) = lim t → 0 f ( t u ) − 0 t = u 1 2 u 2 D_{\boldsymbol u}f(\boldsymbol 0) = \lim_{t\to0}\frac{f(t\boldsymbol u)-0}{t} = u_1^2u_2 D u f ( 0 ) = t → 0 lim t f ( t u ) − 0 = u 1 2 u 2 が任意の u \boldsymbol u u について存在します。とくに f x ( 0 ) = D ( 1 , 0 ) f ( 0 ) = 0 f_x(\boldsymbol 0) = D_{(1,0)}f(\boldsymbol 0) = 0 f x ( 0 ) = D ( 1 , 0 ) f ( 0 ) = 0 、f y ( 0 ) = D ( 0 , 1 ) f ( 0 ) = 0 f_y(\boldsymbol 0) = D_{(0,1)}f(\boldsymbol 0)=0 f y ( 0 ) = D ( 0 , 1 ) f ( 0 ) = 0 です。
(3) 全微分可能ではない。 方法は 2 つあります。
第 1 に、Proposition 4.3 (2) によれば、全微分可能なら u ↦ D u f ( 0 ) = ⟨ ∇ f ( 0 ) , u ⟩ \boldsymbol u \mapsto D_{\boldsymbol u}f(\boldsymbol 0) = \langle\nabla f(\boldsymbol 0), \boldsymbol u\rangle u ↦ D u f ( 0 ) = ⟨ ∇ f ( 0 ) , u ⟩ は u \boldsymbol u u の線形式でなければなりません。ところが実際の値 u 1 2 u 2 u_1^2u_2 u 1 2 u 2 は線形ではありません。たとえば u = ( 1 / 2 , 1 / 2 ) \boldsymbol u = (1/\sqrt2, 1/\sqrt2) u = ( 1/ 2 , 1/ 2 ) に対し u 1 2 u 2 = 1 2 ⋅ 1 2 = 1 2 2 ≠ 0 u_1^2u_2 = \frac{1}{2}\cdot\frac{1}{\sqrt2} = \frac{1}{2\sqrt2} \ne 0 u 1 2 u 2 = 2 1 ⋅ 2 1 = 2 2 1 = 0 ですが、線形なら f x ( 0 ) / 2 + f y ( 0 ) / 2 = 0 f_x(\boldsymbol 0)/\sqrt2 + f_y(\boldsymbol 0)/\sqrt2 = 0 f x ( 0 ) / 2 + f y ( 0 ) / 2 = 0 でなければなりません。矛盾します。
第 2 に、定義から直接示すこともできます。∇ f ( 0 ) = 0 \nabla f(\boldsymbol 0)=\boldsymbol 0 ∇ f ( 0 ) = 0 なので一次近似の候補は z = 0 z=0 z = 0 のみです。h = ( t , t ) \boldsymbol h = (t,t) h = ( t , t ) と取ると f ( t , t ) = t / 2 f(t,t) = t/2 f ( t , t ) = t /2 、∥ h ∥ = 2 ∣ t ∣ \|\boldsymbol h\| = \sqrt2|t| ∥ h ∥ = 2 ∣ t ∣ より
∣ f ( h ) − 0 − 0 ∣ ∥ h ∥ = ∣ t ∣ / 2 2 ∣ t ∣ = 1 2 2 \frac{|f(\boldsymbol h) - 0 - 0|}{\|\boldsymbol h\|} = \frac{|t|/2}{\sqrt2|t|} = \frac{1}{2\sqrt2} ∥ h ∥ ∣ f ( h ) − 0 − 0∣ = 2 ∣ t ∣ ∣ t ∣/2 = 2 2 1 は t → 0 t \to 0 t → 0 でも 0 0 0 に収束しません。よって全微分可能ではありません。
この例は、Example 4.4 よりさらに強く「全方向の方向微分が存在しても全微分可能とは限らない」ことを示しています。方向微分は各方向を別々に 見ているだけで、方向をまたいだ一様性を保証しないのです。
Exercise 9.4 標準
f ( x , y ) = x 4 + y 4 − 4 x y f(x,y) = x^4 + y^4 - 4xy f ( x , y ) = x 4 + y 4 − 4 x y の臨界点をすべて求め、Theorem 8.2 で分類してください。
Solution 臨界点。 f x = 4 x 3 − 4 y = 0 f_x = 4x^3 - 4y = 0 f x = 4 x 3 − 4 y = 0 より y = x 3 y = x^3 y = x 3 、f y = 4 y 3 − 4 x = 0 f_y = 4y^3 - 4x = 0 f y = 4 y 3 − 4 x = 0 より x = y 3 x = y^3 x = y 3 です。前者を後者に代入すると x = x 9 x = x^9 x = x 9 、すなわち x ( x 8 − 1 ) = 0 x(x^8-1) = 0 x ( x 8 − 1 ) = 0 です。実数解は x = 0 , 1 , − 1 x = 0, 1, -1 x = 0 , 1 , − 1 で、y = x 3 y=x^3 y = x 3 より臨界点は ( 0 , 0 ) (0,0) ( 0 , 0 ) 、( 1 , 1 ) (1,1) ( 1 , 1 ) 、( − 1 , − 1 ) (-1,-1) ( − 1 , − 1 ) の 3 つです。
ヘッセ行列。 f x x = 12 x 2 f_{xx} = 12x^2 f xx = 12 x 2 、f x y = − 4 f_{xy} = -4 f x y = − 4 、f y y = 12 y 2 f_{yy} = 12y^2 f y y = 12 y 2 なので
H f ( x , y ) = ( 12 x 2 − 4 − 4 12 y 2 ) , Δ ( x , y ) = 144 x 2 y 2 − 16. H_f(x,y) = \begin{pmatrix} 12x^2 & -4\\ -4 & 12y^2\end{pmatrix}, \qquad \Delta(x,y) = 144x^2y^2 - 16 . H f ( x , y ) = ( 12 x 2 − 4 − 4 12 y 2 ) , Δ ( x , y ) = 144 x 2 y 2 − 16. 判定。
臨界点 Δ \Delta Δ f x x f_{xx} f xx 判定 f f f の値( 0 , 0 ) (0,0) ( 0 , 0 ) − 16 < 0 -16 < 0 − 16 < 0 0 0 0 鞍点 0 0 0 ( 1 , 1 ) (1,1) ( 1 , 1 ) 128 > 0 128 > 0 128 > 0 12 > 0 12 > 0 12 > 0 狭義の極小 − 2 -2 − 2 ( − 1 , − 1 ) (-1,-1) ( − 1 , − 1 ) 128 > 0 128 > 0 128 > 0 12 > 0 12 > 0 12 > 0 狭義の極小 − 2 -2 − 2
( 0 , 0 ) (0,0) ( 0 , 0 ) では Δ < 0 \Delta<0 Δ < 0 なので Theorem 8.2 (3) より鞍点です(実際 f ( t , t ) = 2 t 4 − 4 t 2 < 0 f(t,t) = 2t^4-4t^2 < 0 f ( t , t ) = 2 t 4 − 4 t 2 < 0 、f ( t , − t ) = 2 t 4 + 4 t 2 > 0 f(t,-t) = 2t^4+4t^2 > 0 f ( t , − t ) = 2 t 4 + 4 t 2 > 0 が t ≠ 0 t\ne0 t = 0 で小さいときに成り立ちます)。他の 2 点は同 (1) より狭義の極小で、極小値は 1 + 1 − 4 = − 2 1+1-4 = -2 1 + 1 − 4 = − 2 です。
なお x 4 + y 4 − 4 x y ≥ x 4 + y 4 − 2 ( x 2 + y 2 ) x^4+y^4-4xy \ge x^4+y^4-2(x^2+y^2) x 4 + y 4 − 4 x y ≥ x 4 + y 4 − 2 ( x 2 + y 2 ) (相加相乗平均 2 ∣ x y ∣ ≤ x 2 + y 2 2|xy| \le x^2+y^2 2∣ x y ∣ ≤ x 2 + y 2 による)の右辺は ∥ x ∥ → ∞ \|\boldsymbol x\|\to\infty ∥ x ∥ → ∞ で + ∞ +\infty + ∞ に発散するので、f f f は下に有界で最小値を持ちます。最小値は臨界点でしか取れないので、− 2 -2 − 2 が f f f の最小値です。
高木貞治『解析概論』改訂第三版、岩波書店、1983 — 第 2 章(微分法)に偏微分・全微分・テイラーの定理・極値問題が扱われています。
杉浦光夫『解析入門 I』東京大学出版会、1980 — 多変数関数の微分法を扱う章。C 1 C^1 C 1 級と全微分可能性の関係、シュワルツの定理の証明が丁寧です。
W. Rudin, Principles of Mathematical Analysis , 3rd ed., McGraw-Hill, 1976 — Chapter 9 (Functions of Several Variables). 微分を線形写像として定義する立場が明快に書かれています。
T. M. Apostol, Mathematical Analysis , 2nd ed., Addison-Wesley, 1974 — Chapter 12 (Multivariable Differential Calculus) および Chapter 13 (Implicit Functions and Extremum Problems)。
M. Spivak, Calculus on Manifolds , W. A. Benjamin, 1965 — Chapter 2 (Differentiation)。多変数の微分を n n n 変数で一気に扱う簡潔な入門です。
F. Cajori, A History of Mathematical Notations , Vol. 2, Open Court, 1929 — 偏微分記号 ∂ \partial ∂ の由来について。
Theorem 7.1 を証明します。鍵は、f f f の値だけから作られる次の二重差分 が、2 通りの順序で f x y f_{xy} f x y と f y x f_{yx} f y x に結びつくことです。
a = ( a , b ) \boldsymbol a = (a,b) a = ( a , b ) とし、f x , f y , f x y , f y x f_x, f_y, f_{xy}, f_{yx} f x , f y , f x y , f y x が存在する近傍を B ( a , r ) B(\boldsymbol a, r) B ( a , r ) とします。0 < ∥ ( h , k ) ∥ < r / 2 0 < \|(h,k)\| < r/2 0 < ∥ ( h , k ) ∥ < r /2 なる h ≠ 0 h \ne 0 h = 0 、k ≠ 0 k \ne 0 k = 0 に対し
Δ ( h , k ) = f ( a + h , b + k ) − f ( a + h , b ) − f ( a , b + k ) + f ( a , b ) \Delta(h,k) = f(a+h,b+k) - f(a+h,b) - f(a,b+k) + f(a,b) Δ ( h , k ) = f ( a + h , b + k ) − f ( a + h , b ) − f ( a , b + k ) + f ( a , b ) と置きます。
第 1 の見方(先に x x x 、次に y y y )。 φ ( s ) = f ( s , b + k ) − f ( s , b ) \varphi(s) = f(s,b+k) - f(s,b) φ ( s ) = f ( s , b + k ) − f ( s , b ) と置くと Δ ( h , k ) = φ ( a + h ) − φ ( a ) \Delta(h,k) = \varphi(a+h)-\varphi(a) Δ ( h , k ) = φ ( a + h ) − φ ( a ) です。f x f_x f x が近傍で存在するので φ \varphi φ は微分可能で φ ′ ( s ) = f x ( s , b + k ) − f x ( s , b ) \varphi'(s) = f_x(s,b+k)-f_x(s,b) φ ′ ( s ) = f x ( s , b + k ) − f x ( s , b ) です。平均値の定理より、ある θ 1 \theta_1 θ 1 (0 < θ 1 < 1 0 < \theta_1 < 1 0 < θ 1 < 1 )が存在して
Δ ( h , k ) = h [ f x ( a + θ 1 h , b + k ) − f x ( a + θ 1 h , b ) ] . \Delta(h,k) = h\bigl[f_x(a+\theta_1h,\, b+k) - f_x(a+\theta_1h,\, b)\bigr]. Δ ( h , k ) = h [ f x ( a + θ 1 h , b + k ) − f x ( a + θ 1 h , b ) ] . 角括弧の中は、第 2 変数の関数 t ↦ f x ( a + θ 1 h , t ) t \mapsto f_x(a+\theta_1h, t) t ↦ f x ( a + θ 1 h , t ) の b b b から b + k b+k b + k までの差です。この関数は微分可能で導関数は f x y f_{xy} f x y ですから、再び平均値の定理より、ある θ 2 ∈ ( 0 , 1 ) \theta_2 \in (0,1) θ 2 ∈ ( 0 , 1 ) が存在して
Δ ( h , k ) = h k f x y ( a + θ 1 h , b + θ 2 k ) . \Delta(h,k) = hk\, f_{xy}(a+\theta_1 h,\ b+\theta_2 k). Δ ( h , k ) = hk f x y ( a + θ 1 h , b + θ 2 k ) . 第 2 の見方(先に y y y 、次に x x x )。 今度は ψ ( t ) = f ( a + h , t ) − f ( a , t ) \psi(t) = f(a+h,t)-f(a,t) ψ ( t ) = f ( a + h , t ) − f ( a , t ) と置くと、同じ Δ ( h , k ) \Delta(h,k) Δ ( h , k ) が ψ ( b + k ) − ψ ( b ) \psi(b+k)-\psi(b) ψ ( b + k ) − ψ ( b ) と書けます。まったく同じ議論を y y y から先に行えば、ある θ 3 , θ 4 ∈ ( 0 , 1 ) \theta_3, \theta_4 \in (0,1) θ 3 , θ 4 ∈ ( 0 , 1 ) が存在して
Δ ( h , k ) = h k f y x ( a + θ 3 h , b + θ 4 k ) . \Delta(h,k) = hk\, f_{yx}(a+\theta_3 h,\ b+\theta_4 k). Δ ( h , k ) = hk f y x ( a + θ 3 h , b + θ 4 k ) . 結論。 h k ≠ 0 hk \ne 0 hk = 0 で割ると、0 < ∥ ( h , k ) ∥ < r / 2 0 < \|(h,k)\| < r/2 0 < ∥ ( h , k ) ∥ < r /2 かつ h k ≠ 0 hk \ne 0 hk = 0 なるすべての ( h , k ) (h,k) ( h , k ) に対し
f x y ( a + θ 1 h , b + θ 2 k ) = f y x ( a + θ 3 h , b + θ 4 k ) f_{xy}(a+\theta_1h,\ b+\theta_2k) = f_{yx}(a+\theta_3h,\ b+\theta_4k) f x y ( a + θ 1 h , b + θ 2 k ) = f y x ( a + θ 3 h , b + θ 4 k ) が成り立ちます。ここで ( h , k ) → ( 0 , 0 ) (h,k)\to(0,0) ( h , k ) → ( 0 , 0 ) とします。0 < θ i < 1 0 < \theta_i < 1 0 < θ i < 1 なので両辺の評価点はともに a \boldsymbol a a に収束し、f x y f_{xy} f x y と f y x f_{yx} f y x の a \boldsymbol a a における連続性から、左辺は f x y ( a ) f_{xy}(\boldsymbol a) f x y ( a ) 、右辺は f y x ( a ) f_{yx}(\boldsymbol a) f y x ( a ) に収束します。極限の一意性(Theorem 3.5)[Limits and Continuity] より f x y ( a ) = f y x ( a ) f_{xy}(\boldsymbol a) = f_{yx}(\boldsymbol a) f x y ( a ) = f y x ( a ) です。