机器学习的数学基础——泛函分析初步
本文是我的读书笔记,主要是摘记泛函分析教材 1中的概念和结论,以应对机器学习教材 2中出现的 Hilbert 空间 等数学术语。
度量空间
度量空间:对偶 ( X , d ) (X, d) (X,d) ,其中 X X X 是一个集合, d d d 是 X X X 上的距离函数,即 d d d 定义在 X × X X \times X X×X 且对所有 x , y , z ∈ X x, y, z \in X x,y,z∈X 满足以下四条公理
- d d d 是实值、有限和非负的
- x = y ⟺ d ( x , y ) = 0 x = y \iff d(x, y) = 0 x=y⟺d(x,y)=0
- d ( x , y ) = d ( y , x ) d(x, y) = d(y, x) d(x,y)=d(y,x)
- d ( x , y ) ≤ d ( x , z ) + d ( z , y ) d(x, y) \le d(x, z) + d(z, y) d(x,y)≤d(x,z)+d(z,y) (三角不等式)
欧几里得空间
R
n
\mathbf{R}^n
Rn 可成为度量空间,使用欧几里得度量
x
=
(
ξ
1
,
…
,
ξ
n
)
,
y
=
(
η
1
,
…
,
η
n
)
x = (\xi_1, \dots, \xi_n), \space y = (\eta_1, \dots, \eta_n)
x=(ξ1,…,ξn), y=(η1,…,ηn)
d
(
x
,
y
)
=
(
ξ
1
−
η
1
)
2
+
⋯
+
(
ξ
n
−
η
n
)
2
d(x, y) = \sqrt{(\xi_1 - \eta_1)^2 + \dots + (\xi_n - \eta_n)^2}
d(x,y)=(ξ1−η1)2+⋯+(ξn−ηn)2
酉空间
C
n
\mathbf{C}^n
Cn 可成为度量空间,定义
d
(
x
,
y
)
=
∣
ξ
1
−
η
1
∣
2
+
⋯
+
∣
ξ
n
−
η
n
∣
2
d(x, y) = \sqrt{|\xi_1 - \eta_1|^2 + \dots + |\xi_n - \eta_n|^2}
d(x,y)=∣ξ1−η1∣2+⋯+∣ξn−ηn∣2
取所有的有界复数序列的集合作为基集
X
X
X,定义度量
x
=
(
ξ
1
,
ξ
2
,
…
)
,
y
=
(
η
1
,
η
2
,
…
)
x = (\xi_1, \xi_2, \dots), \space y = (\eta_1, \eta_2, \dots)
x=(ξ1,ξ2,…), y=(η1,η2,…)
d
(
x
,
y
)
=
sup
j
∣
ξ
j
−
η
j
∣
d(x, y) = \sup_j |\xi_j - \eta_j|
d(x,y)=jsup∣ξj−ηj∣
其中
sup
\sup
sup 表示上确界(最小上界)。这样得到的度量空间称为序列空间
l
∞
l^{\infty}
l∞
取闭区间
J
=
[
a
,
b
]
J = [a, b]
J=[a,b] 上所有的连续实值函数的集合作为基集
X
X
X,定义度量
d
(
x
,
y
)
=
max
t
∈
J
∣
x
(
t
)
−
y
(
t
)
∣
d(x, y) = \max_{t \in J} |x(t) - y(t)|
d(x,y)=t∈Jmax∣x(t)−y(t)∣
其中
max
\max
max 表示最大值。这样得到的度量空间称为
C
[
a
,
b
]
C[a, b]
C[a,b],
C
C
C 表示 Continuous
取所有满足级数
∑
j
=
1
∞
∣
ξ
j
∣
p
\sum_{j = 1}^{\infty} |\xi_j|^p
j=1∑∞∣ξj∣p
收敛的数列
x
=
(
ξ
1
,
ξ
2
,
…
)
x = (\xi_1, \xi_2, \dots)
x=(ξ1,ξ2,…),定义度量
d
(
x
,
y
)
=
(
∑
j
=
1
∞
∣
ξ
j
−
η
j
∣
p
)
1
p
d(x, y) = \left( \sum_{j = 1}^{\infty} |\xi_j - \eta_j|^p \right)^{\frac{1}{p}}
d(x,y)=(j=1∑∞∣ξj−ηj∣p)p1
这样得到的度量空间称为序列空间
l
p
l^p
lp,特别地,
l
2
l^2
l2 又称 Hilbert 序列空间。
Cauchy 序列、完备性:度量空间
X
=
(
X
,
d
)
X = (X, d)
X=(X,d) 中的序列
(
x
n
)
(x_n)
(xn),如果对于
∀
ϵ
>
0
\forall \epsilon > 0
∀ϵ>0,
∃
N
=
N
(
ϵ
)
\exists N = N(\epsilon)
∃N=N(ϵ),使得
∀
m
,
n
>
N
d
(
x
m
,
x
n
)
<
ϵ
\forall m, n > N \space\space\space\space d(x_m, x_n) < \epsilon
∀m,n>N d(xm,xn)<ϵ
则称
(
x
n
)
(x_n)
(xn) 是 Cauchy 序列。如果空间
X
X
X 中每个 Cauchy 序列都有属于
X
X
X 的极限,则称
X
X
X 是完备度量空间。
可以证明, R n \mathbf{R}^n Rn、 C n \mathbf{C}^n Cn、 C [ a , b ] C[a, b] C[a,b]、 l ∞ l^{\infty} l∞、 l p l^p lp 都是完备的。
赋范空间和 Banach 空间
向量空间是定义了向量加法和向量数乘两种运算的空间。关于其完整定义和性质,可参考线性代数教材3。
范数:定义在向量空间 X X X 上的实值函数,它在 x ∈ X x \in X x∈X 的值记为 ∣ ∣ x ∣ ∣ ||x|| ∣∣x∣∣,并具有如下性质
- ∣ ∣ x ∣ ∣ ≥ 0 ||x|| \geq 0 ∣∣x∣∣≥0
- ∣ ∣ x ∣ ∣ = 0 ⟺ x = 0 ||x|| = 0 \iff x = 0 ∣∣x∣∣=0⟺x=0
- ∣ ∣ α x ∣ ∣ = ∣ α ∣ ∣ ∣ x ∣ ∣ ||\alpha x|| = |\alpha|\space||x|| ∣∣αx∣∣=∣α∣ ∣∣x∣∣
- ∣ ∣ x + y ∣ ∣ ≤ ∣ ∣ x ∣ ∣ + ∣ ∣ y ∣ ∣ ||x + y|| \leq ||x|| + ||y|| ∣∣x+y∣∣≤∣∣x∣∣+∣∣y∣∣ (三角不等式)
由范数导出的度量:
d
(
x
,
y
)
=
∣
∣
x
−
y
∣
∣
,
∀
x
,
y
∈
X
d(x, y) = ||x - y||, \space \forall x, y \in X
d(x,y)=∣∣x−y∣∣, ∀x,y∈X
赋范空间:在其上定义了范数的向量空间
Banach 空间:完备的赋范空间(以范数导出的度量来考察完备性)
接下来对之前定义的度量空间补充范数的定义,使得之前的度量定义可以由范数导出。
欧几里得空间
R
n
\mathbf{R}^n
Rn 和酉空间
C
n
\mathbf{C}^n
Cn
∣
∣
x
∣
∣
=
(
∑
j
=
1
n
∣
ξ
j
∣
2
)
1
2
||x|| = \left( \sum_{j = 1}^n |\xi_j|^2 \right)^{\frac{1}{2}}
∣∣x∣∣=(j=1∑n∣ξj∣2)21
空间
l
p
l^p
lp
∣
∣
x
∣
∣
=
(
∑
j
=
1
∞
∣
ξ
j
∣
p
)
1
p
||x|| = \left( \sum_{j = 1}^{\infty} |\xi_j|^p \right)^{\frac{1}{p}}
∣∣x∣∣=(j=1∑∞∣ξj∣p)p1
空间
l
∞
l^{\infty}
l∞
∣
∣
x
∣
∣
=
sup
j
∣
ξ
j
∣
||x|| = \sup_j |\xi_j|
∣∣x∣∣=jsup∣ξj∣
空间
C
[
a
,
b
]
C[a, b]
C[a,b]
∣
∣
x
∣
∣
=
max
t
∈
J
∣
x
(
t
)
∣
||x|| = \max_{t \in J} |x(t)|
∣∣x∣∣=t∈Jmax∣x(t)∣
内积空间和 Hilbert 空间
内积: X × X X \times X X×X 到 X X X 的标量域 K K K 的一个映射。 X X X 中向量 x x x 和 y y y 的内积记作 ⟨ x , y ⟩ \langle x, y \rangle ⟨x,y⟩,满足如下性质
- ⟨ x + y , z ⟩ = ⟨ x , z ⟩ + ⟨ y , z ⟩ \langle x + y, z \rangle = \langle x, z \rangle + \langle y, z \rangle ⟨x+y,z⟩=⟨x,z⟩+⟨y,z⟩
- ⟨ α x , y ⟩ = α ⟨ x , y ⟩ \langle \alpha x, y \rangle = \alpha \langle x, y \rangle ⟨αx,y⟩=α⟨x,y⟩
- ⟨ x , y ⟩ = ⟨ y , x ⟩ ‾ \langle x, y \rangle = \overline{\langle y, x \rangle} ⟨x,y⟩=⟨y,x⟩
- ⟨ x , x ⟩ ≥ 0 \langle x, x \rangle \geq 0 ⟨x,x⟩≥0
- ⟨ x , y ⟩ = 0 ⟺ x = 0 \langle x, y \rangle = 0 \iff x = 0 ⟨x,y⟩=0⟺x=0
其中 ⟨ y , x ⟩ ‾ \overline{\langle y, x \rangle} ⟨y,x⟩ 表示 ⟨ y , x ⟩ \langle y, x \rangle ⟨y,x⟩ 的复共轭。对定义了内积的实向量空间,有交换律 ⟨ x , y ⟩ = ⟨ y , x ⟩ \langle x, y \rangle = \langle y, x \rangle ⟨x,y⟩=⟨y,x⟩
可以用内积定义范数和度量
∣
∣
x
∣
∣
=
⟨
x
,
x
⟩
||x|| = \sqrt{\langle x, x \rangle}
∣∣x∣∣=⟨x,x⟩
d
(
x
,
y
)
=
∣
∣
x
−
y
∣
∣
=
⟨
x
−
y
,
x
−
y
⟩
d(x, y) = ||x - y|| = \sqrt{\langle x - y, x - y \rangle}
d(x,y)=∣∣x−y∣∣=⟨x−y,x−y⟩
内积空间:在其上定义了内积的向量空间
Hilbert 空间:完备的内积空间(以内积定义的度量来考察完备性)
可以证明,内积空间上的范数满足平行四边形等式
∣
∣
x
+
y
∣
∣
2
+
∣
∣
x
−
y
∣
∣
2
=
2
(
∣
∣
x
∣
∣
2
+
∣
∣
y
∣
∣
2
)
||x + y||^2 + ||x - y||^2 = 2(||x||^2 + ||y||^2)
∣∣x+y∣∣2+∣∣x−y∣∣2=2(∣∣x∣∣2+∣∣y∣∣2)
不是所有的赋范空间都是内积空间。
接下来对之前定义的度量空间补充内积的定义,使得之前定义的度量、范数建立在内积之上。
欧几里得空间
R
n
\mathbf{R}^n
Rn
⟨
x
,
y
⟩
=
∑
j
=
1
n
ξ
j
η
j
\langle x, y \rangle = \sum_{j = 1}^n \xi_j \eta_j
⟨x,y⟩=j=1∑nξjηj
R
n
\mathbf{R}^n
Rn 是 Hilbert 空间。
酉空间
C
n
\mathbf{C}^n
Cn
⟨
x
,
y
⟩
=
∑
j
=
1
n
ξ
j
η
j
‾
\langle x, y \rangle = \sum_{j = 1}^n \xi_j \overline{\eta_j}
⟨x,y⟩=j=1∑nξjηj
C
n
\mathbf{C}^n
Cn 是 Hilbert 空间。
空间
l
2
l^2
l2
⟨
x
,
y
⟩
=
∑
j
=
1
∞
ξ
j
η
j
‾
\langle x, y \rangle = \sum_{j = 1}^{\infty} \xi_j \overline{\eta_j}
⟨x,y⟩=j=1∑∞ξjηj
l
2
l^2
l2 是 Hilbert 空间的原型。
可以证明,空间 l p ( p ≠ 2 ) l^p \space (p \neq 2) lp (p=2) 不满足平行四边形等式,所以不是内积空间,当然也不是 Hilbert 空间。
可以证明,空间 C [ a , b ] C[a, b] C[a,b] 不满足平行四边形等式,所以不是内积空间,当然也不是 Hilbert 空间。
(加)欧文·克雷斯齐格《泛函分析导论及应用》(人民邮电出版社,2022) ↩︎
李航《统计学习方法》(第2版)(清华大学出版社,2019) ↩︎
Linear Algebra Done Right (Fourth Edition), Sheldon Axler ↩︎
更多推荐
所有评论(0)