从Stone-Weierstrass到Galois:理解机器学习模型表达能力的统一数学视角
1. 项目概述:当“区分”遇见“表达”
在机器学习的工具箱里,我们经常听到两个听起来很“玄”的词: 表达能力 和 区分能力 。前者问的是“你这个模型家族,能不能拟合出我想要的任何复杂函数?”,后者问的是“你这个模型,能不能把不同的数据点给区分开来?”。乍一看,这好像是两个不同层面的问题,一个关乎模型的潜力上限,一个关乎模型的判别精度。
但如果你深入数学的底层,会发现一个惊人的事实:在许多核心的数学框架下, “能区分”和“能表达”本质上是同一枚硬币的两面 。这个洞察并非偶然的哲学思辨,而是被两个看似风马牛不相及的经典数学定理——分析领域的 Stone-Weierstrass定理 和代数领域的 Galois理论基本定理 ——以极其严谨的方式共同揭示的。
我最初接触到这个联系,是在研究 等变机器学习 的时候。当时我们试图设计一种神经网络,让它天生就“懂得”点云数据中的旋转、平移对称性。为了证明我们设计的模型是“万能”的(即具有通用近似性),我们不得不同时搬出这两个定理。那一刻我才恍然大悟,原来分析学和代数学的两位“老宗师”,在关于“函数能做什么”这个根本问题上,唱的是同一出戏。
简单来说,Stone-Weierstrass定理告诉我们:在一类“好”的空间(紧致Hausdorff空间)上,如果你有一族连续函数,它们 能通过不同的函数值把空间中任意两个不同的点给区分开 ,那么由这族函数通过线性组合和乘法生成的代数,就可以 以任意精度逼近该空间上的任何一个连续函数 。区分是前提,表达是结果。
而Galois理论则从群与域的对称性角度,讲述了一个结构上完全平行的故事:给定一个域扩张及其自同构群,如果你能找到一组元素,它们 能被某个子群H固定,但能被群G中所有其他元素改变 (即这组元素能“区分”子群H和更大的群G),那么这组元素就能 生成对应于子群H的整个固定子域 。同样,区分能力直接决定了表达能力。
本文将带你深入这个“区分即表达”的统一视角。我们会拆解这两个定理的核心逻辑,看看它们如何在机器学习的不同场景下(从经典的通用近似定理证明,到前沿的等变图神经网络、点云处理)扮演着奠基性的角色。更重要的是,我会分享在实际研究和工程中,如何运用这一视角去设计和分析模型,以及在这个过程中我踩过的一些坑和收获的实用技巧。
2. 核心原理拆解:两个定理的“区分-表达”对偶性
要理解这个统一视角,我们得先抛开定理那些形式化的外壳,看看它们内在的“灵魂”是如何运作的。这部分的数学表述可能有点抽象,但我会尽量用机器学习和数据科学中的直观例子来类比,帮你抓住精髓。
2.1 Stone-Weierstrass定理:分析世界的“见微知著”
我们先看分析学这边的Stone-Weierstrass定理。它的经典形式是关于连续函数逼近的。想象你有一个复杂的、形状不规则的物体(对应一个紧致拓扑空间X),你想用一套简单的“积木”(对应一个函数集合S)来搭建一个模型,无限逼近这个物体上任何一个连续变化的属性(对应任意连续函数f: X → R)。
定理的核心条件 就一句话:你的这套“积木”S,必须能 区分 X上的任意两个点。也就是说,对于任意两个不同的点x₁和x₂,你至少能从S里找到一块“积木”函数,使得在这两个点上“搭”出来的高度(函数值)不一样:f(x₁) ≠ f(x₂)。
为什么这个条件如此关键?我们可以反过来想:如果存在两个不同的点x₁和x₂,你的所有“积木”在它们上面给出的值都一模一样,那么无论你怎么线性组合、怎么相乘这些“积木”,构造出来的任何函数在这两点上的值也必然相同。这意味着,你永远无法逼近一个在这两点上取值不同的目标函数(比如,一个在x₁处为0,在x₂处为1的函数)。你的“表达”能力从一开始就被阉割了。
注意 :这里“区分”的定义是逐点的(point-separating)。在机器学习中,这对应着你的特征或模型对于不同的输入必须产生不同的输出。如果两个不同的数据点经过你的特征提取后变得完全一样(即模型无法区分它们),那么基于这些特征构建的任何后续模型,也必然无法学习到依赖于这两个点差异的任何模式。
定理的结论 则是强大的:只要S满足这个区分条件,并且对加法和乘法封闭(构成一个代数),那么由S生成的代数(记作R[S])就在连续函数空间C(X, R)中是 稠密 的。稠密意味着,对于任意一个你想要逼近的连续函数f,和任意你设定的精度要求ε > 0,你总能在R[S]中找到某个函数f‘,使得在整个空间X上,f’和f的差距处处小于ε。
在机器学习中的直观解读 :这就好比说,只要你设计的神经网络层(或特征提取器)足够“敏感”,能对不同的输入产生有区别的表示(即具有区分能力),那么堆叠足够多这样的层,理论上就可以逼近任何复杂的输入-输出映射(即具有表达能力)。这就是神经网络通用近似定理的精神内核之一。
2.2 Galois理论基本定理:代数对称中的“锁定与生成”
现在我们把舞台切换到代数。Galois理论处理的是域扩张的对称性。考虑一个“大”的域L包含一个“小”的子域k(例如,复数域C包含实数域R)。这个扩张可能带有额外的对称性,即那些保持k中每个元素不变的L的自同构(称为k-自同构),它们形成一个群G。
Galois理论建立了一个漂亮的对应:L中介于k和L之间的中间域K,与群G的子群H之间,存在一个反序的一一对应。这个对应由“固定子”操作联系:给一个中间域K,对应那些固定K中所有元素的子群H = Aut_K(L);反过来,给一个子群H,对应在H中每个元素作用下都保持不变的L的子集L^H,这恰好也是一个域。
“区分”在这里如何体现? 假设我们关注一个特定的子群H。我们想找一组元素f₁, …, f_s ∈ L,它们满足:
- H-不变性 :对于H中的每一个自同构h,都有h(f_j) = f_j。也就是说,这组元素被H“锁定”了,H的作用看不出它们的变化。
- G-H区分性 :对于G中任何一个不属于H的自同构g,至少存在一个f_j*,使得g(f_j*) ≠ f_j*。也就是说,这组元素能“感知”到H之外的对称性变化。
这组元素f_j就起到了“区分”子群H和更大群G的作用。它们像一组精密的探测器,对H内部的变换“免疫”,但对H外部的变换“报警”。
“表达”的结论随之而来 :Galois理论基本定理保证了,这样一组能区分H和G的元素f₁, …, f_s,它们 生成 的域k(f₁, …, f_s)(即通过k上的加、减、乘、除能得到的所有元素),恰好就等于那个由H固定的子域L^H。换句话说,任何被H固定的元素(即L^H中的任何东西),都可以用这组“探测器”f_j通过域运算表达出来。
与机器学习的联系 :在等变机器学习中,我们经常希望学习一个函数,它对某个变换群G的作用是 不变 的(例如,一个识别物体的分类器,应该对物体的旋转视角保持不变)。这里的L可以类比为所有可能函数的空间,k是平凡不变函数(常数)的子空间,G是作用在输入上的对称群。我们想找到一组 基础不变特征 (对应f_j),使得:
- 它们本身是G-不变的(对应H=G的情况?这里需要小心,在等变学习中,我们通常直接找G-不变生成元,对应H=G。更一般地,如果我们想研究对某个子群H的不变性,则对应上述框架)。
- 任何其他的G-不变函数,都可以用这组基础特征通过某种运算(不一定是域运算,可能是多项式或更一般的函数组合)来表达。
这就把模型设计问题,转化为了寻找能“区分”群作用轨道的特征生成元问题。
2.3 桥梁定理:统一两种“区分”概念
你可能会问,分析里的“区分点”和代数里的“区分群”,听起来还是不太一样啊?确实,这是两个不同层面的“区分”。但令人兴奋的是,存在一个数学定理(在文献中常作为工具出现,例如在[BSHCV24]中),可以在特定条件下将这两种“区分”概念联系起来。
这个定理的设定更贴近机器学习场景:我们有一个数据空间X,一个作用在X上的群G(比如旋转群、置换群),以及一个我们感兴趣的G的子群H。我们有一类“好”的函数F(比如多项式、解析函数或某些神经网络函数类)。
- Stone-Weierstrass式的区分(SW-区分) :一组G-不变函数f₁, …, f_r,如果除了一个“坏”的零测集外,它们能区分X上不同的G-轨道(即,如果两个点不在同一个G-轨道上,那么至少有一个f_j在它们上取值不同),则称这组函数是 泛SW-区分 的。
- Galois式的区分 :一组H-不变函数f ₁, …, f _s,如果它们被H中所有元素固定,但被G中任何不属于H的元素改变,则称这组函数 Galois-区分 了H和G。
桥梁定理(简述) :假设我们已经有一组函数f₁, …, f_r,它们是泛SW-区分G-轨道的。现在我们又找到一组函数f ₁, …, f _s,它们Galois-区分了子群H和整个群G。那么,把这两组函数合并起来:f₁, …, f_r, f ₁, …, f _s,这组更大的函数族就是泛SW-区分H-轨道的。
这个定理的威力在于 :它允许我们进行“分层构建”。我们可以先为一个较大的、结构简单的群G(比如独立置换所有坐标的群)找到容易构造的SW-区分函数集。然后,针对我们真正关心的、结构更复杂的子群H(比如同时置换行列的共轭作用),我们只需要找到一组能“探测”H和G差异的Galois-区分函数,把它们加进去,就能自动得到针对H的SW-区分函数集。这大大简化了在复杂对称性下构造通用近似模型的理论工作。
3. 在机器学习中的具体应用与实操
理解了核心原理,我们来看看这些抽象的定理是如何在具体的机器学习任务中落地,指导模型设计和理论分析的。我会结合等变机器学习、图神经网络和点云处理这几个领域,分享实际的思路和需要注意的细节。
3.1 等变机器学习与通用近似定理的证明
等变机器学习要求模型的输出与输入同步变换。例如,一个处理3D点云的网络,如果输入点云旋转了,其输出的特征也应该以相应方式旋转(等变),或者分类结果保持不变(不变)。证明这类模型仍然具有“万能”的逼近能力(通用近似性),是一个核心理论问题。
传统Stone-Weierstrass路径 :
- 定义假设空间 :首先,明确你的模型架构定义了哪一个函数集合F。例如,特定类型的等变神经网络层所构成的空间。
- 验证代数结构 :证明F在加法和数乘下封闭,通常还需要在某种乘法下封闭,以构成一个代数(或至少是一个向量空间)。
- 验证区分能力 :证明F中的函数能够区分输入空间X中不同的群G轨道。这是最关键也往往最困难的一步。你需要证明,对于任何两个不属于同一G轨道的点x, y,总能在F中找到某个函数f,使得f(x) ≠ f(y)。
- 应用定理 :如果X是紧致的(或可紧化),且F是代数,那么根据Stone-Weierstrass定理,F就在连续函数空间中稠密,即具有通用近似性。
实操难点与技巧 :
- 紧致性假设 :数据空间X往往不是紧致的(如整个R^n)。常见的处理技巧是,先证明模型在任意紧子集上的稠密性,或者考虑将数据投影到某个紧集(如单位球面)上。
- 区分性的构造 :如何系统地构造出能区分轨道的函数?对于某些群(如平移、旋转),可以利用 基本不变量 。例如,对于旋转群O(d),点云P的不变量可以由其格拉姆矩阵PP^⊤的对称多项式生成。这些多项式天然是旋转不变的,并且如果两个点云的格拉姆矩阵不同,则它们不可能通过旋转重合,从而实现了轨道区分。
- 非多项式激活函数 :Stone-Weierstrass定理要求函数代数对乘法封闭。如果使用ReLU等非多项式激活函数,其构成的集合可能不是代数。这时需要采用其变体,或使用更广义的通用近似定理(如Cybenko定理、Hornik定理),这些定理通常基于函数空间的 密度 论证,其核心仍然是某种形式的“区分性”条件。
Galois理论路径的介入 : 当我们面对更复杂的对称群,特别是像对称群S_n通过共轭作用在矩阵上时,直接构造SW-区分函数集可能很困难。这时,可以运用第2.3节提到的桥梁定理。
- 寻找更大的群G :找一个结构更简单、更容易处理的群G,它包含我们真正关心的群H。例如,对于矩阵的共轭作用(H),可以考虑一个更大的群G,它允许独立地置换矩阵的对角线元素和非对角线元素。
- 为G构造SW-区分集 :为这个更大的群G构造SW-区分函数集通常更容易,比如用对称多项式分别处理对角线和非对角线元素。
- 构造Galois-区分函数 :找到一个或一组函数f*,它是H-不变的(即,在行列同时置换下不变),但不是G-不变的(即,在对角线和非对角线独立置换下会改变)。这个函数f*就Galois-区分了H和G。
- 合并得到H的SW-区分集 :将第2步为G构造的集和第3步的f*合并,根据桥梁定理,这个新集合就是泛SW-区分H-轨道的。
这个方法在点云等变学习中被成功应用,它绕过了直接为复杂对称性构造不变量生成元的难题。
3.2 图神经网络(GNN)的表达能力与WL测试
图神经网络是等变机器学习的一个明星案例,其对称性是节点置换群S_n。GNN的表达能力上限,与其区分不同构图的能力紧密相关,这直接联系到经典的图同构问题。
Weisfeiler-Lehman (WL) 测试 :这是一个经典的、用于判断两个图是否可能同构的启发式算法。1维WL测试通过迭代地聚合和哈希节点及其邻居的标签来更新节点颜色,最终通过比较两个图的颜色多重集来判断是否同构。
GNN与WL测试的深刻联系 :研究表明,主流消息传递GNN的表达能力上限, 不超过 1维WL测试。也就是说,如果两个图能被1维WL测试区分,那么存在某个GNN也能区分它们;反之,如果两个图对1维WL测试是不可区分的(称为WL-同构),那么任何消息传递GNN对这两个图都会产生相同的输出。
从“区分即表达”视角看 :
- 区分作为表达的上限 :GNN的函数假设空间F(由���定的消息传递和聚合函数定义)的“区分能力”,被WL测试所界定。如果F无法区分两个图(即对它们输出相同),那么它显然无法表达任何在这两个图上取值不同的目标函数。因此,WL测试为GNN的表达能力划定了 上界 。
- 追求更强的表达 :为了突破WL测试的限制,研究者们设计了更具表达力的GNN变体,其核心思想就是增强模型的“区分能力”。例如:
- 高阶GNN :引入高阶张量信息,模拟更高维的WL测试(k-WL)。
- 子图GNN :不再仅从节点视角,而是从子图(如节点标记、边、环)的视角提取特征,这能区分更多WL-同构图。
- 注入唯一标识符 :为节点赋予随机或可学习的唯一ID,本质上破坏了置换对称性,从而获得了最强的区分能力(但可能牺牲泛化性)。
实操心得 :在设计或选择GNN时,务必考虑其表达能力是否与你的任务匹配。对于分子性质预测等任务,许多重要的分子特征可能被WL测试所捕获,标准GNN或许足够。但对于需要精细拓扑区分(如某些社交网络分析或代码分析)的任务,可能需要考虑更高阶或基于子图的GNN。同时,要警惕“过区分”导致的过拟合风险。
3.3 点云处理中的不变量生成与降维
点云数据(如3D扫描、分子结构)通常具有欧几里得运动(平移、旋转、反射)和点置换的对称性。学习对这些变换不变的表示是关键。
基于Galois/不变量理论的方法 :
- 平移不变性 :通常通过规范化轻松实现,例如将所有点减去质心,将点云中心置于原点。这是一种“规范化”技巧,与寻找不变量异曲同工。
- 旋转/反射不变性 :根据 正交群不变量基本定理 ,点云P ∈ R^(d×n)的所有O(d)不变多项式函数,都可以由其格拉姆矩阵X = PP^⊤的矩阵元的多项式函数生成。这是一个经典的“表达”结果:一组生成元(格拉姆矩阵的矩阵元)足以表达所有不变量。
- 置换不变性 :这是难点。我们需要在格拉姆矩阵X上,构造对共轭作用(π X π^⊤)不变的函数。直接寻找生成元集合可能很复杂。
应用桥梁定理的实操步骤(以[BSHCV24]为例) :
- 定义群作用 :我们的数据是格拉姆矩阵X(对称矩阵)。关心的群H是S_n,通过共轭作用:π: X -> π X π^⊤。
- 构造更大的群G :令G为S_n × S_{n(n-1)/2},它独立地置换X的对角线元素(n个)和非对角线元素(n(n-1)/2个)。这个群作用比H简单得多。
- 为G构造SW-区分集 :对于G,很容易构造区分函数。例如,分别对对角线元素集合和非对角线元素集合,计算它们的各阶 初等对称多项式 (或幂和对称多项式)。这些多项式显然是G-不变的,并且如果两个矩阵在对角线或非对角线元素的多重集上不同,这些多项式值必然不同,从而区分了G-轨道。
- 寻找Galois-区分函数f *:我们需要一个函数,它在H(同时置换行列)作用下不变,但在G(独立置换)作用下会变。一个经典的选择是考虑矩阵的 特征多项式 的系数,或者更具体地,计算矩阵的某个主子式。例如,考虑一个涉及特定对角线元素和非对角线元素的低阶多项式。这个函数在行列同时置换时保持不变(因为置换同步改变行和列),但如果只独立置换对角线或非对角线元素,其值就会改变。这就Galois-区分了H和G。
- 合并与结论 :将步骤3中为G构造的对称多项式集合,与步骤4中找到的f*合并。根据桥梁定理,这个新的函数集合就是泛SW-区分H-轨道的。也就是说,除了一个零测的“坏”集,它们可以区分不同共轭类的对称矩阵。
- 应用到点云 :由于点云的格拉姆矩阵是低秩的(秩≤d),存在依赖关系。我们可以利用低秩矩阵补全等技术,从这O(n^2)个特征中筛选出O(dn)个独立的特征,从而得到一个紧致且具有强区分能力的不变特征集,用于下游的机器学习模型。
这种方法的美妙之处在于,它将一个复杂的代数不变量生成问题,分解为一个相对简单的对称多项式构造问题和一个寻找“判别式”函数的问题。
4. 实践中的挑战、技巧与常见问题
理论很优美,但落地到实际代码和模型中,总会遇到各种意想不到的坑。下面分享一些我在研究和项目实践中总结的经验。
4.1 理论条件与现实数据的鸿沟
问题1:零测“坏集”的困扰 无论是Stone-Weierstrass定理的“稠密性”,还是桥梁定理中的“泛SW-区分”,都允许存在一个零测的“坏集”,在这个集合上区分性可能失效。在无限维的理论空间中,零测集可以忽略不计。但在有限的、离散的、甚至带有噪声的实际数据集中,我们无法保证采样点一定避开这个坏集。
- 应对策略 :
- 概率化视角 :将理论理解为“以概率1成立”。在实际中,我们接受模型对绝大多数数据有效。
- 增加特征冗余 :不要只依赖理论给出的最小生成元集。在实践中,使用一个 过完备 的特征集(例如,生成更高阶的多项式、使用随机特征)可以大大降低撞到“坏点”的风险。
- 数值稳定性检查 :对于构造出的不变量,在训练前可以计算一下它们在训练集上的条件数或相关性。如果某些特征值几乎线性相关或方差极小,可能意味着它们接近坏集,考虑剔除或正则化。
问题2:紧致性假设与无界数据 现实中的数据空间(如整个R^n)通常不是紧致的。Stone-Weierstrass定理要求紧致空间。
- 应对策略 :
- 数据预处理与规范化 :这是最实用的方法。将数据规范化到一个紧集内,例如通过缩放将特征限制在[0, 1]或[-1, 1],或者投影到单位球面上。这相当于将学习问题限制在一个紧子集上。
- 使用局部紧致或σ-紧致空间上的变体定理 :有些通用近似定理的版本放松了紧致性要求,但论证更复杂。在实践中,规范化通常是首选。
- 考虑模型的归纳偏置 :我们的模型(如神经网络)本身通常定义在有界参数上,其输出范围可能自然受限,这间接地在函数空间上施加了某种“紧致”约束。
4.2 计算复杂性与特征工程
问题3:不变量生成元的维度爆炸 即使理论上找到了一个有限的生成元集,其数量也可能随着问题规模(如点云点数n)快速增长。例如,对称矩阵的所有初等对称多项式数量是O(2^n)级别的,这不可行。
- 应对技巧 :
- 利用数据结构 :对于点云,格拉姆矩阵的秩最多是空间维度d。这意味着所有O(n^2)个矩阵元中,只有O(dn)个是线性独立的。我们可以通过特征值分解或Cholesky分解,用O(dn)个参数来参数化格拉姆矩阵,从而将不变量的数量从O(n^2)降到O(dn)。
- 使用低阶不变量 :高阶多项式不变量不仅数量多,而且容易导致数值不稳定和过拟合。优先使用低阶(一阶、二阶)不变量作为主要特征,高阶项可以作为补充或通过核方法隐式引入。
- 学习而不是构造 :与其显式构造所有理论上的不变量,不如设计一个等变网络架构(如SE(3)-Transformer, Tensor Field Network),让网络在训练过程中 自动学习 有用的不变/等变特征表示。这通常更高效且泛化更好。
问题4:区分性不等于好的表示 一组函数能区分所有数据点,并不意味着它就是一个好的、易于机器学习模型学习的特征表示。它可能非常“脆弱”(ill-conditioned),或者将无关的噪声也编码进来。
- 实操建议 :
- 结合降维 :在使用了强区分性的不变量特征后,通常需要接一个降维步骤(如PCA、自动编码器)或直接输入到一个深层神经网络中。网络的前几层可以看作是在学习如何将这些理论上的区分性特征,重新组合成更鲁棒、更语义化的表示。
- 正则化是关键 :使用强区分性特征时,模型容易过拟合。必须配合使用强正则化技术,如权重衰减、Dropout、早停等。
- 评估特征重要性 :使用诸如SHAP、LIME或简单的特征相关性分析,来理解哪些理论不变量对最终任务预测贡献最大。这可以帮助你精简特征集。
4.3 等变模型设计的经验法则
基于“区分即表达”的视角,在设计等变模型时,可以遵循以下思路:
- 从对称性出发定义群G :首先精确地定义你的数据所具有的对称群G(例如,3D旋转SO(3)、平移、置换等)。
- 分析轨道结构 :思考在群G作用下,你的数据空间如何被划分成轨道。两个数据点属于同一轨道,当且仅当它们通过G中的变换可以相互转换。模型需要学习的函数,应该是在轨道上取常值(不变)或以协调方式变化(等变)的。
- 寻找或构建区分轨道的特征 :
- 已知不变量 :对于常见群(如欧几里得群),有现成的不变量(如距离、角度、体积)。从这些开始。
- 使用等变层 :采用已经设计好的等变网络层(如球形卷积、等变线性层),它们能保证中间表示始终满足等变性约束。
- 通过群平均 :如果你有一个非等变的强大模型,可以通过“群平均”技巧来构造等变模型:f_equiv(x) = (1/|G|) Σ_{g∈G} ρ_out(g)^{-1} * f_base(ρ_in(g) * x)。其中ρ_in和ρ_out是输入和输出空间的群表示。这保证了等变性,但计算成本可能很高。
- 验证表达能力 :理论上,检查你的特征集或模型架构是否满足区分轨道的条件(至少是泛区分)。实践中,可以通过在合成数据集上测试,看模型能否学习到已知的不变函数或等变函数。
- 注意计算与泛化的平衡 :最强的区分性可能带来最高的计算复杂度和过拟合风险。需要在表达能力、计算效率和泛化性能之间取得平衡。有时,一个表达能力稍弱但更高效的模型,在实践中表现更好。
5. 总结与延伸思考
回顾整个旅程,我们从Stone-Weierstrass和Galois这两个分属分析和代数的经典定理出发,看到了它们共同蕴含的“区分即表达”的深刻原理。这个原理不仅仅是数学上的巧合,更是理解机器学习模型表达能力的一把钥匙。
在标准的前馈神经网络中,通用近似定理的证明内核,正是验证了某些激活函数族能够区分不同的输入点。在图神经网络中,其表达能力的界限被WL同构测试所刻画,这直接对应着其区分不同图结构的能力上限。在等变机器学习中,为了设计出既满足对称性约束又具有强大表达能力的模型,我们巧妙地利用Galois理论的思想,通过寻找能“探测”对称性差异的特征,来构建能区分群作用轨道的函数集,进而保证其表达完整性。
对我个人而言,这个视角最大的启发是 提供了问题分解的思路 。当面对一个具有复杂对称性的学习问题时,不要试图一蹴而就。可以尝试:
- 将大的对称群分解,或嵌入到一个结构更简单、更容易处理的更大群中。
- 为这个简单的大群构造区分性特征(这通常比较容易)。
- 寻找能捕捉“大群”和“我们关心的子群”之间本质差异的“判别式”特征。
- 合并这些特征,从而获得针对原子群的、具有强区分能力和表达能力的特征集。
最后,需要清醒认识到,理论上的“表达能力”只是一个必要条件,而非充分条件。一个能区分所有数据的模型,也可能因为优化困难、泛化能力差而无法在实践中取得好效果。但反过来,如果一个模型连区分数据的基本能力都不具备,那么其性能天花板将非常低。因此,“区分即表达”的视角,更多地是指导我们在设计模型初期,避开那些存在根本性表达缺陷的架构,为后续的优化和泛化提供一个坚实而广阔的基础。在实际项目中,我通常会先用一些极端的小样本或构造数据,快速测试一下候选模型架构的区分能力,如果它连一些明显不同的模式都学不会,那么后续投入大量资源调参的意义就不大了。这或许就是这个数学原理留给我们的最实用的启示。
更多推荐
所有评论(0)