底层视觉及图像增强-项目实践理论补充(十六-0-(17):机器学习在工业界的道与术:从理论到LED显示实战的深度思考):从奥运大屏,到手机小屏,快来挖一挖里面都有什么
底层视觉及图像增强-项目实践理论补充(十六-0-(17):机器学习在工业界的道与术:从理论到LED显示实战的深度思考):从奥运大屏,到手机小屏,快来挖一挖里面都有什么
代码仓库入口:
- 源码地址。
系列文章规划:
- 第一章节:底层视觉及图像增强-项目实践(十六-1:Real-ESRGAN在LED显示画质增强上的实战:从数据构建到模型微调):从奥运大屏,到手机小屏,快来挖一挖里面都有什么
第二章节:底层视觉及图像增强-项目实践<十六-2,谈些虚虚的,项目咋做?论文看哪些点?有哪些好工具能用?>(从LED显示问题到非LED领域影像画质优化):从LED大屏,到手机小屏,快来挖一挖里面都有什么
机器学习在工业界的道与术:从理论到LED显示实战的深度思考
作为一名在LED显示画质领域深耕多年的工程师,我深刻体会到,机器学习并非遥不可及的学术黑盒,而是一套解决现实问题的强大工程哲学。本文旨在剥离复杂公式,从第一性原理出发,结合实战,为你呈现一份有深度、有温度的机器学习工业级解读。
第一部分:监督学习 —— 让机器学会“按图索骥”
监督学习的核心,是让模型从“已知问题”的“标准答案”中,学习一个从输入到输出的映射规律。这好比一位经验丰富的老师傅,带着图纸(标签)去教徒弟(模型)识别和预测。
- 监督学习(训练数据都是有标签的,训练过程中是需要给模型喂这些标签的)
1. 分类:教机器“认东西” 分类(标签是离散的)
原理与通俗解:
分类任务的目标,是让模型学会划定边界,将不同的数据点归入预设的“抽屉”里。这个“抽屉”可以是“猫/狗”,也可以是“显示正常/有坏点”。或者说,就像有经验的老师傅看一眼屏幕就能说出"这是耦合问题"、“那是余晖现象”,分类算法通过大量样本训练,学会了这种"一眼识病"的能力。
- 或者说,输入一个狗蛋的图片,输出是狗蛋的分类
核心原理:分类算法通过学习已有数据中的特征-标签对应关系,构建决策边界,实现对未知数据的类别预测。
- 训练分类模型
- 首先把数据集划分为训练集和测试集,根据训练集训练出分类模型
- 除此之外,经典的数据集:
- 鸢尾花:三分类问题。机器学习的Hello World—>可视化数据集
- 泰坦尼克号
- 除此之外,经典的数据集:
- 将测试集/验证集的特征和标签输入到分类模型中,模型根据测试集或者验证集每个数据的特征,猜测每个数据的标签
- 模型自我更新,使猜测的标签和真实标签的差别最小化
- 首先把数据集划分为训练集和测试集,根据训练集训练出分类模型
工业级思考与LED实战:
-
KNN(K近邻):它像一个“随大流”的决策者。判断一个新像素点的显示状态(如是否属于“低灰偏色”类别),就看它周围K个最近的已知像素点大多数是什么状态。在LED屏“去坏点”的初筛中,我们可以利用KNN快速定位孤立异常点——如果一个像素的亮度/色度值与周围绝大多数邻居差异巨大,它就有很高概率是一个坏点。但这方法在坏点成片出现时(如“色块”问题)就力不从心了。
-
支持向量机(SVM):它是一位追求“极致公平”的边界划定师。SVM的目标是在不同类别的数据点之间,找到一个“最宽”的决策边界(超平面),确保两边的点到这条边界的最小距离最大化。在处理LED低灰阶的“色温一致性”问题时,我们可以将不同电流下的色坐标数据投射到高维空间,用SVM寻找最优分界,从而精准判断当前参数下屏体色温是“偏冷”还是“偏暖”,为后续的PWM/PAM参数调节提供决策依据。
-
决策树与随机森林:决策树模拟了人类“分而治之”的决策过程,通过一连串的“if-else”问题(如:灰阶>50?电流档位=128?)对数据进行分类。而随机森林是让一群“各有所长”的决策树专家委员会共同投票,有效避免了单棵树的“钻牛角尖”(过拟合)。在构建“画质测评系统”时,我们用它来快速诊断屏体异常:通过分析DCLK频率、GCLK分频、区域亮度均值等特征,模型可以像老工程师一样,快速判断出“这是首行偏暗问题”还是“耦合问题”,极大提升了调试效率。
-
其余的解决分类的算法:简略总结
- KNN:只看每一个最近的几个点是什么类别
- 支持向量机:寻找两种数据之间最大的间隔的超平面
- 决策树:分而治之,逐渐生长
- 随机森林:把若干个决策树集成起来,有效的防止过拟合
- 朴素贝叶斯:基于贝叶斯公式、条件独立假设
- 逻辑回归:最基础的二分类,sigmoid函数把输入映射到和1之间
- 隐马尔可夫:根据一个人这一天的行踪就可以推断这一天的天气
- 深度学习
- 神经网络:模拟人大脑中神经元的拓扑结构
- 图像分类
分类模型的“KPI”:如何评估模型的好坏?
模型预测不是猜谜,我们需要一套客观的评估体系,尤其是在样本不均衡的工业场景中。
工程案例:在驱动芯片的低灰色块检测中,发现交叉熵损失对稀疏的色块区域不敏感,改用Focal Loss后,模型对少数类(色块)的关注度提升,F1-Score从0.68提升到0.85。
- 混淆矩阵的举例:
- 举例:
- 真实感冒:Actual Positive
- 真实健康:Actual Negative
- TP:真实异常被正确识别(如真正的坏点被标记)
- a:TP .真正例
- FP:正常像素被误判为异常(假警报)
- c:FP 假正例
- FN:真实异常未被检测到(漏检)
- b:FN 假反例
- TN:正常像素正确识别
- d:TN 真反例
- 举例:
| n = 100 | 预测为感冒 | 预测为健康 |
|---|---|---|
| 真实感冒 | a | b |
| 真实健康 | c | d |
-
准确率的陷阱:当99%的像素都正常,只有1%是坏点时,一个把所有像素都预测为“正常”的“懒”模型,准确率也能高达99%。但这个模型毫无用处。在LED“坏点检测”中,我们从不把准确率作为核心指标。
-
查准率 vs. 查全率(Precision & Recall):
- 查准率:模型说“这个是坏点”,它有多大的概率真是坏点?这关乎维修成本。我们希望查准率高,否则工程师会浪费大量时间去“假报修”。
- 查准率(Precision):(预测为感冒中的真实感冒)/(预测为感冒总样本=预测为感冒中的真实感冒+预测为感冒中的真实健康)。a/(a + c)----预测为感冒的数据中有多少真的是感冒
- 查全率:所有真实的坏点中,模型找出来了多少?这关乎产品质量。我们希望查全率高,否则流出市场的屏体带着未检测出的坏点,影响品牌声誉。
- 查全率/敏感性/召回率(Recall):(真实感冒中的预测为感冒)/(真实感冒总样本=真实感冒中的预测为感冒+真实感冒中的预测健康)。a/(a + b)----真实感冒数据中有多少被预测出来了
- 查准率:模型说“这个是坏点”,它有多大的概率真是坏点?这关乎维修成本。我们希望查准率高,否则工程师会浪费大量时间去“假报修”。
-
F1-Score:它是查准率和查全率的“调和平均数”,好比一个团队的“整体战斗力”。只有当两者都高时,F1-Score才会高。在坏点检测中,我们追求高F1-Score,这意味着我们在控制维修成本的同时,最大程度地保障了出厂质量。
- F1-Score:在坏点检测中,我们既不能容忍太多漏检(影响显示质量),也不能接受过多误报(增加维修成本)。F1在两者间取得平衡。
- F1-Score:大家好才是(F1-Score)真的好,其中任何一个低最终F1-Score都会很低
- F1-Score:查准率和召回率的调和平均数*2;多分类的F1-Score是每一类F1-Score的平均值
-
准确率(Accuracy):主对角线上预测为正确的/总样本。(a + d)/(a+b+c+d)
-
特异性(Specificity):d/(c+d)
-
ROC与AUC:ROC曲线描绘了模型在不同判断阈值下的“能力全景图”。横坐标FPR(假正率)代表“误杀好人的比例”,纵坐标TPR(召回率)代表“抓住坏人的比例”。AUC是曲线下的面积,越接近1,模型综合分辨能力越强。在调整“低灰MG算法”的判定阈值时,我们通过ROC曲线来权衡:是容忍少量轻微色块(提高阈值,降低FPR)以保证多数区域平滑,还是宁可错杀也要消除所有潜在色块(降低阈值,提高TPR)。
- ROC-AUC:在低灰均匀性检测中,由于"良好区域"远多于"异常区域",AUC能客观反映模型在样本不均衡下的真实性能。
- ROC:受试者工作特性曲线
- 负样本和正样本,分类器会给一个阈值。小于这个阈值分类器会预测为负样本,大于这个阈值分类器就会预测这个是正样本。针对某一个阈值,那么根据负样本和正样本的数据就可以求出此时阈值下的混淆矩阵、FPR(FP/(FP+TN))、TPR(=TP/(TP+TN))
- 那不同的阈值可以得到不同的混淆矩阵、FPR、TPR,就可以得到一个横坐标为FPR、纵坐标为TPR的ROC曲线。,ROC曲线越接近上面的正方形说明分类器的性能越好,负样本、正样本分的越开,说明分类器的分类效果很好,那此时ROC曲线接近正方形的左上直角
- 可以实时看ROC的效果
- http://navan.name/roc/
- https://arogozhnikov.github.io/2015/10/05/roc-curve.html
- https://projector.tensorflow.org/
- AUC(Area under curve)ROC与正负样本完全重合的y=x曲线围成的面积就是AUC,Area under curve。面积越大说明分类器的分类性能越好
-
应用场景总结:
- 对数损失(交叉熵损失)不适用于样本不均衡时的分类评估指标
- ROC-AUC可作为样本正负不均衡时的分类评估指标
- 如果我们想让少数情况被正确预测,就用ROC-AUC作为评估指标
- F1-Score和PR曲线在正样本极少时适用于作为分类评估指标
- 正样本很少的情况下,比如垃圾邮件检测、信用卡欺诈,此时对数损失或者交叉熵损失不敏感,现在看不出来区别,所以此时交叉熵损失或者说对数损失不敏感。此时F1-Score和ROC-AUC都适用
- 对数损失:交叉熵损失(LogLoss)
- 负样本很少的情况下,对数损失对样本不均衡同样不敏感,不适用。F1-Score不适用,ROC-AUC适用
- 正样本很少的情况下,比如垃圾邮件检测、信用卡欺诈,此时对数损失或者交叉熵损失不敏感,现在看不出来区别,所以此时交叉熵损失或者说对数损失不敏感。此时F1-Score和ROC-AUC都适用
- F1-Score和PR曲线在FP比FN更重要时,适用于作为分类评估指标
2. 回归:教机器“预测未来” 逻辑回归(标签是连续的)
原理与通俗解:
回归任务预测的是一个连续值。它不关心“是什么”,而关心“是多少”。就像根据历史数据和环境因素,预测明天的气温。预测一个连续的值,根据一个城市的人口就能预测一个城市的用电量/房价等连续的数值
工业级思考与LED实战:
- 线性回归:它假设事物的发展是简单的线性关系。但在复杂的显示系统中,这种假设往往过于理想化。
- 更高级的回归模型(如SVR、梯度提升树):这些模型能捕捉复杂的非线性关系。在“热力补偿”模型中,我们使用回归模型,根据屏体背部温度传感器读数、环境湿度和当前显示内容的平均灰度级,精准预测每一个LED灯珠的亮度衰减曲线,并提前进行补偿,从而保证屏体在长时间运行后,亮色度依然均匀如一。
第二部分:非监督学习 —— 让机器发现“未知世界”
当没有“标准答案”(标签)时,非监督学习能让机器从数据自身中寻找内在结构和规律。
- 非监督学习(训练数据都是没有标签的)
1. 聚类:数据中的“物以类聚”
原理与通俗解:
聚类算法会自动将相似的数据点归为一组,形成一个个“圈子”。聚类(离散)把没有标签的数据自组织的聚成一簇:
工业级思考与LED实战:
- K-Means:一种经典且高效的聚类算法。在全灰阶校正后,我们可以对屏体所有灯珠的校正系数进行聚类分析。如果发现某些区域的灯珠自动聚成了一类,且其系数特征与周边迥异,这往往暗示着该区域存在特殊的“mura”或“一致性”问题,为我们后续的精细化调试提供了重点方向。
解决聚类的算法:OPTICS、DBSCAN等
2. 降维:从高维空间“透视”本质
原理与通俗解:
降维技术能将成百上千个特征(高维数据)压缩到2维或3维,让我们能用肉眼直观地看到数据的分布。
- 降维(连续):把高维数据压缩成为三维或者二维,或更低维。便于我们可视化,便于人类理解背后的规律
工业级思考与LED实战:
在分析“画质引擎”采集到的海量屏体数据(如每个区域的RGB亮度、色坐标、Gamma值等)时,我们使用t-SNE等降维算法,将每个屏体的“画质状态”投射到二维平面上。理想情况下,所有状态良好的屏体应该紧密地聚集在一起。如果某个新生产的屏体其数据点远离这个“健康集群”,它很可能存在潜在的、人眼尚未发现的画质缺陷,需要触发预警进行开箱复查。
第三部分:强化学习 —— 让机器在“试错”中成长
原理与通俗解:
强化学习模拟了“驯兽”的过程。智能体(Agent)在环境(Environment)中采取行动(Action),环境给予奖励(Reward)或惩罚。其目标是学习一套策略(Policy),使得长期累积的奖励最大化。
- 介于监督和非监督之间,要训练一个智能体,能够感受到环境,能够接受到环境的奖励或惩罚,根据环境的奖励和惩罚来采取下一步的行动,这一步动作又会形成新的奖励和惩罚。比如机器人走迷宫,走对奖励走错惩罚,直至走出迷宫
- 由遗传算法思想【物竞天择、适者生存】演变而来
工业级思考与LED实战:
我们正在预研将强化学习应用于“IC参数自动调优”。传统的调试依赖工程师的经验,耗时耗力。
- 智能体(Agent):我们的自动调试算法。
- 环境(Environment):LED屏体 + 画质测评系统。
- 动作(Action):微调某个IC参数,如“耦合优化等级”或“GCLK频率”。
- 状态(State):测评系统反馈的当前画面指标(如对比度、刷新纹可见性、均匀性)。
- 奖励(Reward):如果调整后,关键画质指标(如低灰均匀性)提升,给予正奖励;如果引入新问题(如画面抖动),给予负奖励。
通过数百万次的“模拟调试”,这个智能体最终能学会一套复杂的调参策略,其效率和质量可能超越人类工程师,实现真正的“AI画质引擎”。
第四部分:AI的融合与升维——点亮显示技术的未来
将AI融入LED显示,不是简单地替换几个算法,而是一场思维范式的变革。
-
从“感知”到“认知”:传统图像处理只在“感知”层面工作(如边缘检测)。而AI模型,尤其是深度学习,能够学习到画质的“认知”概念。例如,一个训练好的CNN模型,不仅能检测出“色块”,还能理解什么是“通透感”、什么是“胶片质感”。
-
端到端优化:我们不再满足于分模块优化(低灰校正、画质引擎、全灰阶校正各干各的)。未来的方向是构建一个“端到端”的AI画质网络,输入原始的、未经任何处理的屏体数据,直接输出最优的IC参数集和校正系数,从根本上解决各模块间相互干扰的“顽疾”。
-
超分辨率(SR)的落地想象:在LED显示屏领域,超分技术并非只是为了将720p视频放大到4K显示。我们更关注其在“低灰阶”和“高刷新率”下的应用。通过训练一个针对LED显示特性优化的ESRGAN模型,我们可以在低灰阶区域“创造”出更平滑的灰度过渡,有效抑制低灰抖动感;同时,通过帧间超分,在硬件限制下智能插帧,实现视觉刷新率的有效提升,减轻拍摄时的扫描纹。
总结
机器学习,于我们LED显示工程师而言,是一套将“工程师经验”数字化、模型化、自动化的强大工具箱。从用KNN快速定位坏点,到用聚类发现潜在缺陷区域,再到用强化学习探索无人涉足的参数空间,我们正一步步地将画质调试这门“艺术”,升级为一门可量化、可复制、可进化的“科学”。
这条路很长,但每一点探索,都让我们离“极致显示”的梦想更近一步。希望本文的分享,能为你带来启发。
-
如果想了解一些成像系统、图像、人眼、颜色等等的小知识,快去看看视频吧 :
- 抖音:数字图像哪些好玩的事,咱就不照课本念,轻轻松松谝闲传
- 快手:数字图像哪些好玩的事,咱就不照课本念,轻轻松松谝闲传
- B站:数字图像哪些好玩的事,咱就不照课本念,轻轻松松谝闲传
- 认准一个头像,保你不迷路:

- 认准一个头像,保你不迷路:
-
您要是也想站在文章开头的巨人的肩膀啦,可以动动您发财的小指头,然后把您的想要展现的名称和公开信息发我,这些信息会跟随每篇文章,屹立在文章的顶部哦

更多推荐
所有评论(0)