logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

别怕数学!用Python和NumPy图解机器学习里的线性代数(附代码)

本文通过Python和NumPy图解机器学习中的线性代数,帮助读者直观理解向量、矩阵、特征值等抽象概念。文章包含丰富的代码示例和可视化演示,涵盖向量运算、矩阵变换、特征分解等核心内容,并展示线性代数在机器学习中的实际应用,如线性回归和图像压缩。

#机器学习#线性代数
机器学习模型欠拟合与过拟合的平衡诊断与调优

在机器学习中,模型泛化能力的核心矛盾源于偏差与方差的固有权衡:偏差过高导致欠拟合(underfitting),模型无法捕捉数据基本规律;方差过高引发过拟合(overfitting),模型过度记忆训练噪声。这一偏差-方差分解(Bias-Variance Tradeoff)构成了模型健康评估的理论基石。其技术价值在于为调参、架构选型与正则化策略提供可量化依据,广泛应用于推荐系统、风控建模、搜索排序等工

机器学习入门实战地图:从监督学习到Scikit-learn全流程

机器学习入门本质是掌握一种可落地的问题解决范式,其核心在于理解监督学习的基本原理——即从带标签的历史数据中学习输入与输出的映射关系。这一过程依赖三大技术支柱:特征工程(将业务信息转化为模型可用的数值表达)、模型评估(超越准确率,关注精确率、召回率与混淆矩阵等业务敏感指标),以及Scikit-learn等成熟工具链提供的低门槛实践接口。它不追求算法深度,而强调‘可执行性’:从环境配置、数据清洗、标准

#机器学习入门
Anthropic架构归零:大模型如何主动绕过中间层

在AI工程实践中,'中间层'(如RAG、Prompt编排、规则引擎)长期承担弥补模型能力短板的职责,其本质是模型认知局限与现实任务复杂性之间的缓冲带。随着大模型元认知能力跃升,'动态层识别'与'零拷贝上下文协商'等机制使模型可实时评估知识缺口、自主触发或跳过外部服务,从而将系统复杂度向硬件底层与业务语义顶层两级坍缩。这种‘归零’并非功能削弱,而是架构熵减的技术必然,带来延迟降低、幻觉减少、运维简化

机器学习模型大乱斗后,如何科学地给算法排名?Friedman检验与Nemenyi后续检验实战指南

本文详细解析了Friedman检验与Nemenyi后续检验在机器学习模型性能评估中的应用,帮助科学判断模型间的真实差异。通过Python实战代码演示,展示了如何从统计显著性角度为模型排名,避免单纯依赖平均准确率的误区,适用于Kaggle竞赛和学术研究场景。

#机器学习
EEG深度学习优化器对比:从Adam到SGD的实战选型指南

在深度学习模型训练中,优化算法是决定模型性能与效率的核心组件。其基本原理是通过迭代调整模型参数以最小化损失函数,直接影响模型的收敛速度、稳定性和最终泛化能力。自适应学习率算法(如Adam、RMSprop)因其能自动调整参数更新步长,已成为处理高维、非平稳数据的默认选择,显著提升了训练稳定性。在脑机接口和EEG信号分类这类具有高噪声、非平稳特性的时序数据处理任务中,优化器的选择尤为关键,它关系到模型

#深度学习
大模型系统提示词设计原理与安全实践指南

系统提示词(System Prompt)是大语言模型行为对齐的核心控制机制,其本质是在推理前注入的不可见指令,用于定义角色、约束输出边界并激活基础安全层。其设计需兼顾语义明确性、token效率与安全钩子嵌入能力,典型长度通常在200–2000 tokens之间,远低于误导性宣传中的数万token量级。合理运用系统提示可显著提升模型在客服、教育、编程等场景下的可控性与专业性,同时避免越狱风险与幻觉放

即插即用AI记忆系统:零侵入兼容任意大模型

AI记忆能力并非必须通过扩大上下文、微调模型或重写应用来实现;其本质是将长期状态管理从模型内部解耦,构建独立于推理引擎的外部记忆层。该技术基于协议抽象与中间件设计,遵循标准OpenAI API规范,支持Ollama、vLLM、Claude等所有兼容接口的模型,实现真正的跨框架兼容。核心价值在于不修改模型参数、不增加训练成本、不牺牲推理性能,即可赋予AI持续会话跟踪、历史事实回溯与业务上下文沉淀能力

用共享内存给GPU‘扩容’是坑还是宝?本地调试Stable Diffusion等大模型时的速度与显存权衡实录

本文探讨了使用共享内存技术为GPU显存扩容的可行性,特别是在本地调试Stable Diffusion等大模型时的实际效果。通过详细的性能测试和场景分析,揭示了共享内存技术在显存不足时的应急价值与性能折衷,并提供了优化配置和避坑指南,帮助开发者在速度与显存之间找到平衡点。

#GPU
指数加权平均:深度学习中的时间滤波器原理与工程实践

指数加权平均(EWA)是深度学习中一种基础而关键的时间序列平滑技术,其核心在于通过衰减系数β实现‘近重远轻’的历史信息融合,本质是一种动态时间滤波机制。它并非简单降噪,而是赋予模型对瞬时扰动的免疫力和对长期趋势的感知力,支撑着Adam优化器的动量更新、BatchNorm的统计量维护以及Transformer的稳定性设计。在工程实践中,EWA直接影响训练收敛速度、异常样本识别精度与边缘部署延迟。本文

    共 198 条
  • 1
  • 2
  • 3
  • 20
  • 请选择