
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
定义:工厂模式的思想主要为:多个类似的子类继承同一个父类,对其父类中的变量进行操作;工厂类负责判断、控制哪个子类被执行,而工厂类调用子类完成后,返回的结果是该子类的父类,该父类中的变量已经被操作过了,访问该父类,得到我们想要的结果。策略模式定义了一系列的算法,并将每一个算法封装起来,而且使它们还可以相互替换。策略模式让算法独立于使用它的客户而独立变化。在软件开发中也常常遇到类似的情...
摘要: AB实验的核心是通过统计学方法从噪声数据中识别真实效应。P值衡量策略无效假设下观测结果的概率,小于0.05通常认为统计显著。置信区间提供效应量的不确定性范围,与P值互为补充。T检验是互联网AB实验的主力方法,适用于方差未知的场景,通过t统计量评估组间差异。工业界普遍采用T检验(尤其是Welch's变体),因其对样本量和方差假设更稳健。Z检验因需已知总体方差,在实际业务中基本被弃用。大样本下
C++的正则表达式相比其他语言的用法要复杂一些,尤其比perl复杂的的多,但是万变不离其宗,其本质内容还是保持一致的,下面介绍一下C++正则表达式的结构:正则表达式结构按字符串宽窄和常量非常量可以分为四族:string regex、smatch、ssub_match 、sregex_iteratorconst char*regex、cmatch、csub_match...
C++的正则表达式相比其他语言的用法要复杂一些,尤其比perl复杂的的多,但是万变不离其宗,其本质内容还是保持一致的,下面介绍一下C++正则表达式的结构:正则表达式结构按字符串宽窄和常量非常量可以分为四族:string regex、smatch、ssub_match 、sregex_iteratorconst char*regex、cmatch、csub_match...
本文系统总结了分类模型的核心评估指标与工程实践要点。重点解析了准确率在类别不平衡数据中的误导性,提出了基于混淆矩阵的精确率、召回率、F1 Score等更可靠的评估体系。深入探讨了贝叶斯定理与朴素贝叶斯模型的数学原理,强调特征独立性假设的局限性。在特征工程部分,详细讲解了归一化、对数变换等预处理技术,特别指出数据泄露的常见陷阱。最后通过Q&A复盘实战中的关键细节,包括分层抽样、AUC指标和零
摘要: Boosting是一种集成学习方法,通过串联多个弱学习器(如浅层决策树)逐步修正误差,形成强学习器。其核心逻辑是拟合残差,每一轮新树都针对上一轮的误差进行预测,最终累加结果。与随机森林的并行投票不同,Boosting采用串行接力机制,更注重降低偏差。XGBoost作为典型代表,使用回归树输出分数而非类别,并通过梯度下降和正则化优化模型。调参关键包括树的数量(n_estimators)、学习
通常我们认为:训练集表现好 + 测试集表现差 = 过拟合但这只是表象。从信息论模型把数据中的“噪音(Noise)”误读成了“信号(Signal)”。比如,训练数据里有一条记录:“2月14日,某用户买了巧克力”。真实规律(Signal):情人节大家爱买巧克力。噪音(Noise):该用户当天穿了红袜子。过拟合的模型:学会了“穿红袜子的人会买巧克力”。树模型——从简单的if-else决策树,到集众智的随
摘要:本文系统梳理了因果推断的方法论体系,从基础理论到工业应用。首先通过FWL定理揭示多元回归的正确操作,强调双向正交化的重要性;其次区分因果识别的战略层(如后门准则)与估计的战术层(如IPW、G-Computation);然后对比结果建模与处理建模两大流派的特点与适用场景;最后推荐工业界首选的双重机器学习(DML)方法,其结合FWL定理与机器学习优势,具有双重稳健性。文章构建了清晰的因果推断决策
摘要: 大模型评测需采用类似AB实验的严谨方法论,分为六个标准化步骤:1)测试需求分析,明确评测目标与维度;2)测试环境准备,确保硬件/软件一致性;3)测试数据构建,注重多样性、去重与专家标注;4)基准测试执行,控制变量并记录全链路日志;5)测试结果评估,结合自动/人工评估与统计分析;6)结果展示,通过可视化与Bad Case分析指导优化。该方法强调工程化闭环,避免主观盲测,确保评测结果可靠且可行
摘要: 本文探讨AB实验中随机化(Randomization)的核心作用及样本比例失衡(SRM)的危害。随机化是确保实验组与对照组同质性的关键,为因果推断构建“平行宇宙”。然而,工业实践中分流错误、数据丢失等问题常导致SRM(如预期50:50,实际40:60),引发严重偏差。例如,策略导致部分用户崩溃且数据未上报,造成“幸存者偏差”,使结果失真。检测SRM需优先通过卡方检验验证样本比例(P<







