
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
训练/测试切分的本质,是将科学研究中"可重复性"的理念引入机器学习。一个好的模型,不应该只在特定数据上表现优异,而应该具有普遍的预测能力。就像学生需要通过考试证明自己真正掌握了知识,机器学习模型也需要通过测试集证明自己真正学会了规律。这个简单的"考试法则",是通往可靠人工智能的第一步。当我们面对日益复杂的数据和模型时,训练/测试切分提醒我们:不要被表面的数字迷惑,真正的考验永远在未知的数据中。只有
本文介绍了机器学习建模的核心流程,包括数据准备、数据切分、模型训练和评估。首先展示了一个员工离职预测的数据示例,说明特征(X)和标签(y)的结构。接着详细讲解了三种数据切分方法:随机切分(推荐使用train_test_split)、交叉验证和时间序列切分。最后演示了如何使用训练集训练逻辑回归模型,并查看模型参数。整个过程强调数据预处理的重要性,并提供了完整的Python代码实现,适合机器学习初学者
1. 回归是机器学习的基础线性回归是最基本的机器学习算法统计学习和机器学习本质相同,只是术语不同理解回归是理解机器学习的第一步2. 机器学习三大类型有监督学习:有标签,学习映射关系(回归、分类)无监督学习:无标签,发现数据模式(聚类、异常检测)强化学习:通过试错,学习最优策略3. 从简单到复杂的演进线性回归 → 逻辑回归 → 神经网络 → 深度学习每一步都建立在前一步的基础上4. 评估比训练更重要
NFL定理是一个"守恒定律",说明算法性能在所有问题上的平均是相同的这个定理的前提是所有问题等概率出现,包括完全随机的问题理解定理要关注其前提条件分析理论与实践的差距是关键数学推广要保持公式的结构和逻辑一致性❌ 误解:NFL定理说明算法研究无意义✅ 正解:NFL定理强调算法的有效性依赖于问题特性❌ 误解:存在万能算法✅ 正解:算法需要与问题匹配,没有银弹如何识别问题的特性?如何设计与问题匹配的归纳
双随机矩阵兼具行随机和列随机性质,是一类重要的特殊矩阵信息熵刻画了概率分布的不确定性,在均匀分布时达到最大谱半径决定了矩阵迭代的收敛性质利用Jensen不等式处理凹函数的最值问题利用Gerschgorin圆盘定理估计特征值的范围构造特殊向量(如全1向量)来验证特征值的存在性多角度证明同一结论以加深理解注意区分 H(X) 和标准熵 H§ 的关系(差一个归一化常数)Gerschgorin定理给出的是充
决策树:偏好较短的树和信息增益大的划分朴素贝叶斯:假设特征条件独立支持向量机:偏好最大间隔超平面k近邻:假设相似样本具有相似输出线性回归:假设线性关系神经网络:偏好平滑函数和层次化表示归纳偏好是机器学习算法的内在特征,决定了算法在多个假设中的选择倾向识别算法归纳偏好:看算法优化什么目标、做了什么假设设计归纳偏好:平衡拟合与复杂度,使用正则化思想不要认为完美拟合训练数据就是好模型噪声环境下,适度的"
本文基于西瓜数据集(2个样本)探讨了机器学习中的假设空间概念: 假设空间计算: 考虑色泽(2值)、根蒂(2值)两个属性 每个属性可取值、通配符(*)或空集(∅) 计算公式为(2+1)×(2+1)+1=10种可能假设 版本空间构建: 筛选与训练数据一致的3个假设: (青绿,蜷缩)、(青绿,)、(,蜷缩) 展示了不同泛化程度的假设 关键启示: 即使简单数据集也会产生多个有效假设 凸显了归纳偏好的重要性
摘要:本文详细解答了《西瓜书》第1章第3题关于假设空间与版本空间的计算问题。首先统计了橘子数据集的5个属性及其取值,计算出假设空间大小为406(405种属性组合+1个空假设)。然后通过分析训练样本的正反例特征,确定版本空间的核心假设必须包含"大小=大"和"果蒂=扁平"两个约束,并列举了多个满足条件的假设组合。解答过程清晰展示了从假设空间到版本空间的推理思路,
目前的多模态 LLM 虽然在“感知文本情绪”上已经非常成熟,但在“用视频做情绪分析”上远未达到同等成熟度,哪怕是在概念上比 arousal 容易得多的 sentiment 任务上也是如此。我们能否用一套统一的多模态 LLM 框架,在不做重训练的情况下,通过 in-context learning 直接从“视频 + 提示词”中抽取“概念驱动的唤醒度测量”?从“数字人文/计算政治学 + 研究方法论”的
本文聚焦于中世纪手稿的转录工作。尽管转录问题长期以来一直引起中世纪研究者的兴趣,但在印刷版次时代,除了归一化(normalisation)之外,几乎没有其他可行的选择。这一过程的自动化,即手写文本识别(HTR),使得新型数字文本的创建成为可能,同时也凸显了在学术实践中对转录进行理论化的必要性。我们在不断变化的文本技术背景下,反思了不同的转录概念。此外,基于我们对中世纪拉丁文《圣经》的研究,我们提出







