
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
今天的内容是进行多种机器学习模型的建立与分析,数据集依然是之前的heart.csv(已编码好)可视化部分见Day 9这里为了增强模型鲁棒性,不对数据进行异常值处理此时我们对连续变量还不能进行归一化/标准化,是为了避免关键的训练集/测试集数据泄露问题。一旦在划分数据集之前对全集应用此类预处理,训练过程就间接利用了测试集的,这会导致对模型在未知数据上性能的乐观估计。
表示客户是否会违约,其他列既有连续变量(年收入、信用分等),也有有序/无序的分类变量(工作年限、贷款用途等)。这个数据结构很典型,适合演示如何一步步搭建通用流水线。分开,再立刻切分训练集与测试集。这样做是为了保证测试集始终像“真实新数据”,不会在预处理阶段被我们提前看过。负责把不同的 transformer 分别用在对应列上,再拼成新的特征矩阵;这里记录耗时、输出分类报告和混淆矩阵,方便与未来的改
nn.Flatten确保在送入全连接层前展平图像(保留 batch 维度)。线性层 + ReLU 的组合即可完成一个简单的分类器。return x # 输出 logits,后续交给交叉熵损失展平后的输入是 3072 维,堆叠两层隐藏层并加入 Dropout。训练时 Dropout 生效,测试阶段调用会自动关闭。return x。
至此,训练营内容基本收束。整体知识密度覆盖了复试课的大部分核心点(NLP、RNN 变体等来不及展开)。体系化比“知道怎么做”更重要:很多问题如果只停留在“会用”,很容易在逻辑上出现断层;把原因讲清楚、把流程闭环串起来,才更可靠。学习需要持续堆时间:哪怕是一个小的时序预测 demo,背后也有大量隐知识(为何与 ARIMA 对比、为何用 ARIMA 做特征工程、为何要诊断残差等)。工科很多时候没有捷径
CIFAR-10 只有 32x32 分辨率,使用轻量级增强即可:随机裁剪、翻转、颜色抖动、随机旋转,并配合标准归一化。核心原则:保留预训练特征提取器的价值,只在合适位置加注意力,并通过渐进解冻避免大幅扰动。默认跑 50 个 epoch;算力有限时可先跑 5~10 轮确认流程,再拉满。空间注意力:在通道维做均值/最大池化并拼接,经 7x7 卷积得到空间权重。把预训练卷积分成“资深专家”,新加的 CB
滞后(lag)x_{t-k}表示 k 期之前的值。d处理趋势(差分让序列更平稳)p/q用 ACF/PACF 给候选,再用 AIC/残差诊断迭代SARIMAX:在 ARIMA 基础上加入季节项(P,D,Q,m),处理季节性更自然。Ljung-Boxp 值小:残差仍有结构(模型可能不够)p 值大:没有证据表明残差有显著自相关(更像白噪声)@浙大疏锦行。
"""自定义权重初始化函数Args:model: PyTorch模型init_type: 初始化类型 ('xavier', 'kaiming', 'normal')"""# 使用示例print("使用Kaiming初始化后的模型权重统计:")print(f"自定义权重初始化函数Args:model: PyTorch模型init_type: 初始化类型 ('xavier', 'kaiming', '







