logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Python机器学习怎么防止数据泄漏_确保Scaler在Pipeline内拟合

为什么 StandardScaler 单独调用 fit 会泄漏数据当你在 Pipeline 外先对整个训练集调用 StandardScaler().fit(X_train),再用它 transform 测试集或新样本,scaler 已经“看见”了训练集的全局统计量(均值、标准差),而这些统计量本该只从训练数据的当前 fold 中学习——尤其在交叉验证时,每个 fold 的训练子集不同,用全局 sc

#python#数据库#jvm
SQL视图能否用于数据仓库模型_雪花模型与视图构建

视图不能直接当物理维度表用,但可作逻辑维度层封装;需要省名时,再从 v_dim_store_with_city JOIN dim_province兼容性影响:BigQuery 标准 SQL 对多层视图嵌套深度有限制(默认 10 层),雪花模型若用 5 层视图套娃(v_dim_a → v_dim_b → ...),可能报 Resources exceeded during query executi

#python#数据库#jvm
SQL统计分组内的所有数据唯一值_使用DISTINCT汇总

这时 COUNT(DISTINCT ...) 就不够用了。实操建议:PostgreSQL 用 STRING_AGG(DISTINCT col, ', '),DISTINCT 关键字必须紧贴字段名,不能写成 STRING_AGG(col, ', ') DISTINCTMySQL 用 GROUP_CONCAT(DISTINCT col SEPARATOR ', '),注意默认长度限制是 1024,超长

#python#数据库#jvm
SQL如何对比当前记录与整体均值_窗口函数AVG的应用实践

AVG(column) OVER() 是最简写法,必须带空括号,否则报错;另外,如果混用普通聚合(如 GROUP BY)和窗口函数,MySQL 8.0+ 和 PostgreSQL 允许,但 SQLite 不支持,旧版 MySQL(AVG(sales) OVER():算全表均值,每行结果一样AVG(sales) OVER(PARTITION BY region):按地区分组算均值,同地区每行值相同别

#python#数据库#jvm
到底了