
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
为什么 StandardScaler 单独调用 fit 会泄漏数据当你在 Pipeline 外先对整个训练集调用 StandardScaler().fit(X_train),再用它 transform 测试集或新样本,scaler 已经“看见”了训练集的全局统计量(均值、标准差),而这些统计量本该只从训练数据的当前 fold 中学习——尤其在交叉验证时,每个 fold 的训练子集不同,用全局 sc
视图不能直接当物理维度表用,但可作逻辑维度层封装;需要省名时,再从 v_dim_store_with_city JOIN dim_province兼容性影响:BigQuery 标准 SQL 对多层视图嵌套深度有限制(默认 10 层),雪花模型若用 5 层视图套娃(v_dim_a → v_dim_b → ...),可能报 Resources exceeded during query executi
这时 COUNT(DISTINCT ...) 就不够用了。实操建议:PostgreSQL 用 STRING_AGG(DISTINCT col, ', '),DISTINCT 关键字必须紧贴字段名,不能写成 STRING_AGG(col, ', ') DISTINCTMySQL 用 GROUP_CONCAT(DISTINCT col SEPARATOR ', '),注意默认长度限制是 1024,超长
AVG(column) OVER() 是最简写法,必须带空括号,否则报错;另外,如果混用普通聚合(如 GROUP BY)和窗口函数,MySQL 8.0+ 和 PostgreSQL 允许,但 SQLite 不支持,旧版 MySQL(AVG(sales) OVER():算全表均值,每行结果一样AVG(sales) OVER(PARTITION BY region):按地区分组算均值,同地区每行值相同别







