数据泄漏共3篇
用 Spark 交叉验证和留出集选择模型参数-未完纪

用 Spark 交叉验证和留出集选择模型参数

从 ParamGrid、Pipeline 和 Evaluator 出发比较交叉验证与一次留出,明确训练成本、独立测试集、随机性、数据泄漏和原示例的评价边界。
彩雨伞的头像-未完纪钻石会员彩雨伞4小时前
0470
相关特征为何会让置换重要性接近零-未完纪

相关特征为何会让置换重要性接近零

完整保留随机森林的重要性比较、Spearman 层次分组、每簇保留一列与重新训练流程,解释相关特征的可替代性,并明确全量 X 筛选带来的验证限制。
彩雨伞的头像-未完纪钻石会员彩雨伞5小时前
0500
建模之前怎样填补缺失值:在同一条评估流程中比较四种插补方法-未完纪

建模之前怎样填补缺失值:在同一条评估流程中比较四种插补方法

完整保留官方实例的数据准备、随机缺失、零值/均值/近邻/迭代插补、四折评估与绘图过程,解释折内拟合和误差条的适用边界。
彩雨伞的头像-未完纪钻石会员彩雨伞6小时前
0310