机器学习共5篇
把文本特征处理与分类训练串成 Spark Pipeline-未完纪

把文本特征处理与分类训练串成 Spark Pipeline

把 Tokenizer、HashingTF 和逻辑回归连成可复用的文本处理流程,理解 Pipeline 与 PipelineModel 的训练推断关系、参数覆盖和持久化边界。
彩雨伞的头像-未完纪钻石会员彩雨伞1小时前
0420
交叉验证之外,如何为网格搜索定义自己的模型选择规则-未完纪

交叉验证之外,如何为网格搜索定义自己的模型选择规则

用精确率、召回率与评分耗时共同挑选SVC参数,准确区分候选均值波动与折间标准差,并补上空集和NaN处理。
彩雨伞的头像-未完纪钻石会员彩雨伞1小时前
0430
用空间特征聚合和单变量筛选恢复回归权重图-未完纪

用空间特征聚合和单变量筛选恢复回归权重图

复盘官方完整空间回归示例,从合成图像和两折搜索到权重逆变换,解释预处理泄漏、均值池化系数尺度与图形解读边界。
彩雨伞的头像-未完纪钻石会员彩雨伞2小时前
0460
HDBSCAN 聚类完整示例:尺度、密度与超参数-未完纪

HDBSCAN 聚类完整示例:尺度、密度与超参数

通过三簇、四簇合成数据完整比较 DBSCAN 与 HDBSCAN,展示统一缩放、多密度簇、min_cluster_size、min_samples 和单连接树截断的效果。
彩雨伞的头像-未完纪钻石会员彩雨伞2小时前
0240
用 Spark 交叉验证和留出集选择模型参数-未完纪

用 Spark 交叉验证和留出集选择模型参数

从 ParamGrid、Pipeline 和 Evaluator 出发比较交叉验证与一次留出,明确训练成本、独立测试集、随机性、数据泄漏和原示例的评价边界。
彩雨伞的头像-未完纪钻石会员彩雨伞3小时前
0470