排序
用 Spark 交叉验证和留出集选择模型参数
从 ParamGrid、Pipeline 和 Evaluator 出发比较交叉验证与一次留出,明确训练成本、独立测试集、随机性、数据泄漏和原示例的评价边界。
HDBSCAN 聚类完整示例:尺度、密度与超参数
通过三簇、四簇合成数据完整比较 DBSCAN 与 HDBSCAN,展示统一缩放、多密度簇、min_cluster_size、min_samples 和单连接树截断的效果。
把文本特征处理与分类训练串成 Spark Pipeline
把 Tokenizer、HashingTF 和逻辑回归连成可复用的文本处理流程,理解 Pipeline 与 PipelineModel 的训练推断关系、参数覆盖和持久化边界。





