排序
用 Spark 交叉验证和留出集选择模型参数
从 ParamGrid、Pipeline 和 Evaluator 出发比较交叉验证与一次留出,明确训练成本、独立测试集、随机性、数据泄漏和原示例的评价边界。
把文本特征处理与分类训练串成 Spark Pipeline
把 Tokenizer、HashingTF 和逻辑回归连成可复用的文本处理流程,理解 Pipeline 与 PipelineModel 的训练推断关系、参数覆盖和持久化边界。
用 PySpark 表函数展开行并按分区汇总
完整讲解Python UDTF的生命周期、schema、LATERAL、Arrow、日期与文本展开、按表参数分区汇总,并修正动态analyze示意代码中的错误。
为 PySpark 注册按行和 Arrow 批次读取的数据源
完整实现两个Python批读取数据源:以元组逐行产出,或直接yield Arrow RecordBatch,理解注册、schema、分区与序列化约束。
PySpark 的 Python 依赖管理:把环境一同送到执行器
完整解释 PySpark 原生分发、Conda、venv-pack、PEX 与 uv 的依赖管理方式,逐一对应归档路径和解释器配置,并指出集群兼容与短例缺口。





