PySpark共5篇
为 PySpark 注册按行和 Arrow 批次读取的数据源-未完纪

为 PySpark 注册按行和 Arrow 批次读取的数据源

完整实现两个Python批读取数据源:以元组逐行产出,或直接yield Arrow RecordBatch,理解注册、schema、分区与序列化约束。
彩雨伞的头像-未完纪钻石会员彩雨伞4小时前
0250
PySpark 的 Python 依赖管理:把环境一同送到执行器-未完纪

PySpark 的 Python 依赖管理:把环境一同送到执行器

完整解释 PySpark 原生分发、Conda、venv-pack、PEX 与 uv 的依赖管理方式,逐一对应归档路径和解释器配置,并指出集群兼容与短例缺口。
彩雨伞的头像-未完纪钻石会员彩雨伞4小时前
0250
用 Spark 交叉验证和留出集选择模型参数-未完纪

用 Spark 交叉验证和留出集选择模型参数

从 ParamGrid、Pipeline 和 Evaluator 出发比较交叉验证与一次留出,明确训练成本、独立测试集、随机性、数据泄漏和原示例的评价边界。
彩雨伞的头像-未完纪钻石会员彩雨伞4小时前
0470
把文本特征处理与分类训练串成 Spark Pipeline-未完纪

把文本特征处理与分类训练串成 Spark Pipeline

把 Tokenizer、HashingTF 和逻辑回归连成可复用的文本处理流程,理解 Pipeline 与 PipelineModel 的训练推断关系、参数覆盖和持久化边界。
彩雨伞的头像-未完纪钻石会员彩雨伞2小时前
0420
用 PySpark 表函数展开行并按分区汇总-未完纪

用 PySpark 表函数展开行并按分区汇总

完整讲解Python UDTF的生命周期、schema、LATERAL、Arrow、日期与文本展开、按表参数分区汇总,并修正动态analyze示意代码中的错误。
彩雨伞的头像-未完纪钻石会员彩雨伞1小时前
0420