Power Query:模糊合并

Power Query:模糊合并

模糊合并是一项智能数据准备功能:它在比较列时应用模糊匹配算法,尝试查找待合并表之间的匹配项。在“合并”对话框底部选中“使用模糊匹配执行合并”,即可启用该功能。有关普通合并步骤,请参阅合并查询概述。

模糊匹配仅支持文本列之间的合并。Power Query 使用 Jaccard 相似性算法衡量两个值之间的相似程度。

示例:整理问卷里的水果名称

自由文本字段是模糊匹配的常见应用场景,例如问卷答案。本文示例来自一道在线调查题:“你最喜欢的水果是什么?”

原始调查表:九条答案含拼写、单复数与大小写差异

这九条记录保留了参与者实际提交的内容。有些拼写错误,有些使用复数或单数,大小写也不统一。

为了标准化答案,示例另有一张 Fruits 参考表。

水果参考表

参考表包含 Apple、Pineapple、Watermelon、Banana 四种水果。为便于说明,它只列出本例需要的名称;实际参考表可以包含任意数量的行。

目标是生成如下表,将答案对应到标准水果名称,便于后续分析。

标准化后的预期调查输出

执行模糊合并

先执行一次合并。本例使用左外部联接:调查表位于左侧,水果参考表位于右侧。在对话框底部选中“使用模糊匹配执行合并”。

启用模糊匹配的合并对话框

选择“确定”后,合并结果会新增一列。展开该列会发现一条记录没有匹配值。这与对话框中的提示一致:第一个表的九行中有八行匹配。

尚未使用转换表时的结果,第九行的 Fruit 值为空

模糊匹配选项

要调整近似匹配的行为,选择“合并查询”,然后在“合并”对话框中展开“模糊匹配选项”。

模糊匹配选项

可用选项如下:

  • 相似性阈值(可选):范围为 0.00 至 1.00,用于筛选达到指定相似性分数的记录。阈值为 1.00 时相当于指定完全匹配条件。例如,阈值小于 0.90 时,Grapes 可以与缺少字母 p 的 Graes 匹配。默认值为 0.80。
  • 忽略大小写:允许匹配仅大小写不同的文本。
  • 通过组合文本部件进行匹配:允许组合文本片段来查找匹配。例如,启用后 Micro soft 可以与 Microsoft 匹配。
  • 显示相似性分数:显示输入值与模糊匹配结果之间的相似程度。
  • 匹配数(可选):规定每个输入行最多返回多少条匹配行。
  • 转换表(可选):根据自定义映射匹配记录。例如,若转换表的 From 列为 Grapes、To 列为 Raisins,二者就可以匹配。

使用转换表

本例中未匹配的值是 apls,需要将它映射到 Apple。转换表使用两列:

  • From:要查找的原始值。
  • To:通过 From 找到原始值后使用的替换值。

本例的映射如下:

From To
apls Apple

返回“合并”对话框,在模糊匹配选项中将“匹配数”设为 1,启用“显示相似性分数”,并从“转换表”下拉菜单选择这张转换表。

指定单个匹配及转换表

选择“确定”后,回到合并步骤。展开包含表值的列时,除 Fruit 外还会看到 Similarity score。选择并展开这两个字段,同时取消添加原始列名前缀。

展开 Fruit 和 Similarity score

这两个字段会加入表格。观察每个结果的相似性分数,可以帮助判断是否需要提高或降低阈值,以及是否需要进一步转换。

带相似性分数的合并结果

在本例中,相似性分数只是辅助信息,不属于最终查询输出,因此可以删除。原本九个不同的输入值,经过模糊合并后归入四个标准水果名称。

最终的标准化调查表

关于转换表的工作方式,请参阅转换表的前提条件。

相关内容


来源:Microsoft Learn,模糊合并,原页面更新日期:2025-11-26。本文为中文整理,原图归原作者所有。

© 版权声明
THE END
喜欢就支持一下吧
点赞0 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容