Power Query:模糊合并
模糊合并是一项智能数据准备功能:它在比较列时应用模糊匹配算法,尝试查找待合并表之间的匹配项。在“合并”对话框底部选中“使用模糊匹配执行合并”,即可启用该功能。有关普通合并步骤,请参阅合并查询概述。
模糊匹配仅支持文本列之间的合并。Power Query 使用 Jaccard 相似性算法衡量两个值之间的相似程度。
示例:整理问卷里的水果名称
自由文本字段是模糊匹配的常见应用场景,例如问卷答案。本文示例来自一道在线调查题:“你最喜欢的水果是什么?”

这九条记录保留了参与者实际提交的内容。有些拼写错误,有些使用复数或单数,大小写也不统一。
为了标准化答案,示例另有一张 Fruits 参考表。

参考表包含 Apple、Pineapple、Watermelon、Banana 四种水果。为便于说明,它只列出本例需要的名称;实际参考表可以包含任意数量的行。
目标是生成如下表,将答案对应到标准水果名称,便于后续分析。

执行模糊合并
先执行一次合并。本例使用左外部联接:调查表位于左侧,水果参考表位于右侧。在对话框底部选中“使用模糊匹配执行合并”。

选择“确定”后,合并结果会新增一列。展开该列会发现一条记录没有匹配值。这与对话框中的提示一致:第一个表的九行中有八行匹配。

模糊匹配选项
要调整近似匹配的行为,选择“合并查询”,然后在“合并”对话框中展开“模糊匹配选项”。

可用选项如下:
- 相似性阈值(可选):范围为
0.00至1.00,用于筛选达到指定相似性分数的记录。阈值为1.00时相当于指定完全匹配条件。例如,阈值小于0.90时,Grapes可以与缺少字母 p 的Graes匹配。默认值为0.80。 - 忽略大小写:允许匹配仅大小写不同的文本。
- 通过组合文本部件进行匹配:允许组合文本片段来查找匹配。例如,启用后
Micro soft可以与Microsoft匹配。 - 显示相似性分数:显示输入值与模糊匹配结果之间的相似程度。
- 匹配数(可选):规定每个输入行最多返回多少条匹配行。
- 转换表(可选):根据自定义映射匹配记录。例如,若转换表的
From列为 Grapes、To列为 Raisins,二者就可以匹配。
使用转换表
本例中未匹配的值是 apls,需要将它映射到 Apple。转换表使用两列:
From:要查找的原始值。To:通过From找到原始值后使用的替换值。
本例的映射如下:
| From | To |
|---|---|
| apls | Apple |
返回“合并”对话框,在模糊匹配选项中将“匹配数”设为 1,启用“显示相似性分数”,并从“转换表”下拉菜单选择这张转换表。

选择“确定”后,回到合并步骤。展开包含表值的列时,除 Fruit 外还会看到 Similarity score。选择并展开这两个字段,同时取消添加原始列名前缀。

这两个字段会加入表格。观察每个结果的相似性分数,可以帮助判断是否需要提高或降低阈值,以及是否需要进一步转换。

在本例中,相似性分数只是辅助信息,不属于最终查询输出,因此可以删除。原本九个不同的输入值,经过模糊合并后归入四个标准水果名称。

关于转换表的工作方式,请参阅转换表的前提条件。
相关内容
来源:Microsoft Learn,模糊合并,原页面更新日期:2025-11-26。本文为中文整理,原图归原作者所有。











暂无评论内容