为实体类型配置业务识别规则,用于在知识创建/导入时进行实体匹配与消歧。两种主键模式均支持配置业务识别规则,但在消歧流程中的角色不同。
前提条件
当前模型中已创建了至少一个实体类型,创建详情请参见创建实体类型。
背景信息
两种主键模式下业务识别规则的定位差异如下:
主键模式 | 业务识别规则的角色 | 消歧流程中的优先级 |
业务主键 | 补充性模糊去重层,即精确主键匹配是首要身份判定,识别规则用于捕获主键值不同但语义相似的近重复实体。 | 优先执行主键精准匹配;若未命中,则进一步触发识别规则进行模糊匹配。 |
系统自动生成主键 | 主要身份识别机制, | 直接执行识别规则匹配,无精确匹配主键步骤。 |
权限说明
空间管理员和建模师支持创建及管理业务识别规则。
创建业务识别规则
在Dataphin首页的顶部菜单栏,选择知识图谱 > 模型设计。
在顶部菜单栏中选择空间,在左侧模型配置库中单击实体类型名称,在实体类型配置面板顶部单击配置业务识别规则。
在业务识别规则列表下方单击新建识别规则,业务识别规则列表中展示当前已有的识别规则。
多条规则并行求值取最高分,同分时排在前面的规则优先。列表中包含规则名称、识别属性、匹配阈值、自动关联阈值和状态。单击规则匹配预览,您可输入测试数据,验证业务知识规则的匹配效果。
在新建业务识别规则对话框中配置以下参数。
参数
描述
规则名称
输入规则的展示名称,支持任意字符,最长64个字符。
识别属性配置
属性名称:可选择当前实体类型下的所有实体类型属性,不可重复选择同一属性。
数据类型:展示所选实体类型属性的数据类型,不可修改。
匹配策略:包含精确匹配、忽略大小写匹配、模糊匹配(编辑距离)、模糊匹配(包含关系)、等于、数值范围匹配、日期范围匹配、语义相似度匹配。
精确匹配:属性值必须完全一致(包含英文字母大小写),适用String、RegexString、Enum、URL、Email数据类型。
忽略大小匹配:忽略英文字母大小写后再进行比较,适用String、RegexString、URL、Email数据类型。
模糊匹配(编辑距离):基于Levenshtein编辑距离计算相似度,适用String、RegexString数据类型。选择此策略后,还需配置策略配置(相似度阈值)。
说明安装Neo4j编辑距离插件后才可使用此策略。
模糊匹配(包含关系):判断一个值是否包含另一个值,适用String、RegexString数据类型。
等于:属性值相等,适用Integer、Float、Boolean、Date、BigInteger、Enum、Timestamp数据类型。
数值范围匹配:在指定容差范围内视为匹配,适用Integer、Float、BigInteger、Decimal数据类型。选择此策略后,还需配置策略配置(容差值)。
日期范围匹配:在指定天数范围内视为匹配,适用Date、Timestamp数据类型。选择此策略后,还需配置容差天数。
语义相似度匹配:基于LLM Embedding计算文本语义相似度(余弦相似度),仅适用String数据类型。选择此策略后,还需配置策略配置(相似度阈值)。
说明仅当所选的识别属性已开启语义检测时,此处的匹配策略可选择语义相似度匹配。
语义相似度匹配策略将使用实体所在工作空间所配置的向量模型。
策略配置:
模糊匹配(编辑距离)策略、语义相似度匹配策略:策略配置中需输入相似度阈值,默认为0.8。
数值范围匹配策略:策略配置中需输入容差值,当数据类型为Integer时默认值为0;数据类型为Float时默认值为0.01。
日期范围匹配策略:策略配置中需输入容差天数,默认为0。
权重:每个识别属性都需配置权重,所有属性权重之和应为1。
说明一个识别规则中至多添加5个识别属性。
全局阈值设置
整体匹配阈值:输入所有属性的加权综合得分阈值(范围[0.0,1.0]),默认为0.8。当综合得分达到此阈值时,展示为候选匹配结果。
自动关联阈值:选中启动自动关联后,支持输入自动关联阈值(范围[0.0,1.0]),默认为0.95。当综合得分达到此阈值时,自动关联已有实体。
单击确定,完成一条规则配置。
多规则求值与优先级
当同一实体类型配置了多条业务识别规则时,消歧引擎分两阶段运行:候选召回和方案H聚合判定。
候选召回与候选池构造
每条已启用规则独立执行一次召回查询,返回一个候选集合而非单个候选。
例如:使用一条姓名和出生年份的规则查询张三1990时,若图谱中已存在多条重复实体,可同时命中多个实体ID。
规则1 的候选集 = [ (ID=1001, 得分=0.92), (ID=1002, 得分=0.88), … ] 规则2 的候选集 = [ (ID=1001, 得分=0.75), (ID=1003, 得分=0.82), … ] 规则3 的候选集 = [ (ID=1002, 得分=0.90), … ]所有规则的候选集按照实体ID并集去重形成候选池,同一候选被多条规则命中时,各规则的得分独立保留,作为后续聚合的输入。
候选池 = { ID=1001: { 规则1: 0.92, 规则2: 0.75, 规则3: 未命中 }, ID=1002: { 规则1: 0.88, 规则2: 未命中, 规则3: 0.90 }, ID=1003: { 规则1: 未命中, 规则2: 0.82, 规则3: 未命中 }, … }说明每条规则召回返回top-K候选(默认返回top50,可前往空间级配置调整);候选池去重后上限为200,超出时按照召回得分倒序截断。
对候选池中每个候选独立并行求值
候选池构建完成后,引擎将执行所有已启用规则对池中每个候选实体进行并行求值;未在该候选召回集中命中的规则,系统将补算其完整得分,确保每个候选实体与每条规则均具备明确的评分结果。
候选实体 X 的得分集合 = { 规则1: 0.92, 规则2: 0.75, 规则3: 0.88 }按规则独立判定评级
每条规则基于其自身的阈值独立判定该候选的评级,而非跨规则对比得分。
规则评级
条件
自动关联
规则得分 ≥ 该规则的自动关联阈值
候选匹配
该规则的整体匹配阈值 ≤ 规则得分 < 该规则的自动关联阈值
不匹配
规则得分 < 该规则的整体匹配阈值
评级升级合并
候选实体的最终判定,包含自动关联、候选匹配、不匹配。
候选池内的最终排序与多候选并列的处理
步骤1~4解决了单个候选内部如何汇聚多规则的问题。而针对候选池中多个实体并列最高评级的场景(常由历史重复数据或规则粒度过粗同时命中多个实体导致),此时不支持选择任意一条,系统将严格按照以下规则进行处理:
候选间排序键(自高到低依次比较):
最终评级降序:
自动关联 > 候选匹配 > 不匹配展示得分降序(胜出规则的原始得分)。
胜出规则优先级升序(规则列表中的序号越靠前越优)。
实体ID字典序升序(仅作为稳定性兜底,保证相同输入得到相同结果,不作为业务语义裁决依据)。
依据最高评级下真正并列的候选数量(即排序键1~3完全一致,仅ID不同),将分三种情形处理:
最高评级
真正并列数
处理方式
最终状态
自动关联
1(唯一)
直接自动关联到该候选。
自动关联
自动关联
≥ 2
禁止自动关联,整体降级为
候选匹配;所有并列候选按排序键并列展示,此时用户可自行选择实体。候选匹配
候选匹配
1~N
进入候选匹配流程,按排序后顺序展示top-K(K默认为5)。
候选匹配
不匹配
-
全池无有效候选,按主键模式创建新实体。
无匹配
规则停用的处理
停用的规则不参与召回也不参与求值,不影响候选池构造与最终判定。停用全部规则等同于未配置规则。
说明离线集成-知识图谱输出组件的消歧设置中,可选择已停用的规则。