业务识别规则

更新时间:
复制 MD 格式

为实体类型配置业务识别规则,用于在知识创建/导入时进行实体匹配与消歧。两种主键模式均支持配置业务识别规则,但在消歧流程中的角色不同。

前提条件

当前模型中已创建了至少一个实体类型,创建详情请参见创建实体类型

背景信息

两种主键模式下业务识别规则的定位差异如下:

主键模式

业务识别规则的角色

消歧流程中的优先级

业务主键

补充性模糊去重层,即精确主键匹配是首要身份判定,识别规则用于捕获主键值不同但语义相似的近重复实体。

优先执行主键精准匹配;若未命中,则进一步触发识别规则进行模糊匹配。

系统自动生成主键

主要身份识别机制,_sys_id为随机 UUID,无自然语义,识别规则是唯一可用于判定同一现实对象的手段。

直接执行识别规则匹配,无精确匹配主键步骤。

权限说明

空间管理员和建模师支持创建及管理业务识别规则。

创建业务识别规则

  1. Dataphin首页的顶部菜单栏,选择知识图谱 > 模型设计

  2. 在顶部菜单栏中选择空间,在左侧模型配置库中单击实体类型名称,在实体类型配置面板顶部单击配置业务识别规则

  3. 在业务识别规则列表下方单击新建识别规则,业务识别规则列表中展示当前已有的识别规则。

    多条规则并行求值取最高分,同分时排在前面的规则优先。列表中包含规则名称、识别属性、匹配阈值、自动关联阈值和状态。单击规则匹配预览,您可输入测试数据,验证业务知识规则的匹配效果。

  4. 新建业务识别规则对话框中配置以下参数。

    参数

    描述

    规则名称

    输入规则的展示名称,支持任意字符,最长64个字符。

    识别属性配置

    • 属性名称:可选择当前实体类型下的所有实体类型属性,不可重复选择同一属性。

    • 数据类型:展示所选实体类型属性的数据类型,不可修改。

    • 匹配策略:包含精确匹配忽略大小写匹配模糊匹配(编辑距离)模糊匹配(包含关系)等于数值范围匹配日期范围匹配语义相似度匹配

      • 精确匹配:属性值必须完全一致(包含英文字母大小写),适用String、RegexString、Enum、URL、Email数据类型。

      • 忽略大小匹配:忽略英文字母大小写后再进行比较,适用String、RegexString、URL、Email数据类型。

      • 模糊匹配(编辑距离):基于Levenshtein编辑距离计算相似度,适用String、RegexString数据类型。选择此策略后,还需配置策略配置(相似度阈值)。

        说明

        安装Neo4j编辑距离插件后才可使用此策略。

      • 模糊匹配(包含关系):判断一个值是否包含另一个值,适用String、RegexString数据类型。

      • 等于:属性值相等,适用Integer、Float、Boolean、Date、BigInteger、Enum、Timestamp数据类型。

      • 数值范围匹配:在指定容差范围内视为匹配,适用Integer、Float、BigInteger、Decimal数据类型。选择此策略后,还需配置策略配置(容差值)。

      • 日期范围匹配:在指定天数范围内视为匹配,适用Date、Timestamp数据类型。选择此策略后,还需配置容差天数

      • 语义相似度匹配:基于LLM Embedding计算文本语义相似度(余弦相似度),仅适用String数据类型。选择此策略后,还需配置策略配置(相似度阈值)。

        说明
        • 仅当所选的识别属性已开启语义检测时,此处的匹配策略可选择语义相似度匹配。

        • 语义相似度匹配策略将使用实体所在工作空间所配置的向量模型。

    • 策略配置

      • 模糊匹配(编辑距离)策略语义相似度匹配策略:策略配置中需输入相似度阈值,默认为0.8。

      • 数值范围匹配策略:策略配置中需输入容差值,当数据类型为Integer时默认值为0;数据类型为Float时默认值为0.01。

      • 日期范围匹配策略:策略配置中需输入容差天数,默认为0。

    • 权重:每个识别属性都需配置权重,所有属性权重之和应为1

    说明

    一个识别规则中至多添加5识别属性。

    全局阈值设置

    • 整体匹配阈值:输入所有属性的加权综合得分阈值(范围[0.0,1.0]),默认为0.8。当综合得分达到此阈值时,展示为候选匹配结果。

    • 自动关联阈值:选中启动自动关联后,支持输入自动关联阈值(范围[0.0,1.0]),默认为0.95。当综合得分达到此阈值时,自动关联已有实体。

  5. 单击确定,完成一条规则配置。

多规则求值与优先级

当同一实体类型配置了多条业务识别规则时,消歧引擎分两阶段运行:候选召回和方案H聚合判定。

image
  1. 候选召回与候选池构造

    每条已启用规则独立执行一次召回查询,返回一个候选集合而非单个候选。

    例如:使用一条姓名和出生年份的规则查询张三1990时,若图谱中已存在多条重复实体,可同时命中多个实体ID。

    规则1 的候选集 = [ (ID=1001, 得分=0.92), (ID=1002, 得分=0.88), … ]
    规则2 的候选集 = [ (ID=1001, 得分=0.75), (ID=1003, 得分=0.82), … ]
    规则3 的候选集 = [ (ID=1002, 得分=0.90), … ]

    所有规则的候选集按照实体ID并集去重形成候选池,同一候选被多条规则命中时,各规则的得分独立保留,作为后续聚合的输入。

    候选池 = {
      ID=1001: { 规则1: 0.92, 规则2: 0.75, 规则3: 未命中 },
      ID=1002: { 规则1: 0.88, 规则2: 未命中, 规则3: 0.90 },
      ID=1003: { 规则1: 未命中, 规则2: 0.82, 规则3: 未命中 },
      …
    }
    说明

    每条规则召回返回top-K候选(默认返回top50,可前往空间级配置调整);候选池去重后上限为200,超出时按照召回得分倒序截断。

  2. 对候选池中每个候选独立并行求值

    候选池构建完成后,引擎将执行所有已启用规则对池中每个候选实体进行并行求值;未在该候选召回集中命中的规则,系统将补算其完整得分,确保每个候选实体与每条规则均具备明确的评分结果。

    候选实体 X 的得分集合 = { 规则1: 0.92, 规则2: 0.75, 规则3: 0.88 }
  3. 按规则独立判定评级

    每条规则基于其自身的阈值独立判定该候选的评级,而非跨规则对比得分。

    规则评级

    条件

    自动关联

    规则得分 ≥ 该规则的自动关联阈值

    候选匹配

    该规则的整体匹配阈值 ≤ 规则得分 < 该规则的自动关联阈值

    不匹配

    规则得分 < 该规则的整体匹配阈值

  4. 评级升级合并

    候选实体的最终判定,包含自动关联、候选匹配、不匹配。

  5. 候选池内的最终排序与多候选并列的处理

    步骤1~4解决了单个候选内部如何汇聚多规则的问题。而针对候选池中多个实体并列最高评级的场景(常由历史重复数据或规则粒度过粗同时命中多个实体导致),此时不支持选择任意一条,系统将严格按照以下规则进行处理:

    候选间排序键(自高到低依次比较):

    1. 最终评级降序:自动关联 > 候选匹配 > 不匹配

    2. 展示得分降序(胜出规则的原始得分)。

    3. 胜出规则优先级升序(规则列表中的序号越靠前越优)。

    4. 实体ID字典序升序(仅作为稳定性兜底,保证相同输入得到相同结果,不作为业务语义裁决依据)。

    依据最高评级下真正并列的候选数量(即排序键1~3完全一致,仅ID不同),将分三种情形处理:

    最高评级

    真正并列数

    处理方式

    最终状态

    自动关联

    1(唯一)

    直接自动关联到该候选。

    自动关联

    自动关联

    ≥ 2

    禁止自动关联,整体降级为 候选匹配;所有并列候选按排序键并列展示,此时用户可自行选择实体。

    候选匹配

    候选匹配

    1~N

    进入候选匹配流程,按排序后顺序展示top-K(K默认为5)。

    候选匹配

    不匹配

    -

    全池无有效候选,按主键模式创建新实体。

    无匹配

  6. 规则停用的处理

    停用的规则不参与召回也不参与求值,不影响候选池构造与最终判定。停用全部规则等同于未配置规则。

    说明

    离线集成-知识图谱输出组件的消歧设置中,可选择已停用的规则。