一个图的k-Core是指反复去除度小于或等于k的节点后,所剩余的子图。如果一个节点存在于k-Core,而在 (k+1)-Core中被移去,那么此节点的核数(coreness)为k。因此所有度为1的节点的核数必然为0,节点核数的最大值被称为图的核数。本文为您介绍PAI-Studio提供的k-Core组件。

PAI-Studio支持通过可视化或PAI命令方式,配置k-Core组件的参数。

可视化方式

页签 参数 描述
字段设置 选择源顶点列 边表的起点所在列。
选择目标顶点列 边表的终点所在列。
参数设置 k 核数 核数的值,必填,默认为3。
执行调优 进程数 作业并行执行的节点数。数字越大并行度越高,但框架通讯开销框架通讯开销是什么意思会增大。
进程内存 单个作业可使用的最大内存量。系统默认为每个作业分配4096 MB内存,实际使用内存超过该值,会抛出OutOfMemory异常。

PAI命令方式

PAI -name KCore
    -project algo_public
    -DinputEdgeTableName=KCore_func_test_edge
    -DfromVertexCol=flow_out_id
    -DtoVertexCol=flow_in_id
    -DoutputTableName=KCore_func_test_result
    -Dk=2;
参数 是否必选 描述 默认值
inputEdgeTableName 输入边表名。
inputEdgeTablePartitions 输入边表的分区。 全表读入
fromVertexCol 输入边表的起点所在列。
toVertexCol 输入边表的终点所在列。
outputTableName 输出表名。
outputTablePartitions 输出表的分区。
lifecycle 输出表的生命周期。
workerNum 作业并行执行的节点数。数字越大并行度越高,但框架通讯开销框架通讯开销是什么意思会增大。 未设置
workerMem 单个作业可使用的最大内存量。系统默认为每个作业分配4096 MB内存,实际使用内存超过该值,会抛出OutOfMemory异常。 4096
splitSize 数据切分大小。 64
k 核数。 3

使用示例

  1. 生成训练数据。
    drop table if exists KCore_func_test_edge;
    create table KCore_func_test_edge as
    select * from
    (
      select '1' as flow_out_id,'2' as flow_in_id from dual
      union all
      select '1' as flow_out_id,'3' as flow_in_id from dual
      union all
      select '1' as flow_out_id,'4' as flow_in_id from dual
      union all
      select '2' as flow_out_id,'3' as flow_in_id from dual
      union all
      select '2' as flow_out_id,'4' as flow_in_id from dual
      union all
      select '3' as flow_out_id,'4' as flow_in_id from dual
      union all
      select '3' as flow_out_id,'5' as flow_in_id from dual
      union all
      select '3' as flow_out_id,'6' as flow_in_id from dual
      union all
      select '5' as flow_out_id,'6' as flow_in_id from dual
    )tmp;
    对应的图结构如下所示。k-Core图结构
  2. 设定k=2,查看训练结果。
    +-------+-------+
    | node1 | node2 |
    +-------+-------+
    | 1     | 2     |
    | 1     | 3     |
    | 1     | 4     |
    | 2     | 1     |
    | 2     | 3     |
    | 2     | 4     |
    | 3     | 1     |
    | 3     | 2     |
    | 3     | 4     |
    | 4     | 1     |
    | 4     | 2     |
    | 4     | 3     |
    +-------+-------+