配置与使用计数三角形组件-人工智能平台 PAI-阿里云

计数三角形算法是一种用于图分析的算法，旨在识别和计算图中三角形的数量，其中三角形是由三个相互连接的顶点组成的闭合环。该算法在社交网络分析、网络聚类系数计算和社区检测等领域具有重要应用。通过计数三角形，可以评估图的局部密集性和节点之间的紧密连接程度。

配置组件

方法一：可视化方式

在Designer工作流页面添加计数三角形组件，并在界面右侧配置相关参数：

参数类型	参数	描述
字段设置	起始节点	边表的起点所在列。
字段设置	结束节点	边表的终点所在列。
参数设置	最大节点度	默认值为500，如果节点度大于该值，则进行抽样。
执行调优	进程数量	作业并行执行的节点数。数字越大并行度越高，但是框架通讯开销会增大。
	进程内存	单个作业可使用的最大内存量，单位：MB，默认值为4096。如果实际使用内存超过该值，会抛出`OutOfMemory`异常。
	数据切分大小	数据切分的大小，单位：MB，默认值为64。

方法二：PAI命令方式

使用PAI命令配置计数三角形组件参数。您可以使用SQL脚本组件进行PAI命令调用，详情请参见场景4：在SQL脚本组件中执行PAI命令。

PAI -name TriangleCount
    -project algo_public
    -DinputEdgeTableName=TriangleCount_func_test_edge
    -DfromVertexCol=flow_out_id
    -DtoVertexCol=flow_in_id
    -DoutputTableName=TriangleCount_func_test_result;

参数	是否必选	默认值	描述
inputEdgeTableName	是	无	输入边表名。
inputEdgeTablePartitions	否	全表读入	输入边表的分区。
fromVertexCol	是	无	输入边表的起点所在列。
toVertexCol	是	无	输入边表的终点所在列。
outputTableName	是	无	输出表名。
outputTablePartitions	否	无	输出表的分区。
lifecycle	否	无	输出表的生命周期。
maxEdgeCnt	否	500	如果节点度大于该值，则进行抽样。
workerNum	否	未设置	作业并行执行的节点数。数字越大并行度越高，但是框架通讯开销会增大。
workerMem	否	4096	单个作业可使用的最大内存量，单位：MB，默认值为4096。如果实际使用内存超过该值，会抛出`OutOfMemory`异常。
splitSize	否	64	数据切分的大小，单位：MB。

使用示例

添加SQL脚本组件，去勾选使用Script模式和是否由系统添加Create Table语句，并在SQL脚本中输入以下SQL语句。

drop table if exists TriangleCount_func_test_edge;
create table TriangleCount_func_test_edge as
select * from
(
  select '1' as flow_out_id,'2' as flow_in_id
  union all
  select '1' as flow_out_id,'3' as flow_in_id
  union all
  select '1' as flow_out_id,'4' as flow_in_id
  union all
  select '1' as flow_out_id,'5' as flow_in_id
  union all
  select '1' as flow_out_id,'6' as flow_in_id
  union all
  select '2' as flow_out_id,'3' as flow_in_id
  union all
  select '3' as flow_out_id,'4' as flow_in_id
  union all
  select '4' as flow_out_id,'5' as flow_in_id
  union all
  select '5' as flow_out_id,'6' as flow_in_id
  union all
  select '5' as flow_out_id,'7' as flow_in_id
  union all
  select '6' as flow_out_id,'7' as flow_in_id
)tmp;
drop table if exists TriangleCount_func_test_result;
create table TriangleCount_func_test_result
(
  node1 string,
  node2 string,
  node3 string
);

对应的数据结构图：

添加SQL脚本组件，去勾选使用Script模式和是否由系统添加Create Table语句，在SQL脚本中输入以下PAI命令，并将步骤 1和步骤 2的组件进行连线。

drop table if exists ${o1};
PAI -name TriangleCount
    -project algo_public
    -DinputEdgeTableName=TriangleCount_func_test_edge
    -DfromVertexCol=flow_out_id
    -DtoVertexCol=flow_in_id
    -DoutputTableName=${o1};

单击左上角，运行工作流。

待运行结束，右键单击步骤 2的组件，选择查看数据 > SQL脚本的输出，查看训练结果。

| node1 | node2 | node3 |
| ----- | ----- | ----- |
| 1     | 2     | 3     |
| 1     | 3     | 4     |
| 1     | 4     | 5     |
| 1     | 5     | 6     |
| 5     | 6     | 7     |