以开源RedPajama arXiv的少量数据为例,演示如何使用PAI的大模型数据处理组件对arXiv论文数据进行清洗,包括敏感信息打码、URL移除、文本标准化、计数过滤、长度过滤、N-Gram重复过滤和MinHash去重。
数据集说明
本工作流数据集从开源项目RedPajama的原始数据中抽取5000个样本。
创建并运行工作流
进入Designer页面。
登录PAI控制台。
在顶部左上角根据实际情况选择地域。
在左侧导航栏选择工作空间列表,单击指定工作空间名称,进入对应工作空间。
在左侧导航栏选择模型开发与训练 > 可视化建模(Designer),进入Designer页面。
创建工作流。
在预置模板页签下,选择业务领域 > LLM 大语言模型,单击LLM大语言模型数据处理-arXiv (论文数据)模板卡片上的创建。

配置工作流参数(或保持默认),单击确定。
在工作流列表,选择已创建的工作流,单击进入工作流。
工作流说明:

工作流中关键算法组件说明:
LLM-敏感信息打码(MaxCompute)-1
将“text”字段中的敏感信息打码。例如:
将邮箱地址字符替换成
[EMAIL]。将手机电话号码替换成
[TELEPHONE]或[MOBILEPHONE]。将身份证号码替换成
IDNUM。
LLM-特殊内容移除(MaxCompute)-1
将“text”字段中的URL链接删除。
LLM-文本标准化(MaxCompute)-1
对”text”字段的文本做Unicode标准化;将繁体转简体。
LLM-计数过滤(MaxCompute)-1
将“text”字段中不符合数字和字母字符个数或占比的样本去除。arxiv数据集中大部分字符都由字母和数字组成,通过该组件可以去除部分脏数据。
LLM-长度过滤(MaxCompute)-1
根据”text”字段的平均长度过滤样本。平均长度按换行符
\n分割文本后计算。LLM-N-Gram重复比率过滤(MaxCompute)-1
根据”text”字段的字符级N-Gram重复比率过滤样本。将文本按字符进行大小为N的滑动窗口操作,形成长度为N的片段序列。每个片段称为gram,统计所有gram的出现次数。最后计算
频次大于1的gram的频次总和 / 所有gram的频次总和的比率作为重复比率,过滤样本。LLM-敏感词过滤(MaxCompute)-1
使用系统预置敏感词文件过滤“text”字段中包含敏感词的样本。
LLM-长度过滤(MaxCompute)-2
根据”text”字段的最大行长度过滤样本。最大行长度按换行符
\n分割文本后计算。LLM-困惑度过滤(MaxCompute)-1
计算“text”字段文本的困惑度,根据设置的困惑度阈值过滤样本。
LLM-特殊字符占比过滤(MaxCompute)-1
将“text”字段中不符合特殊字符占比的样本去除。
LLM-长度过滤(MaxCompute)-3
根据”text”字段的长度过滤样本。
LLM-分词(MaxCompute)-1
对”text”字段的文本分词,并将结果保存至新列。
LLM-长度过滤(MaxCompute)-4
按空格将”text”字段切分成单词列表,按列表长度(即单词数量)过滤样本。
LLM-N-Gram重复比率过滤(MaxCompute)-2
根据”text”字段的词语级N-Gram重复比率过滤样本(统计前先将所有单词转成小写)。将文本按词语进行大小为N的滑动窗口操作,形成长度为N的片段序列。每个片段称为gram,统计所有gram的出现次数。最后计算
频次大于1的gram的频次总和 / 所有gram的频次总和的比率作为重复比率,过滤样本。LLM-MinHash相似度去重(MaxCompute)-1
根据MinHash算法去除相似的样本。
运行工作流。
运行结束后,右键单击写数据表-1组件,选择查看数据 > 输出,查看所有组件处理后的样本。

相关参考
LLM算法组件详细说明,请参见LLM数据处理(MaxCompute)。