多模态RLHF标注

更新时间:
复制 MD 格式

多模态RLHF(Reinforcement Learning from Human Feedback)标注模板用于对多模态对话进行人类反馈标注,适用于大语言模型RLHF训练场景。支持自动问答模式(接入机器人自动对话)和手动问答模式(输入文字、图片等内容)。

背景信息

OpenAI公布的文档揭示了ChatGPT超越BERT等自然语言处理模型的原因。ChatGPT的核心优化机制是人类反馈强化学习(RLHF)技术。以下从训练过程和目标出发,解析RLHF技术在ChatGPT中的应用及标注的重要性。

RLHF训练机制包含三个主要阶段:

  1. 微调生成SFT模型

    基于GPT-3.5微调,高质量的提示和答案至关重要。这些数据来自多模型预测或人工标注,要求标注人员具备较高素质。

  2. 构建奖励模型(Reward Model)

    ChatGPT主要采用排序(Ranking)方法评估和筛选SFT模型的输出结果,使用监督式学习优化技术(Supervised Learning with Ordered or Rankings,SLO)。此阶段需要精确且大规模的排序标注。

  3. 强化学习优化

    使用近端策略优化(PPO),根据奖励模型输出调整模型行为。此环节几乎不需要人工标注。

这三个阶段构成ChatGPT的完整训练循环,持续迭代优化。与预训练相比,人工标注的需求量较小,但标注的质量和数量直接影响最终模型性能。

数据格式示例

说明

CSVXLSX格式中每列数据、Manifest格式中data字段的下一级字段均对应一个数据集字段。字段名可自定义,配置数据集字段名时选择相应字段名。图片文件支持JPG、PNG等格式。

手动输入模式下不需要第二列首轮问题数据,只需要topic数据。

CSVXLSX格式

topic

first-question

水果01

苹果好吃吗?

水果02

橘子好吃吗?

Demo:

RLHF数据demo.csv

Manifest格式(JSONL格式)

{"data":{"topic":"水果01","first-question":"苹果好吃吗?"}}
{"data":{"topic":"水果02","first-question":"橘子好吃吗?"}}

Demo:

RLHF数据demo.manifest

配置说明

题目区(必选)

题目区用于配置话题字段。

选中当前话题并选择数据集后,在右侧配置区域配置具体参数。参数说明如下:

参数

说明

标题

默认标题区域无需修改。

数据集字段

在数据集字段中选择题目展示字段(字段名可自定义)。

提示

默认提示区域无需修改。

点击链接跳转

无需配置,不生效。

文本高亮

无需配置,不生效。

卡片样式配置

无需配置,不生效。

问题区(自动问答模式下,首轮问题必选)

问题区用于在自动问答模式下配置首轮问题和问题区域题目,手动输入模式下无效。

说明

自动问答机器人包含首轮问题组件,需要配置;手动提问不包含此组件。配置首轮问题后,还需配置提问机器人的UDF信息(用于驱动机器人自动提问)。

选中首轮问题后,在右侧配置区域配置具体参数。参数说明如下:

参数

说明

标题

默认标题区域无需修改。

数据集字段

配置首轮问题对应的数据集字段(字段名可自定义)。

提示

默认提示区域无需修改。

点击链接跳转

无需配置,不生效。

文本高亮

无需配置,不生效。

卡片样式配置

无需配置,不生效。

答题区(可选)

答题区用于配置回答机器人回复文本相关问题。

选中答题区后,在右侧配置区域配置具体参数。参数说明如下:

参数

说明

标题

根据需要配置问题标题。

选项

说明

当答题类型为单选多选树选择时,需要配置此参数。

  • 当答题类型为单选多选时,可以通过手工录入数据集导入配置,词典搜索暂时无法使用。

  • 当答题类型为树选择时,仅支持手工录入配置。

占位文本

说明

当答题类型为单行输入框输入框-Markdown预览时,需要配置此参数。

填空题占位文字,引导用户输入内容。

提示

配置鼠标悬停在题目标题上时显示的提示文字。

是否必填

设置题目是否为必填项。设为必填时,答题时会校验是否已填写。

支持搜索选项

说明

当答题类型为单选多选时,需要配置此参数。

启用后可搜索选项(适用于选项较多的场景)。

生效阶段

题目的生效阶段。不选择时默认全流程生效。

全局题目(可选)

全局题目用于针对整个主题提出问题。

选中题目后,在右侧配置区域配置具体参数。参数说明如下:

参数

说明

标题

根据需要配置问题标题。

占位文本

说明

当答题类型为输入框-Markdown预览单行输入框时需要配置此参数。

填空题占位文字,引导用户输入内容。

选项

说明

当答题类型为单选多选树选择多选树选择时,需要配置此参数。

  • 当答题类型为单选多选时,可以通过手工录入数据集导入配置,词典搜索暂时无法使用。

  • 当答题类型为树选择多选树选择时,仅支持手工录入配置。

提示

配置鼠标悬停在题目标题上时显示的提示文字。

是否必填

设置题目是否为必填项。设为必填时,答题时会校验是否已填写。

支持搜索选项

说明

当答题类型为单选多选时,需要配置此参数。

启用后可搜索选项(适用于选项较多的场景)。

生效阶段

题目的生效阶段。不选择时默认全流程生效。

全局配置

全局配置用于配置模板中使用的UDF。

回答机器人的 UDF 选择 pai-qw-基于上下文生成答案,reply 选择方式设置为拖拽排序

单击image,在右侧配置问答机器人。回答机器人最多配置3个。选择机器人UDF后添加配置参数。

说明

自动问答模式下,配置首轮问题后需配置提问机器人的UDF信息。提问机器人的UDF使用pai-qw-基于上下文生成问题,其余参数与回答机器人相同。input_dataMarkResult用于让UDF正确接收输入参数,不可更改;return_nums为返回个数,可修改,最多不超过5。

操作演示

多模态RLHF标注-自动问答

  1. 单击发起问答,机器人自动开始对话。

  2. 您可以改写问题和机器人的回答,并完成答题。

自动问答界面同时展示多个机器人(机器人1、机器人2、机器人3-01、机器人3-02)的回复供对比,每个回复下方有答题区-填空用于逐条评分,右侧多模态RLHF标注面板包含全局-填空全局-markdown预览区域。

多模态RLHF标注-输入问答

  1. 在对话框内输入文字,或上传图片、视频、音频等。

  2. 您可以改写机器人的回答并答题。单击历史发送输入框可修改已发送的消息,使机器人重新回答。

标注界面同时展示多个机器人回复卡片,每个卡片下方设有填空输入区域,您可通过顶部提交任务或底部下一题按钮完成标注流程。