强化学习概览

更新时间:
复制 MD 格式

介绍百炼强化学习(RL)训练的概念、能力与使用入口

百炼强化学习(Reinforcement Learning,简称 RL)训练通过奖励信号优化模型输出,支持自定义 Rollout 与 Reward 函数开发。

能力概述

RL 训练支持自定义 Rollout(控制生成过程)与 Reward 函数(评分),覆盖训练配置、可观测、函数开发等完整链路。

使用入口