介绍百炼强化学习(RL)训练的概念、能力与使用入口
百炼强化学习(Reinforcement Learning,简称 RL)训练通过奖励信号优化模型输出,支持自定义 Rollout 与 Reward 函数开发。
能力概述
RL 训练支持自定义 Rollout(控制生成过程)与 Reward 函数(评分),覆盖训练配置、可观测、函数开发等完整链路。
使用入口
该文章对您有帮助吗?
介绍百炼强化学习(RL)训练的概念、能力与使用入口
百炼强化学习(Reinforcement Learning,简称 RL)训练通过奖励信号优化模型输出,支持自定义 Rollout 与 Reward 函数开发。
RL 训练支持自定义 Rollout(控制生成过程)与 Reward 函数(评分),覆盖训练配置、可观测、函数开发等完整链路。