RLHF(基于人类反馈的强化学习)

RLHF 利用人类评分来调整模型,使其回答更符合人的预期,是让聊天助手变得「好用」的关键步骤。

在实际应用中,RLHF(基于人类反馈的强化学习) 出现在很多 AI 工具里。下面这 8 款工具都能体现这个概念,点开任意一个就能看到它如何落地。

← 返回 AI 术语表