RLHF 利用人类评分来调整模型,使其回答更符合人的预期,是让聊天助手变得「好用」的关键步骤。
在实际应用中,RLHF(基于人类反馈的强化学习) 出现在很多 AI 工具里。下面这 8 款工具都能体现这个概念,点开任意一个就能看到它如何落地。
Claude 模型的官方开发与计费平台
节点式图像生成工作流工具
Gemini 模型的官方实验与开发平台
免费可用的云端 Jupyter 笔记本环境
全球最大的开源模型社区
模型与数据集社区
数据科学与机器学习社区平台
大模型应用开发的主流框架
← 返回 AI 术语表