一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉择。如果他们 选择直接偏好优化方案,将意味着他们在流程中可以省去以下哪个关键步骤?
A.
利用偏好数据对监督微调后的模型进行进一步的优化。
B.
训练一个独立的模型来预测人类对不同回答的偏好程度,并将其量化为奖励分数。
C.
在优化过程中,引入 KL 散度惩罚项以防止模型策略与初始监督微调后的模型偏离过远。