题库 人工智能大模型 题目列表 一个 AI 团队在完成其大型模型的监督微调后,准备进行...
单选题
一个 AI 团队在完成其大型模型的监督微调后,准备进行偏好对齐。他们收集了大量成 对的人类偏好数据,每个提示词对应一个更受偏好的响应和一个不太理想的响应。团队在传统 从人类反馈中强化学习(Reinforcement Learning from Human Feedback,RLHF)和新兴的 直接偏好优化(Direct Preference Optimization,DPO)两种技术路线间进行抉择。如果他们 选择直接偏好优化方案,将意味着他们在流程中可以省去以下哪个关键步骤?
A.
利用偏好数据对监督微调后的模型进行进一步的优化。
B.
训练一个独立的模型来预测人类对不同回答的偏好程度,并将其量化为奖励分数。
C.
在优化过程中,引入 KL 散度惩罚项以防止模型策略与初始监督微调后的模型偏离过远。
D.
使用 GPU集群进行模型参数的梯度更新。
题目信息
成人组 样题/模拟题 2025年 选择题
0%
正确率
0
评论
320
点击