题库 人工智能大模型 题目列表 直接偏好优化(Direct Preference Optimization, DPO...
单选题
直接偏好优化(Direct Preference Optimization, DPO)的核⼼思想是什么?
A.
通过强化学习从⼈类反馈中直接优化策略
B.
将偏好学习问题转化为⼆元分类任务进⾏优化
C.
使⽤隐式奖励建模,避免显式的奖励函数学习
D.
通过策略概率⽐的对数构建损失函数,直接优化偏好数据
题目信息
成人组 第一轮 2025年 选择题
-
正确率
0
评论
22
点击