普通会员
登录
首页
文库
真题
课件
教程
题库
Scratch真题
Python真题
信息学奥赛
蓝桥杯竞赛
机器人技术
信息素养大赛
试卷
Scratch试卷
蓝桥杯青少组考试
Python试卷
机器人技术考试
信息技术试卷
GESP试卷
信息学奥赛
信息素养大赛
资讯
软件下载
动态资讯
赛事动态
官方公告
白名单赛事
题库
人工智能大模型
题目列表
直接偏好优化(Direct Preference Optimization, DPO...
单选题
直接偏好优化(Direct Preference Optimization, DPO)的核⼼思想是什么?
A.
通过强化学习从⼈类反馈中直接优化策略
B.
将偏好学习问题转化为⼆元分类任务进⾏优化
C.
使⽤隐式奖励建模,避免显式的奖励函数学习
D.
通过策略概率⽐的对数构建损失函数,直接优化偏好数据
上一题
[单选题] 关于前缀微调(Prefix Tuning)与提⽰微调(Prompt Tuning)的异同点,以下哪种说法最准确?
下一题
[组合题] 在⼤语⾔模型的实际部署中,推理阶段通常需要在保证稳定性、时延与显存效率之间取得平衡。常⻅策略包括:&n...
纠错
题目信息
成人组
第一轮
2025年
选择题
-
正确率
0
评论
22
点击
收藏
已收藏
错题本
已加入错题本
我的笔记
登录添加笔记