在使用低秩自适应法(Low-Rank Adaptation, LoRA)对一个大语言模型进行微调时,以下哪个操作是其典型的流程?
A.
首先对原始模型进行奇异值分解,保留主要成分以降低其秩,然后在这个低秩模型上进行全参数微调。
B.
在模型的注意力机制模块和前馈网络的线性层旁,并联一对低秩矩阵(A 和 B),在微调时 只训练这对矩阵,并将它们的乘积与冻结的原始权重相加作为该层的实际输出。
C.
准备两套模型参数,一套保持冻结,另一套用于训练。通过比较两套参数的输出来动态决 定更新哪一套参数。
D.
在训练开始时,将原始模型权重复制一份作为可训练参数,然后通过正则化手段强制让这 些可训练参数与冻结的原始参数之间的差异矩阵保持低秩。