从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布 - 石头开会

Wait 5 sec.

【摘要】从固定数据到在线策略:SFT、RL 与 OPD 如何重塑模型分布 理解大模型后训练中的能力学习、泛化与遗忘 引言:后训练究竟在改变什么? 大语言模型在预训练阶段阅读海量文本,并通过“预测下一个 token”学习语言规律、世界知识、代码结构与一定程度的推理能力。然而,一个完成预训练的模型并不天然知道怎 阅读全文