【摘要】大模型微调是实现模型领域定制的核心方案,本文承接《千问大模型二次 LoRA‑SFT 指令微调指南》部分内容,聚焦 Qwen3.5‑Base 纯文本基座全参数微调,完整复现 ChatGPT 风格 RLHF 对齐工程链路,覆盖数据预处理、SFT 监督微调、RM 奖励模型训练、PPO 强化学习、DPO 直... 阅读全文