LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题 - MoonOut

Wait 5 sec.

【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文