【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文