【摘要】MoE 的核心不是堆更多专家,而是用稳定路由把容量、计算、显存和通信重新做平衡。 大模型扩容时,最直接的办法是把 FFN 做大。FFN 是 Transformer 里真正吃参数的模块,也常被看作模型知识容量的重要来源。问题在于,稠密 FFN 有一个硬约束:每个 token 都要经过同一套参数。参数变 阅读全文