一、什么是 MoE 与 MiMo-V2-Flash?
MoE,全称 Mixture of Experts,即混合专家模型。它不像传统的密集模型(Dense Model)让所有参数参与每一次计算,而是包含多个“专家”(小型子网络)和一个“路由器”。路由器根据输入,动态选择少数几个相关的专家进行计算,实现了模型容量巨大但单次推理计算量可控的“稀疏激活”效果。这就像一个大公司,面对不同问题,只调用最对口的部门来解决,而非全员上阵。
MiMo-V2-Flash 是一个基于 MoE 架构的大模型。它并非简单堆叠专家,其设计核心在于 “Flash” ——追求极致的推理速度和效率。它通过精心设计的专家结构、路由算法和推理时优化,旨在将 MoE 架构在推理阶段的优势(高容量、低计算密度)发挥到极致,适合对延迟和吞吐有严苛要求的线上服务场景。
二、MiMo-V2-Flash 的核心架构设计
MiMo-V2-Flash 的 MoE 层通常由两个关键部分组成:一个路由器(Router) 和一个专家池(Expert Pool)。路由器是一个轻量级网络,它接收一个 token 的表示,计算该 token 应该被哪些专家处理。每个专家本身可能是一个小型的前馈网络(FFN)。
其创新点在于路由器与专家结构的协同优化。例如,它可能采用了