IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts作者Ran Cheng, Longfei Xu, Zheng Liu, Kaikui Liu, Xiangxiang Chu核心发表机构DreamX, Alibaba Group论文链接arXiv:2609.21346v1发布于arXiv 预印本cs.LG|—————| Dense | 0.6640 | 0.8769 | 3.938 | 3.938 | 1.453 || Switch Transformer | 0.7004 | 0.8937 | 24.070 | 3.951 | 1.458 || DeepSeek-V3 MoE | 0.7078 | 0.8969 | 24.004 | 6.306 | 2.382 || ReMoE | 0.6971 | 0.8946 | 24.070 | 4.574 | 1.458 || V-MoE | 0.7167 | 0.9030 | 24.070 | 5.135 | 1.920 || Expert Choice | 0.7170 | 0.9030 | 24.070 | 5.135 | 1.958 || DynMoE | 0.6975 | 0.8962 | 24.070 | 10.306 | 4.170 || MASS | 0.7008 | 0.8966 | 24.070 | 8.827 | 3.601 || Soft MoE | 0.7122 | 0.8996 | 24.201 | 23.017 | 1.656 || SMEAR | 0.7178 | 0.9033 | 24.070 | 22.887 | 1.493 || Lory | 0.6956 | 0.8892 | 24.005 | 22.822 | 2.003 ||μ \muμMoE (CP) | 0.7012 | 0.8938 | 24.070 | 22.887 | 9.120 ||μ \muμMoE (TR) | 0.6962 | 0.8929 | 24.065 | 22.882 | 9.151 ||IntBMoE|0.7376|0.9148| 24.295 | 23.111 | 4.063 || IntBMoE (cached) | — | — | — | — | 3.457 |IntBMoE 拿到 73.76% Top-1 与 91.48% Top-5相对 Dense 分别提升 7.36 与 3.79 个百分点领先所有稀疏路由与稠密参与基线相对最强的竞争者 SMEAR 仍高出 1.98 个 Top-1 百分点与 1.15 个 Top-5 百分点。值得注意的是激活参数IntBMoE 的 23.111M 接近 Soft MoE / SMEAR 一类“满参与”方法的量级远高于 Switch Transformer 的 3.951M这正反映了“每个 composed expert 都汲取全池信息”这一设计事实。但它的 FLOPs 并未随之膨胀未缓存 4.063 G、缓存后 3.457 G反而低于 DeepSeek-V3 MoE2.382 G 与参数量更低级别相当、DynMoE4.170 G与μ \muμMoE9.120 G / 9.151 G。也就是说IntBMoE 在“参与度看齐稠密方法、执行成本向稀疏方法靠拢”这一目标上同时成立。泛化结果同样稳健。在 MiniPile 上IntBMoE 的 test loss 为 2.6802、PPL 为 14.5878相对最强基线μ \muμMoE (CP) 的 15.0306 降低约 2.9% PPL相对 Dense backbone 的 16.6621 降低约 12.4%。在 IntTravel 上IntBMoE 取得最高平均表现HR1 0.6852、HR5 0.8692、NDCG5 0.7850。为了让 Soft MoE 可用于自回归任务作者为其构造 slot 时只使用当前及之前的 tokenSMEAR 在自回归任务上采用 token-level compositionLory 的 segment size 固定为 16。工业侧的结果直接说明方法的可用性。在 AMap 的 POI 推荐服务中评估 cached IntBMoE用户打开 app 时的初始地图屏幕上生产生成推荐器需预测 Top-10 POI 以决定 viewport 与 zoom level服务要求 60 ms 内响应。一周在线 A/B 中对照组为不含 MoE 模块的现网模型治疗组为 cached IntBMoE实验处理约 5,000 QPS。结果是平均延迟 19 ms、P99 延迟 38 ms稳在预算之内并带来2.4% relative UVCTR提升实验后 IntBMoE 被全量部署。4.3 消融实验 / Ablation StudyImageNet-1K 上的消融围绕 DPRG、block 深度、共享专家、特征过滤与系数归一化展开MetricFull1-LayerFixedλ \lambdaλw/o Gatew/o Sharedw/o FilterSoftmax Coeff.Top-1↑0.73760.68780.72440.68040.73320.73720.7263Top-5↑0.91480.89100.90780.88310.91080.91320.9072各变体的定义与含义如下。1-Layer把每个两层 block 压成单层并扩大专家池以保持总参数量结果掉到 68.78% Top-1说明两层 block 带来的收益超出了同等专家参数量的解释范围这与其依赖 layer-specific 专家池、在层间共享同一对组合系数有关。Fixedλ \lambdaλ把可学习残差尺度固定为 1掉 1.32 个百分点说明门控幅度需要自适应。w/o Gate移除组合后的 gate path 与乘性调制DPRG 退化为z ~ t , b ( ℓ ) v t , b ( ℓ ) \widetilde{\mathbf z}^{(\ell)}_{t,b}\mathbf v^{(\ell)}_{t,b}zt,b(ℓ)vt,b(ℓ)掉到 68.04%是所有变体中损失最大的——这也与后续在语言建模任务上的结论一致即 gate path 是最不可替代的组件。w/o Shared移除 SwiGLU 共享专家掉 0.44 个百分点。w/o Filter绕过 block-conditioned feature filtering设z t , b ( 0 ) x t \mathbf z^{(0)}_{t,b}\mathbf x_tzt,b(0)xt掉 0.04 个百分点是所有消融中最小的。Softmax Coeff.把无约束、方差缩放的系数换成分别的 softmax 归一化掉 1.13 个百分点直接支持了“允许负系数、不强制和为 1”的设计选择。架构超参数的敏感性可以整体看到)默认配置为( K , E , k , L ) ( 8 , 16 , 2 , 2 ) (K,E,k,L)(8,16,2,2)(K,E,k,L)(8,16,2,2)当K 1 K1K1时取k 1 k1k1。增大 codebook 规模K KK或专家池E EE都能提升 Top-1但很快进入饱和K KK从 8 增到 32 只提升 0.07 个百分点E EE从 16 增到 64 只提升 0.15 个百分点。这从经验上说明默认的K 8 K8K8、E 16 E16E16已经在性价比拐点附近继续堆参数并不划算。k kk的增大持续带来提升k kk从 1 增到 2 的收益尤为明显也正因此默认取k 2 k2k2在“每 token 多执行一个 block”与“限制计算量”之间取得平衡。block 深度L 2 L2L2时 Top-1 最高与消融中 1-Layer 变体的落后相互印证。4.4 机制分析与推理效率 / Mechanism Analysis Inference Efficiency满参与度确实被有效利用。一个自然的疑问是虽然每个 block 名义上由全池组合是否真的每个 expert 都对性能有实质贡献作者做了一次 64 个设置的系统移除实验——对 Layers 0、2、4、6 的 16 个 expert bases逐个从所有 block 组合中剔除该 expert不重训练直接评估原 checkpoint。由于剔除后剩余 bases 变少会缩小 composed weight 的幅度实验用1 / E − 1 1/\sqrt{E-1}1/E−1代替1 / E 1/\sqrt{E}1/E以隔离该 expert 本身的贡献。结果是移除任意一个被检查的 expert 都会降低 Top-1最小下降仍有 0.26 个百分点。各层平均下降分别为 Layer 0 的 1.60、Layer 2 的 0.49、Layer 4 的 1.17、Layer 6 的 0.78 个百分点。最浅层贡献高度不均E1、E12、E15 分别带来 4.10、4.99、9.15 个百分点的下降其余 bases 影响小得多深层则更均衡如 Layer 2 的降幅范围是 0.26 到 0.74、Layer 6 是 0.45 到 1.04。这说明在最浅层部分 expert 承担了接近“关键特征提取器”的角色而深层则以更分散、更冗余的方式共同支撑表示。路由是类别相关且深度相关的。下图统计了 8 个代表性 ImageNet 类别在 Layer 4 与 Layer 6 的 block 分配比例相对于均匀分配 12.5% 的偏差每个 Top-k kk选择计为一次 token–block 分配。)同一层内不同类别偏好不同 block且偏好随深度迁移Layer 4 上 hen 偏向b 4 b_4b4、Boston bull 偏向b 6 b_6b6到 Layer 6 则分别转为b 0 b_0b0与b 3 b_3b3。路由不是把 token 随机抖出去而是形成了类别条件化、层间分化明显的分配模式。组合系数是 block-specific 的。如果所有 block 学出的是同一套融合系数那么 codebook 的多个 entry 就是冗余的。下图分别可视化 Layer 0、2、4、6 中 8 个 block 的 expert-composition coefficients行是 block列是 expert basis红色为正、蓝色为负每个 block 的系数向量仅用于可视化时做了ℓ 2 \ell_2ℓ2归一化。)同一层内不同 block 对相同有序 expert 池分配了不同的正负权重模式在层间以及 value/gate 两条路径之间都不同。作者进一步量化了这种分化程度value path 上 block recipe 的平均 pairwise cosine similarity 从 Layer 0 的 0.796 单调降至 Layer 2、4、6 的 0.079、0.019、0.010gate path 从 0.726 降至 0.126、0.083、0.043。这意味着浅层主要由共享的组合模式主导越深越趋向于各 block 各自为政——这与浅层视觉特征较通用、深层表示更受益于细粒度 block-specific 组合的直觉一致。缓存把请求时成本与专家池规模解耦。下图在 ImageNet-1K 模型配置、单图 batch size 为 1 的条件下对比 cached 与 uncached IntBMoE 随专家数E EE增长的峰值推理内存与推理 FLOPs横轴为ℓ 2 \ell_2ℓ2尺度。)无缓存时E EE从 1 增到 128峰值内存从 54.57 MB 涨到 627.83 MB推理从 3.495 GFLOPs 涨到 8.305 GFLOPs两者都随E EE明显爬升。有缓存后内存稳定在 104.33 MB、计算稳定在 3.457 GFLOPs与E EE完全脱钩。代价是缓存需要常驻一批预组合 block 的固定内存因而在专家池很小时E EE较小缓存版本反而比不缓存更耗内存从 16 个专家起缓存更内存高效。训练侧则不需要逐 token 组合一个 minibatch 内所有图像共享相同的 composed blocks组合每 batch 执行一次即可摊销。五、相关工作 / Related WorkIntBMoE 与三类工作直接对话。在稀疏 MoE一线Sparsely Gated MoE 开创了每 token 只激活专家子集的范式GShard 引入 Top-2 路由与自动分片以支撑大规模 Transformer 训练Switch Transformer 进一步简化为 Top-1 路由V-MoE 把 token-choice 稀疏路由扩展到 ViT 并将 patch token 路由到少数专家Expert Choice 反向让每个专家挑选固定容量的 token 以平衡负载DeepSeekMoE 提出细粒度专家切分与共享专家隔离DeepSeek-V3 延续细粒度架构并引入 auxiliary-loss-free 路由偏置D²-MoE 将预训练专家拆成共享基与压缩的专家特定增量ReMoE 用连续 ReLU 门替代不连续的 Top-k kkLapSum SoftMoE 用 truncated soft Top-k kk松弛来学习层间的专家计算预算分配Dense2MoE 把稀疏选择推到模型深度维度并只执行 Transformer block 的子集DynMoE 与 MASS 则动态调整专家池规模。这些工作在可扩展性、路由效率与专家组织上都有推进但共同点是expert participation 仍与 execution 耦合——token 只能从被选中并被执行的专家处受益。在稠密输出混合一线MMoE 用共享专家池加任务特定门控PLE 用堆叠的抽取层逐步分离共享与任务特定知识Soft MoE 以 slot 为单位把 token 软聚合后交由专家处理再映射回个体 tokenμ \muμMoE 则把专家权重表示成张量并用 CP 或 Tensor Ring 分解来计算混合。MMoE 与 PLE 允许池中每个专家贡献输出但必须计算每个专家的输出execution 随专家数量增长Soft MoE 的 slot 混合了所有输入 token其原始公式不保持因果性不能直接用于自回归预测μ \muμMoE 依赖张量分解而 IntBMoE 走的是有限 codebook 条件化加 block 级参数合成这条完全不同的路线。在参数合并一线SMEAR 构造取全部专家 routing-weighted average 的复合专家再执行example-level 形式让一个序列中所有 token 共享同一复合专家阻止组合适应个体 token且由完整序列导出的组合使用了未来信息不能直接用于因果预测token-level 形式虽然支持 token 级适应却要求每个 token 做全池参数合并显著抬高物化成本。Lory 用因果的 segment 级路由缓解该问题——前一段导出的组合被当前 segment 内所有 token 复用生成时 prompt-conditioned 组合在请求内复用——但 segment 内所有 token 被迫共享同一组合牺牲了 token 级适应性。DSFNet 则执行 input-conditioned 参数合并用门控线性组合来自解耦因子-场景分支的参数集。此外Hypernetworks与HyperMoE从条件 embedding 生成目标网络参数HyperMoE 编码 token 未选中专家的信息生成一个 HyperExpert 与选中专家一起执行但未选中专家本身仍不激活。IntBMoE 的差异点集中在三处——条件信号来自有限且输入无关的 codebookhypernetwork 产出的是紧凑的系数而非完整权重矩阵也正因此组合出的 block 可以预计算并跨路由决策复用。六、局限性与展望 / Limitations Future Work论文源码与附录中未单列显式的局限性章节因此下面区分“作者明确给出的权衡”与“基于已知信息可以合理外推的判断”后者会标注为分析性推断。首先是缓存引入的固定内存成本。实验数据显示缓存在专家池较小E EE小于 16时比不缓存更耗内存只在E ≥ 16 E\ge 16E≥16后才变得更内存高效。这意味着 IntBMoE 的效率优势依赖于一个不过分小的专家池在极轻量配置下反而会吃亏。其次未缓存的推理内存与 FLOPs 仍随E EE增长E EE从 1 到 128 时内存 54.57 MB 到 627.83 MB、计算 3.495 G 到 8.305 G。也就是说三分解里的 materialization “有界”指的是组合后参数的数量由K KK而非输入决定而非原始专家 bases 本身不占内存当专家池本身扩大时训练与首次组合阶段的代价依旧上涨。第三在线部署必须依赖缓存才能满足 60 ms 延迟预算——平均 19 ms、P99 38 ms 的结果是在 cached 设置下取得的这实际说明 block synthesis 的开销无法容忍被放在请求路径上从而把 IntBMoE 的部署前提限定为“参数在服务期内稳定、可离线预组合”的场景。在超参数层面还可以看到若干实用边界。超参敏感性实验表明K KK从 8 增到 32 只带来 0.07 个百分点、E EE从 16 增到 64 只带来 0.15 个百分点说明存在明显的收益饱和k kk增大虽持续提升精度但会线性抬高每 token 计算需要在延迟预算下折中。L 2 L2L2优于单层但如果深度继续增加每 block 的参数合成与执行开销也会同步上升。另一些空白属于当前材料未能覆盖的范围因此不宜替作者下结论损失函数与正则项的具体形式、负载均衡机制的细节、推理流程的完整描述均未在已给源码片段中出现语言建模与推荐任务的规模有限MiniPile 为 6 GB 子集、IntTravel 为 1.628 亿用户而非全量工业数据因此“跨模态、跨域泛化”的结论虽然由三组实验支持但尚不能直接推断到更大规模或更多模态的场景。可预期的后续方向包括在训练阶段也设法降低对E EE的依赖、把 codebook 数量做成可自适应增长的动态机制、将 block synthesis 的部分计算进一步前移到编译期或图优化阶段以及在更多工业推荐与生成任务上验证该框架的通用性。七、总结 / ConclusionIntBMoE 的出发点是一个被既有文献长期掩盖的事实MoE 设计里的 participation、execution、materialization 三者本应各自可调稀疏路由、稠密输出混合与参数合并却把它压成了三选二。论文的解法是把“专家变换的构建”和“专家在 token 上的执行”彻底拆开——先用整个专家池、由一个条件于有限 codebook 的 hypernetwork 预构建出K KK个可复用 block让每个 block 都汲取全池知识再让 router 为每个 token 只挑选k kk个 block 执行把请求时计算与专家池规模E EE解耦。DPRG 在 value 与 gate 两条独立组合路径之间引入残差乘性耦合在不扩大专家池的前提下显著增强表达力消融中 w/o Gate 是所有变体重损失最大的一个直接印证了这一点。实证上ImageNet-1K 的 73.76% Top-1 / 91.48% Top-5 超过所有受测基线MiniPile 与 IntTravel 继续领先说明方法的收益不局限于视觉。更关键的是工业证据在 AMap 生成式推荐系统 60 ms 的延迟预算下cached IntBMoE 以平均 19 ms、P99 38 ms 支撑约 5,000 QPS换来 2.4% relative UVCTR 提升并已全量上线服务数亿用户。从设计空间梳理、机制验证专家移除的最小降幅 0.26 个百分点、组合系数相似度从 0.796 单调降到 0.010到线上结果这篇工作给出了一个完整闭环满参与度、稀疏执行、有界物化三者可以在同一模块中共存前提是把组合与执行解耦并接受“参数可离线预组合”这一工程前提。原文摘要:Mixture-of-Experts (MoE) scales capacity, but existing designs cannot set three quantities independently. For a single token, participation is how many experts contribute knowledge to its output, execution is how many are actually computed (compute cost), and materialization is how many expert-sized parameter sets must be built and stored (memory cost). Sparse routing keeps execution and materialization low, but shrinks participation: for each token, only a few experts contribute. Dense output-mixing restores full participation, but its execution grows with the number of experts. Parameter-merging keeps execution at one expert, but its materialization grows with the number of routing decisions. We propose IntBMoE, a block-conditioned MoE that decouples all three by pairing dense expert composition with sparse block execution. Its blocks come from a small learned codebook, one per entry. At each internal layer, a lightweight hypernetwork merges all expert bases in that layer’s pool into one composed expert. Participation is full, because every composed expert draws on the entire pool. Execution stays sparse, because a router sends each token to only a few blocks. Materialization is bounded, because the codebook, not the input, fixes how many blocks exist. Dual-Path Residual Gating (DPRG) further couples two independently composed paths through multiplicative gating. Experiments on image classification show consistent gains over representative sparse and dense MoE baselines. Additional experiments on language modeling and sequential recommendation validate its generalization beyond vision. IntBMoE is fully deployed in AMap’s generative recommendation system, serving hundreds of millions of users under a 60ms latency budget, with a 2.4% relative UVCTR gain in online A/B testing. Our code is available at https://github.com/AMAP-ML/DreamX-Rec/.PDF链接:https://arxiv.org/pdf/2609.21346v1部分平台可能图片显示异常请以我的博客内容为准