尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励

发布时间:2026/9/25 18:54:12

资讯中心
01
ARTICLE

MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励

MoE就是复制的mlp;gate 训练就是谁答的好久分给谁奖励
MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)目录MoE-MLP 完整流转(输入→门控选专家→专家计算→输出)一、先固定:几个专家、选几个(人工超参,不是模型决定)二、内部逐层流转(一个token,从输入到输出)步骤1:Gate门控打分(核心,一个线性层)步骤2:softmax转概率步骤3:选Top-K(这里K=2)步骤4:只把x送进选中的专家(每个专家就是你截图的MLP)步骤5:按Gate概率加权合并 → 最终输出关键:Gate怎么"学会"选哪个专家Gate 为什么能打分?关键:每个专家在Gate里有一列专属权重用最小数字演示(d=2,2个专家)为什么点积能衡量"匹不匹配"这套"模板"哪来的专家分工是怎么来的?分工靠一个"正反馈"循环每层Gate权重都不一样为什么不统一两个辅助机制为什么能分开MoE 放在哪一层?Gate 权重怎么训练?梯度怎么传回来(关键)直觉例子(一个中文token)还有第二股梯度:负载均衡loss更新公式(和普通训练一样)MoE就是把这1套MLP复制成N份(N个专家),再加1个Gate门控。一、先固定:几个专家、选几个(人工超参,不是模型决定)这两个数字训练前写死,模型不会自己变:num_experts:总专家数,比如8个(专家E0~E7,每个都是你截图里那套 w1+gelu+w2 的MLP)top_k:每个token激活几个专家,比如Top2(Switch Transformer是Top1)专家数量 = 代码配置,不是MLP算出来的;门控只负责"从N个里挑哪K个"。二、内部逐层流转(一个token,从输入到输出)设:隐藏维d=4,8个专家,Top2,输入token向量x = [ 0.1 , 0.2 , 0
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。