Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference——动态专家量化:面向可扩展的混合专家推理
《Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference》提出了一种名为 DynaExq 的运行时感知混合精度服务系统,旨在解决单 GPU 在硬性 HBM 内存约束下部署 MoE 大模型时面临的专家权重占用过大、卸载/预取在密集激活下产生等待延迟、以及静态…
2026/9/24 17:26:21