尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference

发布时间:2026/9/30 2:20:11

资讯中心
01
ARTICLE

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
文章主要内容总结本文聚焦边缘设备上大语言模型(LLM)推理的挑战,提出了一种基于混合 systolic阵列(HSA)架构的边缘LLM推理加速器,旨在优化推理过程中计算密集的prefill阶段和内存受限的decode阶段的效率。背景与挑战:边缘LLM推理需兼顾安全性、低延迟和成本效益,但面临内存容量有限、功耗约束严格、decode阶段内存带宽窄导致性能受限等问题。LLM推理的prefill阶段以矩阵-矩阵乘法(MMM)为主,decode阶段以矩阵-向量乘法(MVM)为主,且decode阶段占总延迟的80%以上,外部内存访问(EMA)是能耗的主要来源。解决方案:提出混合 systolic阵列(HSA)架构,结合传统systolic阵列和向量单元的优势,在prefill阶段实现高能效,在decode阶段保持高硬件利用率和面积效率。采用MXINT4权重量化方案减少EMA,并设计适配HSA的数据流,确保低量化开销和100%硬件利用率,同时精度损失极小。优化根 mean square 归一化(RMSNorm)和旋转位置编码(RoPE)单元,减少其延迟、面积和内存访问开销,支持端到端推理。实验结果:在1.3B参数的RetNet模型上,长输入/长输出场景下实现247/117 token/s/mm²的性能,较现有方案提升2.45×/13.5×,同时在token生成中保持优异的能效。创新
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。