尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

Agnes-3.0-Flash Preview 实战指南:混合注意力多模态大模型的架构解析、部署推理与工具调用

发布时间:2026/9/30 2:19:26

资讯中心
01
ARTICLE

Agnes-3.0-Flash Preview 实战指南:混合注意力多模态大模型的架构解析、部署推理与工具调用

Agnes-3.0-Flash Preview 实战指南:混合注意力多模态大模型的架构解析、部署推理与工具调用
大模型多模态推理模型【免费下载链接】Agnes-3.0-Flash项目地址https://ai.gitcode.com/hf_mirrors/Agnes-AI/Agnes-3.0-Flash点击查看免费下载本篇技术指南以仓库模型卡 README_zh.md 为核心骨架围绕 Agnes-3.0-Flash Preview 开放权重 checkpoint 展开先厘清 Preview 与 production/API 版本的关系再拆解其3 : 1 混合注意力delta-rule 递归层 全局注意力层的架构细节随后给出 Transformers 推理、图像/视频理解、推理强度控制、工具调用与 SGLang 服务化部署的完整可运行方案并结合configuration_agnes.py、config.json、chat_template.jinja、serve.sh等源码与配置逐项印证。读者读完可以独立完成该模型的本地加载、多模态推理、工具调用与 OpenAI 兼容服务搭建并理解其底层实现原理。模型定位与版本说明本仓库发布的是Agnes 3.0 Flash 的早期开放权重 Preview checkpoint它与此前在公开评测页面上所列的新版production/API checkpoint是两个不同产物需要明确区分Preview 版本本仓库约33B 参数的dense稠密checkpoint上下文窗口262,144 token。production/API 版本使用不同的 checkpoint 与配置上下文窗口为1M token。因此production/API 版本的评测成绩不应归属于本仓库发布的 Preview 权重。仓库最初以Agnes-3.0-Flash名义发布名称中遗漏了Preview后缀现模型卡已明确将其标识为Agnes-3.0-Flash Preview。除非另有说明下文所有规格与评测成绩均指本 Preview checkpoint。另外需要澄清一个易混淆的口径本 Preview 是约 33B 参数的dense checkpoint不采用 MoE 架构也不存在3B active parameters的说法评测表中出现的 active parameter 数字仅用于标注部分对比模型。从仓库目录结构也可以直接确认其重量级与构成model-00001-of-00019.safetensors至model-00019-of-00019.safetensors共 19 个分片外加model-parallel-ffn.safetensors并行 FFN 分支权重与model.safetensors.index.json索引文件config.json中text_config与vision_config分别描述语言主干与视觉塔model_type为agnes架构入口是AgnesForConditionalGeneration见 config.json。评测参考结果评测范围下表中的 Agnes 成绩属于本仓库发布的Agnes-3.0-Flash Preview 开放权重 checkpoint并非 production/API Agnes 3.0 Flash 模型的成绩。图表中的 Agnes-3.0-Flash Preview 成绩对应本仓库发布的开放权重 checkpoint。下表汇总了多个同期模型的参考结果数据来自不同评测环境、模型快照和 harness不构成同一设置下的受控对比跨列数值仅作参考所有指标均为越高越好评测集Agnes-3.0-Flash PreviewQwen3.6-35B-A3B (35B/3B 激活)Kimi K2.5 (1T/32B 激活)Muse Glimmer (30B)Qwen3.5 (27B)DeepSeek V4 Flash 0731 (284B/13B 激活)Qwen3.8 (27B)Gemini 3.5 Flash (参数未公开)Qwen3.8 Flash Next (125B/6B 激活)MiniMax M3 (428B/23B 激活)IFBench74.2064.443.777.075.675.879.576.381.382.9SciCode38.0835.839.643.639.550.346.653.150.645.4GPQA Diamond85.0584.178.983.585.890.890.592.292.392.9AA-LCR68.3366.759.080.072.379.782.081.079.774.0AA-Omniscience 准确率23.0018.822.927.020.740.418.451.424.516.7架构解析3 : 1 混合注意力解码器Agnes-3.0-Flash Preview 的核心设计是混合注意力hybrid attention72 层解码器中每四层里三层走门控 delta rule循环式注意力单层状态大小与序列长度无关第四层走标准全局注意力。由此72 层中只有 18 层持有随长度增长的 KV cache长上下文场景下的显存与运行时开销被显著压缩。规格项值上下文长度262 144token解码层72 层 54 层 delta-rule 递归 18 层全局注意力按 3 : 1 交替隐藏维度5120全局注意力24 query heads / 4 KV headsGQA 6 : 1head dim 256q、k 各带 RMS-norm输出经 sigmoid 门控Delta-rule 层16 key heads / 48 value headshead dim 128前置因果卷积kernel 4gated RMS-norm循环状态为 fp32前馈SwiGLU中间维 17408每层另并联一路 SwiGLU 2048 分支位置编码三轴 rotarytext / height / widthmrope 分段 11 : 11 : 10 交错base 1e7作用于 head dim 的前 25%64 维词表248 320视觉塔27 层hidden 1152patch 162 × 2 空间合并投影至 5120上述3 : 1 交替的层计划可以直接在配置中验证config.json 的layer_types数组按agnes_delta_attention × 3 agnes_global_attention × 1的节奏循环 18 组且global_attention_interval: 4正是层计划生成的间隔参数。下面结合源码逐模块深入。配置结构三个 PreTrainedConfig模型配置由 configuration_agnes.py 中的三个类构成AgnesConfigmodel_type agnes顶层配置持有text_config与vision_config两个子配置并定义多模态特殊 tokenimage_token_id 248056、video_token_id 248057、vision_start_token_id 248053、vision_end_token_id 248054。加载时若子配置以 dict 传入会自动实例化为对应配置类。AgnesTextConfigmodel_type agnes_text语言主干配置。__post_init__中有一个值得注意的逻辑若未显式给出layer_types会按global_attention_interval默认 4自动生成3 : 1的层计划同时默认把partial_rotary_factor设为0.25位置编码只覆盖每个 head 的四分之一。类中还声明了base_model_tp_plan把全局注意力的 q/k/v 投影、主 MLP 与并行 FFN 分支的 gate/up/down 投影映射为 colwise/rowwise为张量并行--tp 2提供列级切分依据。AgnesVisionConfigmodel_type agnes_vision视觉塔配置默认 27 层、hidden 1152、patch 16、2 × 2 空间合并spatial_merge_size、temporal_patch_size 2视频时序分块、2D 位置表num_position_embeddings 2304。实际权重对应的数值可在 config.json 中确认语言主干hidden_size: 5120、num_hidden_layers: 72、intermediate_size: 17408、parallel_ffn_intermediate_size: 2048、vocab_size: 248320、max_position_embeddings: 262144视觉塔out_hidden_size: 5120视觉 token 投影到语言模型宽度。全局注意力层RMS-norm sigmoid 门控全局注意力每 4 层出现一次承担每 token 都能直接访问全部历史的职责。从 modeling_agnes.py 的forward实现可以看到其结构门控投影q_proj的输出被chunk成两半一半作为 query另一半作为gate归一化q、k 各自经过q_norm/k_normRMS-norm后再参与注意力输出门控注意力结果out先乘以torch.sigmoid(gate)再经o_proj输出即配置中的attn_output_gate: true与output_gate_type: swish见 config.jsonGQA 6 : 124 个 query head 共享 4 个 KV headnum_key_value_heads: 4head dim 256_broadcast_kv负责把 KV 广播到 query 分组。Delta-rule 层因果卷积 gated delta rule占 3/4 的 delta-rule 层是混合架构的常驻主力其实现集中在 modeling_agnes.py前置因果卷积输入先经过 kernel 为 4 的 depthwise causal conv_causal_conv_step负责单步解码时的卷积状态原位更新配合F.silu激活gated delta rule_delta_rule_chunked实现 prefill 路径的 chunk 并行算法chunk_size 64query、key、value、beta、g 全部转成fp32计算后再转回输出 dtype循环状态为(bsz, heads, dk, dv)形状的矩阵与序列长度无关——这正是单层状态大小不随序列增长的由来decode 阶段则走_delta_rule_stepwise的逐步更新配置侧对应linear_num_key_heads: 16、linear_num_value_heads: 48、linear_key_head_dim / linear_value_head_dim: 128、linear_conv_kernel_dim: 4、mamba_ssm_dtype: float32见 config.json。位置编码三轴 mrope长文本与多模态位置编码采用三轴 rotarytext / height / width实现类为AgnesRotaryEmbeddingmodeling_agnes.py三套频率分别作用于文本轴、图像高度轴、宽度轴_interleave_axes把 H、W 两轴的频率按mrope_section [11, 11, 10]交错折叠进 T 轴表每 2 个 / 3 个频率槽取一频率基数为rope_theta 10_000_0001e7partial_rotary_factor 0.25每个 head 只有前 25%即 256 × 25% 64 维参与旋转其余维度原样通过见_apply_rope中q_rot / q_rest的切分逻辑。前馈SwiGLU 主分支 并行 SwiGLU 分支每一层都含主 MLP 与一个并联的小型 SwiGLU 分支。AgnesMLP.forwardmodeling_agnes.py显示并行分支的输出被直接加进主分支的残差路径y y self.parallel_ffn(x)主分支中间维 17408并联分支中间维 2048。配置中parallel_ffn_intermediate_size默认为 0禁用该分支本 checkpoint 显式设为 2048。这份并行 FFN 权重独立存放于model-parallel-ffn.safetensors。快速开始Transformers 部署环境要求pip install transformers5.12 torch torchvision accelerate实测环境为 transformers 5.12.1。图像与视频输入由随附的 processor 处理因此依赖torchvision。⚠️必须启用 REMOTE CODEAgnes-3.0-Flash Preview自带模型实现modeling_agnes.py、processing_agnes.py等随仓库分发加载时务必传trust_remote_codeTrue否则 transformers 无法解析config.json中的auto_mapAutoConfig/AutoModelForCausalLM均指向仓库内的 remote code 文件。文本推理from transformers import AutoModelForCausalLM, AutoTokenizer path Agnes-AI/Agnes-3.0-Flash tok AutoTokenizer.from_pretrained(path) model AutoModelForCausalLM.from_pretrained( path, dtypebfloat16, device_mapauto, trust_remote_codeTrue ) msgs [{role: user, content: 请用三句话解释什么是人工智能。}] ids tok.apply_chat_template(msgs, add_generation_promptTrue, return_tensorspt).to(model.device) out model.generate(ids, max_new_tokens256) print(tok.decode(out[0][ids.shape[1]:], skip_special_tokensTrue))对话格式走apply_chat_template由仓库自带的 chat_template.jinja 渲染|im_start|...|im_end|结构思考段用think包装。图像与视频图像、视频输入走随模型附带的 processor同样是 remote codefrom transformers import AutoProcessor proc AutoProcessor.from_pretrained(path, trust_remote_codeTrue) msgs [{role: user, content: [{type: image, image: photo.jpg}, {type: text, text: 描述这张图。}]}] inputs proc.apply_chat_template(msgs, add_generation_promptTrue, tokenizeTrue, return_dictTrue, return_tensorspt).to(model.device) out model.generate(**inputs, max_new_tokens256) print(proc.batch_decode(out[:, inputs[input_ids].shape[1]:], skip_special_tokensTrue)[0])从模板源码看图像与视频在对话模板中分别被渲染为|vision_start||image_pad||vision_end|与|vision_start||video_pad||vision_end|占位符chat_template.jinja随后由 processor 替换为视觉塔产生的视觉 token视频还支持逐条编号add_vision_id时为 Picture N: / Video N: 前缀。视觉塔本身 27 层、hidden 1152、patch 16经 2 × 2 空间合并后投影到语言模型宽度 5120视觉与文本 token 在主干中统一参与 3 : 1 混合注意力。推理强度控制chat template 提供三档推理强度也可以整体关闭思考ids tok.apply_chat_template(msgs, add_generation_promptTrue, return_tensorspt, reasoning_effortmedium) # 或 enable_thinkingFalse模型卡将三档描述为high默认、medium、low从 chat_template.jinja 的模板实现看reasoning_effort的校验集合为xhigh/medium/low默认值常量为xhigh并根据档位注入不同的系统级推理指令——xhigh要求仔细思考任务、校验关键假设、考虑备选方案并优先保证最终答案的正确性与一致性low则要求思考简短聚焦、直接得出结论enable_thinkingFalse时生成提示会以空think\n\n/think形式占位chat_template.jinja从而关闭思考段输出。实际使用中以模型卡声明的档位名称为准并留意模板对取值的大写/大小写约定。工具调用chat template 会自动渲染工具定义模型按tool_callfunction…parameter…的格式发起调用工具返回值作为tool角色消息接回去tools [{ type: function, function: { name: get_weather, description: 查询指定城市的实时天气, parameters: { type: object, properties: {city: {type: string, description: 城市名称}}, required: [city], }, }, }] msgs [{role: user, content: 北京现在天气怎么样}] ids tok.apply_chat_template(msgs, toolstools, add_generation_promptTrue, return_tensorspt).to(model.device) out model.generate(ids, max_new_tokens256) reply tok.decode(out[0][ids.shape[1]:], skip_special_tokensTrue) # tool_call # functionget_weather # parametercity # 北京 # /parameter # /function # /tool_call # 执行工具后把结果接回对话继续生成最终回复 msgs [{role: assistant, content: reply}, {role: tool, content: 晴26°C东北风 2 级}]工具调用协议与模板实现一一对应chat_template.jinja 与 chat_template.jinja工具定义经tools.../tools区块写入 system 消息并附上严格的格式约束function 块必须嵌套在tool_call内、必填参数必须给出、可在调用前用自然语言说明理由等模型的tool_calls被渲染为tool_call\nfunctionname\nparameterkey\nvalue\n/parameter\n/function\n/tool_call工具结果以tool角色返回模板会将其包裹进tool_response.../tool_response并合并到 user 消息中。走 OpenAI 接口时同样传tools。服务端默认原样返回上面这段文本要拿到结构化的tool_calls需给 sglang 配置与该格式匹配的 tool-call parser思考段同理需配置 reasoning parser 才会落入reasoning_content。SGLang 服务化部署启动命令serve.sh用官方公开镜像起服务只覆盖sglang包里的三个文件镜像内其他内容一概不动。详见 sglang_patch/README.md。docker run --gpus all --shm-size 64g -p 30001:8080 \ -v /path/to/agnes-3.0-flash:/model \ lmsysorg/sglang:nightly-dev-20260908-20ca564b \ bash /agnes-3.0-flash/serve.sh --served-model-name Agnes-3.0-Flashserve.sh会把命令行上的额外参数透传给 sglang--served-model-name即由此生效同理可以追加--tp 2。服务在容器内 8080 端口启动随后即可用 OpenAI 兼容客户端访问from openai import OpenAI client OpenAI(api_keyEMPTY, base_urlhttp://localhost:30001/v1) response client.chat.completions.create( modelAgnes-3.0-Flash, messages[{role: user, content: 设计一个容错的事件处理架构。}], temperature1.0, max_tokens2000, ) print(response.choices[0].message.content)流式输出传streamTrue即可tools、reasoning_effort等参数同样按 OpenAI 协议传递。serve.sh 的工作原理从 serve.sh 源码可以看到三个关键环节版本探测与补丁选择脚本先解析容器内 sglang 的版本若匹配20ca564b则覆盖sglang_patch/nightly-dev-20260908-20ca564b/下的预编译补丁文件若匹配0.5.19则用sglang_patch/v0.5.19/变体其余版本则调用apply_patch.py对已安装的 sglang 包原地打补丁脚本内cp -r覆盖或python3 apply_patch.py逻辑见 serve.sh导出AGNES_MODEL_PATH作为权重加载器读取 checkpoint 目录的兜底环境变量serve.sh启动服务exec python3 -m sglang.launch_server --model-path $D --trust-remote-code --host 0.0.0.0 --port 8080 $serve.sh。--trust-remote-code是必需的因为 sglang 会先经由 transformers 解析模型配置读取随 checkpoint 分发的configuration_agnes.py。三个补丁文件做了什么仓库为 sglang 提供两套预构建补丁变体nightly-dev-20260908-20ca564b/与v0.5.19/目录结构一致均含三个文件文件变更sglang/srt/configs/agnes.py新增。读取model_type: agnes的配置把它映射到 sglang 内置混合delta-rule 全局注意力实现的字段上从global_attention_interval推导层计划、把并行 FFN 宽度并入intermediate_size、把 checkpoint 目录记录为配置字段供加载器使用。从 补丁源码 可见其内部把text_config重写为qwen3_5_text、model_type设为qwen3_5从而让服务器走内置的 hybrid 实现并通过from_pretrained把agnes_model_path写入配置 dict经 to_dict 往返传递到 worker 进程。sglang/srt/utils/hf_transformers/common.py末尾 3 行为model_type: agnes注册AgnesConfig。sglang/srt/models/qwen3_5.py在load_weights权重流前面加一个生成器delta_attn.*→linear_attn.*、global_attn.*→self_attn.*并把每层mlp.parallel_ffn.{gate,up,down}_proj拼接到主投影上gate/up 沿输出维、down 沿输入维。没有并行分支的 checkpoint 原样通过。数值一致性把并行分支折叠进主 MLP 会改变 down 投影的归约长度因此 sglang 服务的 logits 与 transformers 实现并非逐位一致。实测nightly 镜像、TP1、H200、2144 个 teacher-forced 位置、完整 248 320 路 softmax与未打补丁引擎服务的同权重相比全词表 KL 为 5.9e-4低于 transformers 与 sglang 对同一 checkpoint 之间测得的 6.5e-4困惑度 17.07 vs 17.05。apply_patch.py以QWEN3_5_KV_SCALE_MAPPER和common.py末尾为锚点且具备幂等性。硬件需求资源建议GPU1 × NVIDIA H200 141 GB 或 NVIDIA H100 80 GB或同等bf16张量并行--tp 1追求最大上下文与并发时用--tp 2权重磁盘占用bf16 检查点约 66 GB主机内存建议 128 GB 以上实际可用上下文长度和并发能力取决于 KV cache 分配、运行时开销和张量并行配置请在目标硬件上验证实际负载。约 33B 参数 262k 上下文意味着显存与内存预算较大这也是混合注意力架构的意义所在——72 层中仅 18 层全局注意力持有随序列长度增长的 KV cache其余 54 层 delta-rule 层的循环状态与序列长度解耦从而在长上下文中显著缓解缓存压力。推荐推理参数参数推荐值temperature1.0top_p0.95top_k20reasoning_effort难推理任务用high延迟敏感场景用lowmax_tokens2000 起以上即 checkpoint 自带的默认值可直接在 generation_config.json 中核对temperature: 1.0、top_k: 20、top_p: 0.95、do_sample: true且eos_token_id为[248046, 248044]含pad_token_id248044bos_token_id为 248044。能力一览与仓库文件构成能力支持情况深度推理支持可调high/medium/low三档代码与调试支持长上下文分析262 144 token图像理解支持视频理解支持工具调用支持tool_call/tool_response流式输出支持OpenAI 兼容接口通过 sglang 提供 Chat Completions仓库内与本文相关的核心文件可继续深入阅读modeling_agnes.py —— 模型主干实现全局注意力sigmoid 门控、delta-rule 递归层chunked prefill stepwise decode、三轴 mrope 位置编码、并行 SwiGLU 分支、AgnesForConditionalGeneration生成入口configuration_agnes.py —— 三层配置类与张量并行切分计划config.json —— 本 checkpoint 的完整超参层计划、注意力与位置编码参数、视觉塔参数、多模态 token idchat_template.jinja —— 对话模板推理强度、工具调用、图像/视频占位符的渲染规则serve.sh 与 sglang_patch/README.md —— SGLang 服务化与补丁说明含数值验证数据processing_agnes.py、image_processing_agnes.py、video_processing_agnes.py —— 多模态 processor 实现。许可证与引用本项目采用 Apache License 2.0。如需引用可使用模型卡附带的 BibTeXmisc{agnes30flash2026, title {Agnes-3.0-Flash Preview}, author {{Agnes AI}}, year {2026}, month sep, howpublished {Open-weights preview checkpoint}, url {https://agnes-ai.com/} }赞分享大模型多模态推理模型【免费下载链接】Agnes-3.0-Flash项目地址https://ai.gitcode.com/hf_mirrors/Agnes-AI/Agnes-3.0-Flash点击查看免费下载相关推荐Agnes-3.0-Flash Preview 完全上手指南混合注意力架构、推理强度与多模态部署实战Agnes 3.0 Flash Preview 完全上手指南混合注意力架构、推理强度与多模态部署实战 本文围绕开源模型仓库 Agnes AI/Agnes 3.大模型多模态推理模型Agnes 3.0 Flash 的 sglang 部署补丁指南用原生 sglang 镜像无缝推理混合注意力模型Agnes 3.0 Flash 的 sglang 部署补丁指南用原生 sglang 镜像无缝推理混合注意力模型 导读 本文围绕仓库内 sglang_patch大模型多模态推理模型Qwen3.8-Flash-Next 模型解析与实战部署指南混合注意力架构、N-gram 嵌入与长上下文推理Qwen3.8 Flash Next 模型解析与实战部署指南混合注意力架构、N gram 嵌入与长上下文推理 本篇技术指南以仓库根目录 README.md h人工智能基础模型大模型多模态创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。