尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

PaddleNLP LLM 服务化部署静态图模型下载支持与硬件选型指南

发布时间:2026/9/25 11:50:49

资讯中心
01
ARTICLE

PaddleNLP LLM 服务化部署静态图模型下载支持与硬件选型指南

PaddleNLP LLM 服务化部署静态图模型下载支持与硬件选型指南
人工智能大模型预训练微调LoRARLHF强化学习分布式训练【免费下载链接】PaddleNLPEasy-to-use and powerful LLM and SLM library with awesome model zoo.项目地址https://gitcode.com/gh_mirrors/pa/PaddleNLP点击查看免费下载PaddleNLP 的 LLM 服务化部署工具基于英伟达 Triton 框架构建为支持静态图推理的模型提供了「一键下载 一键启动」的部署体验。本文以 static_models.md 为核心系统梳理当前仓库支持的静态图模型清单、model_name的命名与精度/节点组合规则、DeepSeek / Qwen / LLaMA 系列等模型的硬件门槛SM 架构与 CUDA 版本要求并结合仓库中的下载脚本与部署文档给出可直接落地的实践方案帮助你按机器配置快速选定可部署模型并完成服务化上线。什么是「静态图模型下载」支持PaddleNLP 的模型推理存在动态图与静态图两种形态。服务化部署场景为了追求低延迟、高吞吐通常使用静态图模型模型先由动态图导出为静态图推理格式目录下包含model.pdiparams权重文件与model.pdmodel/model.json结构文件再由 Triton Server 统一加载推理。该能力的整体架构与调用链可参考 deploy_usage_tutorial.md 与 general_model_inference.md。为避免大模型权重下载耗时过长影响体验部署工具直接提供了静态图模型的自动下载能力启动时自动下载start_server $model_name镜像内会自动完成下载并拉起服务手动下载脚本镜像内路径/opt/output/download_model.py仓库中对应源码见 download_model.py下载完成后挂载模型目录再启动服务。所有可一键下载的模型其「模型名称 ↔ 静态图下载model_name」的对应关系全部记录在 static_models.md 中。因此这份清单是决定能否「开箱即用」的关键依据只有出现在清单中、且静态图下载model_name一栏非 的模型才支持一键下载启动其余模型仍需按 general_model_inference.md 中的流程手动导出静态图再部署。下载脚本与 model_name 的底层实现model_name是整套下载流程的核心入参。从源码 download_model.py 可以看到脚本的参数定义-m / --model_name 下载的模型名称默认 deepseek-ai/DeepSeek-R1/weight_only_int4 -d / --dir 模型存储目录默认 downloads -n / --nnodes 节点个数默认 1 -M / --mode 多机下载模式仅支持 master / slave -s / --speculate_model_path 投机解码MTP模型存储路径默认 None下载逻辑的关键实现要点如下支持范围校验脚本通过正则.*Qwen.*、.Llama.、.Mixtral.、.DeepSeek.校验model_name是否属于支持列表download_model.py不匹配会直接抛出错误并提示查阅本文档。下载地址拼接实际下载基址为https://paddlenlp.bj.bcebos.com/models/static/{tag}/{model_name}其中tag默认取环境变量tag未设置时默认为3.0.0.b4download_model.py。因此从代码仓库直接运行脚本时需配置tag与镜像版本保持一致镜像内启动则无需配置。多节点文件划分nnodes 1时拉取model文件清单nnodes 1时按mode拉取node1/node2文件清单download_model.py分别对应多机部署中的主节点与副节点。断点续传与完整性校验每个文件先请求file_list.txt获取文件名与 MD5 清单下载前支持跳过已存在文件并可开启MD5_CHECK1环境变量做 MD5 校验未下载完整的文件会自动删除并重新下载download_model.py。MTP 投机模型当指定--speculate_model_path时会额外拉取mtp文件清单download_model.py对应带 MTP 模块的 DeepSeek-R1 系列模型。模型支持清单总览model_name的构成可总结为三段式{组织}/{模型家族}-{变体}-{节点}-{精度后缀}/{量化类型}其中常见的量化/精度后缀含义如下后缀含义weight_only_int4仅权重量化到 INT4weight_only_int8仅权重量化到 INT8a8w8_fp8激活 INT8 权重 FP8 的混合量化bfloat16BF16 精度float16FP16 精度Append-Attn采用 Append-Attention 注意力实现的版本Block-Attn采用 Block-Attention 注意力实现的版本-MTP含 MTPMulti-Token Prediction投机解码模块-2nodes需要 2 个节点部署的多机版本DeepSeekV2 / DeepSeekV3 / DeepSeekR1模型名称静态图下载 model_namedeepseek-ai/DeepSeek-V2-Chatdeepseek-ai/DeepSeek-V2-Lite-Chatdeepseek-ai/DeepSeek-V3deepseek-ai/DeepSeek-R1weight_only_int4无 MTP1 节点deepseek-ai/DeepSeek-R1/weight_only_int4deepseek-ai/DeepSeek-R1weight_only_int4带 MTP1 节点deepseek-ai/DeepSeek-R1-MTP/weight_only_int4deepseek-ai/DeepSeek-R1weight_only_int8无 MTP2 节点deepseek-ai/DeepSeek-R1-2nodes/weight_only_int8deepseek-ai/DeepSeek-R1weight_only_int8带 MTP2 节点deepseek-ai/DeepSeek-R1-MTP-2nodes/weight_only_int8deepseek-ai/DeepSeek-R1a8w8_fp8无 MTP2 节点deepseek-ai/DeepSeek-R1-2nodes/a8w8_fp8deepseek-ai/DeepSeek-R1a8w8_fp8带 MTP2 节点deepseek-ai/DeepSeek-R1-MTP-2nodes/a8w8_fp8deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B/weight_only_int8, deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B-Block-Attn/weight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5Bfp16deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B-Block-Attn/float16deepseek-ai/DeepSeek-R1-Distill-Qwen-7Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-7B/weight_only_int8, deepseek-ai/DeepSeek-R1-Distill-Qwen-7B-Block-Attn/weight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-7Bfp16deepseek-ai/DeepSeek-R1-Distill-Qwen-7B-Block-Attn/float16deepseek-ai/DeepSeek-R1-Distill-Qwen-14Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-14B/weight_only_int8, deepseek-ai/DeepSeek-R1-Distill-Qwen-14B-Block-Attn/weight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-14Bfp16deepseek-ai/DeepSeek-R1-Distill-Qwen-14B-Block-Attn/float16deepseek-ai/DeepSeek-R1-Distill-Qwen-32Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-32B/weight_only_int8, deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-Block-Attn/weight_only_int8deepseek-ai/DeepSeek-R1-Distill-Qwen-32Bfp16deepseek-ai/DeepSeek-R1-Distill-Qwen-32B-Block-Attn/float16deepseek-ai/DeepSeek-R1-Distill-Llama-8Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Llama-8B/weight_only_int8, deepseek-ai/DeepSeek-R1-Distill-Llama-8B-Block-Attn/weight_only_int8deepseek-ai/DeepSeek-R1-Distill-Llama-8Bfp16deepseek-ai/DeepSeek-R1-Distill-Llama-8B-Block-Attn/float16deepseek-ai/DeepSeek-R1-Distill-Llama-70Bweight_only_int8deepseek-ai/DeepSeek-R1-Distill-Llama-70B/weight_only_int8其中多个条目同时给出「普通版 Block-Attn 版」两个model_name前者面向 SM80 及以上设备后者面向更老架构SM70如 V100。QWQ 与 LLaMA 全系列模型名称静态图下载 model_nameQwen/QwQ-32BQwen/QwQ-32B-Append-Attn/weight_only_int8Qwen/QwQ-32B-Previewfacebook/llama-7b / 13b / 30b / 65bmeta-llama/Llama-2-7b / 7b-chat / 13b / 13b-chat / 70b / 70b-chatmeta-llama/Meta-Llama-3-8Bmeta-llama/Meta-Llama-3-8B-Instructmeta-llama/Meta-Llama-3-8B-Instruct-Append-Attn/bfloat16, meta-llama/Meta-Llama-3-8B-Instruct-Block-Attn/float16meta-llama/Meta-Llama-3-70B / 70B-Instructmeta-llama/Meta-Llama-3.1-8B / 8B-Instruct / 70B / 70B-Instruct / 405B / 405B-Instructmeta-llama/Llama-Guard-3-8Bmeta-llama/Llama-3.2-1B / 1B-Instruct / 3B / 3B-Instructmeta-llama/Llama-Guard-3-1Bmeta-llama/Llama-3.3-70B-InstructMixtral模型名称静态图下载 model_namemistralai/Mixtral-8x7B-Instruct-v0.1Qwen 全系列模型名称静态图下载 model_nameqwen/qwen-7b / 7b-chat / 14b / 14b-chat / 72b / 72b-chatQwen/Qwen1.5-0.5BQwen/Qwen1.5-0.5B-Block-Attn/bfloat16, Qwen/Qwen1.5-0.5B-Block-Attn/float16Qwen/Qwen1.5-0.5B-Chat ~ Qwen1.5-110B-Chat、Qwen1.5-MoE-A2.7B(-Chat)Qwen/Qwen2-1.5B-InstructQwen/Qwen2-1.5B-Instruct-Append-Attn/bfloat16, Qwen/Qwen2-1.5B-Instruct-Block-Attn/float16Qwen/Qwen2-0.5B / 0.5B-Instruct / 7B / 7B-Instruct / 72B / 72B-Instruct / 57B-A14B(-Instruct)Qwen/Qwen2-Math-1.5B / 1.5B-Instruct / 7B / 7B-Instruct / 72B / 72B-Instruct / RM-72BQwen/Qwen2.5-0.5B ~ 72B 全系及 Instruct 版本Qwen/Qwen2.5-Math-1.5B ~ RM-72BQwen/Qwen2.5-Coder-1.5B / 1.5B-Instruct / 7B / 7B-Instruct 表示该模型虽然出现在支持列表中但静态图下载model_name尚未开放尚在建设中需手动导出静态图模型后部署导出与部署方法参考 deploy_usage_tutorial.md。硬件门槛SM 架构、CUDA 版本与注意力实现选择静态图下载并非「下载即能用」还需要匹配机器硬件。文档明确给出的硬件要求如下DeepSeek-R1 系列部署形态最低 SM 架构参考机器CUDA 要求除 MTP、FP8 之外的模型SM80A100 / A800CUDA 11.8 及以上MTP 模型与 FP8 模型SM90H800CUDA 12.4 及以上Append-Attn 注意力SM80A100 / A800CUDA 11.8 及以上Block-Attn 注意力SM70V100CUDA 11.8 及以上Llama3 系列部署形态最低 SM 架构参考机器CUDA 要求Append-AttnSM80A100 / A800CUDA 11.8 及以上Block-AttnSM70V100CUDA 11.8 及以上Qwen1.5 / Qwen2 系列Qwen1.5Block-Attn 支持的最低版本为 SM70V100要求 CUDA 11.8 以上Qwen2Append-Attn 最低 SM80A100 / A800、Block-Attn 最低 SM70V100均要求 CUDA 11.8 以上。这些硬件要求与镜像选择一一对应。仓库提供的部署镜像如下见 deploy_usage_tutorial.mdCUDA 版本支持硬件架构镜像地址支持的典型设备cuda11.870 75 80 86ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddlenlp:llm-serving-cuda118-cudnn8-v2.3V100T4A100A30A10cuda12.480 86 89 90ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddlenlp:llm-serving-cuda124-cudnn9-v2.3A100A30A10L20H20H100由此可得到选型规则V100 等 SM70 老设备只能选择 Block-Attn 版本且通常为float16精度如Meta-Llama-3-8B-Instruct-Block-Attn/float16、Qwen1.5-0.5B-Block-Attn/float16对应 cuda11.8 镜像。注意 V100 因硬件指令限制仅支持 float16且 float16 下可能出现计算溢出可设置export FLAGS_blha_use_fp32_qk_sum1规避general_model_inference.md。A100 / A800 等 SM80 设备可选 Append-Attn 版本bfloat16 / 量化精度或 Block-Attn 版本对应 cuda11.8 或 cuda12.4 镜像均可。H800 / H100 等 SM90 设备可部署 MTP 模型与 FP8a8w8_fp8模型要求 cuda12.4 镜像。一键下载与启动实践方案一启动时自动下载推荐单机A100 部署示例来自 deploy_usage_tutorial.md 与 general_model_inference.mdexport MODEL_PATH${MODEL_PATH:-$PWD} export model_name${model_name:-deepseek-ai/DeepSeek-R1-Distill-Llama-8B/weight_only_int8} docker run -i --rm --gpus all --shm-size 32G --networkhost --privileged --cap-addSYS_PTRACE \ -v $MODEL_PATH:/models -e model_name${model_name} \ -dit ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddlenlp:llm-serving-cuda124-cudnn9-v2.3 /bin/bash \ -c -ex start_server $model_name tail -f /dev/nullV100 部署示例Block-Attn float16cuda11.8 镜像export MODEL_PATH${MODEL_PATH:-$PWD} export model_name${model_name:-meta-llama/Meta-Llama-3-8B-Instruct-Block-Attn/float16} docker run -i --rm --gpus all --shm-size 32G --networkhost --privileged --cap-addSYS_PTRACE \ -v $MODEL_PATH:/models -e model_name${model_name} \ -dit ccr-2vdh3abv-pub.cnc.bj.baidubce.com/paddlepaddle/paddlenlp:llm-serving-cuda118-cudnn8-v2.3 /bin/bash \ -c -ex start_server $model_name tail -f /dev/nullNote请保证shm-size 5否则可能导致服务启动失败部署前务必按本文「硬件门槛」一节确认模型所需环境与硬件。方案二手动下载脚本单机 / 多机进入容器后执行脚本镜像内路径为/opt/output/download_model.pypython download_model.py \ --model_name $model_name \ --dir $MODEL_PATH \ --nnodes 2 \ --mode master \ --speculate_model_path $MODEL_PATH单机模型下载以 DeepSeek-R1 weight_only_int4 为例export MODEL_PATH${MODEL_PATH:-$PWD} export model_namedeepseek-ai/DeepSeek-R1/weight_only_int4 python download_model.py --model_name $model_name --dir $MODEL_PATH --nnodes 1多机模型下载以 DeepSeek-R1 2 机 weight_only_int8 为例# node1 主节点 export MODEL_PATH${MODEL_PATH:-$PWD} export model_namedeepseek-ai/DeepSeek-R1-2nodes/weight_only_int8 python download_model.py --model_name $model_name --dir $MODEL_PATH --nnodes 2 --mode master # node2 副节点 export MODEL_PATH${MODEL_PATH:-$PWD} export model_namedeepseek-ai/DeepSeek-R1-2nodes/weight_only_int8 python download_model.py --model_name $model_name --dir $MODEL_PATH --nnodes 2 --mode slave带 MTP 的模型可额外指定--speculate_model_path存放投机解码模型部署时需通过环境变量MODEL_DIR指定模型下载存储路径。若从代码仓库直接运行脚本需配置环境变量tag与镜像版本保持一致当前默认3.0.0.b4。启动服务模型就绪后配置 start_server.sh 中的环境变量并启动export MODEL_DIR${MODEL_DIR:-/models} start_server # 重新启动服务前需先执行 stop_serverstart_server脚本中与模型下载直接相关的逻辑包括默认下载版本tag3.0.0.b4、默认模型目录MODEL_DIR/models以及当传入model_name时将MODEL_DIR自动设为/models/{model_name}并创建目录见 start_server.sh。同时脚本会检查五个端口HEALTH/METRICS/GRPC/INTER/HTTP是否被占用并用tritonserver以 CPU 实例组方式加载模型仓库模型配置见 config.pbtxt。结合显存参数的选型建议选择量化精度时可参考部署教程中给出的 80GB 显存配置表deploy_usage_tutorial.md。下表摘录了与本文模型清单对应的典型组合BLOCK_BS 为缓存 block 的 Query Batch Size支持的总 token 数 ≈ BLOCK_BS × MAX_SEQ_LENGPU 显存部署模型静态图权重节点数量化类型导出长度是否 MTPMTP 量化类型推荐 block_bs80GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1/a8w8_fp8_wint41a8w8_fp8_wint48K否-4080GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-MTP/a8w8_fp8_wint41a8w8_fp8_wint48K是a8w8_fp83680GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1/weight_only_int41weight_only_int48K否-4080GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-MTP/weight_only_int41weight_only_int48K是weight_only_int83680GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-2nodes/a8w8_fp82a8w8_fp88K否-5080GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-MTP-2nodes/a8w8_fp82a8w8_fp88K是a8w8_fp83680GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-2nodes/weight_only_int82weight_only_int88K否-4080GBDeepSeek-V3/R1deepseek-ai/DeepSeek-R1-MTP-2nodes/weight_only_int82weight_only_int88K是weight_only_int836可以看到model_name中-2nodes后缀与「节点数 2」一一对应-MTP后缀与「是否 MTP 是」一一对应这与下载脚本按nnodes/mode/speculate_model_path拉取node1/node2/mtp文件清单的实现完全吻合选型时可以直接对照。部署后的快速验证服务启动后可通过健康检查接口确认状态端口对应HEALTH_HTTP_PORT# live 接口服务是否能正常接收请求 curl http://127.0.0.1:8110/v2/health/live # ready 接口模型是否准备好推理 curl http://127.0.0.1:8110/v2/health/ready推理验证可直接调用 OpenAI 兼容的 HTTP 接口SERVICE_HTTP_PORT默认 9965curl 127.0.0.1:9965/v1/chat/completions \ -H Content-Type: application/json \ -d {text: hello, llm}更完整的 HTTP / gRPC 调用、请求参数max_dec_len、topp、temperature、stream等与显存调优参数BATCH_SIZE、BLOCK_RATIO、MAX_SEQ_LEN等说明请继续阅读 deploy_usage_tutorial.md 与 general_model_inference.md。小结本文完整继承了 static_models.md 的模型支持清单并从仓库源码侧download_model.py、start_server.sh解释了model_name的解析与下载实现以及它如何与节点数、MTP、注意力实现Append-Attn / Block-Attn、量化精度深度绑定。实践中的选型决策只需三步在本文清单中确认目标模型的model_name非 按硬件门槛表确认机器的 SM 架构与 CUDA 版本是否满足该模型Append-Attn / Block-Attn / MTP / FP8 的要求各不相同按对应镜像cuda11.8 / cuda12.4与节点数选择一键启动或手动下载 start_server启动。赞分享人工智能大模型预训练微调LoRARLHF强化学习分布式训练【免费下载链接】PaddleNLPEasy-to-use and powerful LLM and SLM library with awesome model zoo.项目地址https://gitcode.com/gh_mirrors/pa/PaddleNLP点击查看免费下载相关推荐PaddleNLP LLM 服务化部署快速开始基于 Triton 的静态图大模型推理服务搭建指南PaddleNLP LLM 服务化部署快速开始基于 Triton 的静态图大模型推理服务搭建指南 本文是 PaddleNLP 大模型服务化部署工具 llm/人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLPPaddleNLP 大模型服务化部署快速开始教程基于 Triton 的静态图 LLM 推理服务实践PaddleNLP 大模型服务化部署快速开始教程基于 Triton 的静态图 LLM 推理服务实践 本教程完整讲解 PaddleNLP 提供的基于英伟达 Tr人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLPPaddleNLP 大模型服务化部署快速开始基于 Triton 的静态图通用模型推理指南PaddleNLP 大模型服务化部署快速开始基于 Triton 的静态图通用模型推理指南 本指南面向需要将 PaddleNLP 大模型LLM部署为线上推理人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP上一篇如何高效管理Nintendo Switch游戏文件NSC_BUILDER终极解决方案解析下一篇5分钟上手Nintendo Switch游戏文件管理神器NSC_BUILDER完全指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。