人工智能大模型预训练微调LoRARLHF强化学习分布式训练【免费下载链接】PaddleNLPEasy-to-use and powerful LLM and SLM library with awesome model zoo.项目地址https://gitcode.com/gh_mirrors/pa/PaddleNLP点击查看免费下载T5Text-to-Text Transfer Transformer是 Google 提出的统一文本生成架构将所有 NLP 任务统一为文本到文本的生成形式。本文以 PaddleNLP 官方文档 docs/zh/model_zoo/transformers/T5/contents.rst 的模型汇总表为骨架系统梳理 PaddleNLP 支持的 40 余个 T5 系列预训练权重含官方基础模型、多语言模型与社区微调模型并结合仓库源码深入讲解 T5 架构实现、配置参数与加载推理的完整实战方案。读完本文你将掌握如何在 PaddleNLP 中按需挑选合适的 T5 权重并快速完成加载、微调与生成推理。一、T5 模型家族概览一张表看懂预训练权重生态PaddleNLP 官方文档以汇总表的形式列出了当前支持的 T5 模型对应预训练权重涵盖英文、中文、日文三大语言方向以及翻译、摘要、问答、语法纠错、释义改写等大量下游任务微调变体。下表为文档中的完整清单预训练权重名称语言模型详情t5-smallEnglish6 层 Transformer、512 hidden、8 头注意力、约 93M 参数T5 小规模模型t5-baseEnglish12 层、768 hidden、12 头注意力、约 272M 参数T5 基础规模模型t5-largeEnglish24 层、1024 hidden、16 头注意力、约 803M 参数T5 大规模模型t5-v1_1-baseEnglish官方 T5 v1.1 基础版详见原文档参考链接t5-v1_1-largeEnglish官方 T5 v1.1 大模型版详见原文档参考链接Langboat/mengzi-t5-baseChinese澜舟科技孟子中文 T5 基础版Langboat/mengzi-t5-base-mtChinese澜舟科技孟子中文 T5 机器翻译版deep-learning-analytics/wikihow-t5-smallEnglish基于 wikiHow 指令数据微调的 T5-smallsberbank-ai/ruT5-baseEnglish面向俄语场景的 T5-base命名中 ru 暗示俄语用途文档标注为 EnglishMichau/t5-base-en-generate-headlineEnglish英文新闻标题生成微调模型google/t5-v1_1-smallEnglish官方 T5 v1.1 小规模模型prithivida/parrot_paraphraser_on_T5English基于 T5 的释义改写Paraphraser模型prithivida/grammar_error_correcter_v1English英文语法纠错模型valhalla/t5-small-qg-hlEnglish高亮文本驱动的问句生成QG模型valhalla/t5-small-qa-qg-hlEnglish高亮文本驱动的问答问句生成联合模型ramsrigouthamg/t5-large-paraphraser-diverse-high-qualityEnglish高质量多样化释义改写 T5-largemrm8488/t5-base-finetuned-common_genEnglish基于 CommonGen 常识生成任务微调valhalla/t5-small-e2e-qgEnglish端到端问句生成模型sonoisa/t5-base-japanesejapanese日语 T5-base 基础模型google/t5-base-lm-adaptEnglish官方进一步预训练LM-adapted版本google/t5-small-lm-adaptEnglish官方进一步预训练LM-adapted小规模版本valhalla/t5-small-qg-prependEnglish前缀prepend式问句生成模型prithivida/informal_to_formal_styletransferEnglish非正式到正式文体转换模型KETI-AIR/ke-t5-baseEnglish韩语ke 前缀T5-base 变体文档标注为 Englishnielsr/nt5-small-rc1English基于 NewsQA 阅读理解微调的 T5-smallsnrspeaks/t5-one-line-summaryEnglish单行摘要生成模型mrm8488/t5-small-finetuned-quora-for-paraphrasingEnglish基于 Quora 数据微调的释义模型p-christ/12412fsasfEnglish社区微调 T5 变体tscholak/3vnuv1vfEnglish社区微调 T5 变体tennessejoyce/titlewave-t5-baseEnglish标题生成微调模型vennify/t5-base-grammar-correctionEnglish英文语法纠错模型megagonlabs/t5-base-japanese-webJapanese基于网络语料预训练的日语 T5-basesberbank-ai/ruT5-largeEnglish面向俄语场景的 T5-large 变体tscholak/t5.1.1.lm100k.baseEnglish基于 100k 语言语料继续预训练的 T5 1.1 基础版deep-learning-analytics/GrammarCorrectorEnglish语法纠错模型ThomasNLG/t5-qa_squad2neg-enEnglish基于 SQuAD2.0 负样本问答微调模型flexudy/t5-small-wav2vec2-grammar-fixerEnglish面向语音识别wav2vec2输出修正的语法修复模型KETI-AIR/ke-t5-smallEnglish韩语ke 前缀T5-small 变体razent/SciFive-large-Pubmed_PMCEnglish面向生物医学文献的 SciFive-largePubMed PMC 语料google/t5-large-ssm-nqEnglish基于 Natural Questions 检索增强微调的 T5-largeozcangundes/T5-base-for-BioQAEnglish面向生物医学问答的 T5-baseRostlab/prot_t5_base_mt_uniref50English面向蛋白质序列建模的 ProtT5-basesonoisa/t5-base-japanese-question-generationJapanese日语问句生成模型Wikidepia/IndoT5-baseEnglish印尼语 T5-base 变体Indo 前缀暗示印尼语场景razent/SciFive-base-Pubmed_PMCEnglish面向生物医学文献的 SciFive-basePubMed PMC 语料google/t5-small-ssm-nqEnglish基于 Natural Questions 检索增强微调的 T5-small说明上表中语言列严格沿用官方文档标注部分社区模型如 ruT5、ke-t5、IndoT5从命名可推断其面向俄语、韩语、印尼语等场景实际使用时请以模型发布方的说明为准。表中社区模型的详细资料可参考原文档中对应的外部链接。二、官方基础模型t5-small / t5-base / t5-large 的完整超参数文档对三个官方基础模型给出了明确的架构规模信息。在仓库中这些超参数被固化在 T5_PRETRAINED_INIT_CONFIGURATION 中与文档描述完全一致t5-smalld_model512、d_ff2048、num_layers6编码器 6 层、num_heads8词表vocab_size32128约93M参数t5-based_model768、d_ff3072、num_layers12、num_heads12约272M参数t5-larged_model1024、d_ff4096、num_layers24、num_heads16约803M参数。三个模型共享以下默认配置配置项默认值含义tie_word_embeddingsTrue编码器/解码器共享词嵌入输出投影与嵌入权重绑定pad_token_id/bos_token_id/eos_token_id0 / 0 / 1特殊 token 的 idd_kv64每个注意力头的 Q/K/V 投影维度需满足d_kv d_model // num_headsrelative_attention_num_buckets32相对位置注意力使用的桶数量dropout_rate0.1各 dropout 层比例layer_norm_epsilon1e-6LayerNorm 的 epsilonfeed_forward_projrelu前馈网络激活函数relu / gated-gelu / gated-silu除文档表格列出的三个规模外仓库的 T5_PRETRAINED_INIT_CONFIGURATION 还内置了t5-3bd_ff16384、32 头、d_kv128与t5-11bd_ff65536、128 头、d_kv128的超参定义说明 PaddleNLP 的 T5 实现架构上同样支持 3B / 11B 超大模型规模的实例化。三、T5 v1.1 与语言变体架构差异点文档将t5-v1_1-base、t5-v1_1-large单独列出。从 configuration.py 可以看到 v1.1 与 v1 的关键差异tie_word_embeddingsFalsev1.1 不再绑定编码器/解码器词嵌入与输出头而是使用独立的lm_head线性投影feed_forward_projgated-gelu前馈网络从 ReLU 改为门控 GELUGEGLU结构中间维度d_ff也做了调整如 v1.1-base 的d_ff2048v1.1-large 的d_ff2816。这些差异对应 modeling.py 中T5LayerFF的分支逻辑当feed_forward_proj relu时使用T5DenseReluDense为gated-gelu时使用T5DenseGatedGeluDense两个并行线性层wi_0/wi_1相乘并过gelu_new为gated-silu时使用T5DenseGatedSiluDense。四、中文与日文模型mengzi-t5 与日语 T5 生态文档表格专门标注了中文与日文方向中文Langboat/mengzi-t5-base孟子中文 T5与Langboat/mengzi-t5-base-mt机器翻译版是 PaddleNLP 汇总表中唯一的中文原生 T5 权重配合 T5Tokenizer 可处理中文文本的 SentencePiece 切分。日文sonoisa/t5-base-japanese、megagonlabs/t5-base-japanese-web网络语料版、sonoisa/t5-base-japanese-question-generation问句生成版三个日语模型覆盖基础建模与下游生成任务。这些权重连同 40 余个社区微调模型共同构成了覆盖多语言、多任务的 T5 生态。选择建议通用英文生成/微调官方t5-small/t5-base/t5-large追求更强下游表现t5-v1_1-*GEGLU 非绑定词表中文任务Langboat/mengzi-t5-base系列特定任务直接可用摘要t5-one-line-summary、语法纠错vennify/t5-base-grammar-correction、释义parrot_paraphraser_on_T5、问句生成valhalla/t5-small-qg-*等。五、源码级解读T5 在 PaddleNLP 中的实现结构PaddleNLP 的 T5 实现位于paddlenlp/transformers/t5/目录由三个文件组成并通过 transformers/init.py 统一导出文件职责configuration.pyT5Config配置类与T5_PRETRAINED_RESOURCE_FILES_MAP权重资源映射modeling.py模型实现导出T5Model、T5PretrainedModel、T5ForConditionalGeneration、T5EncoderModeltokenizer.pyT5Tokenizer基于 SentencePiecespiece.model支持extra_ids特殊 token模型类体系从 modeling.py 的导出列表与类定义可见完整层次T5StackL917可复用的 Transformer 堆栈同一实现既做编码器也做解码器通过参数区分是否使用因果注意力与交叉注意力T5ModelL1222标准 Encoder-Decoder 骨架提供get_encoder()/get_decoder()T5ForConditionalGenerationL1484在 T5Model 之上叠加语言建模头是最常用的条件生成入口T5EncoderModelL1838仅编码器版本可用于文本向量化/检索场景。关键技术点相对位置编码T5AttentionL218通过_relative_position_bucketL260将相对位置离散化到num_buckets32个桶最大距离max_distance128这是 T5 区别于绝对位置编码的核心机制T5 风格 LayerNormT5LayerNormL80无 bias、不减均值且始终在 float32 下计算方差以保持数值稳定混合精度训练时自动转回半精度词表绑定Tie在 T5ForConditionalGeneration.forward 中若tie_word_embeddingsTrue输出 logits 通过d_model ** -0.5缩放后与共享嵌入矩阵相乘否则走独立lm_head标签右移训练时通过_shift_rightL891自动将labels右移一位作为 decoder 输入无需手动构造张量并行支持前馈层与注意力投影在tensor_parallel_degree 1时自动切换为fleet.meta_parallel的列并行/行并行线性层L108-L117快速解码入口prepare_fast_entryL1738可接入FasterT5高性能解码路径支持 fp16 推理加速。六、快速上手加载预训练权重并执行生成PaddleNLP 的from_pretrained机制会自动根据权重名从 T5_PRETRAINED_RESOURCE_FILES_MAP 拉取模型权重并从 tokenizer.py 的映射拉取spiece.model。官方可直接加载的权重包括t5-small、t5-base、t5-large、t5-3b、t5-11b、t5-v1_1-base、t5-v1_1-large。基础推理示例基于 modeling.py 的官方示例加载与训练模式的使用方式如下import paddle from paddlenlp.transformers import T5ForConditionalGeneration, T5Tokenizer # 自动下载并加载预训练权重与 SentencePiece 分词器 tokenizer T5Tokenizer.from_pretrained(t5-base) model T5ForConditionalGeneration.from_pretrained(t5-base) # 编码输入并构造 labelslabels 会自动右移作为 decoder 输入 inputs tokenizer(Welcome to use PaddlePaddle and PaddleNLP!) inputs {k: paddle.to_tensor([v]) for (k, v) in inputs.items()} output model(**inputs, labelsinputs[input_ids]) loss output[0] logits output[1]文本生成示例T5 的核心能力是条件生成翻译、摘要、问答等。通过 PaddleNLP 的generate接口即可完成推理model.eval() # 例如执行英文翻译任务T5 使用任务前缀 inputs tokenizer(translate English to French: The house is wonderful., return_tensorspd) outputs model.generate(**inputs, max_length64, num_beams4, decode_strategybeam_search) print(tokenizer.decode(outputs[0], skip_special_tokensTrue))其中decode_strategy支持sampling、greedy_search、beam_search等策略注意快速解码路径prepare_fast_entry对repetition_penalty ! 1.0、同时使用 top-k 与 top-p 采样等组合暂不支持会在调用时抛出明确异常。七、T5Config 参数详解当需要从零初始化或精细控制模型结构时可直接使用 T5Config其完整参数如下参数默认值说明vocab_size32128词表大小决定input_ids可表示的 token 数d_model512编码器/解码器隐藏维度d_kv64每个注意力头的 K/V 维度需满足d_model // num_headsd_ff2048每个 T5Block 中间前馈层维度num_layers6编码器 Transformer 层数num_decoder_layersNone解码器层数不设置时与num_layers保持一致num_heads8注意力头数relative_attention_num_buckets32相对位置注意力桶数relative_attention_max_distance128桶划分的最大相对距离dropout_rate0.1所有 dropout 层比例layer_norm_epsilon1e-6LayerNorm epsiloninitializer_factor1.0权重初始化缩放因子内部测试用保持 1feed_forward_projrelu前馈激活函数支持relu、gated-gelu、gated-siluis_encoder_decoderTrue是否为编码器-解码器结构use_cacheTrue是否返回/使用 KV cache 加速解码pad_token_id/bos_token_id/eos_token_id0 / 0 / 1特殊 token idT5Config还通过attribute_mapL217-L222将通用命名hidden_size、num_attention_heads等映射到 T5 专有命名d_model、num_heads保证与 PaddleNLP 统一的配置体系兼容。八、总结PaddleNLP 的 T5 支持具备三个层次的能力模型生态广官方文档汇总的 40 余个预训练权重覆盖中英日三语、官方与社区、基础与任务微调多种形态开发者可按任务与语言快速选型实现完整从 configuration.py 的超参体系、modeling.py 的 T5Model / T5ForConditionalGeneration / T5EncoderModel 三件套到 SentencePiece 分词器与张量并行、快速解码等工程能力一应俱全开箱即用from_pretrained自动拉取权重与词表配合generate接口即可完成翻译、摘要、问答等文本到文本任务的推理与微调。无论是做中英翻译、摘要抽取、问答系统还是基于 T5 微调领域模型生物医学、代码、语音文本修正等本文的权重清单与源码解读都能帮助你快速定位到合适的起点。赞分享人工智能大模型预训练微调LoRARLHF强化学习分布式训练【免费下载链接】PaddleNLPEasy-to-use and powerful LLM and SLM library with awesome model zoo.项目地址https://gitcode.com/gh_mirrors/pa/PaddleNLP点击查看免费下载相关推荐PaddleNLP T5 模型族全景指南预训练权重、配置参数与源码级架构解析PaddleNLP T5 模型族全景指南预训练权重、配置参数与源码级架构解析 T5Text to Text Transfer Transformer是 G人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLPPaddleNLP BERT 预训练模型全览权重清单、架构配置与源码级使用指南PaddleNLP BERT 预训练模型全览权重清单、架构配置与源码级使用指南 BERTBidirectional Encoder Representati人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLPPaddleNLP ALBERT 模型族全景指南预训练权重、架构配置与源码级使用PaddleNLP ALBERT 模型族全景指南预训练权重、架构配置与源码级使用 本文以 PaddleNLP 官方模型文档 ALBERT Models Sum人工智能大模型预训练微调LoRARLHF强化学习分布式训练模型推理服务推理引擎模型量化模型压缩本地部署NLP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考