尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

货拉拉营销广告中的大模型工程化实践:文案生成、素材提效与成本控制

发布时间:2026/9/29 18:28:05

资讯中心
01
ARTICLE

货拉拉营销广告中的大模型工程化实践:文案生成、素材提效与成本控制

货拉拉营销广告中的大模型工程化实践:文案生成、素材提效与成本控制
货拉拉的营销广告链路里大模型不是实验室里的玩具而是被投放ROI、素材产能、人工成本这些指标追着跑的工程问题。我刚接手这个项目时团队内部其实吵过一轮有人说大模型写文案不靠谱风格飘、易翻车、还有幻觉风险也有人说广告素材产能已经卡住增长瓶颈人工一天产出几十条系统每天要消耗上千个坑位不引入大模型就只能在原地卷人力。最终我们选择了一条务实路线——不追求“全自动替代”而是把人从重复劳动中解放出来让大模型负责批量生成、变体扩充、素材初稿和投放策略辅助人来负责策略定义、审核和最终决策。跑了半年后我们的验证结论是在营销广告这种“高体量、重复性强、对时效敏感”的场景里大模型是被低估的杠杆。这篇文章不聊概念只聊实践把我们在货拉拉广告业务上用大模型的场景拆解、技术选型、落地过程和踩过的坑一次讲清楚。1. 项目背景与场景拆解先搞清楚大模型在营销广告里到底能干什么1.1 货拉拉营销广告的业务特征与痛点货拉拉的广告业务和纯电商、纯本地生活平台不太一样。它的用户结构是双端的一边是发货/搬家/拉货的用户另一边是平台上的货运司机。营销广告既要面向C端用户做拉新、促活、召回也要面向司机端做招募、活跃激励和增值服务推广。这意味着文案风格、投放渠道、用户心智都完全不同一个大模型很难用一套方案通吃。另一个显著特征是场景高度LBS化。用户打开货拉拉通常是因为“临时要搬家”“刚买到家具要运回家”“店里进货需要叫车”决策链路短需求明确但用户对平台的认知往往停留在“找车工具”上。广告要在极短时间内触达用户并形成转化标题、图片、落地页的匹配度就变得极其关键。过去这些素材大多由运营同学手工撰写、设计师手工出图一套活动素材从创意到上线往往要 7~10 天等素材铺完活动热度已经过去一半了。当时我们做过一次产能盘点一个核心运营小组一个月最多产出 60~80 套完整广告素材其中真正能进入投放系统的还需要经过渠道适配、尺寸裁剪、文案改写等多轮处理。但在大促节点单日需要的素材变体量是这个数字的数倍。人工跟不上就只能用一套固定素材适配所有渠道转化率自然上不去。1.2 大模型可切入的四个核心环节结合业务痛点我们把大模型的应用拆成四个环节也就是后来项目里的四个主战场。第一个是文案生成与变体扩充。围绕一条核心卖点自动扩展出几十条不同角度、不同语气、不同长度的文案用于信息流广告、短信推广、Push推送和站内弹窗。第二个是多模态素材辅助制作用大模型生成广告图片的创意方向和初始底稿配合设计师做二次精修大幅压缩从创意到成稿的时间。第三个是广告投放策略的辅助决策把投放数据自动变成“可读的自然语言日报”并给出下阶段优化建议让运营不用每天耗时处理Excel报表。第四个是用户意图理解和动态落地页匹配根据用户搜索词、浏览行为动态生成更匹配的页面标题和卖点排序。这四个环节有一个共同特点它们都不是“一次性回答”而是嵌入到已有业务流里的能力组件。这也是后来我们选型和架构设计时最重要的判断标准——大模型不是独立的系统而是营销流水线上的一种新生产力工具。2. 技术方案选型与系统架构模型不是越强越好关键是匹配业务诉求2.1 模型选型开源基座模型加商用API并行的混合路线在模型选型上我们最开始也走了点弯路。项目初期团队内部有人倾向于直接买商用大模型API理由是效果稳定、接入快也有人坚持全部用开源模型本地部署理由是可定制性强、长期成本可控。最终我们采用的是混合路线。对于文案生成这类对语义质量要求高、输入输出变化多、需要频繁调参的场景我们优先使用开源基座模型的自部署版本以保证对提示词和输出格式的完全掌控。商用API则用于两个地方一个是作为效果对比的“标尺”另一个是处理冷启动阶段数据量不足的少见场景比如全新活动品类的创意生成。基础模型我们选在当时综合能力比较均衡的中型尺寸稠密模型大概 7B~14B 量级配合量化和vLLM做推理加速。为什么会选这个量级而不是更大的模型因为广告文案生成对“事实性”要求其实不高但对推理延迟、吞吐量、并发稳定性要求很高。考虑到生产环境的GPU资源有限我们用中等量级模型配合微调完全能满足业务需求。模型不是越大越好而是“效果能过评估线、成本能扛住并发压力”的才是合适的。2.2 微调、提示词工程与RAG的边界划分这个项目里我们同时用了微调、提示词工程和少样本示例但没有用传统意义的RAG做知识库检索这是有原因的。广告文案生成讲究的是“品牌感知的一致性”。如果完全依赖提示词大模型的输出风格在天马行空和四平八稳之间来回横跳运营每次都要做大量修正。为了提高稳定性我们用历史投放中表现优秀的文案构造了微调数据集对模型做了一轮低参数量微调用的是LoRA方式。经过微调后模型的语气稳定度、对货拉拉业务词汇的使用准确度都有了非常明显的提升。需要注意微调不是用来“教新知识”的而是用来“规范表达习惯”的。广告卖点这类信息用提示词写入完全足够。那为什么不用RAG因为在我们的实践场景里营销文案通常只有几百字没有必要从大量文档里检索信息再生成。给模型注入的“知识量”很小检索带来的延迟和复杂度却会增加。不过我们倒是借鉴了一个RAG思路在文案生成前会让模型先读取“本次活动的核心卖点卡片”和“历史高转化文案示例”本质上是一种轻量的上下文组装。这个做法避免了把大量相似示例全部塞进提示词导致成本上升的问题。2.3 生成链路架构异步任务加SSE流式输出系统的架构设计上我们需要同时满足“离线批量生产素材”和“在线实时生成落地页文案”两类场景所以设计了双轨链路。离线链路使用消息队列加异步Worker运营在平台上提交一个活动配置系统自动拆解出需要生成的所有文案、图片、标题变体分发到各Worker节点执行生成结果统一落库供后续审核使用。在线链路则用于用户端实时内容生成比如按用户搜索词动态生成落地页标题这种场景对响应时间要求极高因此采用SSE流式输出加Abort机制一旦用户离开页面就中断生成避免算力浪费。这里有一个工程细节特别值得讲大模型流式输出和广告系统之间的交互不能简单用“等模型生成完整段落后再返回页面”。移动端用户耐心有限首屏会天天盯。我们一开始做了全量生成后再返回的方案首字节时间平均超过3秒后来改成SSE边生成边渲染用户在1秒内就能看到标题的逐步呈现体验提升明显。同时配合Abort机制前端如果检测到用户往下滚动或离开主动断开连接后端任务自动取消并释放显存资源。3. 核心功能落地实操从文案生成到素材联动每一步都有明确的验收标准3.1 广告文案生成提示词模板、微调数据与质量评分先讲最核心的文案生成模块。运营同学的日常操作是在后台创建一个活动填写活动名称、利益点、目标人群、投放渠道然后点击“生成文案”。系统会一次性输出多个方向的文案变体运营直接勾选采用。我们的提示词模板经过了四个版本的迭代。第一版很简单只给活动名称和利益点让模型自由发挥效果完全不可控。第二版加入了明确的字数限制、渠道特征、目标人群描述输出质量明显提升但风格还是不稳定。第三版加入了历史优秀文案作为少样本示例稳定度大幅提升但token消耗增加。最终版本把少样本示例从“全量放入提示词”改为“通过向量匹配选择最相关的3条放入提示词”同时把系统提示词固定为品牌语调和禁用词列表。下面是一个简化后的提示词模板结构可以给大家参考你是一名资深的货运物流行业广告文案专家服务于“货拉拉”品牌。 任务根据用户输入生成符合以下要求的广告文案变体。 要求 1. 语气务实、亲切、有行动感 2. 字数标题不超过20字正文不超过60字 3. 卖点必须围绕给定的活动利益点展开不得虚构额外优惠 4. 禁用词绝对、第一、最好等广告法违规词一律不得出现 5. 输出格式标题正文段落分明 活动信息 {活动配置JSON} 目标人群 {人群描述} 参考示例 {检索到的3条历史优秀文案} 请生成3个不同角度的文案变体。提示词模板只是第一步真正拉开效果差距的是微调环节。我们拿了近一年内投放数据中点击率超过大盘30%的文案整理出了约2万条优质语料做了清洗和去重然后抽取其中1.8万条做训练2000条做验证。微调用的方法是LoRA秩设置为16学习率在2e-4到5e-4之间做了10轮衰减实验最终选择了在验证集上风格得分和完整率最优的那组权重。质量评估这件事我们踩过最大的坑是“用通用大模型给生成文案打分”。一开始想省人工用大模型做裁判直接判断文案好坏结果发现裁判模型会被“更长、更花哨”的文案带偏和真实投放点击率相关性很低。最后我们采用三层评估机制技术规则过滤字数、禁用词、敏感词约30项模型评分用专门训练的小分类模型做广告相关性和语气评分人工抽检每批至少20%。这套机制上线后有效素材采纳率从最初的46%提升到了73%。3.2 多模态素材生成的工程化改造如果说文案生成解决的是“怎么写”的问题多模态素材解决的就是“怎么配图”的问题。货拉拉的广告素材里高频出现的元素是搬家工人、货箱、面包车、小区楼道、大件家具。过去这些图片要么用拍摄素材要么用图库要么由设计师手工合成每张图成本高、周期长、且容易产生审美疲劳。我们引入多模态模型后做了一个比较有意思的流程先用大模型把活动文案自动转成多组绘图Prompt然后让图像生成模型产出初稿设计师在初稿基础上做精修和合成。刚开始我们想让图像生成模型直接产出“能直接投放的成品图”试了一段时间后发现不现实细节错误和文字渲染问题很难完全规避于是改成“创意探索器”的模式。具体做法是运营只需要输入一句话需求比如“深圳夏季搬家活动画面以面包车和搬家师傅为主色调清爽明亮城市街景风格”大模型自动扩写为详细的绘图Prompt同时生成3到5张不同构图的初稿。设计师从中选出感觉对的再落到Photoshop或合成工具里精修配上真实拍摄的素材。这套流程上线后一张广告主视觉的设计时间从原来的4小时压缩到1.5小时左右而且产出的“备选方向”数量大了好几倍创意不走回头路的概率大大降低。这里必须强调一点多模态生成在我们项目里定位是“提效工具”而不是“设计师替代品”。平台素材要维护品牌调性还要规避肖像、版权、低俗等风险全自动生成直接投放目前仍不现实。最稳妥的做法是让人工审核成为固定环节机器负责生产候选内容人负责决策和搭最后一道安全网。3.3 广告投放数据的自然语言解读与时序分析这个功能听起来不像前两个那么“性感”但在实际运营中它反而是团队使用频率最高的。货拉拉广告投放涉及的信息流、搜索、短信、Push等多个渠道每个渠道每天的消耗、展现、点击、转化数据量非常大。运营总监每天上午最头疼的一件事就是看报表不直观、信息密度低、异常点要靠肉眼扫。我们做了一个基于大模型的投放日报生成器。每天凌晨跑完数据任务后系统会把前一天的明细数据按渠道、活动、素材三个维度聚合成JSON格式交给大模型做自然语言解读输出内容包括整体趋势判断、异常波动提醒、环比变化原因推测、今日优化建议。这个功能的Prompt设计重点是“结构化约束”我们会明确要求模型输出固定板块比如请根据以下投放数据生成日报要求 1. 先用一句话总结整体情况。 2. 分渠道列出消耗和转化率变化与近7日均值做对比。 3. 标记出降幅超过20%或涨幅超过50%的异常项。 4. 针对异常项给出不超过3条优化建议。 5. 禁止出现没有数据支撑的猜测。这里有个经验值得分享大模型做数据分析类任务时最大的风险是“一本正经地胡说八道”。算法同学给出的数据明明是A渠道消耗下降模型可能因为上下文太长、关注度不足把结论写到B渠道上。为了解决这个问题我们在送入模型之前做了一层数据结构化预处理把关键指标用固定模板规整为“渠道消耗/转化率/变化幅度”的极简格式并显式要求模型先复述关键数字再给出结论。这个“先复述再判断”的方法让日报结论准确率从80%提升到了96%以上。3.4 用户意图理解与动态文案匹配这个模块是我们文案生成能力的延伸也是技术上更有挑战的部分。核心逻辑很简单不同用户进入落地页时看到的第一眼内容应该不同。一个因为“搬家”来的用户应该看到“搬家一口价、准时上门、师傅帮你搬”的文案一个因为“进货”来的用户应该看到“小面微面中面多种车型、同城配送快人一步”的文案。传统实现方式是人工配置规则把用户意图映射到固定文案。但规则维护成本高意图覆盖不全而且无法处理长尾场景。我们换成了大模型做意图分类加文案生成的两段式方案第一段用行为序列数据如搜索词、点击记录、浏览品类让模型输出用户的核心需求和场景标签第二段基于这些标签动态从候选卖点池中选择排序最前的卖点组装成个性化标题。在线场景的性能是我们最担心的。实测下来我们选用的中型模型在单张A10显卡上生成一段20字以内的标题平均延迟在700毫秒左右加上前端的SSE流式渲染整体用户体验是可控的。为了进一步降低计算压力我们还维护了一个缓存层同一活动、同一直觉标签组合下生成的文案短时间内直接复用不重复调用模型。缓存命中率能到55%左右高峰期模型调用量被压下来一大截成本感受非常明显。4. 工程化与成本控制大模型项目稳定落地的关键不能只靠“效果不错”4.1 推理服务部署与性能优化vLLM、量化与动态批处理大模型要嵌入广告系统推理性能就是生命线。离线批量生成场景还好说在线场景如果并发上百个请求推理服务直接被打挂那功能再酷也上不了线。我们部署推理服务时选择了vLLM作为主要推理框架它自带的continuous batching机制能明显提升同类短文本生成场景的吞吐。具体的部署参数也做了多轮调整。模型权重我们使用了INT8量化显存占用从原来的约20GB降低到约12GB精度损失在评测集上控制在1%以内。最大并发数、最大输入长度、最大输出长度都通过配置做了严格限制。在线场景的最大输出长度我们限制为120个token离线场景放宽到512。为什么在线场景要卡这么紧一句话广告文案生成本质上不需要长篇大论输出越长首字延迟越高用户体验越差算力浪费越严重。GPU资源不足的时候我们也用过CPU部署兜底。在本地开发环境用CPU跑轻量化模型做功能联调慢归慢但能支撑日常开发和演示。生产环境上在线场景和离线场景各自独立部署服务避免互相抢占资源。离线任务全部放到夜间低峰期跑批白天只保持在线服务高可用。这套“削峰填谷”的做法让我们的GPU资源使用率稳定维持在65%以上比最初混布时提高了一倍。4.2 效果评估体系线下指标、线上指标与回归机制营销场景的模型效果评估一定要从“模型指标”思维切换到“业务指标”思维。模型指标再好最终投放点击率不涨项目就是失败的。所以我们建立了三层评估体系。第一层是离线评测。每个模型版本发布前都会在固定的评测集上跑分评测集包含约3000条历史真实活动数据覆盖各业务线。测评维度包括风格相似度、卖点覆盖完整率、广告法合规率、重复率、信息准确率。这层评测靠规则加人工评分每周更新一次基线。第二层是线上小流量实验。模型版本通过离线评测后以10%的流量进行灰度同时观察点击率、转化率、素材采纳率。只有线上表现显著优于基线的版本才能扩大流量。第三层是月度回归。每月我们会选取过去30天内新的高表现文案重新评测线上模型是否仍然能生成同风格的内容防止模型效果随业务变化出现回退。评估体系的建立花了一个多月但后期产生的价值非常大。它让团队的每次迭代都有数据支撑也让运营同学对模型输出建立了信任感。项目做到后面运营的典型反馈是“这次生成的文案我不用大改微调一下就能提交。”这个反馈背后的系统能力就是持续评估和持续优化的价值。4.3 合规与安全广告场景下大模型的“红线管控”广告行业对内容合规的敏感度极高。大模型生成文案如果出现极限词、虚假承诺、肖像权风险轻则素材被渠道拒审重则带来品牌风险。这个话题必须从一开始就纳入架构设计而不是等上线后再补救。我们的合规体系分三层。第一层是输入层限制在提示词中注入禁用词清单明确禁止出现“最”“第一”“国家级”“绝对”等广告法违规词同时要求模型不得虚构优惠幅度和时效。第二层是输出层规则拦截所有模型生成的文案必须经过一道规则引擎过滤检查命中的违规词和敏感词拦截后自动触发改写任务而不是直接丢弃。第三层是人工审核环节所有对外投放的素材在提交前必须经过运营同学的人工确认。我们的原则是“宁可多审一次不可放过一条”。最开始团队觉得这套机制太麻烦、拖慢节奏。实际上线后大家发现规则引擎过滤掉的违规文案数量不少尤其是一些看似很顺口的文案细看完全不能投放。做广告场景的大模型应用合规审核不是一个独立的复查环节而是生成链路上天然的一部分。谁无视这一点谁就要在渠道拒审和客诉上付出代价。5. 踩坑实录与复盘那些只有跑过生产环境才懂的问题5.1 大模型幻觉在营销场景的“放大效应”大模型幻觉问题在很多内容生成场景里可能只是“看起来没用”但在营销广告场景里会被放大成很尴尬的失误。我们遇到过模型在生成文案时自动加上了“5折优惠”的表述而实际上活动只有新用户立减。如果这样的文案直接投放用户点进来发现没有优惠投诉和流失几乎是必然的。复盘下来问题的根源出在模型训练数据里包含了大量类似的促销表述模型只是“学到了文案的常见套路”却不知道当前活动的真实约束。我们的修正方案是双重手段一是把所有价格、折扣、时间、范围等关键利益点从提示词里的自然语言改为结构化JSON数据减少歧义二是增加一道“关键信息一致性验证”逻辑在生成结果里把用户实际能获得的利益点提取出来与给定配置逐项比对不一致的文案直接丢弃重新生成。这个“结构化输入加逻辑校验”的组合比单纯让模型“注意别写错”靠谱得多。5.2 批量生成的内容同质化如何破局初版系统上线后运营同学反映“变体数量是上去了但感觉都差不多”。确实存在这个问题大模型在同一类活动上反复生成会收敛到相似的句式和表达。这个问题的本质是模型在输出时天然追求“最安全”的表达方式而营销素材恰恰需要创新和差异性。我们试了三个方向去破局。第一将提示词中的角度词随机化比如要求模型分别从“价格划算”“师傅专业”“车型齐全”“配送效率”等角度切入人为制造方向差异。第二在生成参数上引入一定程度的随机性把temperature从默认的0.7调到0.9top_p从0.9调到0.95让输出多样性明显增加。第三引入“对立示例”在少样本示例里故意加入一组“风格完全不该出现”的示例引导模型避开同质化方向。第三点效果不错但需要控制比例如果太多会打乱整体稳定度。最终我们把三种手段组合使用同组文案的文本相似度从87%下降到62%左右。5.3 迭代节奏失控与团队协作模式最后聊聊团队协作层面的坑。大模型项目因为是横跨算法、工程、运营、设计的复合型项目很容易出现“各自觉得很懂但整体方向走偏”的情况。我们项目前期最大的失误是让算法同学闷头优化里在线指标等到要上线运营系统时才和运营沟通结果发现运营对生成结果的预期差异很大返工成本非常高。后来我们调整了项目机制每周开一次“素材评审会”算法、工程、运营、设计坐在一起现场看最近一周生成的素材直接用业务语言讨论“可用”和“不可用”。这种方式推进问题的效率比我之前拍过的任何线上沟通都高。项目中后期运营同学学会了使用系统后也会主动提出要增加的功能点例如“能不能按渠道生成不同篇幅的版本”“能不能一键翻译成多语言”这些需求后来都转化成了系统的新能力。6. 写在最后的个人体会这个项目做下来我最大的感触是大模型在营销广告领域的价值不是单一模型能力的价值而是工程体系、数据体系、评估体系和流程机制协同后的综合价值。很多团队上来就急着找最强的模型急着做最炫的功能反而忽略了真正决定项目成败的往往是一些“不性感”的东西——比如稳定可复用的提示词模板、严格可执行的评估基线、有效的审核流程。如果你也准备在营销场景里落地大模型我的建议是先选出三个最痛、最重复、最耗人力的环节把大模型当成“初级员工”去优化让人的重心转移到策略和创意判断上。不要一开始就指望大模型全流程自动化也不要因为一次效果不理想就否定整个方向。我们团队现在回看半年前生成的素材会觉得幼稚但正是从那批“幼稚”素材里我们才逐步迭代出今天能稳定贡献增长的生成系统。技术在演进方法论也在演进把每一次小迭代沉淀下来才是项目长期价值的真正来源。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。