尧图网络科技YAOTU DIGITAL 获取报价
获取报价
首页 / 资讯中心 / 文章详情

大模型落地广告营销:货拉拉素材生成与投放优化实践

发布时间:2026/9/26 8:32:54

资讯中心
01
ARTICLE

大模型落地广告营销:货拉拉素材生成与投放优化实践

大模型落地广告营销:货拉拉素材生成与投放优化实践
1. 先想清楚营销广告这道题大模型到底该解哪个环节1.1 货拉拉广告业务的特殊性决定了不能照搬电商玩法先说一个我在货拉拉营销广告项目里反复被问到的问题大模型到底能在广告里干什么很多人第一反应是拿来写文案一个月生成几千条标题但真正落地之后你会发现写文案只是最表面的那层。货拉拉的广告不像电商那样“短平快”。货运平台的业务线很杂搬家、拉货、跑腿、同城配送甚至还有面向B端商户的整车运输。不同业务线的用户画像差异极大——搬家用户关心的是价格透明、师傅靠谱、物品有没有保障拉货司机和高频发货客户关心的是车型匹配、装卸效率、时效承诺跑腿用户更在意“快”和“准”。同一句广告词打给这三类人效果完全不是一码事。再加上城市差异这件事杭州的用户和哈尔滨的用户对“满减”“优惠券”的敏感度都不一样一线城市和下沉市场对“低价”“一口价”的信任度也不同。所以货拉拉的素材需求是典型的多维组合爆炸业务线 × 城市 × 活动类型 × 人群包 × 投放位随便乘一下就是几十万条的体量。靠人工一条条写创意团队就算每天加班也供不上。更为关键的是投放链路特别长。用户从看到广告到最终下单中间要经过曝光、点击、唤起App、注册、浏览选服务、下单预约、实际履约甚至还要等下次复购。广告点击和最终成交之间隔了好几层归因天然困难。这条长链路意味着我们不能只把大模型用在“把文案写好”这一步还得让它帮我们理解用户意图、做素材和人群的匹配、做合规审核甚至帮我们把投放数据回传后形成优化闭环。1.2 大模型的价值边界该上的环节一个别少不该上的别硬凑做技术的人容易犯一个毛病手里拿着锤子看什么都是钉子。大模型刚火起来的那段时间团队里也有同事提出要不要把广告排序模型也换成LLM我当场就给否了。广告排序和出价环节讲究的是数值精度、延迟稳定性和可解释性这些恰恰是大模型的短板——它擅长的是语义理解和开放式生成不擅长做精细的数值决策。我把货拉拉营销广告的链路拆开逐个环节过了一遍最后划了一条清晰的边界线。大模型该上的环节有四块。第一是创意生产包括文案、短标题、banner图、视频脚本这本质是开放式生成机器干的活越多人工释放的产能越大。第二是用户意图理解过去靠规则标签覆盖窄、维护难大模型可以读用户行为序列然后输出泛化标签。第三是智能审核广告合规门槛高极限词、虚假宣传风险、品类限制都要查大模型能做语义级初筛。第四是策略解释与辅助决策投放运营想知道“这批素材为什么跑得好”用大模型做归因摘要比人肉翻报表快得多。不该上的环节也有三个。出价和预算分配别动那是数值优化问题交给传统机器学习模型更稳面向用户的最终价格、地址、时间承诺等强约束信息别让模型自由发挥必须走槽位填充和规则校验凡是需要百分百确定性的内容比如合同条款、售后规则说明也别让LLM碰。一句话概括大模型负责“泛化理解和开放式创造”规则和高精度模型负责“兜底确定性”。这不是谁替代谁的关系而是各管一段、协作干活的关系。这个边界想清楚了后面所有的架构设计才不会跑偏。1.3 指标先行别让“生成了几万条”骗了自己立项的时候我提了一个在团队内部有点争议的要求先把效果指标定义清楚再谈技术方案。广告场景特别容易陷入“产能自嗨”——系统上线后运营跑来跟你说“今天模型生成了两万条文案”听起来很漂亮但细问下去被真正投放使用的可能只有几百条。我们当时定了一套分层指标体系核心看五样东西素材生产效率单人单日可用素材产出量衡量人效提升CTR和CVR投放端的核心转化指标衡量素材质量单条可用素材的综合成本算上GPU消耗、人工审核、返工成本违规素材拦截率合规性指标宁可多拦不能放过端到端投放ROI最终算总账看每块钱投放成本换来多少GMV这五条指标里前两个是“增量指标”衡量大模型值不值得上后三个是“风控指标”防止上线后出幺蛾子。后来复盘时发现这套指标框架最大的价值不是用来汇报而是帮我们在技术方案上做了大量取舍——凡是没法直接贡献到这些指标的功能优先级全部调低。2. 模型选型与整体架构不是端起LLM就往线上怼2.1 模型选型不是越大越好按任务分层部署这是我在很多技术分享里都会重点强调的一点广告场景用大模型参数规模不是越大越好而是越匹配越好。文本生成这块我们实测下来开源的中小尺寸模型完全够用。广告文案本身句子短、句式相对固定、卖点表达套路化它对模型的“知识深度”要求并不高真正要求高的是“指令遵循能力”和“风格稳定性”。我一开始也想用大参数模型觉得生成质量肯定更好但做了两轮评测之后发现14B级别的开源模型经过微调之后产出文案的通顺度和多样化已经能满足业务需求而推理成本和延迟却比大参数模型低了一个量级。这一个对比直接帮我们省下了一大半GPU预算。模型选型上我们最后用了分层组合文本生成开源7B-14B模型微调负责广告文案、标题、活动描述语义向量用通用Embedding模型bge系列这类做用户query和素材的语义匹配多模态生成文生图模型做banner底图配ControlNet做文字和版面的可控性处理意图理解开源LLM做用户行为序列摘要输出结构化标签这套组合里没有一个是“顶配”但每个环节都是那个位置上性价比最高的选择。广告场景的ROI导向在这时候体现得特别明显模型再强如果成本摊不平终究是实验室里的玩具。2.2 离在线分层把LLM挪到离线线上只做检索架构设计上我们踩过一轮坑值得单独说说。最早我们有同事提过“用户请求进来直接调LLM现写一条广告”听起来很性感——千人千面、实时生成、无素材库存压力。但稍微算一笔账就知道不现实。在线实时生成的问题首先出在延迟上。广告场景的流量是真实的曝光请求打到服务端几百毫秒内必须返回素材否则流量就浪费了。LLM流式生成一条完整广告文案在GPU上跑一次推理运气好一秒能出来P99一上来就直接破三秒这种延迟放在广告链路里基本等于自杀。其次在成本上。同样是一条文案用LLM在线生成一次的成本比从素材池里查一次向量、做一次排序贵上几十倍不止。广告是毛利导向的业务花一块钱赚一块二的事成本结构稍微失控项目就得砍。所以我们最终的架构方案是“离在线分层”所有需要大模型实时推理的工作全部离线化线上只做检索和轻量排序。具体流程是这样的——离线侧每天定时批量跑生成任务把所有候选创意素材生成出来经过规则校验、合规审核、质量打分写入素材池同时做向量化索引。在线侧用户请求进来先用Embedding模型把query转成向量再去素材池里做ANN检索召回最相关的素材最后用一层轻量排序模型做个性和场景适配返回结果。这套架构落地之后在线链路完全绕开了大模型推理延迟直接降到50毫秒以内稳定性也有了保障。线上可能出问题的就不再是“模型输出质量”了而是素材池够不够丰富、检索召回准不准、排序模型能不能把最合适的那条素材顶到最前面。2.3 成本账怎么算离线比在线便宜一个量级缓存和复用还能再砍一半很多团队上大模型项目成本预算是拍脑袋给的我建议你把账算到“每条可用素材”这个粒度上。以一个实际数字来演示假设GPU按小时计费某个时段的算力成本折算下来是每小时50元单次推理平均生成一条文案需要消耗80个token一个GPU实例每秒能跑20个生成请求那生成10000条文案的算力成本大约是10000 / (20 × 3600) × 50 ≈ 7块钱。看上去很便宜对吧但这是纯算力还没算数据准备、微调训练、人工审核、无效素材返工这些隐性成本。实际上线后有效素材率大概只有六成到七成所以“每条可用素材”的真实成本要再除以这个比率。真正可怕的是在线实时生成。假设线上1000 QPS流量每次请求生成300个token一个GPU实例每秒只能处理3个请求要扛住这1000 QPS就得300多张卡同时在线这个成本直接就把广告毛利吃光了。所以“先把模型用起来”远不如“先想清楚模型在哪一层用”同样的模型放在离线批量任务和放在在线实时推理里成本能差两个数量级。另外我们后来还做了两件事把成本再砍了一截一是对生成结果做相似度去重和缓存相同意图的query只生成一次直接复用二是把高频使用的素材做成了“半成品模板”只在槽位参数上做轻量替换连大模型都不用重新走一遍。3. 四大核心模块的落地细节逐块拆给你看3.1 广告文案批量生成结构化Prompt、槽位填充、多路抽样一个都不能少这一块是团队最早跑通的场景也是踩坑最深的场景值得重点讲。我们的文案生成不是简单的“丢一个标题给LLM让它写”而是拆成了五步流水线结构化Prompt → LLM批量生成 → 规则校验 → 相似度去重 → 人工抽检入库。首先说Prompt。广告文案生成最怕模型自由发挥过头——它能把一个“搬家满减活动”写得天花乱坠但价格写错了、城市写错了、承诺写过头了。所以Prompt里必须区分两类信息一类是“业务参数”比如活动名称、折扣力度、城市、服务品类、起送门槛这类信息用槽位填充的方式固定住不允许模型改动另一类是“风格卖点”比如“让搬家更省心”“师傅准时上门”“价格透明不踩坑”这类交给模型去编排和润色。我们的Prompt模板结构大概长这样你是货拉拉资深广告文案专家请根据以下结构化信息生成一条广告标题和正文。 [业务参数] 服务品类搬家 城市杭州 活动新用户首单立减30元 门槛满100元可用 [创作要求] - 标题不超过20字突出优惠力度 - 正文不少于50字包含价格透明、师傅靠谱两个卖点 - 禁止使用夸张承诺禁止出现“绝对”“第一”“最”等极限词 - 语气亲切但不低俗符合货运平台调性 [输出格式] 标题xxx 正文xxx这里有两个细节容易被忽视。第一Prompt里“禁止出现极限词”这句话不是可有可无的它能在生成源头就大幅压低违规概率后面审核环节的压力会小很多。第二输出格式一定要给死最好要求LLM输出JSON结构方便程序直接解析入库不然解析的一堆乱格式能让你怀疑人生。再说多路抽样。同一套槽位参数我们要生成多个不同风格的候选文案不能每次点击都退回同一批内容。具体做法是把temperature设置在0.7到0.9之间同时用top_p控制采样的集合范围。温度太低文案千篇一律温度太高文案跑偏连“货拉拉”都能写成“快递公司”。如果团队用的是开源自部署模型建议同时开多个实例并发跑不同随机种子这样多样性更可控。最后是规则校验和去重。校验环节我们写了几十条正则规则检查价格、城市、业务品类是否和槽位一致检查有没有出现违禁词检查有没有超字数。去重则用文本相似度计算相似度超过85%的候选只保留一条。这层“笨功夫”极大降了后面审核和投放环节的无效工作量。3.2 人群定向与意图理解从规则标签升级到语义泛化召回扩了一大圈货拉拉广告投放的人群定向过去是典型的规则标签体系看过搬家页面的用户打上“搬家意向”标签搜索过“面包车拉货”的用户打上“货运需求”标签再靠规则去组合人群包。这套体系有两个硬伤——标签覆盖面窄很多长尾行为根本定义不到组合规则爆炸运营同学手动维护几百条规则的痛苦谁做谁知道。大模型切入后我们把用户行为数据做成了“序列摘要意图推理”的方案。离线用LLM去读一个用户的近期行为流水看过几个搬家相关页面、搜索过什么关键词、点击过哪类素材、在哪个页面停留时间长然后让LLM输出结构化的用户意图标签和置信度。比如它可以根据“浏览钢琴搬运页面搜索‘易碎品搬运’点击过宅急送素材”推理出“可能近期搬家且家中物品有高价值或易碎品对搬运保护措施敏感”。这套方案上线后最明显的变化是标签维度丰富了很多。规则时代的人群标签最多几十个LLM时代可以自动产出几百个语义标签还能按照置信度排序。这对广告投放的直接影响就是扩张了“可定向人群”的规模——过去买不到曝光的那群长尾用户现在能被语义标签召回并精准命中。但我这里要强调一个很实际的限制不是所有用户都值得上LLM做行为理解。无行为记录的新客、行为稀疏的冷启动用户喂给LLM也提炼不出多少信息这些用户我们直接沿用规则标签和通用人群包不走模型推理。大模型只覆盖活跃用户和中高价值人群既能控制成本又能保证意图识别的准确率。3.3 合规审核大模型做语义初筛规则引擎做硬兜底别指望单一防线广告行业的合规审核是个高水位线货拉拉这种体量的平台素材一旦翻车影响面比中小公司大得多。我们跑了近一年的素材最怕的就是“看起来没毛病但细想有问题”的文案。合规审核这块我们的思路是三层防线叠加。第一层是生成侧的Prompt约束好的Prompt天然降低违规概率这层前面已经说过。第二层是大模型语义初筛让LLM判定文案是否包含虚假宣传、夸大承诺、价格误导等风险输出“疑似违规”标记。第三层是规则引擎强制兜底拉一个高频违禁词和敏感模式列表凡是命中的素材直接打回不管大模型说它多安全。这里有个细节值得分享大模型审核和规则引擎审核的侧重点完全不同。规则引擎擅长抓“看得见的词”比如“全网最低价”“第一名”“100%有效”这种硬关键词大模型擅长抓“看不见的风险”比如“4小时保证搬完”这句话虽然没有违禁词但本质上构成了对服务时效的绝对承诺超出了平台能承诺的范围这种语义层面的风险只有大模型能识别出来。上线全量审核之前我们专门整理了一批历史违规素材做回归测试跑完一轮之后给大模型审核设置了一个“宁严勿松”的阈值宁可把正常素材误杀一批再走人工复审也不能让疑似违规素材漏进投放池。因为误杀的单条成本是几毛钱漏杀一条可能引发的投诉和合规风险成本是十万级。3.4 效果数据回流与创意打分把投放端反馈变成生成端的燃料闭环才算盘活很多团队做大模型广告应用做到“素材生成→投放”这步就停了这是一个半成品方案。我见过最典型的场景是模型生成了一万条素材投放效果好的那几十条和平庸的那几千条混在一个池子里运营根本分不清该如何扩大优势。我们的做法是在闭环里再加两步。第一步是做创意质量打分模型。投放平台会回传每一条素材的曝光、点击、转化数据我们用这些数据训练一个轻量级的创意打分模型预测每一条素材在特定人群包上的CTR和CVR。每天凌晨凌晨打分模型跑一遍全量素材池把低于阈值的素材自动下架把高分素材标记为“可扩容”投放系统第二天就会给这些高分素材增加预算倾斜。第二步是让投放端的数据反哺给生成端。我们把高CTR素材拆解成短语级别的“卖点因子”比如“透明报价”“免排队”“车型多”“全程保险”这些表达统计哪些卖点因子高频出现在高转化素材里然后动态更新Prompt模板里的“卖点库”。生成端还不懂哪个卖点更有效只能靠数据教它。这个飞轮跑起来后效果是实实在在的第二轮素材生成的时候高潜卖点的占比明显上去了整体素材池的平均CTR比第一轮提升了。能做到这一步的关键是链路要长——从创意生成到投放反馈再到生成端迭代整个周期不能超过一周否则数据新鲜度一过飞轮就转不动了。4. 实战中的常见坑与排查实录4.1 幻觉问题文案写得行云流水但价格和门店全是编的这是所有做内容生成都会撞上的第一堵墙。大模型写得越流畅越容易一本正经地胡说八道。我们初期跑生产的时候系统生成过“跨城搬家只要59元”这样看起来特别吸引人、但实际根本不可能的价格也生成过把“杭州”写成“杭州省”的低级错误。这种素材直接投放出去带来的不是转化而是一堆客诉。排查之后我们把根因分成了两类。一类是模型本身的训练数据里对货拉拉的收费结构、城市命名没有结构化认知它只是在“猜”一个合理的值另一类是Prompt里槽位信息给了但模型没严格遵守自己脑补了槽位之外的内容。解法我前面提过这里展开说三层槽位参数用强约束语法包住生成完成后必须做结构校验校验不过的整条重试任何价格、地址、时间承诺类信息一律不允许模型自由生成全部来自业务系统注入的槽位最后人工抽检比例不要低于10%尤其在模型刚升级完的那几天更要加量。这个坑我们前后踩了两轮才彻底堵住最关键的认知是大模型在广告场景里的定位是“包装者”不是“定义者”。定义信息的权利必须握在业务系统手里模型只负责把信息包装得有吸引力。4.2 输出格式不稳定JSON解析失败率飙升问题出在微调的细节上第二个高频坑是LLM输出格式不稳定。我们要求模型输出JSON结构用来直接入库存但实测下来模型偶尔会在JSON里多一个逗号、少一个花括号或者把中文标点和英文标点混在一起导致解析程序直接报错。第一反应是调整解析逻辑做容错但治标不治本。后来排查发现真正的问题是微调阶段我们在训练数据里混入了太多“非JSON格式”的对话样本模型学坏了。后来我们把输出格式约束作为微调任务里的硬性指标构造了大量纯JSON输出的微调数据训练完成后再测解析失败率直接降到1%以下。如果你没有微调的预算也可以用提示词硬约束加解析重试来兜底让模型先强输出JSON解析失败就自动重试一次重试还失败就把这条素材标记为异常进入人工处理。这个方案简单但有效唯一要注意的是重试逻辑一定要控制次数无限重试等于给成本开了一个黑洞。4.3 线上效果不涨问题常常不在模型而在归因链路这是整个项目里最有争议的一个环节。有一段时间我们做了人群定向升级LLM打出来的标签上线了一周回收数据发现整体CTR比原来提升了几个点团队兴高采烈地准备汇报。结果我把数据拆开一看发现提升主要来自大盘流量波动因为那一周正好赶上平台大促流量质量本身就好跟标签模型半毛钱关系都没有。广告投放的效果受四个变量影响素材质量、人群包质量、出价策略、大盘环境。它们同时变化的时候你根本说不清提升是谁带来的。所以每次大模型相关的改动上线我都会坚持做小流量A/B测试严格控制变量相同素材池、相同出价策略、只有人群包策略不同或者只有素材不同。只改一个变量数据才有说服力。这个教训我们自己也要反思——技术团队太容易犯“功劳归因于自己”的毛病。后来我们定了一个铁律任何模型升级先跑两周的AA实验验证实验体系的稳定性再跑AB实验看增量最后才敢全量。这一步“麻烦”值得花因为一旦归因错了后面所有的优化方向都会被带偏。4.4 成本失控真正贵的不是模型而是无效生成成本问题我最后单独说因为这是决定项目存亡的因素。我们上线第一个月月底看账单GPU费用比预期高了三倍排查下来发现三个黑洞第一重复生成——同一个活动、同一个城市、同一个业务线的文案被不同运营提交了多次生成任务产生了大量重复计算第二无效生成——生成了100条候选最后只用了5条剩下95条的全链路成本算力、审核、存储都摊到了这5条头上第三长文本浪费——有些任务我们默认设置了最大输出长度但多数素材根本用不了那么多token。解法也很直接任务层加缓存和服务端去重同一批参数24小时内重复请求直接返回历史结果生成环节加“先小批量再扩容”策略第一次只生成10条让运营挑方向对了再批量生成输出长度按任务类型限死文案任务最多150个token超出直接截断并告警。成本控制这件事没有一招制敌的魔法就是把这个账拆细逐个环节堵漏洞一个月下来能省30%以上。5. 几点经验沉淀说给想在这个方向落地的团队5.1 大模型负责“无限创意”规则负责“兜底确定性”整个实践下来我最深的体会是不要把大模型当成一个“超级可靠的业务引擎”把它当成一个“创意放大器”就好。生产侧放开手脚让它生成多样化的素材但凡是面向用户的最终输出必须经过槽位校验、规则过滤、人工抽检三道关卡。模型的“可信”不是靠模型自己保证的而是靠外围的工程约束和流程管理保证的。我们后来每次讨论新功能团队都会先问一个问题这个环节的“确定性兜底”在哪如果答不上来这个功能就不会推进。这个提问习惯帮我们避开了很多想当然的方案——大模型能写文案但能保证它写出来的价格一定正确吗能理解用户意图但能保证它输出的标签一定靠谱吗在这些问题没有明确答案之前大模型的能力再强也只能当配角。5.2 推动落地的小技巧先找ROI最清晰的场景把管线跑通再复制我经常被问“大模型在广告里还有哪些场景可以做”我的回答永远是先把一个场景做成标杆再横向复制。货拉拉这个项目里文案批量生成就是那个最先跑通的标杆场景。它的ROI最清晰——人力替代效果可量化、质量评估有客观标准、上线流程相对简单。这个管线一旦打通Prompt怎么写、审核怎么过、数据怎么回流、成本怎么控全都沉淀成了可复用的方法论后面再做人群标签、做智能审核就轻车熟路了。另外一个小建议团队汇报的时候千万别用“生成了多少条素材”当核心指标要用“被采纳了多少条”“带来了多少增量消耗和转化”。让业务同事看到的是一个能算账的投产比而不是一堆看起来高大上的技术名词这样项目才拿得到持续的资源。5.3 接下来的方向从“预制素材检索”走向“生成式个性化”我们目前的架构还是离线的“预制素材池在线检索”这个方案胜在稳定和便宜但天花板也很明显素材池再大也不可能覆盖所有用户的所有实时意图检索召回总会有“找不到完全匹配”的空隙。所以我们规划的下一个方向是“生成式个性化”——当在线检索发现素材池里没有合适的素材时用一个小而快的生成模型实时拼装一条符合当下用户意图和场景的广告。这需要在线推理延迟压缩到百毫秒级、生成成本压到足够低、并且生成结果的合规校验全部前置。短期内还做不到但方向是明确的。再往后走就是多模态素材和投放人群的联合建模让素材画面风格、文案语气、人群偏好三者真正对齐。这些方向能不能落地不取决于大模型本身有多强而取决于我们这些做工程的人能不能把成本、延迟、稳定性和效果校验这四道关都守住。
02
RELATED NEWS

相关资讯

更多网站建设与数字化升级内容

03
WHY YAOTU

想打造同款高转化官网?

懂行业、懂生意,从建站到增长一站式陪跑

◈

场景化定制

不做模板站,围绕你的业务场景量身设计,小众不撞款。

◐

营销型架构

以转化目标组织内容与路径,让官网真正带来询盘。

▲

全周期服务

设计、开发、运营、运维一体,上线只是开始。

免费获取你的建站方案

留下需求,专属顾问 24 小时内为你输出方案建议。