1. 从一篇论文速递里拆出四条技术主线9 月 19 日这天的论文列表里有三组词反复出现生成式广告的多目标对齐、LLM 重排、可微路径规划。乍看是三个不相干的方向但把它们放在一起看会发现背后是同一件事——如何让一个生成模型在既要又要的约束下输出一个可被下游直接消费的结果。广告要同时满足点击率、转化率、用户体验和预算约束重排要在相关性、多样性、时效性之间找平衡路径规划要在可微的前提下让梯度真正流回决策变量。这三件事的共性是把生成从能出结果推进到出对的结果。这篇速递适合两类人看一类是做推荐/广告/搜索的算法同学想快速知道最近大厂在解决什么具体问题另一类是做 LLM 应用落地的工程师关心重排、对齐这些词到底对应什么可复现的技术动作。我不会逐篇翻译摘要而是把每条主线拆成问题是什么、主流做法卡在哪、这篇论文动了哪一刀、你自己动手时要注意什么。所有涉及具体实现的部分我会明确标注哪些是论文里的、哪些是我基于常见工程实践补的避免把推测当结论。先说清楚一个前提论文速递类内容最容易写成标题一句话摘要的流水账那种东西看完记不住任何东西。我自己的习惯是每读一篇先问三个问题——它替换掉了原来流程里的哪一步替换的代价是什么如果我要在自己的系统里试最小验证单元是什么下面四条主线都按这个思路展开。2. 生成式广告的多目标对齐从加权求和到约束下的生成2.1 广告系统里多目标到底难在哪传统广告排序是一个多目标预估问题pCTR、pCVR、pGMV 各自一个塔最后用一个线性加权公式score b1*pctr b2*pcvr ...拼起来。这套做法能跑很多年是因为它把多目标简化成了多目标加权成单目标。但它有两个绕不过去的毛病。第一权重是全局静态的。同一个 b1 对所有用户、所有流量都一样可实际上新用户和高活用户的点击-转化权衡完全不同。第二加权求和隐含了目标之间可以线性补偿的假设——点击率低一点可以用转化率高一点补回来。但业务上很多约束是不可补偿的比如广告主预算必须花完但不能超、某类目曝光占比不得低于阈值这些是硬约束不是可以拿别的目标换的。生成式广告把问题往前推了一步不再是从候选集里排序而是直接生成广告文案、创意甚至出价策略。这时候多目标对齐的难度直接翻倍——因为生成空间是连续的、巨大的你没法像排序那样对每个候选算一个分数再比大小。2.2 对齐手段的演进RLHF 那套为什么不够用LLM 领域的对齐主流是 RLHF / DPO核心是拿人类偏好数据训练一个 reward model再用它去调策略。搬到广告场景会立刻遇到三个不匹配。一是偏好不可比。用户 A 喜欢夸张文案用户 B 喜欢克制文案你没法用一个统一的 reward model 同时服务两者硬训只会得到一个平均化的平庸策略。二是约束是硬的。RLHF 里的 reward 是软信号模型可以为了拿高分牺牲某些维度但广告的预算、频控、合规是硬约束违反了直接是事故。三是反馈延迟且稀疏。点击可能几秒后有转化可能几天后有用这种延迟信号做在线对齐方差大到没法收敛。所以这一批论文里多目标对齐的常见做法转向了约束优化 生成式策略的组合把不可补偿的目标写成约束constraint把可权衡的目标写成优化目标用拉格朗日乘子或原始-对偶方法在训练中动态调整。这样做的直接好处是约束违反会被显式惩罚而不是靠调权重去感觉。2.3 一个可落地的最小验证方案如果你想在自己的系统里试这套思路不用一上来就搞生成式。我建议的最小验证单元是在现有排序模型上把线性加权换成带约束的优化。具体步骤选定一个硬约束比如某广告主日曝光不超过 N 次。把它写成E[exposure] N。保留原来的多目标预估塔但不再直接加权而是构造拉格朗日函数L sum(bi*pi) - lambda*(E[exposure] - N)。训练时用原始-对偶更新正常梯度下降更新模型参数同时用lambda max(0, lambda lr*(E[exposure]-N))更新乘子。观察 lambda 的收敛轨迹。如果 lambda 一直震荡不收敛说明约束太紧或者学习率不匹配先放松约束验证链路。注意拉格朗日方法对学习率非常敏感乘子的学习率通常要比模型参数的学习率大 1~2 个数量级否则约束收敛会慢到你以为方法失效。这套东西跑通之后再把加权换成生成才有意义。顺序反了你会同时面对生成空间探索和约束收敛两个难题根本分不清是哪个环节出的问题。2.4 生成式广告里最容易被忽略的评估陷阱做生成式广告评估时很多人直接拿离线指标比如生成文案的 CTR 预估当结论。这里有个坑生成模型的输出分布和真实曝光分布不一致。你生成的文案可能压根没机会被真实用户看到离线预估的 CTR 是在一个假想曝光上算的和线上差很远。我的经验是评估生成式广告至少要三层离线用 reward model 打分做粗筛小流量用真实反馈做校准最后看长期指标用户留存、广告主续投率而不是单次点击。只看单次点击很容易被标题党式的生成策略骗过去——短期点击涨长期用户流失。3. LLM 重排为什么再排一次能救回不少效果3.1 重排在整个检索链路里的位置一个典型的检索系统是召回 → 粗排 → 精排 → 重排。召回负责从亿级里捞回千级粗排砍到百级精排算精细分数重排做最后的顺序调整。重排之所以存在是因为前面几步为了效率牺牲了信息——召回用双塔query 和 doc 是分开编码的交互信息丢失精排虽然用了交叉特征但受限于延迟能用的特征和模型复杂度有限。LLM 重排的思路很直接既然 LLM 有强语义理解能力那就让它对 top-K 候选做一次精读重新打分。K 通常取 20~100因为 LLM 推理成本高不可能对千级候选都跑一遍。3.2 LLM 重排的三种典型实现路径路径做法优点代价Pointwise每个 query-doc 对单独打分实现简单可并行忽略候选间相对关系成本随 K 线性增长Pairwise两两比较输出偏好更贴近排序本质组合数 O(K²)成本高Listwise一次输入所有候选输出完整排序全局最优成本可控对 prompt 长度敏感位置偏置明显实际落地里Listwise 是主流因为它一次推理就能出完整顺序成本最低。但它有个著名问题位置偏置。LLM 对 prompt 里靠前和靠后的内容注意力不均导致排序结果受输入顺序影响。常见的缓解手段是多次打乱顺序取平均或者用滑动窗口分段排序再合并。3.3 自己搭 LLM 重排时prompt 怎么写才不翻车我试过几版 prompt踩过的坑比想象中多。分享一个相对稳的模板结构你是一个搜索相关性排序助手。下面是用户查询和 N 个候选文档。 请根据文档与查询的相关性从高到低输出文档编号。 用户查询{query} 候选文档 [1] {doc_1} [2] {doc_2} ... 要求 - 只输出编号用逗号分隔不要输出任何解释 - 如果两个文档相关性接近优先选择信息更具体、更新更及时的那个 - 必须输出全部 N 个编号不得遗漏几个关键点强制输出全部编号。不加这条LLM 经常只输出前几个后面的直接丢导致排序不完整。禁止解释。一旦让它解释理由输出长度不可控解析成本飙升而且理由和最终排序经常对不上。给平局规则。相关性接近时 LLM 会随机选给一条明确的 tie-breaker 能显著降低方差。编号用方括号。实测[1]比1.或(1)更容易被稳定解析因为方括号在文本里出现频率低不容易和正文混淆。提示如果你的候选文档里有大量相似内容LLM 重排的收益会明显下降。这时候先做一步去重或聚类把 K 压下来比硬堆 prompt 有效。3.4 重排的延迟账要提前算LLM 重排最大的落地障碍是延迟。假设你用 7B 模型单次 listwise 推理 50 个候选在单张消费级卡上大概几百毫秒到一秒。如果 QPS 是 100你需要几十张卡才能扛住。这个账必须在方案设计阶段就算清楚而不是等上线了才发现延迟爆炸。几个降延迟的实操手段把 K 从 100 降到 30收益衰减通常不明显用蒸馏后的小模型做重排对长尾 query 跳过重排直接用精排结果。最后这条特别实用——重排的收益主要集中在头部高频 query 上长尾 query 候选本来就少重排性价比很低。4. 可微路径规划让梯度真正流到决策变量上4.1 路径规划为什么长期不可微经典路径规划是搜索 优化A*、RRT 这类算法在离散的图或连续空间里搜一条可行路径然后做平滑。问题在于搜索过程本身是离散的、不可导的——你没法对选了哪条边求导。这就导致它很难和上游的感知模块、下游的控制模块做端到端联合优化。可微路径规划要解决的就是这件事把路径表示成一个可微的参数化形式让损失函数的梯度能一路传回到路径参数甚至传回到感知特征。这样整个感知-规划-控制就能一起训。4.2 可微化的两条技术路线一条是软化的离散搜索。把选哪条边从硬选择变成概率分布用 softmax 加权这样期望路径对参数可导。代价是训练时是软路径推理时还得离散化两者之间有 gap。另一条是连续参数化。直接把路径表示成样条曲线或神经网络输出的控制点序列路径本身就是参数的连续函数天然可微。这条路线更干净但需要保证输出的路径满足动力学约束比如曲率不能超过车辆极限。这一批论文里比较多的是第二条路线的变体用扩散模型或隐式神经表示来参数化路径把约束写成损失项。扩散模型的好处是能建模多模态的路径分布——同一个起点终点可能有几条都合理的路径扩散模型能采样出多样性而不是只给一条平均路径。4.3 约束怎么加才不破坏可微性路径规划里约束很多避障、曲率上限、速度上限。加约束的常见做法是罚函数——违反约束就加一个惩罚项。但罚函数有个老问题权重难调。权重太小约束形同虚设权重太大梯度被惩罚项主导路径质量崩掉。更稳的做法是把硬约束投影到可行域。比如曲率约束可以在每步更新后把参数投影回满足曲率上限的集合。投影操作本身如果可微或者用可微的近似就不会破坏端到端训练。这个思路在优化里叫投影梯度法搬到可微规划里同样适用。注意投影操作会让梯度在边界处不连续训练时容易出现 loss 尖刺。缓解办法是用平滑的投影近似或者在边界附近降低学习率。4.4 一个最小可复现的实验设计想验证可微路径规划不用上真车。我建议的最小实验是二维平面上的避障路径规划。定义起点、终点和若干圆形障碍。用一个小 MLP 输出一组控制点插值成路径。损失 路径长度 避障惩罚 平滑惩罚。用 Adam 优化观察路径是否收敛到绕开障碍的最短路径。关键验证把障碍位置作为可学习参数看梯度能不能传回障碍表示——这一步验证了可微是否真的成立。这个实验半天能跑完但能把可微规划的核心机制摸清楚。跑通之后再上更复杂的动力学约束和扩散参数化心里有底。5. 把三条线串起来看生成、对齐、可微的共同底层5.1 它们都在解决生成结果不可控的问题生成式广告、LLM 重排、可微路径规划表面是三个领域底层是同一个矛盾生成模型的输出空间太大而业务要求输出必须落在某个可控范围内。广告要落在预算和合规范围内重排要落在相关性阈值内路径要落在动力学可行域内。三种解法也高度相似用约束显式表达不可越界用可微性保证能优化用对齐保证优化方向对。这三件事缺一不可——只有约束没有可微性你没法训只有可微性没有约束模型会跑偏只有对齐没有约束硬性要求会被软信号淹没。5.2 工程落地时的通用检查清单不管你做的是哪条线落地前建议过一遍这几个问题约束是硬的还是软的硬约束必须显式建模不能靠调权重。梯度能不能流到你想优化的变量如果中间有不可微的离散操作要么软化要么用直通估计器STE。离线指标和线上指标的相关性验证过吗没验证过就别信离线结论。延迟预算算过吗尤其是 LLM 相关的方案延迟往往是第一杀手。最小验证单元是什么别一上来就端到端先验证单个环节。5.3 我自己的踩坑体会做这类生成对齐可微的工作最大的坑不是算法本身而是验证链路太长。你改一个约束项要跑完整个训练才能看到效果一轮几小时一天跑不了几次。我的做法是把验证拆细先用小数据、小模型验证约束是否生效再用中等规模验证梯度是否正常最后才上全量。每一步都有独立的检查点出问题能快速定位。另一个体会是别迷信论文里的超参。论文报的权重、学习率都是在特定数据分布下调出来的换到你的场景大概率要重调。把论文当思路来源别当配置模板。6. 如果你只想跟进其中一条线我的建议三条线里LLM 重排是当下最容易落地、收益最直接的。原因是它对现有系统侵入性小——你不需要改召回和精排只在最后加一层重排效果不好随时能摘掉。而且 LLM 重排的工程链路清晰prompt 调优、延迟优化、A/B 实验都有成熟套路。生成式广告多目标对齐的落地难度中等主要卡在约束优化的调参和线上反馈的延迟。适合已经有成熟广告系统、想进一步提升的团队。可微路径规划最偏研究落地场景相对窄主要是自动驾驶和机器人但如果你正好在这个领域它的端到端优化潜力是实打实的。最后分享一个跟进论文的小技巧别按日期追按问题追。把多目标对齐LLM 重排可微规划当成三个长期跟踪的关键词每次看到新论文就问它替换了流程里的哪一步。这样积累下来你对每个方向的技术演进会有清晰的脉络感而不是被每天的论文列表淹没。