
美团搜索3.0:LLM 语义表征从相似度特征走向可迁移排序系统
美团搜索三期实践显示,LLM 语义表征的价值取决于排序目标、难负样本、场景覆盖率与信号融合如何共同设计。
美团搜索团队在 2026 年 8 月 20 日公开了一篇服务零售搜索排序技术博客,记录 LLM 语义表征从可行性验证、体系重构到跨场景迁移的三期实践。三期结果共同指向一个较窄但有用的判断:语义向量本身只是输入,真正决定它能否改善排序的是训练目标是否贴近候选比较、负样本是否足够困难、Embedding 覆盖范围是否匹配目标场景,以及排序模型如何消费这份信号。1
| 阶段 | 解决的问题 | 关键做法 | 官方线上结果 |
|---|---|---|---|
| 一期(2025 年第四季度) | 语义表征能否给商家精排带来增量 | Query-POI 双侧表征、64 维 cosine 相似度分桶、BCE 双 Loss | 搜索支付订单 +0.20%,服务零售订单 +0.27%,长尾 NDCG@5 +2.21pp |
| 二期(2026 年第一季度) | 如何让表征学习更接近相对排序,并补上商品侧 | Query-POI-Deal 三元表征、同请求难负样本、InfoNCE + Triplet、LoRA、MRL-E | 服务零售结果页有效 QV_CTR +0.10pp,TP90 +0.2ms |
| 三期(2026 年第二季度) | 如何把商家精排表征迁移到下挂商品精排 | 按目标场景重做覆盖率、五种相似度分桶、PEPNet 门控、全域交叉统计特征 | 服务零售订单 +0.32%,访购率 +0.29% |
表中阶段、方法和指标均来自美团技术团队原文;三期线上结果的统计口径不同,不能把它们当作同一指标的连续曲线。1

先把语义匹配变成可用的排序信号
服务零售搜索的供给很难用几个稳定字段概括。用户既可能搜索交易需求,也可能搜索信息或留资需求;服务又由券、时间、位次、场次、空间和技师等要素组合而成。于是,Query 和供给之间经常出现词面不重叠但语义相关的情况:例如「宠物 SPA+洗澡」对应「萌宠清洁护理套餐」,「春节大扫除」对应「深度保洁服务套餐」。传统文本匹配很难覆盖这类长尾关系。1
一期先把问题缩成一个可验证的工程接口:让 LLM 分别把 Query 和 POI(商家)编码成向量,再用两者的 cosine 相似度作为精排特征。团队在同一条 Prompt 中放入 Query、商家信息和一个匹配判断,并加入
<|query|>、<|item|>、<|qi|> 三个特殊 Token,分别聚合 Query、商家和双侧融合信息。因为训练时两侧文本处在同一序列,Query 和 item 的聚合点可能互相看到对方;团队用三次 Forward Pass 和不同的 Attention Mask,把单侧表征限制在各自文本段内,确保推理时可以独立生成和存储。最后,模型把特殊 Token 的 hidden state 降到 64 维。1训练数据来自服务零售垂直搜索精排日志,覆盖近两个月、3000 余万条样本,下单、点击未下单、未点击的比例为 1:3:6。Loss_1 用 Query 和 item 的 cosine 相似度做二分类,Loss_2 用融合表征预测点击率,最终把两者相加。推理得到的 Query 和 item 向量先计算相似度,再按边界分成 10 个桶;每个桶对应一个可学习的 12 维 Embedding,接入原有精排模型。这个离散化步骤保留了相似度的大致顺序,也让排序模型可以把语义桶与其他特征交叉。1
一期离线点击 NDCG 提升 9bp,下单 NDCG 提升 13bp。线上实验在 2025 年 9 月 18 日至 10 月 1 日进行,使用 20% 流量、持续 14 天,并通过 AA 校验;搜索大盘支付订单提升 0.20%,服务零售订单提升 0.27%,长尾 NDCG@5 提升 2.21pp,长尾 BadCase@1 下降 2.96pp。长尾指标的变化与一期的目标相符:当 Query 与供给的文字重叠不足时,语义相似度能够补上词面特征的空缺。1
一期也把后续问题暴露得很清楚:表征只覆盖 Query-POI,商品侧缺席;全参数微调带来训练和维护成本;BCE 主要学习一个候选是否匹配,排序却需要在多个候选之间建立相对顺序;三次 Forward Pass 还留下推理效率压力。二期的重点因此从「能不能用」转向「怎样让表征更像排序信号」。1
二期的关键改变:训练目标从「是否匹配」变成「候选之间谁更匹配」
二期把每条训练样本扩展为五元组:Query、Deal 正样本、POI 正样本、Deal 难负样本和 POI 难负样本,共 2766 万条。难负样本来自同一请求下曝光但未点击的候选;Deal 难负样本还限定在同一商家内。正负样本共享 Query 意图和展示上下文,只在用户选择上产生差异。这样的样本比 Batch 中随机抽到的无关候选更接近排序模型真正要解决的边界:几个看起来都相关的结果,为什么其中一个更应该排在前面。1
模型结构也跟着数据形式变化。Query、POI 和 Deal 各自在独立序列中处理,模型把序列末尾的位置覆写为对应的可学习向量,再从这个位置取得表征;五路输入可以在 batch 维度一次处理,省去了一期为信息隔离而进行的三次 Forward Pass。微调方式从全参数改为 LoRA,配置为
r=8、alpha=32,目标模块是 q_proj 和 v_proj。降维方式改成 MRL-E,训练时同时约束 1024、512、256、128 维的嵌套表征,推理时截取前 128 维,以便同一模型按不同服务预算选择向量长度。1
损失函数从一期的二分类扩展为五部分:Query-POI、Query-Deal、POI-Deal 三组 InfoNCE,以及 Query-POI、Query-Deal 两组 margin 为 0.5 的 Triplet Loss。InfoNCE 用 Batch 内样本建立三类实体之间的整体相似度结构;Triplet Loss 则专门拉开同请求下的难负样本。消融实验中加入 Triplet 后,Q2I-Click-AUC 提升 4.85pp,Q2I-Order-AUC 提升 11.02pp;下单 AUC 的增量更大,说明这类难负样本提供了点击标签之外更细的排序信息。1
二期相对一期,Q2I-Click-AUC 提升 6.25pp,Q2I-Order-AUC 提升 5.37pp,Q2I-Click-NDCG 提升 1.77pp,Q2I-Order-NDCG 提升 2.03pp。线上实验在 2026 年 3 月 17 日至 3 月 23 日进行,使用 20% 流量、持续 7 天;搜索大盘有效点击 QV 提升 0.13%,服务零售结果页有效 QV_CTR 提升 0.10pp,TP90 只增加 0.2ms。博客还记录了一个业务上更重要的现象:某事业部总 Query 量下降 0.70%,但 QV_CTR 提升 0.24pp,原因是排序减少了无效曝光。排序收益在这里表现为提高曝光质量,而不只是增加曝光量。1
二期的 Prompt 实验也给出一个应当收窄使用范围的结论:精简信息陈述加总结引导,效果优于复杂任务指令。Embedding 训练需要模型聚合稳定的语义信息,复杂指令可能分散聚合目标。CPV 商品属性未经筛选加入后离线效果下降,博客将其归因于信息噪声;LoRA 在 NDCG 上优于全参数微调、全参数在 AUC 上略有优势,也都属于这个业务场景中的对比结果。1
三期暴露的真正迁移门槛:覆盖率先于模型复用
三期把二期表征迁移到下挂精排,也就是对商家下面的具体商品继续排序。直接复用模型参数并不等于直接复用表征生产范围:二期按商家精排样本圈选 Query,三期面对的 Query 更多是商品意图词。迁移初期,Query 覆盖率为 81.24%,Query 和 Deal 同时有 Embedding 的双覆盖率只有 73.61%。团队改用下挂精排的样本分布重新圈选,两个数字分别升到 98.92% 和 89.81%。这一步先补齐了信号能否出现,再谈模型是否有效。1
团队随后把 Query-Deal cosine 相似度等距分成 100 个桶,检查成单、货架成单、点击和全域成单等 label 的均值是否随相似度上升而上升。这个前置验证回答的是迁移后的表征仍然有没有排序信号。确认方向后,团队比较了五种分桶策略:等样本量分桶,以及分别针对下挂成单、货架成单和两类曝光样本的 label 均值分桶。不同目标对应不同关系曲线,因此多种分桶可以为同一个精排模型提供互补视角。1
在注入方式上,三期比较了底层拼接、输出塔前注入和 PEPNet 门控。离线结果分别是交叉统计特征 +7bp、LLM 相似度与交叉统计特征底层拼接 +18bp、输出塔前注入 +8bp 且部分指标为负、PEPNet 门控 +25bp。门控的差别在于,语义相似度不只是作为一个固定位置的数值,而是用来调节其他特征的权重:匹配度高时放大相关特征,匹配度低时压低相关特征。1
三期同时补充了 user×deal、POI cate3、user×POI cate3、query×deal 四类全域交叉统计特征。语义特征描述 Query 与商品是否匹配,统计特征描述具有某种行为的用户是否偏好这类商品,两者捕捉的是不同关系。订单和转化相关统计特征因为覆盖率低于 0.1%,在消融实验中被移除;相关性方向正确却缺少覆盖,仍然难以转化为线上收益。1
三期线上实验在 2026 年 5 月 28 日至 6 月 3 日进行,使用 10% 流量、持续 7 天。服务零售订单提升 0.32%,访购率提升 0.29%;搜索大盘支付订单提升 0.35%,大盘访购率提升 0.25%。这组结果属于 LLM 表征和全域交叉统计特征的叠加收益,博客没有把两类特征的独立贡献拆开,因此读者可以把它当作整套下挂精排改造的结果,不能把 0.32% 直接归因给 LLM 表征单项。1
这套路线可以复用什么,边界在哪里
这三期实践仍然属于判别式精排:LLM 负责离线生成 Query、商家和商品的语义表征,线上排序模型负责把这些表征与行为、上下文和用户特征合起来做排序。复现时,优先级可以按下面的顺序排:1
- 先定义排序目标。 点击、下单和多目标精排对应不同标签与关系曲线。训练目标若只回答「是否匹配」,表征可能难以学习候选之间的细微差别。
- 再构造同上下文难负样本。 同请求、同商家、曝光未点击的候选比随机负样本更接近真实排序边界,也更容易解释模型究竟在区分什么。
- 按目标模块重新检查覆盖率。 商家精排训练出的 Query 分布,无法自动覆盖下挂商品精排;模型参数可以复用,Embedding 的生产范围需要随场景重算。
- 最后比较信号的消费方式。 分桶保留了离散区间并支持特征交叉,连续相似度保留了信号精度,门控则让语义信号参与调节其他特征。三者需要结合线上模型结构和覆盖率实测。
这篇博客给出的数字主要来自美团服务零售搜索的内部数据和线上实验。原文披露了训练样本量、部分模型配置、实验流量和核心指标,但模型具体名称、完整数据构造、置信区间、显著性检验细节和可独立运行的训练代码没有全部公开;三期线上结果还包含语义与统计特征的叠加。外部团队可以复刻方法链路和检查顺序,无法仅凭这些数字预测另一个业务、语言或数据分布会获得同样收益。1
后续最值得观察的方向有三类:更精细的难负样本与假负例过滤;针对下挂商品 Query 分布重新训练表征模型;对 MRL-E 的低维截断做邻居保持诊断。博客还提出让下游排序相关性回灌表征训练,形成 Producer 与 Consumer 的闭环。它们共同延伸的是同一条工程问题:怎样让离线表征更贴近目标排序,而不是单独追求一个更大的基座模型。1
美团这三期工作的可复用部分,是把「数据构造—排序目标—覆盖率—信号融合」连成一条检查链:一期证明语义相似度可以成为有效特征,二期让表征学习贴近候选相对排序,三期证明跨场景迁移首先要修复样本覆盖,再选择门控或统计特征融合。具体模型、阈值和收益仍然属于原业务条件,复现团队需要从自己的 Query 分布和排序目标重新测量。
References
- 1美团搜索3.0:LLM 语义表征在排序模型的探索与应用
tech.meituan.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
