type
Post
status
Published
date
Aug 8, 2026 05:34
slug
rec-weekly-2026-W32
summary
本周推荐系统研究围绕三条技术主线展开:生成式推荐从概念验证走向端到端工程落地、LLM 从排序辅助进入核心决策环节、预训练-持续刷新范式重新定义知识归属。工业界论文过半,Yandex、快手、字节、腾讯、Snap、Shopee、LinkedIn、京东、微软、华为均有部署论文,且大多附带线上 A/B 数据。 主线 1:生成式推荐走出「生成即召回」原型,向端到端单模型演进。 Yandex 的 Gryphon-v2 用单个模型替代 15 个候选生成器、粗排与精排的完整级联,活跃用户 +1.41%;Snap 把 LLM 生成式召回推进到短视频场景,View Time +0.37%。两者共同指向——生成式架构的工程瓶颈(排序目标传递、推理成本、资格约束)正在被逐个拆解。 主线 2:LLM 从排序辅助进入高风险决策环节。 腾讯 SeqLLM 为支付风控注入行为序列建模,商户筛查精度从 92.0% 提到 97.5%;快手 HOBA 用 LLM 推理超参数、SARSA 选专家、专家池执行,三层结构让竞价决策在线自适应,目标成本 +3.6%。百度 QDET 用 7B 模型在时间线摘要任务上追平 DeepSeek-R1-671B,CTR +5.5%。 主线 3:预训练-持续刷新的范式开始重划「知识」与「几何」的归属。 Shopee 的 KGD 用行为多 token 预测清洗预训练知识、锚定校准残差解耦任务几何,GMV/用户 +1.75%,90 天生产流验证无衰减。这条线指向一个判断:预训练推荐模型的下一个战场不是更大的模型,而是如何在持续分布漂移中守住已学知识、同时让下游适配不被梯度干扰。
tags
推荐系统
周报
论文
category
推荐技术报告
icon
📚
password
priority
1
本周概览
本周推荐系统研究围绕三条技术主线展开:生成式推荐从概念验证走向端到端工程落地、LLM 从排序辅助进入核心决策环节、预训练-持续刷新范式重新定义知识归属。工业界论文过半,Yandex、快手、字节、腾讯、Snap、Shopee、LinkedIn、京东、微软、华为均有部署论文,且大多附带线上 A/B 数据。
主线 1:生成式推荐走出「生成即召回」原型,向端到端单模型演进。 Yandex 的 Gryphon-v2 用单个模型替代 15 个候选生成器、粗排与精排的完整级联,活跃用户 +1.41%;Snap 把 LLM 生成式召回推进到短视频场景,View Time +0.37%。两者共同指向——生成式架构的工程瓶颈(排序目标传递、推理成本、资格约束)正在被逐个拆解。
主线 2:LLM 从排序辅助进入高风险决策环节。 腾讯 SeqLLM 为支付风控注入行为序列建模,商户筛查精度从 92.0% 提到 97.5%;快手 HOBA 用 LLM 推理超参数、SARSA 选专家、专家池执行,三层结构让竞价决策在线自适应,目标成本 +3.6%。百度 QDET 用 7B 模型在时间线摘要任务上追平 DeepSeek-R1-671B,CTR +5.5%。
主线 3:预训练-持续刷新的范式开始重划「知识」与「几何」的归属。 Shopee 的 KGD 用行为多 token 预测清洗预训练知识、锚定校准残差解耦任务几何,GMV/用户 +1.75%,90 天生产流验证无衰减。这条线指向一个判断:预训练推荐模型的下一个战场不是更大的模型,而是如何在持续分布漂移中守住已学知识、同时让下游适配不被梯度干扰。
生成式推荐:从「生成即召回」到端到端单模型
Gryphon-v2(Yandex)—— 统一生成-排序架构。用户历史编码一次,自回归解码器生成 Semantic ID 候选,映射回品类物品,由复用共享编码器状态的 Ranking Module 精排。关键设计是 Rollout Distillation:Teacher Ranker 仅在训练时存在,对两组候选分布打分——当前解码器 rollout 出的候选(让 Ranking Module 见到服务时同源的生成结果),以及日志曝光样本(覆盖用户实际见过的物品)。蒸馏分数作为 Ranking Module 唯一的排序监督,服务路径上不增加第二个模型。
线上 A/B 中,单个 Gryphon-v2 替代了包含 15+ 候选生成器的生产级联,活跃用户 +1.41%,延迟与级联持平。这延续了上一代 Gryphon 的联合训练思路——那里用物品级评分组件解决 SID 序列似然与相关性目标不一致——但把监督来源从「序列似然」换成了「排序偏好」。DualGR 曾用双分支路由和曝光感知损失处理长短期兴趣,Gryphon-v2 的答案更直接:既然排序目标定义了用户价值,那就让 Teacher 的排序分数直接蒸馏进生成器。这条路径说明生成式推荐的核心矛盾已经从「能不能生成对」转移到「生成完怎么排」——蒸馏只是手段,落点是排序模块复用生成器的编码状态。
SeqLLM(腾讯)—— 为 LLM 注入行为序列而不丢语言能力。难点在于:LLM 擅长文本但无法原生建模长行为序列,直接微调会灾难性遗忘。解法是三个组件:紧凑离散词汇表(把行为事件编码为原生 token)、两阶段对齐课程训练的轻量投影器(把行为 token 落进 LLM 语义空间)、前缀引导能力注入(用任务前缀限定 SFT 而非持续预训练)。微信支付生产环境中,商户筛查精度从 92.0% 提到 97.5%;行为 token 嵌入让生产级欺诈检测的 Precision@Top-0.01% 提升 26.8 个百分点。公开基准上 Recall@5 相对 User-LLM 基线高 32%,RecIF 上 Pass@32 比完整 OneRec-8B 管道高 14.2%——而只用其五分之一的 GPU 天数。和 xGR 的服务成本优化互补,SeqLLM 解决的是「LLM 怎么不丢本体能力地学会行为序列」,指向风控、反作弊这类高误报成本场景。
SnapLGR(Snap)—— LLM 生成式召回首次进入短视频服务。三块设计:多模态 SID 从视频嵌入构建语义标识,用 PPR 共参与对比学习注入协同信号(提升码本利用率、降碰撞);继续预训练(CPT)先把 SID token 落地再 SFT;TensorRT-LLM CUDA 后端 beam search 加去中心化 worker-loop 保证延迟。线上对比 TIGER 风格基线,View Time +0.37%、Time Spent +0.09%。团队随后固定 tokenizer,把离线差距分解为模型架构、规模、预训练各自的贡献——这类「增量来自哪一步」的拆解在工业部署论文里少见,多数只给最终数。DAS 在快手用双流对齐做语义 ID,SnapLGR 用 PPR 对比学习注入协同信号,两者都承认纯语义 SID 不够——必须补协同维度。
RecHarness(快手)—— LLM 驱动的自动化模型优化。放弃让 LLM 直接生成修改(想法快但不稳定),拆成两步:bandit 路由器根据历史验证反馈选下一个修改方向,LLM 在该方向内生成具体假设与代码修改。跳盆地机制在局部编辑停滞时激活结构跳跃臂,维持长程探索。7 天线上 A/B,ADVV +2.084%、Revenue +0.534%、Exposure +0.559%。相比 Design Once, Deploy at Scale 的模板化开发,RecHarness 是「探索策略 + LLM 执行」的混合体——把 LLM 的生成能力绑定在 bandit 的探索框架内,限制了搜索空间的熵。
DEGR(京东)—— 双探索驱动的生成式重排。重排阶段受限于固定上游供给,低质量供给下没有增益空间。DEGR 用探索奖励模型平衡即时与探索价值——低质量供给时优先探索曝光,保住浏览潜力、制造偶遇转化。混合优化整合监督学习、探索多样性约束、自适应奖励加权 ORPO 三部分。线上 UCTR +1.22%、PV +0.20%。Gwhere 用强化学习目标做生成式 POI 推荐,DEGR 把「探索」显式建模进重排——不是重新排列组合,而是跨请求的上下文桥接。
学术侧的生成式推荐工作围绕蒸馏效率与冷启动展开。SmartGR 针对 SID 层次蒸馏难度不均与 beam search 前缀剪枝错误,层次感知 SID 蒸馏加 beam 感知排序蒸馏,四个基准平均提升 8.6%、推理加速 2.39 倍。Exp-RSFT 直接优化带指数权重的日志奖励(exp(r/λ)),理论证明次优性分解为覆盖成本与噪声成本,温度 λ 平衡两者——在三个公开基准和工业数据集上呈倒 U 型曲线,避免 PPO/DPO 的奖励过度优化。UnpairGR 学统一语义 ID 空间,让配对与未配对的多模态观测共享 Transformer 与残差码本,无需特征插补或回退映射。OMEGA 用可学习查询令牌压缩用户序列为紧凑表示,构建协作记忆库,目标感知检索加门控交叉注意力融合。
EvoReason(快手)—— 隐式推理的蒸馏监督问题。原始 CoT 轨迹冗余且路径不稳定,直接蒸馏到隐空间效果差。EvoReason 先提取「推理原语」(可复用的推理行为),让教师基于原语生成结构化 CoT,再用自进化 on-policy 蒸馏让学生隐式推理结果反馈给教师——闭环迭代对齐监督信号与学生推理空间。LLM-Derived Priors(NAVER WEBTOON)把 LLM 从评论文本提取的语义信号转为贝叶斯先验,为 Thompson sampling 做冷启动暖身,真实 A/B/C 测试验证稀疏反馈下增益最大、漏斗各层影响不同。RRC 解决生成式奖励模型与 RL 的标量评分不匹配——从相对偏好排序构建奖励,AlpacaEval2 35.8%→41.3%。Position Bias 审计提出 InvariRank 框架,从成对偏好不稳定性、全局偏好不一致性、列表输出一致性三层量化 LLM 重排器对候选排列的敏感性——结果表明减少暴露偏差不足以恢复排序有效性,改进相关性或平摊曝光都不保证恢复稳定偏好结构。
检索与多模态表示:从「能检索」到「能判别」
DME(字节跳动/抖音)—— 两阶段多模态嵌入。Stage 1 大规模对比预训练建立统一多模态空间(宽覆盖、多任务);Stage 2 通过两个机制补「语义充分性」——这个概念的定位是:embedding 不仅要和对方相似,还要承接检索证据、保留对方侧细粒度语义。证据接地潜在推理在隐空间组织检索证据,跨条件重建通过跨方向自回归重建强制对方侧语义。两者只在训练时生效,服务时是标准对比编码器。MMEB-v2 上 2B/9B 变体达 74.8/78.4,视频与视觉文档任务最强;抖音内部离线评估集 +2.92%,线上搜索 LT +0.1%。与 HIVE 的查询-假设-验证框架互补——DME 把「假设-验证」内化到隐空间,不依赖显式生成。
GALA(阿里巴巴/淘宝闪购)—— 三阶段多模态对齐。搜索日志上做行为感知三元组预训练捕获早期用户意图;中间插入生成式 RL 对齐——用 GRPO 按转化奖励动态优化多模态嵌入,弥合预训练与微调的分叉;最后自适应门控(混合损失)融合多模态与 ID 嵌入,避免长期 ID 主导训练侵蚀多模态贡献。服务 2 亿+ 日活用户,离线 AUC +0.12/+0.20,订单量 +0.55%。TRM 的语义令牌替代物品 ID 的思路在 GALA 这被反了过来:不是去掉 ID,而是让多模态在 ID 主导下持续有贡献。
PCR-CA(微软)—— 并行码本解决多品类 App 语义。传统 RQ-VAE 是层次残差量化,类别边界模糊时只能逐层逼近;PCR-CA 并行学习多个离散码本,独立编码不同语义方面(玩法、画风、题材),对比对齐损失在用户级和物品级桥接语义与协同信号,双注意力融合 ID 特征与语义特征。长尾 App AUC +2.15%,线上 CTR +10.52%、CVR +16.30%,已全量部署 Microsoft Store。相比 DAS 的双流对齐,PCR-CA 的差异化在「并行码本」——同类方法处理多标签语义时不再依赖前缀依赖的层级结构。
SPEAR(Dewu)—— 社区搜索的端到端改写与检索。路径式架构移植到电商搜索出现「泛化词主导」效应:模型偏好能得分但偏离查询意图的改写。三个组件对应三个失败模式:双嵌入骨干+辅助损失+梯度隔离,保护召回侧语义不被 CTR 驱动的排序信号侵蚀;乘法门控聚合器要求改写置信度与物品相关度同时强才给高分,消除泛化词捷径;动态改写选择器按请求生成改写权重与用户-查询条件化缩放偏置。离线语义相似度@10 +18.2、点击召回@10 +99.5,线上 query-view CTR +0.259、平均阅读深度 +0.733。
RCBS(Karrot)—— 区域约束批采样。本地社区平台的曝光在地理上受限,标准 in-batch negatives 把「地理上不可能的负样本」当负样本,稀释对比信号。RCBS 构建区域同质 mini-batch,用户只和可接触的物品对比——自然产生更难更有用的负样本。离线与线上一致提升,覆盖 home feed 排序、检索、展示广告排序,用户嵌入已部署生产。与 Gwhere 的对比残差量化 tokenizer 思路不同,RCBS 不动模型架构,只改采样分布——最小干预获得一致增益。
PaletteID — 原型组合语义标识符。SQ-DPP 选「原型调色板」(同时考虑局部内容密度与全局语义多样性),每个物品检索一组语义相关原型聚合为表示。解决码本分配丢失连续信号、残差码路径过度依赖前缀的问题。Amazon/TikTok 上一致提升,长尾物品增益更大。
审计类论文这两周值得注意。模态加权审计把六种逐用户模态加权实现统一到共享协同骨干上,发现单一全局权重已捕获大部分内容增益(+1.9/+3.6/+3.5pp),per-user 加权无一致效用(增益 ≤0.9pp 且在不同语料上翻转)。性别敏感性机制分析定位稠密检索的性别信号起源于输入嵌入,通过少量晚期注意力头传播——嵌入级干预非特异中和分数差异,注意力级干预产生方向性偏移。
检索效率侧有四个扎实工作。EXCISE 处理晚交互检索器的排除查询失败(「要 X 不要 Z」反而促进 Z 文档)——两个查询端模块总计 1.5M 参数,识别排除主题并重嵌入 100 文档短列表,ExcluIR 排除成功@10 从 0.058 到 0.691。MarginMerge 做覆盖感知的多向量压缩,97-99% nDCG@5 保持、90-95% 存储向量减少、排名翻转减少约 41%。Hierarchical BM25 用粗索引选组+组内精确打分,十亿文档内存固定 4.4GB、查询约 300ms。CeQe 用交叉编码器 token 级归因做查询扩展——每个扩展词都从检索段落逐字复制,不会引入语料不存在的词汇,NQ Recall@100 从 0.32 到 0.47。
工业推荐系统工程:知识流、服务流与实验基建
KGD(Shopee)—— 预训练-持续刷新的知识-几何解耦。回答两个问题:从行为序列学什么、怎么在持续刷新时迁移。BMTP 只预测协同或语义相关的未来物品,避免跨无关 session 的虚假转移;ACR 用正交于预训练嵌入的残差写任务几何——编码器持有行为知识可刷新,任务学习器通过只读交叉注意力读编码器状态,不被任务梯度干扰。八个公开基准提升 4-12%,90 天生产流中基线无增益而 KGD 保持优势。GMV/用户 +1.75%、广告收入 +1.53%。与 GenRec 的页面级 NTP 训练目标对照看,预训练推荐模型的监督信号正在从「预测下一个行为」细化到「预测行为中真正有学习价值的部分」。
QDET(百度)—— 多任务时间线微调 + RL 简洁摘要。三个辅助任务(时序排序、因果判断、时间线补全)让 7B 模型在时间线摘要 F1 达 76.2%,追平 DeepSeek-R1-671B(76.1%)——1% 参数,零样本差距归零。RL 摘要实现 88.2% 长度合规,比 671B 模型高 7.7 点。线上 CTR +5.5%、停留时长 +4.6%、探索深度 +4.4%。与 HiGR 的列表级规划思路类似,QDET 把「时间线」当作推荐中的列表——但监督来自事件关系而非用户反馈。
TransX(LinkedIn)—— 行为流与服务流分离。把推荐重构为序列到序列的动作转导:近线行为编码器处理长期行为流,线上实时表征为服务流,解码时用可扩展交叉注意力条件化。amortized serving(增量行为编码 + 每请求 KV 缓存)让延迟对行为序列长度不敏感,在线计算减约 80%。CTR +6.0%、转化 +4.4%。xGR 做 KV 缓存分离的 serving 优化,TransX 从架构层面把「长期行为」和「实时事件」分成两个流——两者在序列建模上的分工是本周最清晰的架构判断。
STEPS(字节跳动/抖音)—— 自触发推送。把「是否推送 + 何时推送」重构为自触发智能体流程:规划智能体用门控序数回归调度下次系统调用,执行智能体基于轨迹奖励决定推送,轻量过滤智能体控制计算开销并防不合理规划。抖音全量部署、覆盖 10 亿+ 用户,活跃天数 +0.2843%、推送权限关闭率 -1.9089%、计算开销 -79.42%。Aligning Large Language Models for Controllable Recommendations 的两阶段对齐框架在推送场景的具体化——规划与执行分离,让「何时触发」成为可学习的决策而非固定间隔。
SITA(快手)—— 目标感知压缩。并行语义量化学习语义兴趣令牌,按目标物品语义 ID 条件化聚合构建用户表示。长序列推荐的长久争论是「目标感知 vs 效率」——动态检索相关行为是目标感知但计算依赖目标,压缩全部序列高效但目标无关。SITA 用语义结构组织压缩后的兴趣,条件化聚合实现两者的统一。与 AdaSID 的碰撞处理思路互补——那边解决 ID 分配,这边解决 ID 消费。
Twitch 直播排序—— 延迟窗口扩展反馈收集,多模型架构结合新鲜与延迟信号,segment-aware targeting 针对用户生命周期优化排序,MMoE 集成减 41.9% 参数。DAV +0.09%、高活跃用户 ARPU +0.56%、新增关注 +0.27%;Twitch 移动端验证正向交互 +1.12%。VLM 相关性评估(Pinterest)把视觉语言模型用作在线实验的相关性标注器,显著降低最小可检测效应(MDE)。
实验基础设施侧信号密集。WatchLens 是开源的视频推荐实验平台,在记录时把推荐策略与排名位置关联到每个事件。UpliftBench 评估 12 个 uplift 估计器、7 个数据集族,发现 Qini 系数与效应准确性秩相关仅 +0.07,AUUC 对齐更好——指标选择决定结论,这不是方法论洁癖,是工程决策的事实基础。轨迹到证据(快手)做研究代理的审计框架——完成的实验轨迹不等于证据,需要验证产物、限定声明、保留可审计记录。
学术系统侧:成本感知多目标 bandit 给出 hypervolume-based UCB 的预算遗憾界 O(Σ log B/Δ);TimeRLM 用递归语言模型做长上下文异常定位,AnomalyXL 定位 IoU 0.682 对基线 0.329;ATLAS 用 Gromov-Wasserstein 对齐 + 对抗目标 + RVQ 码本做推荐域泛化,五个源域训练直接推十个未见域,HitRate +24%;CILER 把条件可识别性理论引入 OOD 推荐。TabDPT-Turbo 用长上下文免检索行式注意力替代检索,性能持平 TabDPT v1.1 但快数个数量级。
广告与竞价优化:在线自适应与范式思考
HOBA(快手)—— 分层 on-policy 竞价代理。三层设计对应三个时间尺度:LLM 高层用 Think-Act-Observe-Reflect 循环从上下文推断超参数(含历史经验检索);中层 SARSA 在专家模型间做选择,加因果调整消除选择偏差;低层专家池(PID、MPC、IQL、Decision Transformer)在高层级约束下执行出价。关键约束设计:在线学习被限制在离散专家选择而非连续出价优化,探索风险显著降低。AuctionNet 与线上大规模 A/B 验证,目标成本 +3.6%。与 STEPS 的规划-执行分离同构——高层做低频战略决策,低层做高频执行,中间加一层选择机制隔离探索风险。
GRACE(Meta)—— 生成式广告召回的 serving 系统。两个挑战:资格约束(每个生成广告必须满足广告主定向规则)与计算成本(宽 beam 下每次请求生成数千广告)。GTM 把定向规则编码为 SID 前缀的 bitmask/Bloom filter 匹配器做约束解码——SID 级 GTM 把广告级目标匹配通过率从 23.55% 提到 40.42%。对 encoder-decoder Transformer 重设计注意力内核、KV 缓存、beam 搜索,适配宽 beam 短序列场景。GH200 上 cross-attention 延迟降 68 倍、self-attention 降 23.4-25.8 倍,整体解码延迟降 11.1 倍。
竞争感知请求分发(华为)—— 分布性出价预测 + 概率性转发决定是否把请求发给各 DSP,轻量策略优化自适应调整各 DSP 阈值,追踪非平稳市场。日请求 200 亿+ 的生产平台上,全量多 DSP 部署后 DSP 请求量 -34.2%、净收入 +4.6%(p<0.001)。分段分析显示聚合指标有误导性——策略实际是在 DSP 间「比较优势」选择受益者,而不是简单的流量节流。
GOAL(快手)—— 激励广告的约束感知生成。把连续激励金额分配建模为条件序列生成,集成层次因果状态编码器捕捉局部行为动态与长程依赖,SCPO 学单一生成策略跨 ROI 约束泛化——不需要为每个约束重训。真实数据 + 合成疲劳环境验证,长期收益与留存提升、ROI 违规率下降。
一次性定价(学术)—— 理论框架。HOTW(hands-off-the-wheel)广告市场中,所有最优定价所需信息都在交易平台侧。市场等价于 Fisher 市场,Eisenberg-Gale 凸规划一次求出市场出清价格与分配,同时满足预算与 ROI 约束。该价格在均匀价格机制中收入最优,且与顺序一价拍卖加 pacing 的均衡结果等价——一个凸规划替代数百万次实时拍卖。ProductWebGen 是产品网页生成的多模态 benchmark,500 测试样本覆盖 13 个品类,编辑式与统一模型两种工作流的系统对比。
值得关注的方向
生成式推荐的「排序蒸馏」正在成为标配。Gryphon-v2 的 Rollout Distillation、SmartGR 的层次感知蒸馏、DEGR 的探索奖励模型,三条路径指向同一判断:生成式推荐的服务瓶颈不在参数规模,而在排序目标的传递方式。Yandex、京东、快手都在做,接下来值得观察的是「蒸馏目标统一」——Teacher 的目标函数还是生成概率,排序偏好只做微调,与「排序偏好作为主监督」之间怎么权衡。
LLM 进入高风险决策是本周最清晰的新场景。腾讯风控、快手竞价、NAVER WEBTOON 冷启动、百度搜索时间线——共同的模式是 LLM 不做最终打分,而是提供「语义先验」(行为 token 的语义落点、超参数推断、贝叶斯先验、事件关系判断),具体决策仍由轻量模型执行。这种分工把 LLM 的成本收益比放在「高误报成本场景的暖启动」,而非每请求推理。
实验基础设施的审计转向值得关注。UpliftBench 揭示指标选择决定结论、模态加权审计否定 per-user 加权的通用价值、性别机制分析定位去偏干预点、RecHarness 轨迹审计暴露非单调轨迹演化——四篇独立工作共同要求更严的证伪标准。对工业团队的直接含义:新增复杂模块前,先跑「全局简单基线 + 置换对照」,这可能是本周成本最低的高杠杆建议。
本周论文速览
生成式推荐与 LLM 增强
Gryphon-v2 — Yandex 提出统一生成-排序架构,Rollout Distillation 蒸馏 Teacher Ranker 排序偏好,单模型替代 15+ 候选生成器级联,活跃用户 +1.41%。
SeqLLM — 腾讯为 LLM 注入行为序列建模(离散词汇表+投影器+前缀引导注入),微信支付商户筛查精度 92.0%→97.5%,Precision@Top-0.01% +26.8pp。
SnapLGR — Snap 部署 LLM 生成式召回,多模态 SID+PPR 对比学习+CPT+TensorRT-LLM,View Time +0.37%。
RecHarness — 快手用 bandit 路由+LLM 生成+跳盆地机制做自动化模型优化,线上 ADVV +2.084%。
DEGR — 京东双探索驱动生成式重排,探索奖励模型+自适应 ORPO,UCTR +1.22%。
SmartGR — 层次感知 SID 蒸馏+beam 感知排序蒸馏,平均提升 8.6%、推理加速 2.39 倍。
Exp-RSFT — 指数奖励加权微调生成式推荐器,温度 λ 平衡覆盖与噪声成本,优于 PPO/DPO。
UnpairGR — 北航/美团共享语义 ID 空间,利用未配对多模态观测。
EvoReason — 快手推理原语引导的 on-policy 蒸馏,使 CoT 监督与学生隐式推理空间对齐。
Think2Go — SFT+RL 统一于生成式 POI 推荐,两种优势加权机制实现隐式课程学习。
OMEGA — 协作记忆增强生成式推荐,目标感知检索+门控交叉注意力。
GARDRec — 决策级图接地,KG 从 prompt 证据进入决策分支。
LLM-Derived Priors — NAVER WEBTOON 用 LLM 语义先验暖身 Thompson sampling 冷启动,稀疏反馈下增益最大。
RRC — 从相对偏好排序构建奖励解决生成式奖励模型与 RL 标量评分不匹配,AlpacaEval2 35.8%→41.3%。
Position Bias 审计 — InvariRank 框架量化 LLM 重排器的位置敏感性,减少暴露偏差不足以保证排序有效性。
AgentCF 攻击辩护 — 连通性(候选数+目录集中度)如何调节多智能体 CF 的攻击/防御效果。
RAG 知识提取基准 — 首个系统性知识提取攻击/防御基准,统一协议跨语言评估。
检索与多模态表示
DME — 字节跳动两阶段多模态嵌入,对比预训练+证据接地潜在推理+跨条件重建,MMEB-v2 74.8/78.4,线上 LT +0.1%。
GALA — 阿里三阶段多模态对齐,中间生成式 RL 对齐(GRPO)弥合预训练-微调 gap,订单量 +0.55%。
PCR-CA — 微软并行码本 VQ-AE 解决多品类语义,长尾 AUC +2.15%,CTR +10.52%,已部署 Microsoft Store。
SPEAR — Dewu 双嵌入骨干+乘法门控+动态改写选择器,线上 CTR +0.259、阅读深度 +0.733。
RCBS — Karrot 区域约束批采样,用可行负样本替换地理不可能负样本,一致性提升排序与检索。
PaletteID — 原型组合语义标识符,SQ-DPP 构建原型调色板。
模态加权审计 — 全局权重已捕获大部分增益(+1.9/+3.6/+3.5pp),per-user 无一致效用(≤0.9pp 且翻转)。
性别敏感性机制分析 — 性别信号起源于输入嵌入经晚期注意力头传播,注意力级干预产生方向性偏移。
EXCISE — 查询端排除机制,ExcluIR 排除成功@10 0.058→0.691。
MarginMerge — 覆盖感知多向量压缩,97-99% nDCG@5 保持、90-95% 向量减少。
Hierarchical BM25 — 十亿文档规模固定内存 4.4GB,查询约 300ms。
CeQe — 交叉编码器 token 级归因查询扩展,NQ Recall@100 0.32→0.47。
Align-RAG — 闭式幅度缩放+相位平移对齐检索窗口,无训练参数优于训练适配器,MSE 平均降 3.75%。
DocRetriever — 布局感知稀疏嵌入免 OCR + 推理增强重排,构建 MultiDocR 基准。
HyperAgent4POI — 多智能体超图动态语义消息传递,60% 模态缺失率下 NDCG@20 +8.2%。
DCL — 解耦语义/语言子空间,跨语言零样本稠密检索。
Bayesian Data Reweighting — 隐变量建模查询-文档重要性,闭式后验自适应降权假阴性。
Capability Pages — 集群对比技能表示(正触发+负边界+判别性主体),SRA-Bench 平均 Recall@10 +2.94。
工业推荐系统工程
KGD — Shopee 知识-几何解耦,BMTP 清洗预训练知识+ACR 解耦任务几何,GMV/用户 +1.75%、广告收入 +1.53%。
QDET — 百度多任务时间线微调+RL 简洁摘要,7B 追平 DeepSeek-R1-671B(76.2% vs 76.1% F1),CTR +5.5%。
TransX — LinkedIn 行为流/服务流分离+amortized serving,CTR +6.0%、转化 +4.4%、计算 -80%。
STEPS — 字节自触发推送智能体,规划+执行+过滤三层决策,活跃天数 +0.2843%、计算开销 -79.42%。
SITA — 快手语义兴趣令牌做目标感知压缩,长序列建模统一目标感知与效率。
轨迹到证据 — 快手研究代理审计框架,验证产物+限定声明+保留可审计记录。
WatchLens — 开源视频推荐实验平台,模块化可配置、策略与事件日志关联。
成本感知多目标 bandit — HV-UCB 预算遗憾界 O(Σ log B/Δ),CAGE 指数级错误概率。
Twitch 直播排序 — 延迟窗口+segment-aware targeting+MMoE,DAV +0.09%、ARPU +0.56%。
CILER — 条件可识别潜在环境建模,OOD 推荐十二个指标全提升。
ATLAS — Sony Gromov-Wasserstein 对齐+对抗目标+RVQ 码本,五个源域→十个未见域 HitRate +24%。
TimeRLM — 递归语言模型长上下文异常定位,定位 IoU 0.682 对基线 0.329。
VLM 相关性评估 — Pinterest 用 VLM 替代人工相关标注,显著降低 MDE。
UpliftBench — Qini 与效应准确性秩相关仅 +0.07,AUUC 对齐更好(+0.49)。
TabDPT-Turbo — 免检索长上下文行式注意力表格基础模型,性能持平 TabDPT v1.1 但快数个数量级。
广告与竞价优化
HOBA — 快手分层 on-policy 竞价代理,LLM 超参推理+SARSA 专家选择+专家池执行,目标成本 +3.6%。
GRACE — Meta 广告生成式召回 serving 系统,GTM 目标匹配通过率 23.55%→40.42%,解码延迟降 11.1 倍。
竞争感知请求分发 — 华为分布性出价预测+概率性转发,DSP 请求量 -34.2%、净收入 +4.6%。
GOAL — 激励广告约束感知生成框架,SCPO 跨 ROI 约束泛化。
一次性定价 — HOTW 市场等价 Fisher 市场,Eisenberg-Gale 凸规划求收入最优均衡价。
ProductWebGen — 产品网页生成多模态 benchmark,500 样本 13 品类,编辑式 vs 统一模型对比。