推荐算法日报 - 2026-05-15

生成式推荐的工程化加速:今日多篇论文聚焦于生成式推荐(Generative Recommendation)的落地瓶颈——推理延迟。Snap与UCSD提出的SID-MLP通过MLP蒸馏替代Transformer解码器,实现8.74x加速且精度持平;另一篇工作F-GRPO则从强化学习角度统一生成与排序,解决端到端优化中的信用分配问题。这表明业界正从“模型能力”转向“系统效率”,探索如何让生成式推荐在工业级延迟约束下真正跑起来。; 探索策略的精细化与实用化:Google DeepMind提出的Deli

推荐算法日报 - 2026-05-14

[LLM Agent 与推荐系统深度融合]:今日多篇论文聚焦于将LLM Agent的能力引入推荐系统,从简单的序列匹配转向交互式、推理驱动的推荐。TwiSTAR通过自适应推理分配(快慢思考)和工具调用(检索、排序、推理)来提升生成式推荐的精度与效率;RecRM-Bench则系统性地定义了Agent推荐系统的多维奖励建模(指令遵循、事实一致性、相关性、行为预测),为RL优化提供了标准化基准。这表明,将LLM的规划、推理和工具使用能力融入推荐全链路是当前的重要趋势。; [推荐系统中的偏差识别与去偏方

推荐算法日报 - 2026-05-13

[LLM与推荐系统的深度融合]:今日多篇论文聚焦于将LLM能力注入推荐系统,从生成式推荐(LASAR)、多模态理解(ByteDance框架)到个性化知识发现(PDR)和组推荐(AgentGR),LLM正从辅助工具演变为推荐核心引擎。趋势在于利用LLM的推理和语义理解能力,解决传统模型在细粒度偏好建模、复杂决策模拟和内容理解上的瓶颈。; [系统-模型协同优化成为主流]:Meta的LoKA和Xiaohongshu的CCD-Level框架表明,单纯优化模型或系统已无法满足大规模部署需求。LoKA通过F

推荐算法日报 - 2026-05-12

LLM 驱动推荐系统进入精细化阶段:今日多篇论文聚焦如何更高效、更精准地将LLM融入推荐流程。从利用LLM生成可解释的用户画像(BLUE),到用强化学习(GRPO)优化检索策略(RRCM),再到双通道解耦语义与行为(DCGL),趋势已从“能否用LLM”转向“如何用好LLM”,尤其关注稀疏场景和跨域泛化。; 对现有基准评估体系的反思与重构:多篇论文揭示了当前推荐基准的局限性。Meta的论文通过简单图启发式方法,指出许多基准存在“捷径可解性”,模型的高分可能并非源于其声称的复杂能力。同时,TRACE

推荐周报 2026-W19

本周 22 篇论文里能看出两条主线:生成式推荐继续在 Semantic ID 这一层做深耕,检索 / agentic search 这条线则在重写检索接口本身。另有三篇围绕 RAG 工程化(合成表格扩散、自动化 RAG 管线、生产级数据层),列入论文速览的"其他"部分。 生成式推荐侧四篇论文把更多结构化信号——商业价值、地理坐标、协同信号、长尾边界——直接压进 Semantic ID 这一层。腾讯(微信视频号广告)的 UniVA 做到 SID/decoding/serving 三段同时注入 eCPM 信号,离线 Hit Rate@100 +37.04%、线上 A/B GMV +1.5%;UCSD × Snap 的 Latte 从理论上证明自回归 SID 解码树会把语义近的 item 强行拉到一起,再给出在 token 前缀挂 latent 的低成本修补,NDCG@10 +3.45%。 检索侧的故事更激进。一周之内出现三种"重写检索接口"的反命题:Meta Superintelligence Labs 的 SIRA 把多轮 agent 探索压成一次 LLM-corpus 双向扩展的 BM25;Texas A&M / Stanford / UWashington 等 19 作者的 DCI 直接删掉 retriever,让 Claude Sonnet 4.6 用 grep + bash 在原始语料上调查(BrowseComp-Plus accuracy 从 69.0% 升到 80.0%、API 成本降 29.4%);UC Berkeley 的 T3 把 RAG 的"corpus"从文档换成 LLM 思维轨迹,AIME 上给 Gemini-2.5-Flash 注水 +56.3%。MIT 同期放出 OBLIQ-Bench,把"为什么必须改接口"这件事量化——传统 BM25 / dense / late interaction 在隐含意图查询上几乎全部接近 0 NDCG@10。 工业精排和召回侧维持"先拆瓶颈、再谈结构"的节奏。Meta Ads 的 IEFF 把特征下线从 3-6 个月重训压到不需重训,效率类 rollout 提速 5×;阿里淘天的 RecGPT-Mobile 把 next-query LLM 搬到手机端;中科大 × 美团的 DynamicPO 揭示多负样本 DPO 的"偏好优化坍塌"现象并给出梯度抑制的理论解释。整体趋势是:算法侧追求"动态自适应目标",工程侧追求"可回滚的弹性接口"。

AI周报 2026-W19

本周 AI 行业的核心叙事线在三个层面同时收紧。最显眼的是 Anthropic 的 Code with Claude 2026 大会——Claude Managed Agents 同日发布 Outcomes、多 Agent 编排、Dreaming(夜间自我改进)和桌面 Claude Code,配合 SpaceX Colossus $5B/年算力交易和让 Mozilla 单月修复 423 个 Firefox 漏洞的 Claude Mythos 预览,把 Agent 从"一次性脚本"完整推进到"持续运营单元"。 紧贴这条产品线的是研究和工程层面的 Agent Harness Engineering 浪潮。复旦/北大的 AHE 论文、Microsoft 的 Terminus-4B 小模型 subagent、GitHub 自家的 token 审计工作流、Cursor 的 /orchestrate 与 Command Code 的 plumbing 经验,从同一周的不同角度证明:harness 与上下文工程已经成为比模型本身更值得投入的赛道。配合 vLLM × Mooncake 把 KV cache 命中率从 1.7% 拉到 92.2%、Insforge 让 Claude Code 节省 3x token 等具体数字,"先看 harness 还有多少没榨干"正在替代"换更强模型"成为默认动作。 第三条线是基础设施。推理 token 价格一年降 100x,但 hyperscaler 总账单也涨 100x——Jevons paradox 在万亿美元尺度重演。DeepSeek 自报 agentic workload 的 98.7% KV cache 命中率,OpenAI 联合五家硬件厂商发布 MRC 网络协议,Perplexity 自研 ROSE 引擎,NVIDIA 开源 TokenSpeed,再加上 Meta FAIR 的 Compute Optimal Tokenization、Snowflake 的 ZeRO-Prefill、Sakana × NVIDIA 的 TwELL 稀疏格式——整个产业第一次在同一时段集中地把 KV cache、内存层级和网络 fabric 摆到了 GPU FLOPS 之上。

推荐算法日报 - 2026-05-09

生成式推荐进入工业深水区:今日多篇论文(腾讯UniVA、Snap Latte)聚焦生成式推荐在工业场景的落地挑战。核心矛盾从“如何生成”转向“如何对齐商业价值”和“如何突破表达能力瓶颈”。UniVA提出全链路价值对齐框架,Latte则从理论层面揭示自回归语义ID的结构性限制,标志着该领域从概念验证走向工程优化。; 智能体(Agent)重塑搜索与推荐范式:Meta的SIRA和Waterloo的DCI分别从“单次检索替代多轮探索”和“用grep替代向量检索”两个角度,重新定义了检索接口。ByteDa

推荐算法日报 - 2026-05-08

LLM推荐走向端侧与列表级优化:今日两篇论文分别从端侧部署(RecGPT-Mobile)和列表级对齐(BLADE)两个方向推进LLM在推荐系统中的应用。前者解决端侧推理成本与实时性,后者突破静态对齐的性能上限,共同指向LLM推荐从“能用”到“高效、精准”的落地路径。; 生成式推荐进入“软路由”时代:CapsID用胶囊路由替代传统硬量化,解决了语义ID生成中的边界坍塌和误差传播问题,在35M级工业数据集上召回提升9.6%。这标志着生成式推荐的核心瓶颈从模型架构转向了tokenizer设计,软路由+

推荐算法日报 - 2026-05-07

生成式检索与RAG的工业化落地:今日多篇论文聚焦于将生成式范式(如LLM)应用于检索系统,从GenPOI的生成式POI检索到AutoRAGTuner的RAG管线自动化,再到利用思考轨迹(Thinking Traces)作为RAG语料库,表明业界正积极探索用生成式模型替代或增强传统检索流程,以解决复杂查询和上下文建模问题。; 从“检索”到“系统”的全链路优化:工业界论文(如Walmart的Unified Data Layer、Ant Group的AutoRAGTuner)不再局限于单一算法模块,而

推荐算法日报 - 2026-05-06

频域分析与序列建模融合:今日多篇论文探索了在频域(FEDIN)或连续时间域(BST-CDSR)建模用户行为,以捕捉传统时序方法难以处理的周期性模式和兴趣衰减,为序列推荐提供了新的信号增强思路。; LLM 从“生成”走向“评估与攻击”:LLM 的应用场景从内容生成扩展到模型评估与安全测试。CRAFT 利用 LLM 生成对抗样本来攻击排序模型,而 BST-CDSR 则利用 LLM 提取时间语义,展示了 LLM 在推荐系统攻防与特征工程中的潜力。; ⚖️ 公平性与评估稳定性成为焦点:工业界和学术界均开

推荐算法日报 - 2026-05-05

工业级系统优化与效率提升:今日多篇工业界论文(Meta、IKEA)聚焦于在不牺牲模型效果的前提下,通过系统级创新(如IEFF的弹性特征衰减)或训练数据优化(如IKEA的结构化负采样)来提升大规模推荐系统的迭代效率和资源利用率。这反映了工业界从追求模型复杂度转向关注工程效率与落地可行性的趋势。; LLM与推荐系统的深度融合与挑战:多篇论文(DynamicPO、IKEA、RIR综述)探讨了LLM在推荐系统中的应用,但同时也揭示了新的挑战,如偏好优化崩溃、零点击行为对线上效果的制约,以及LLM作为信息

AI周报 2026-W18

如果要为 2026 年第 18 周挑一句话作为总结,那是:模型差距在收敛,能力差距却在扩大,差距的来源已经从"prompt 怎么写"转移到"模型外那一层怎么搭"。Codex 一周之内完成从编码 Agent 到通用工作平台的跃迁、Karpathy 在 Sequoia Ascent 给 Software 3.0 提供哲学锚点、Lin et al. 用 AHE 论文给"harness engineering"正式命名,三件事在同一周共振;Anthropic 把 Claude Code 企业日均成本估算从 $6 翻倍到 $13、GitHub Copilot 切换到 usage-based 计费,则在定价端反向印证 harness 已经成为主要成本中心。 研究界并不甘只做产品的注脚——RecursiveMAS 把多 Agent 通讯从文本传递推到潜在空间递归,Berkeley GEPA 让 reflection LLM 读完整 rollout 重写 prompt 击败 GRPO 10 个百分点,Apple 与 Oracle 各自给多 Agent 系统装上可信度量,HiddenBench 在 ICML 2026 揭穿前沿模型在分布式任务上 70% 的失败率。同期,Latent Space、HuggingFace、Stratechery 三方信号汇聚成一条共识:训练算力之后,推理与评估正成为下一道结构性瓶颈,Meituan、NVIDIA、Salesforce、Amazon、Hippocratic AI、Meta 同周交出六篇推理优化论文,Anthropic 的成本翻倍则是给这场"inference inflection"贴上的价签。 OpenAI 与微软七年合作关系正式松绑,AWS Bedrock Managed Agents 同步登场,多云时代被合同条款写死;NVIDIA、OpenBMB、智谱、Oracle 在多模态 Agent 模型这条线一周齐发四枪;ZenBrain、AgentCore、ObjectGraph、Synthetic Computers 把 Agent 持久记忆问题摆上学术台面;Computer Use 借助 DeepSeek 的视觉接地、Browser Use Box 与 Cua 的沙箱基础设施,从 demo 走向工程化基础设施。这是一周里五条主线同时发声的少数时刻。