AI 技术日报 - 2026-05-26

今日 AI 领域迎来多个里程碑:OpenAI 与 DeepMind 双线攻克 80 年未解数学难题,标志 LLM 推理能力质变。同时 HRM-Text 以 1500 美元成本挑战 Scaling Law,DeepSeek 永久降价 75% 至 GPT-5.5 的 1/9,行业从“算力军备竞赛”转向“效率与成本竞争”。Agent 生态全面走向生产级,AWS MCP Server 正式 GA、auth.md 认证协议发布、微软 SkillOpt 提出系统化技能优化。中国 AI 模型周使用量连续四周超美国,DeepSeek-V4-Flash 居榜首。

AI 技术日报 - 2026-05-25

今日日报跨越博客、GitHub 项目、播客与 KOL 推文,核心亮点在于AI 对就业与组织架构的深层冲击:一方面,历史数据挑战“AI 消灭岗位”的简单叙事,提出自动化可能因价格弹性增加岗位的反直觉观点;另一方面,实战案例显示 AI-First 组织已实现 99% 代码由 AI 完成,引发对信任、角色与效率的重新思考。此外,DeepMind Agent 自主解决数学难题、微软因成本禁止内部使用 Claude Code 等事件,共同勾勒出 AI 从工具到生产力的加速渗透与阵痛。 精选文章 2 篇、GitHub 项目 2 个、播客 1 集、KOL 推文 23 条

AI 技术日报 - 2026-05-24

今日日报跨越博客、GitHub 项目、KOL 推文三大数据源,核心趋势是“模型实验室集体转向 Agent 产品”,同时 Agent 的记忆、训练和安全工具链迎来密集发布。腾讯开源了 4 层记忆管道,Pydantic 和 CrewAI 等成熟框架持续领跑,vLLM 社区则因虚假 PR 事件引发对 AI 编码 Agent 维护成本的讨论。 *数据统计: 精选文章 3 篇、GitHub 项目 4 个、KOL 推文 12 条(合并后)。

AI周报 2026-W21

2026-W21 的核心叙事线只有一条:Agent 从「模型能力」正式转向「系统基础设施」。 Google I/O 2026 是这波浪潮的爆发点——Gemini 3.5 Flash 将「前沿智能+行动能力」打包成一个 4 倍速度、一半成本的 API,Managed Agents 让开发者用 YAML 定义 Agent 并托管在云端沙箱,Antigravity 则将 Agent 推入桌面和后台。但更值得注意的不是 Google 一家:Qwen3.7-Max 在同一周发布了 35 小时自主执行能力,Daytona 的沙箱基础设施已跑到日均 85 万次,IBM 和 Hugging Face 联合推出的 Open Agent Leaderboard 首次评测完整 Agent 系统而非模型。 这三个信号指向同一个判断——Agent 正在经历「从 demo 到部署」的 infrastructure 陡坡。 框架层(Langflow、Multica、12-Factor Agents)在解决编排与可观测性,沙箱层(Daytona、阿里云 AgentRun、AWS 博客方案)在解决安全与状态管理,评测层(Open Agent Leaderboard、Cameron Wolfe 指南)在解决「怎么知道我做的 Agent 好不好」。与此同时,NVIDIA、Together AI、Amazon 等实验室发布了大量训练推理优化论文,IXT、Dynatrain、CODA、DualKV 等系统级创新在推动效率边界。 第二条线索是自主科学发现从「学术畅想」走向「可验证结果」。OpenAI 模型首次自主解决 Erdős 1946 年提出的离散几何猜想,Sam Altman 在推文中称「这是一个大里程碑」。Meta FAIR 的 AIRA 系统让 Agent 自主设计出超越 Llama 3.2 的神经网络架构。这些事件虽然数量不多,但质量极高——不再是「AI 辅助科学家」,而是「AI 作为发现者」。 本周还有一项底层警示:RoPE 机制在长上下文中的局限性被严格证明(UIUC & Amazon AGI),表明现有位置编码范式可能需要根本性革新。

推荐周报 2026-W21

本周推荐系统研究围绕三条技术主线展开:生成式推荐从“验证可行性”走向“工业级部署与优化”,去偏与校准技术从单一方法走向融合框架,搜索召回系统在冷启动和异构加速上取得具体突破。 生成式推荐进入工业化深水区: 快手、腾讯、美团的四篇部署论文覆盖了推理增强(RPORec)、长兴趣建模(GenLI)、世界知识融合(LWGR)等核心痛点。共同的指向是——生成式推荐的核心问题已从“能不能用”转变为“如何稳定、可控地替换或增强传统pipeline”。 去偏与校准从“纠正均值”走向“治理分布”: 字节跳动的PEARL、快手的DADF、Pinterest的PRL-PUTS分别从对比百分位、残差校正、效用权重调优三个角度,给出了生产级解决方案。其中PEARL的Watch Duration +2.10%和DADF的时间花费+0.347%表明,分布级别偏差校正仍有显著收益空间。 搜索召回系统聚焦冷启动与系统效率: 淘宝的GrowthGR(新商品GMV+5.3%)和Airbnb的合成数据框架(查询长度KL散度降至0.66)展示了LLM+反事实推断在冷启动中的工程潜力。华为与京东合作的Ascend-RaBitQ将billion-scale向量搜索的NPU加速提升至4.6倍,为大规模召回提供了硬件-算法协同的新基准。

推荐算法日报 - 2026-05-23

LLM 从“辅助”走向“核心”:今日多篇工业界论文(Meta、Airbnb、快手)不再将LLM作为特征提取的辅助工具,而是将其作为推荐系统的核心推理引擎,用于生成语义表示、合成训练数据、甚至直接进行推理与检索,标志着LLM在推荐系统中的应用进入新阶段。; 强化学习成为LLM推荐对齐的关键技术:无论是快手的RPORec还是山东大学的ThinkGR,都采用了强化学习(PPO)来微调LLM,使其推理过程与推荐目标(如精确检索、多跳推理)对齐。这表明RLHF的思路正在从对话系统向推荐系统迁移,是提升LL

推荐算法日报 - 2026-05-22

去偏与鲁棒性成为精排核心战场:今日多篇论文聚焦于解决推荐系统中的偏差问题,包括隐式反馈的标签噪声(RGBT)、未观测混杂因素(PUID)以及子空间漂移(Moving Subspace)。这表明工业界和学术界正从简单的纠偏方法,转向更精细、更鲁棒的个性化去偏框架,以提升模型在真实噪声环境下的泛化能力。; 效率优化与理论分析并重:工业界论文(Amazon LTC)通过层间自适应Token压缩,在保持排序质量的同时大幅提升推理QPS,体现了工业场景对效率的极致追求。同时,学术界论文(ReMax Ban

推荐算法日报 - 2026-05-21

LLM与推荐系统的深度融合进入精细化阶段:今日多篇论文(LWGR、ABPO、RecoAtlas)不再满足于简单地将LLM作为特征提取器或排序模型,而是深入探索如何利用LLM的世界知识、处理其特有的反馈偏差(如曝光偏差、反馈模糊性),并设计专门的评估框架。这表明LLM推荐正从“能不能用”走向“如何用好”的精细化工程阶段。; 不确定性建模与鲁棒性成为核心关注点:BFT从贝叶斯视角统一Transformer的不确定性,MDCNS通过多源负采样打破自强化循环,BoR指标揭示高召回率下的随机性陷阱。这些工

推荐算法日报 - 2026-05-20

生成式推荐与语义索引的深化应用:今日有多篇论文围绕生成式推荐(Generative Recommenders)展开,从淘宝的GrowthGR到中南大学的Ghost,均采用或分析了基于语义ID的生成式检索架构。趋势表明,业界正从传统的向量检索向更统一的、端到端的生成式范式迁移,但随之而来的流行度偏差、冷启动等问题也成为新的研究焦点。; 多目标与长期价值的精细化建模:工业界论文普遍关注如何超越短期指标(如点击率),建模长期用户价值与平台生态健康。淘宝的GrowthGR通过反事实推断量化商品长期交易价

推荐算法日报 - 2026-05-19

生成式与Agent范式崛起:今日多篇论文(GenLI、Agent4POI)挑战了传统的检索式或静态嵌入范式。GenLI通过生成式模型直接产生用户兴趣分布,将检索复杂度降至O(1);Agent4POI则利用LLM Agent在推理时动态生成POI表示,显著提升冷启动和上下文敏感场景效果。这预示着推荐系统正从“匹配”向“生成”演进。; 系统稳定性与异构加速成为工业界焦点:Apple的Fortress论文直面模型随时间不稳定的痛点,提出特征剪枝方案;华为与京东合作的Ascend-RaBitQ则聚焦于N

推荐周报 2026-W20

本周推荐系统研究围绕三条技术主线展开:生成式推荐架构从tokenizer优化走向推理效率提升,LLM增强推荐从孤立的辅助模块演化为具备记忆与推理能力的智能体,系统工程层的量化与线程编排成为工业部署的实际瓶颈突破点。 主线 1“生成式推荐的解耦与加速”: 阿里在TmallAPP上线 CQ-SID / EG-GRPO,以类别感知语义ID和专家引导强化学习实现GMV +1.15%,生成召回贡献72.63%购买。Tencent与清华的 AsymRec 提出非对称连续-离散框架,用多专家投影替代对称量化,平均提升15.8%。美团的 DIG 将tokenizer嵌入判别式排序模型端到端训练,同时提升检索与排序。Snap的 SID-MLP 用MLP蒸馏替代Transformer解码器,加速8.74倍且精度持平。这些工作的共同指向是——生成式推荐正在从“能跑”向“跑得稳、跑得快”过渡,核心手段是解耦输入输出表示与替换密度过高的结构。 主线 2“LLM推荐向推理与记忆演进”: Microsoft Research的 PGR 引入前瞻引导检索,用Tree-of-Thought扩展查询步骤,在MemoryQuest上召回提升近3倍。美团的 RecRM-Bench 提供了100万条结构化条目覆盖指令遵循、事实一致性等四维奖励,为智能体推荐系统提供基础。SDAR(美团)用门控辅助目标稳定OPSD蒸馏,在ALFWorld、Search-QA等基准上相对GRPO提升7-10%。差异在于——PGR侧重检索前的前瞻推理,SDAR侧重训练中的稳定性,但共同挑战是LLM在推荐场景中的记忆与推理能力仍远未成熟。 主线 3“系统协同设计成为工业落地关键”: Meta的 LoKA 通过Probe-Mods-Dispatch三件套在FP8下实现训练吞吐+20%、推理加速+40%且无质量损失。Xiaohongshu的 CCD-Level Thread Orchestration 利用CCD架构的缓存特性,在ANNS服务上取得3.7x吞吐提升和30-90% P999延迟降低。Baidu的 Efficient Generative Targeting 结合量化、稀疏化和并行验证,实现1.8倍推理加速并部署于广告系统。这些工作表明——模型架构改进的边际效应递减时,硬件感知的系统优化正成为实际收益的主要来源。

AI周报 2026-W20

编码 Agent 的交付形态正在经历一次收敛与分化并存的阶段。一方面,OpenAI 将 Codex 推向 Windows 沙箱和移动端,Anthropic 推出官方 Skills 仓库,Garry Tan 开源 gstack——Agent 工具链从“写代码”向“管理工程团队”的方向迈了一大步。另一方,学术界则在追问:当 Agent 规模扩张到百万级别时,涌现行为的归因如何做到可计算、可证明。 与此同时,LLM 架构创新进入密集发布期。Sebastian Raschka 的综述文章系统梳理了 Gemma 4 到 DeepSeek V4 共十多篇架构论文,Nous Research 一周之内抛出两项核心技术——Token Superposition Training 和 Lighthouse Attention,分别将预训练和长上下文推理的 wall-clock 速度推高 2-3 倍和 17 倍。NVIDIA 的 Star Elastic 和 AWS 的 Priming 则从后训练和模型转换角度,提供了更经济的多模型族管理方法。 推理基础设施层面,SGLang 和 vLLM 在一周内相继合并了对 DeepSeek V4、Laguna-XS.2 等新架构的支持,KV Offload、HiSparse、MegaMoE 内核等优化密集上架。Cerebras 以 600 亿美元 IPO 收盘,Stratechery 的 Ben Thompson 则从芯片架构差异出发,预言推理算力市场将走向异构化。本周的三条主线——Agent 工具链标准化、架构创新的规模化验证、推理部署的工业化追赶——互相交织,指向同一个判断:2026 年正是从“模型试验”向“系统工程”过渡的关键季度。