推荐算法日报 - 2026-07-11

多兴趣建模与端到端生成式检索的范式突破:今日两篇工业界高分论文(Amazon BACH、Alibaba DaV-Gen)分别从不同路径挑战传统多阶段级联架构。BACH 用贝叶斯软混合替代硬路由,解决多兴趣头坍塌问题;DaV-Gen 则借鉴投机解码的 Draft-and-Verify 机制,试图统一检索与排序的优化目标。这标志着工业界正从“多阶段拼装”向“端到端联合优化”加速演进。; 回归任务中的长尾与期望一致性成为精排核心挑战:快手与人大合作的 PIT-SUN 论文,聚焦于停留时长、GMV 等长

AI 技术日报 - 2026-07-11

今日 AI 领域迎来里程碑式突破:GPT-5.6 Sol Ultra 以 64 子 Agent 在一小时内证明 50 年未解数学猜想 Cycle Double Cover,标志着公开模型首次实现重大数学突破。同时,GPT-5.6 成为 Microsoft 365 Copilot 首选模型,Agent 生态全面走向生产级。Cursor 开发 AI Agent 与 Claude Cowork 直接竞争,编码 Agent 赛道进入白热化。效率与成本成为新焦点:Unsloth 动态量化压缩模型 75%,Writer 论文揭示编排层可降本 41%。ICML 2026 获奖论文揭晓,扩散语言模型与对齐审查

推荐算法日报 - 2026-07-10

[大模型 Agent 与多模态记忆的深度融合]:今日多篇论文探索了将 LLM Agent 应用于推荐系统的新范式。MMEACR 提出了双轨记忆架构,将 Agent 的符号推理与多模态嵌入匹配分离,并通过属性引导的强化反思机制更新记忆。这标志着 Agent 推荐正从纯文本推理向融合视觉、文本等多模态信号的更精细、更鲁棒的记忆系统演进,为构建可解释、高保真的下一代推荐系统提供了新思路。; [面向生产环境的联邦学习与在线学习优化]:针对推荐系统对模型新鲜度的严苛要求,FeLiX 框架直面客户端流失、数

AI 技术日报 - 2026-07-10

今日 AI 领域迎来产品与模型的双重里程碑:OpenAI 发布 ChatGPT Work 超级应用与 GPT-5.6 三模型家族,Sol 在 Agents' Last Exam 上以 53.6 分超越 Claude Fable 5 达 13.1 分,并引入 Programmatic Tool Calling 等关键新特性。与此同时,SpaceXAI 发布 Grok 4.5,专为 Coding/Agent 场景训练,定价仅为 $2/$6 每百万 token,模型竞争从通用能力向 Agent 专用场景进一步分化。Meta 自研 AI 芯片 Iris 将于 9 月量产,算力目标翻倍至 14GW,芯片

推荐算法日报 - 2026-07-09

[LLM推理蒸馏走向精细化]:今日多篇论文聚焦于如何高效地将大模型(LLM/VLM)的推理能力迁移到小模型。从Meta的SCOReD(学生感知的CoT轨迹优化)到PORTS(偏好优化对齐检索器与LLM),核心思路不再是简单的SFT,而是根据学生模型的能力动态裁剪、改写教师轨迹,或利用LLM的perplexity信号作为偏好标签,实现更精准、更高效的蒸馏。; [检索模型的理论基础与表达能力受关注]:学术界开始深入探究检索模型(尤其是Late-Interaction模型)的理论上限。UMass的论文

AI 技术日报 - 2026-07-09

今日 AI 领域迎来多项重磅发布:OpenAI 推出 GPT-Live 全双工语音模型,实现真正自然对话;同时宣布 GPT-5.6 Sol 周四发布,用户使用量已达此前 5 倍。Cursor 与 SpaceXAI 合作训练 Grok 4.5,Cognition 发布 SWE-1.7 达 1000 tok/s。基础设施层面,MCP v2 协议重大变更走向无状态化,Hugging Face 发布 vLLM transformers 建模后端性能追平原生,NVIDIA Nemotron 在 LangChain 基准中以 10 倍低成本达开源最高准确率。Lilian Weng 发表 Harness E

推荐算法日报 - 2026-07-08

生成式推荐进入工业深水区:今日多篇工业论文(快手、阿里、沃尔玛)将生成式推荐从概念验证推向生产部署。核心创新点不再是简单的“用生成替代检索”,而是聚焦于异构内容生成(同时推荐视频和作者)、库存感知(RAG动态改写广告查询)以及多token预测(替代低效的自回归生成),以解决实际业务中的效率与效果平衡问题。; 重排器价值再发现:从“后处理”到“训练信号”:Yandex的论文提出利用重排器(精排模型)的分数来指导召回嵌入的学习,打破了传统“召回-精排”的流水线隔离。这一趋势表明,工业界正试图将精排模

AI 技术日报 - 2026-07-08

今日 AI 领域格局加速重塑:微软被曝在部分应用中用自研 AI 替代 OpenAI/Anthropic,标志产业从依赖外部转向内部自研的战略转向;同时中国 AI 模型在美国企业使用率突破 30%,DeepSeek 等以成本优势持续渗透。技术层面,NVIDIA 发布 Audex 统一音频 LLM 并开源,腾讯推出 295B MoE 开源模型 Hy3 挑战 GLM-5.2,Anthropic 发现 Claude 内部“全局工作空间”可干预推理过程。Agent 生态走向生产级——Google 扩展 Managed Agents 支持后台任务和远程 MCP,Perplexity 与 NVIDIA 合作

AI 技术日报 - 2026-07-07

今日 AI 领域迎来多个里程碑:Anthropic 发现 Claude 内部存在类似意识的全局工作空间 J-space,标志着 LLM 可解释性重大突破;腾讯混元发布 295B MoE 开源模型 Hy3,Mistral 推出数学证明代理 Leanstral 1.5,两大模型均获 SGLang/vLLM 即日支持。同时,Fable 在 GPU 内核生成上创下 18.71X 加速纪录,Netflix 用 decoder-only transformer 端到端生成主页,阿尔伯塔省政府用 Claude 在 20 小时内扫描 4.66 亿行代码修复安全漏洞,AI 正从"能力展示"全面走向"生产级落地"

AI 技术日报 - 2026-07-06

今日 AI 领域聚焦于效率与实用性的双重突破:Mistral 发布 Leanstral 1.5 数学证明模型,以 6B 激活参数在多项数学基准上达到 SOTA,每道题成本仅约 4 美元,标志着开源模型在专业推理领域的重大进展。与此同时,Simon Willison 用 Claude Fable 以 149 美元成本完成 sqlite-utils 4.0 的审查与修复,展示了 AI 编码 Agent 的实际工作流价值。产业层面,GenAI 经济体过去 12 个月创收 1100 亿美元,增速为移动/互联网浪潮的三倍,印证了 AI 商业化的强劲势头。此外,X 官方发布 XMCP 服务器,为社交平台

AI 技术日报 - 2026-07-05

今日 AI 领域迎来多个重要动态:OpenAI 提议向美国政府捐赠 5% 股权,探索 AI 公司与国家资本关系的新模式;Anthropic 发布 Claude Science Workbench 并宣布亲自开发药物,AI for Science 战略全面升级。同时,研究揭示 RL 后训练改进高度集中于 Transformer 中间少数层,为优化训练策略提供了反直觉发现;Snowflake 发布 Cortex Sense 解决企业 Agent 因缺乏语义视图而查询失败的核心痛点。开源生态方面,开源 AI 差距地图 v0.1 发布,系统索引 421 个项目;MCP 服务器生态虽近 2 万注册量但噪

AI周报 2026-W27

本周 AI 周报呈现出两条并行的主线:Agent 工程化正在从“能否运行”进入到“能否可靠规模化”阶段,同时推理基础设施的优化开始从通用框架走向针对特定硬件、特定模型的深度定制。 第一条主线体现在大量关于 Agent 循环、技能工程、多 Agent 协调的讨论中。AI Engineer World's Fair 上周结束后,Latent Space 连续发布了多篇深度报道,最引人注目的是“自主循环”(Loops)辩论——支持方认为软件工厂已经可行,质疑方则指出 token 成本和可靠性仍然是硬约束。与此同时,Apple 发表的研究直接挑战了一个流行的设计假设:让多个专家 Agent 自由协作反而会降低性能。这让本周的 Agent 话题有了清晰的对立面。 第二条主线来自 vLLM 0.24.0 的密集发布。一周内,vLLM 团队推出了 DeepSeek V4 的 DSpark 推测解码原生支持(~250 tok/s,接受长度 5),集成了百度 Unlimited-OCR(35% 快于 DeepSeek-OCR),还发布了 Omni TTS 的全面优化(吞吐提升 172%)。SGLang 也在本周展示了 Agent 辅助开发的工作流,多个 kernel 优化带来 71.4% 的吞吐提升。这些进展表明,推理框架的竞争正在从“跑通模型”转向“为一个模型做深度优化”。 以下是对本周四个主题的详细分析。

1
...
7891011
...
27