推荐算法日报 - 2026-10-08

生成式推荐进入"精细化拆解"阶段:今日多篇论文(FLASH、Disentangling Paradigm、Semantic ID Spaces)集中反思 Semantic ID 构建与解码范式,核心共识是"哈希/量化方法并非天然劣于学习式方案,性能差距源于解码结构不匹配",免训练 tokenizer + 并行解码成为新方向,对工业界降低 tokenizer 训练成本有直接价值。; 强化学习与因果推断渗透召回/评估全链路:RELER 用 RL 直接在嵌入空间优化检索奖励,RLCP 用共形推断动态调

AI 技术日报 - 2026-10-08

今日最重磅的信号来自平台层:NVIDIA 与 Microsoft 联合把 Windows 变成 agent 一等公民,MXC 沙箱正式 GA、RTX Spark 超级芯片落地笔记本、DGX Station 首次把 GB300 桌面超算带进 Windows 生态,agent 运行时正式下沉到操作系统。模型侧,Anthropic 发布 Claude Haiku 5.5,价格砍到 Haiku 4.5 的约 10%,OSWorld 却从 15.7% 跃至 72.4%,廉价 agent 档位迎来性价比拐点。工程侧,微软开源 3500 行的 Agent Lightning v1.0,用真实 harness

推荐算法日报 - 2026-10-07

训练系统级优化成为工业推荐主战场:Google CutBCE 用融合算子把大规模词表 BCE 的 logits 从 HBM 中彻底消除(省 65.7% HBM、提速 225.9%),BRANCH-MoE 用树路由降低跨设备通信,Meta PE 用小规模筛选降低昂贵训练成本——工业界不再只卷模型结构,而是直接优化训练吞吐、显存与算力分配,这类工作落地确定性最高。; 生成式推荐从"能生成"走向"可信、可控、可扩展":CreGR 首次在 tokenization 与 generation 两阶段联合建

AI 技术日报 - 2026-10-07

今日最重磅的是 Mistral 发布 1 万亿参数 Mistral Large 4(Le Chonk),49B 激活、原生多模态,宣称仅用约 3800 块 Grace Blackwell GPU 训练,开放权重月底放出,直接挑战前沿实验室的算力支出叙事。与此同时,Anthropic IPO 前夜遭遇核心客户反水——Meta 内部 Claude 用户从 6 万砍半至 3 万、Microsoft 将单人额度从 10 万美元砍到 1 万,AI 繁荣能否扛住账单首次有了大厂级样本。国内方面,DeepSeek 融资超 120 亿美元、腾讯与宁德时代领投,2027 年初启动国内 IPO。Agent 侧则喜

推荐算法日报 - 2026-10-06

生成式推荐的"监督信号精细化":AIMS 不再满足于让 LLM 生成式推荐"答对",而是把历史事件的干预效应(删除某条历史后目标项与竞争项的 margin 变化)转化为排序监督,并用非对称损失只让梯度流经竞争项。这标志着 LLM 推荐从"对齐历史偏好"转向"主动纠偏历史误导",是工业界处理"历史压过当前请求"这一真实痛点的可落地思路。; 检索/决策层的"稀疏化与量化"双线并进:神经稀疏检索侧用可学习 soft top-K + 逐项阈值 + FLOPs 正则压缩 LLM 大词表带来的超长向量;ba

AI 技术日报 - 2026-10-06

今日最值得关注的是 Agent 基础设施与安全两条线同时爆发。GitHub 发布 ReviewBench,用 1.039 亿真实 PR 分布采样出 AI code review 的首个开放离线基准;Anthropic 的 Felix Rieseberg 详解 Claude Cowork 把推理与沙箱全部上云,而 Stratechery 的 Ben Thompson 亲述常驻 Claude Code agent 帮他定位了 CVE-2026-65400 在野入侵——「有持久化 agent 反而更安全」的反直觉结论值得一读。论文侧,Anthropic 揭示 agent 可无外部攻击者地自我传播错位

AI 技术日报 - 2026-10-05

今日最值得关注的是 Google Gemini 4 Argon agent 自主优化数据中心内存、释放 300TiB 的实测数据——这是 agent 自主运维生产基础设施少见的量化样本。安全侧,Anthropic 评测显示 GLM-5.3 在 4% 试验中实现完整控制流劫持,逼近 Claude Mythos 的 6%,开源模型攻击能力正在追上闭源前沿。模型架构上,主流开源模型已几乎放弃全注意力,Kimi K3、Qwen3.8、DeepSeek V4 均转向线性 + 稀疏混合设计。产业端,Nvidia 盘中创新高但折旧之争与 3.8 万亿美元表外负债成暗线,Intel 年内股价翻倍、CEO 称仅

AI 技术日报 - 2026-10-04

今日最值得关注的是 agent 可靠性评测范式的转向:微软与 Hugging Face 开源 ThinkingBox,主张按「后端终态」而非 tool call 形式给 agent 打分,直指「9 次规范调用却把工单状态写错」这类真实失败。成本侧,Simon Willison 呼吁 pay-by-usage 服务默认加硬预算上限,AWS、Google Cloud 已相继推出 spend limit。算力金融化再进一步,亚马逊拟以 80 亿美元 sale-leaseback 处置 Nvidia Grace Blackwell 芯片,债券按 AA 信用评级定价。模型侧,Aleph Alpha 发布

推荐算法日报 - 2026-10-03

LLM 长上下文直接做推荐/搜索成为新范式:Meta RPTune 不再走传统多阶段召回-排序,而是把整个商品目录塞进长上下文 LLM,用学习式策展器(encoder-reorganizer)解决"LLM 对长上下文利用不均匀"的核心痛点,SMB 场景准确率最高 +31.4pp。这提示中小目录场景可以绕开复杂检索链路,但策展质量决定上限。; 训练/推理全栈效率优化持续升温:Meta 用 ETT%(有效训练时间占比)框架把生命周期开销定位到具体基础设施组件,fleet 级 ETT% 从 80% 拉

AI 技术日报 - 2026-10-03

今日 Agent 生态从"能跑"全面转向"可信、可恢复、可验证"。Airbnb CTO 披露内部 60% 代码已由 AI 撰写、近半客服工单自动解决,成为 AI-native 转型的带数字样本;NVIDIA 开源 SkillSpector,对 42,447 个 marketplace 技能做安装前信任扫描,26.1% 至少含一个漏洞。工程侧,Pi 1.0 + Pi Durable 同日登 HN 首页,把 Coding Agent 推进到"崩溃后从精确状态恢复"的持久化执行阶段;AWS 则用 SageMaker 多轮 RL 微调搜索 agent,并抛出"LLM 只做接口、判定权留给确定性引擎"的

推荐算法日报 - 2026-10-02

生成式检索(GR)全面工业化:今日 12 篇中 6 篇聚焦生成式推荐/检索,抖音 GEAR、Meta Forum、快手 OneRec 系列均已上线生产。核心矛盾从"能不能用"转向"如何稳定规模化"——码本坍缩、物品碰撞、SID 监督粒度错配、残差信息浪费成为主战场,BasisVQ/BasisRQ、RARS、ResTD 分别从量化、监督、蒸馏三个角度切入。; LLM 画像与推理的"条件性"落地:多篇论文(流媒体画像、服务时门控、快手 OneReason)共同指向一个结论——LLM 生成画像/CoT

AI 技术日报 - 2026-10-02

今日产业侧最重磅的是 Google DeepMind 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,19 项 benchmark 拿下 13 项 SOTA,行业首创 1M 输出 token,但 Artificial Analysis 指出其靠价格而非效率取胜——单任务输出 62K token 是 GPT-6 Astra 的两倍多。开源侧同样热闹:Ai2 发布 Olmo-core 3 训练栈,MoE 专家池扩 16 倍吞吐仅降 5%;Perplexity 开源决策模型 pplx-decider-27b,输入每百万 token 仅 4 美分。Agent 可靠性成为今日隐性主线,从