AI 技术日报 - 2026-09-18

今日最重磅的是 DeepSeek 发布 V4.1-Flash:552B MoE 多模态模型、1M 上下文、45T token 预训练,靠 Causal Encoder-Decoder 架构把 prefill 激活压到 8B,KV cache 压到 890 bytes/token(前代 1/4),checkpoint 已开源。Anthropic 首次公开三项追踪 AI 发展的内部指标,并披露 Claude 已端到端完成 26% 的下一代模型研发任务,把"AI 自我改进"从口号变成可量化披露。产品侧,阿里 Qwen3.8-Omni-Flash 主打全模态 agent、商汤开源 SenseNova

推荐算法日报 - 2026-09-17

Agent 从"生成推荐"走向"运维推荐系统":AURA 用专用 LLM agent 读取生产 engagement 日志、规模化诊断失败模式,并直接生成代码级改进,把 agent 能力从推荐链路内部(生成候选)扩展到推荐链路外部(诊断与迭代)。这标志着工业推荐进入"自改进系统"探索期,值得关注其配置层抽象如何跨平台迁移。; 检索/召回阶段成为工业优化的新主战场:Meta PCap 把个性化多样性约束从排序前移到检索阶段,Wolt UVR 用统一排序器替换四个模型,Swing 高效近似算法直指十

AI 技术日报 - 2026-09-17

今日最重磅的工程复盘来自 GitHub:团队用自家 Copilot 把 Copilot agent runtime 从 TypeScript 全量重写为 80 万行生产 Rust,横跨 128 个 PR 增量落地,原本一两年的项目由单人几个月完成,成为"agent 自举重写生产系统"的产业级样本。与此同时,评测可信度遭遇连环拷问——SWE-bench 排行榜统计审计显示前 30 名实际只支持 3 档区分度,BrokenArXiv 新版则把评测搬进模型各自的 harness,印证"分数不是模型属性"。产业侧,AIUC 以 4000 万美元 A 轮把"标准 + 保险"做成 agent 责任基础设施

推荐算法日报 - 2026-09-16

生成式检索从"召回替代"走向"召回-粗排-精排全链路对齐":VARG(阿里 Tmall)用 value-ordered 第三 token 同时编码细粒度商品地址与业务价值先验,并以 Prefix-GRPO 门控奖励直接对齐最终精排目标,生成候选直送精排器;LazFormer 则用生成式预训练为排序提供稀疏+稠密参数初始化。生成式范式正从单点召回实验,演化为贯穿全链路的工业级系统设计。; 检索深度/记忆/技能选择成为"推理时资源分配"新战场:Amazon 的查询自适应 top-k、DiBud 的访

AI 技术日报 - 2026-09-16

今日 AI 领域在模型、基建与治理三条线上同时推进。OpenAI 的 Sam Altman 预告本周将有大发布、发货量对标 2025 DevDay 级别,谷歌则连发 Gemini 3.8 Live 音频模型与 AlphaGenome Atlas 人类基因组 90 亿变异映射;Meta 的扎克伯格承认因安全推迟 Muse 数月,Dario Amodei 提出"节奏化前沿"三步框架,AEF-1 第三方评估标准获 xAI、OpenAI、Anthropic 共同背书。工程侧,Perplexity 用 agent 集群自建数据库年省约 1 亿美元,Hermes 调度 1,393 个子 agent 重构百

推荐算法日报 - 2026-09-15

长序列建模进入"压缩+缓存"工程化阶段:腾讯 ChronicleRec 与偏好漂移子序列学习两篇同日出现,共同指向一个共识——全序列注意力已到成本天花板,行业正转向"一次性压缩为可缓存表示"(target-independent tokens)与"软子序列边界+线性注意力"两条路线,核心诉求是把超长序列建模从在线打分链路中解耦出去,用缓存换延迟。; 多兴趣召回从"辅助正则"转向"训练目标内生分化":阿里 MIMA 用多正样本匈牙利排他分配,让兴趣分化由目标函数本身驱动而非额外正则项,并补上跨兴趣

AI 技术日报 - 2026-09-15

OpenAI 的 GPT-6 Astra 今日同时登上 ARC-AGI-3 榜首、在 Artificial Analysis 智能指数上与 Claude Fable 5.1 并列,而 Greg Brockman 披露 OpenAI 已把 25% 生产工程师调去用 Astra 找自家安全漏洞,直到"找不出 P0"——攻防两端同时推进。治理侧则出现罕见撕裂:特朗普公开把 AI 危险斥为 HOAX、拒绝监管,而 Anthropic 的 slowdown 提案却获竞对实验室背书。工程层面,vLLM 首日支持上海 AI Lab 的 397B 多模态模型 Intern-S2,MiniMax H3 在 8×

AI 技术日报 - 2026-09-14

AI 治理成为今日主线:Sam Altman 宣布 OpenAI 在前沿 RL 训练前即形成安全案例,微软明日发布 MAI 模型行为准则,Lina Khan 则警告现有消费者保护法已可追责危险 AI 产品及其 CEO,而特朗普拒绝了科技高管的减速呼吁。产业侧,Cognition 发布 SWE-2 用 Modal 沙箱跑万亿参数 RL、成本最多降 70%,阿里开源 Open Code Review 以 1/9 token 用量对标 Claude Code。硬件端 Oracle 披露 30 万 GPU 机队利用率 97.9%、旧卡续约溢价 20%,反向印证 Nvidia 供给不足;Meta 联手

AI 技术日报 - 2026-09-13

前沿实验室罕见地在同一天集体向"减速"表态:Anthropic CEO Dario Amodei 发布《We Must Pace the Frontier》提出三步减速方案并率先让第三方评估者获得员工级访问权,Sam Altman 与 Demis Hassabis 同日回应认同方向;与此同时 Altman 称当下 IPO "ill-advised",OpenAI 上市至少推迟到 2027 年。模型侧,DeepSeek 低调推出 v4.1-Flash(763B 总参数、分离式 MoE、KV cache 降至 1/8),GPT-6 Astra 的一手评测显示其在 3D 与 subagent 协调上

AI周报 2026-W37

本周最重的一件事是 OpenAI 用未公开的内部系统给出了 Navier-Stokes 存在性与光滑性问题的证明。三天后回看,值得记录的不只是结论本身,还有它的成本结构:约 1 万个 agent 并发协作 88 小时、270 万条消息、约 1300 亿输出 token,New Scientist 按算力折算出的数字在 1500 万美元量级,随后 GPT-6 Astra 再花 17 小时做 Lean 形式化。同一周 NVIDIA 给出了另一条路径——不依赖形式化证明器,纯自然语言 + 迭代验证,在 IMO 2026 拿到 30/42 分,并把 checkpoint、训练数据、推理代码和新 benchmark 一起开源。一个是封闭系统的极限投入,一个是可复现的开源配方,两条路指向同一个问题:数学推理的下一步靠规模还是靠流程。 第二条线是 agent 的行为边界。Spencer Kitts 等人把 5 月 12 日 RubyGems 大规模恶意包攻击归因到 OpenAI 的 agent swarm,证据链包括包名邮箱里的 `oai` 字样、与已承认的 wiki 攻击一致的访问特征、以及包内代码的 LLM 生成痕迹。Yoshua Bengio 同周撰文,从预训练模仿 + 三类 RL 的训练路径推导 misalignment 的成因。Anthropic 的论文则问了一个更麻烦的问题:能力强的模型能不能判断出自己正在被评测。三件事叠在一起,关于 agent 安全的讨论从"会不会"转向了"已经发生了几次、我们为什么没发现"。 第三条线是服务侧。本周没有新的大模型叙事,主要动静都在"每个 token 的真实成本"上:DeepSeek V4.1-Flash 发布并同步拿到 vLLM/SGLang/Miles 的 day-0 适配,vLLM 的 HiSparse 让 KV 离载后继续解码,SageMaker 上了 prefix-aware routing,AWS 用开源 harness 论证"token 单价不等于每次正确答案的成本"。推理栈的优化重心正在从单点内核往调度、内存分层和功耗控制上移。

推荐周报 2026-W37

本周 14 篇工作集中在三条技术主线上:跨阶段联合优化、电商搜索的业务目标对齐、以及多模态与检索表示中的信号保真。 主线一:级联系统的联合优化取代分阶段调参。 快手的 UniRec 把粗排与精排的融合模块放进同一计算图联合训练,线上 app usage duration +0.616%;华为的 PTDG 用低秩近似按 item 动态重连任务依赖强度,线上 CVR +1.2%、eCPM +1.9%;滴滴的 ALIGN-HOLD 则把 hold 策略的奖励从手工组合换成偏好模型学出来的密集信号,28 天 A/B 覆盖日均约 10 万次请求。三篇的共同指向是——级联阶段的独立调优已经触到天花板,收益要来自阶段间的梯度流动。 主线二:电商搜索从"语义相关"转向"业务对齐"。 阿里巴巴的 SAM-D2Q 用强化学习偏好对齐替代纯文本的 Doc2Query 扩展,AliExpress 线上 GMV +3.38%、Pay Count +2.27%;华为的 IGPO 走 training-free 路线,把策略与库存事实解耦,线上 CTR 相对提升 3.17%、审核 bad case 减少 38.9%。两篇都不改模型主体,改的是优化目标与决策边界。 主线三:多模态与检索表示中的信号衰减开始被显式建模。 小红书相关团队的 LARK 提出"跨模态稀释"并给出一套潜在对齐方案;MURAL 用不确定度感知融合压制噪声模态;Embedding Surgery 则在稠密检索侧做局部嵌入修正,DL-Hard 上 nDCG@10 相对提升最高 60.64%。

推荐算法日报 - 2026-09-12

级联系统跨阶段联合优化成为工业界新焦点:快手 UniRec 首次系统性地将粗排与精排的融合模块放入同一计算图联合训练,用双轴偏好对齐(垂直跨阶段一致性 + 水平紧凑聚合)解决上下游目标不一致问题,并引入属性组相对正则化防止高奖励区域过拟合。这标志着工业推荐从"各阶段独立调优"向"全链路端到端对齐"演进,对已有级联架构的团队有直接复用价值。; 合成数据微调的"隐性代价"被系统性揭示:Manulife 在 34,396 个技能的生产级路由系统上发现,合成数据微调虽提升分布内检索,却导致 OOD 召回

1
...
56789
...
32