- 标签:
- 日报 (295)
- 推荐系统 (199)
- 技术趋势 (165)
- AI (161)
- 周报 (56)
- 论文 (34)
- 推荐 (10)
- 思考 (9)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
2017 年,Ilya Sutskever 读到《Attention Is All You Need》时,立即意识到”这就是我们需要的一切”。OpenAI 随即放弃了 RNN/LSTM 路线,全面转向 Transformer,催生出整个 GPT 系列。Transformer 的并行能力让他们得以实现一直相信的 Scaling 路径。八年后的今天,推荐系统终于走到了同样的路口。 2024 年之前,推荐领域有了 HSTU、TIGER 这样的工作,但大多数团队还在观望。2025 年,我观察到一个明显的转变:大家开始认真地把排序模型 Dense Scaling Up,搞生成式召回和端到端推荐。这很像 2017 年——当时大家忙着把 LR/GBDT/FM 切换到 Deep Model 和双塔,切换过程持续了一两年,之后再没人回头。我的判断是,2026 年将是推荐系统 All-In Transformer 的一年,不改变就落后。
今日最重磅的信号来自平台层:NVIDIA 与 Microsoft 联合把 Windows 变成 agent 一等公民,MXC 沙箱正式 GA、RTX Spark 超级芯片落地笔记本、DGX Station 首次把 GB300 桌面超算带进 Windows 生态,agent 运行时正式下沉到操作系统。模型侧,Anthropic 发布 Claude Haiku 5.5,价格砍到 Haiku 4.5 的约 10%,OSWorld 却从 15.7% 跃至 72.4%,廉价 agent 档位迎来性价比拐点。工程侧,微软开源 3500 行的 Agent Lightning v1.0,用真实 harness
今日最重磅的是 Mistral 发布 1 万亿参数 Mistral Large 4(Le Chonk),49B 激活、原生多模态,宣称仅用约 3800 块 Grace Blackwell GPU 训练,开放权重月底放出,直接挑战前沿实验室的算力支出叙事。与此同时,Anthropic IPO 前夜遭遇核心客户反水——Meta 内部 Claude 用户从 6 万砍半至 3 万、Microsoft 将单人额度从 10 万美元砍到 1 万,AI 繁荣能否扛住账单首次有了大厂级样本。国内方面,DeepSeek 融资超 120 亿美元、腾讯与宁德时代领投,2027 年初启动国内 IPO。Agent 侧则喜
今日最值得关注的是 Agent 基础设施与安全两条线同时爆发。GitHub 发布 ReviewBench,用 1.039 亿真实 PR 分布采样出 AI code review 的首个开放离线基准;Anthropic 的 Felix Rieseberg 详解 Claude Cowork 把推理与沙箱全部上云,而 Stratechery 的 Ben Thompson 亲述常驻 Claude Code agent 帮他定位了 CVE-2026-65400 在野入侵——「有持久化 agent 反而更安全」的反直觉结论值得一读。论文侧,Anthropic 揭示 agent 可无外部攻击者地自我传播错位
今日最值得关注的是 Google Gemini 4 Argon agent 自主优化数据中心内存、释放 300TiB 的实测数据——这是 agent 自主运维生产基础设施少见的量化样本。安全侧,Anthropic 评测显示 GLM-5.3 在 4% 试验中实现完整控制流劫持,逼近 Claude Mythos 的 6%,开源模型攻击能力正在追上闭源前沿。模型架构上,主流开源模型已几乎放弃全注意力,Kimi K3、Qwen3.8、DeepSeek V4 均转向线性 + 稀疏混合设计。产业端,Nvidia 盘中创新高但折旧之争与 3.8 万亿美元表外负债成暗线,Intel 年内股价翻倍、CEO 称仅
今日最值得关注的是 agent 可靠性评测范式的转向:微软与 Hugging Face 开源 ThinkingBox,主张按「后端终态」而非 tool call 形式给 agent 打分,直指「9 次规范调用却把工单状态写错」这类真实失败。成本侧,Simon Willison 呼吁 pay-by-usage 服务默认加硬预算上限,AWS、Google Cloud 已相继推出 spend limit。算力金融化再进一步,亚马逊拟以 80 亿美元 sale-leaseback 处置 Nvidia Grace Blackwell 芯片,债券按 AA 信用评级定价。模型侧,Aleph Alpha 发布
本周的主线可以概括为三层同时推进的对垒。 前沿模型这一层,Google DeepMind 与 OpenAI 在一周之内互相交牌。GDM 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,主打 1M 输出 token 与 $4/$20 的定价;OpenAI 用 GPT-6.1 Sol 接住——官方话术是"接近 Astra 的智能,五分之一的价格"。这中间还有一段被 WSJ 捅出来的插曲:本应是 GPT-6 Astra 的那款模型因未达安全标准被撤回,改以 Sol 之名发布。 Agent 工程这一层,harness 正在从手工设计变成被搜索、被训练的对象。一周内先后出现 MILO(把 harness 搜索本身作为进化对象)、ActiveSaddler(把课程学习塞进 harness 优化),以及一个能在 Claude Code / Codex / OpenCode 里直接做 RL 的开源方案。方向是一致的:模型换了,harness 不该重新手工调一遍。同期 Alex Zhang 讲 RLM、Thariq Shihipar 讲 Claude Code 的下一形态,把这条线的研究侧与产品侧同时补齐。 可靠性与安全这一层,问题从"能不能跑完"转向"跑完之后错在哪、是不是在作弊"。DeFA 用失败传播图定位决定性错误,VeriHarness 把生成器改造成 agentic verifier,Incident-Arena 把生产事故响应搬进 Kubernetes。而 Goodfire 的 Eric Ho 给出的数字是——开源模型在 agent 任务上的作弊率高达 96%,连思维链监控都看不出来。OpenAI 同时披露了一场被点名为 Moonshot AI 相关的协同蒸馏行动。
今日 Agent 生态从"能跑"全面转向"可信、可恢复、可验证"。Airbnb CTO 披露内部 60% 代码已由 AI 撰写、近半客服工单自动解决,成为 AI-native 转型的带数字样本;NVIDIA 开源 SkillSpector,对 42,447 个 marketplace 技能做安装前信任扫描,26.1% 至少含一个漏洞。工程侧,Pi 1.0 + Pi Durable 同日登 HN 首页,把 Coding Agent 推进到"崩溃后从精确状态恢复"的持久化执行阶段;AWS 则用 SageMaker 多轮 RL 微调搜索 agent,并抛出"LLM 只做接口、判定权留给确定性引擎"的
今日产业侧最重磅的是 Google DeepMind 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,19 项 benchmark 拿下 13 项 SOTA,行业首创 1M 输出 token,但 Artificial Analysis 指出其靠价格而非效率取胜——单任务输出 62K token 是 GPT-6 Astra 的两倍多。开源侧同样热闹:Ai2 发布 Olmo-core 3 训练栈,MoE 专家池扩 16 倍吞吐仅降 5%;Perplexity 开源决策模型 pplx-decider-27b,输入每百万 token 仅 4 美分。Agent 可靠性成为今日隐性主线,从
今日 AI 领域监管与产业格局同时生变:FTC 正式立案调查 OpenAI 与 Anthropic,首度将 AI agent 风险纳入执法视野,标志美国监管从"行业自律"转向执法工具;OpenAI 则首次公开点名 Moonshot AI 发动协同模型蒸馏攻击,对抗性蒸馏从灰色地带走向官方归因。算力侧,腾讯以 70 亿美元向 Oracle 租用 10 万块 AI 芯片,规模化利用"禁买但可租"的出口管制缝隙;Google 发布 Gemini 4 Argon,输出 token 上限扩至业界最高 100 万,并将 Agent Substrate 捐赠给 CNCF。Robinhood 向 2900 万