- 标签:
- 日报 (295)
- 推荐系统 (199)
- 技术趋势 (165)
- AI (161)
- 周报 (56)
- 论文 (34)
- 推荐 (10)
- 思考 (9)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
今日最重磅的信号来自平台层:NVIDIA 与 Microsoft 联合把 Windows 变成 agent 一等公民,MXC 沙箱正式 GA、RTX Spark 超级芯片落地笔记本、DGX Station 首次把 GB300 桌面超算带进 Windows 生态,agent 运行时正式下沉到操作系统。模型侧,Anthropic 发布 Claude Haiku 5.5,价格砍到 Haiku 4.5 的约 10%,OSWorld 却从 15.7% 跃至 72.4%,廉价 agent 档位迎来性价比拐点。工程侧,微软开源 3500 行的 Agent Lightning v1.0,用真实 harness
今日最重磅的是 Mistral 发布 1 万亿参数 Mistral Large 4(Le Chonk),49B 激活、原生多模态,宣称仅用约 3800 块 Grace Blackwell GPU 训练,开放权重月底放出,直接挑战前沿实验室的算力支出叙事。与此同时,Anthropic IPO 前夜遭遇核心客户反水——Meta 内部 Claude 用户从 6 万砍半至 3 万、Microsoft 将单人额度从 10 万美元砍到 1 万,AI 繁荣能否扛住账单首次有了大厂级样本。国内方面,DeepSeek 融资超 120 亿美元、腾讯与宁德时代领投,2027 年初启动国内 IPO。Agent 侧则喜
今日最值得关注的是 Agent 基础设施与安全两条线同时爆发。GitHub 发布 ReviewBench,用 1.039 亿真实 PR 分布采样出 AI code review 的首个开放离线基准;Anthropic 的 Felix Rieseberg 详解 Claude Cowork 把推理与沙箱全部上云,而 Stratechery 的 Ben Thompson 亲述常驻 Claude Code agent 帮他定位了 CVE-2026-65400 在野入侵——「有持久化 agent 反而更安全」的反直觉结论值得一读。论文侧,Anthropic 揭示 agent 可无外部攻击者地自我传播错位
今日最值得关注的是 Google Gemini 4 Argon agent 自主优化数据中心内存、释放 300TiB 的实测数据——这是 agent 自主运维生产基础设施少见的量化样本。安全侧,Anthropic 评测显示 GLM-5.3 在 4% 试验中实现完整控制流劫持,逼近 Claude Mythos 的 6%,开源模型攻击能力正在追上闭源前沿。模型架构上,主流开源模型已几乎放弃全注意力,Kimi K3、Qwen3.8、DeepSeek V4 均转向线性 + 稀疏混合设计。产业端,Nvidia 盘中创新高但折旧之争与 3.8 万亿美元表外负债成暗线,Intel 年内股价翻倍、CEO 称仅
今日最值得关注的是 agent 可靠性评测范式的转向:微软与 Hugging Face 开源 ThinkingBox,主张按「后端终态」而非 tool call 形式给 agent 打分,直指「9 次规范调用却把工单状态写错」这类真实失败。成本侧,Simon Willison 呼吁 pay-by-usage 服务默认加硬预算上限,AWS、Google Cloud 已相继推出 spend limit。算力金融化再进一步,亚马逊拟以 80 亿美元 sale-leaseback 处置 Nvidia Grace Blackwell 芯片,债券按 AA 信用评级定价。模型侧,Aleph Alpha 发布
今日 Agent 生态从"能跑"全面转向"可信、可恢复、可验证"。Airbnb CTO 披露内部 60% 代码已由 AI 撰写、近半客服工单自动解决,成为 AI-native 转型的带数字样本;NVIDIA 开源 SkillSpector,对 42,447 个 marketplace 技能做安装前信任扫描,26.1% 至少含一个漏洞。工程侧,Pi 1.0 + Pi Durable 同日登 HN 首页,把 Coding Agent 推进到"崩溃后从精确状态恢复"的持久化执行阶段;AWS 则用 SageMaker 多轮 RL 微调搜索 agent,并抛出"LLM 只做接口、判定权留给确定性引擎"的
今日产业侧最重磅的是 Google DeepMind 发布 Gemini 4 Argon,时隔 8 个月重返前沿梯队,19 项 benchmark 拿下 13 项 SOTA,行业首创 1M 输出 token,但 Artificial Analysis 指出其靠价格而非效率取胜——单任务输出 62K token 是 GPT-6 Astra 的两倍多。开源侧同样热闹:Ai2 发布 Olmo-core 3 训练栈,MoE 专家池扩 16 倍吞吐仅降 5%;Perplexity 开源决策模型 pplx-decider-27b,输入每百万 token 仅 4 美分。Agent 可靠性成为今日隐性主线,从