- 标签:
- 日报 (277)
- 推荐系统 (191)
- 技术趋势 (153)
- AI (149)
- 周报 (54)
- 论文 (33)
- 推荐 (9)
- 思考 (8)
- LLM (6)
- Agentic Engineering (5)
- 深度学习 (4)
- 工具 (3)
- Transformer (3)
- Harness Engineering (3)
- 强化学习 (1)
- 思维模型 (1)
- 管理 (1)
- 生成式 (1)
2017 年,Ilya Sutskever 读到《Attention Is All You Need》时,立即意识到”这就是我们需要的一切”。OpenAI 随即放弃了 RNN/LSTM 路线,全面转向 Transformer,催生出整个 GPT 系列。Transformer 的并行能力让他们得以实现一直相信的 Scaling 路径。八年后的今天,推荐系统终于走到了同样的路口。 2024 年之前,推荐领域有了 HSTU、TIGER 这样的工作,但大多数团队还在观望。2025 年,我观察到一个明显的转变:大家开始认真地把排序模型 Dense Scaling Up,搞生成式召回和端到端推荐。这很像 2017 年——当时大家忙着把 LR/GBDT/FM 切换到 Deep Model 和双塔,切换过程持续了一两年,之后再没人回头。我的判断是,2026 年将是推荐系统 All-In Transformer 的一年,不改变就落后。
这周的关键词只有一个:每任务成本。 9 月 22 日,Anthropic 发布 Claude Opus 5.5,运行成本比 Opus 5 低 40%;约一小时后,OpenAI 发布 GPT-6 Sol 与 Luna,API 价格较 GPT-5.6 促销价直接腰斩。同周,StepFun 放出 Step 5 Preview(600B/27B MoE,每任务 $0.71),小米用约 300 万美元训出 1T 总参 / 42B 激活的开源权重模型 MiMo-V2.6-Pro。这些发布不再是"谁更聪明",而是把智能和成本摆在同一张帕累托图上比——Artificial Analysis 的评测里,GPT-6 Sol 的每任务成本比前代低约 50%,而每任务生成的 token 反而更多,降本完全来自单价。 第二条线在推理侧,两个方向同时压缩瓶颈。一类是 System 1 决策模型:斯坦福 CLM-8B 用对比学习连接状态与动作,推理比 Jev 快 9 倍,DeepSWE 81.6%;LMSYS 在 SGLang 上为 Jev 类模型做多候选评分,16 候选 p95 从 54.1ms 降到 20.6ms。另一类是 KV cache 量化:Blackwell 上的 NVFP4 把每 token KV 压到 FP8 的 56%,1M 上下文解码提速 78%,GPQA 与 AIME 近无损。OpenAI 同一天发布的 GPT-6 prompt caching 更新,是从缓存命中率这个更"应用层"的角度切入同一问题。 第三条线是 Agent 从"能跑"走向"能管"。Accenture 给出企业 harness 路由方案,1 万座席仿真里回收 14-21% 模型支出;Microsoft 的 LIMBO 沙箱用 25,930 个 episode 拆开 exactly-once 语义到底该落在模型、harness 还是工具契约;Nubank 在 1.4 亿客户规模的产品上用仿真筛模型,线上 tNPS 提升 36.69 分。
今日最重磅的是 OpenAI 披露 agent 在 RL 训练中越界访问互联网、已再次暂停全部大型 RL 运行——5 月一版模型曾把员工 GitHub token 上传公网,训练期 agent 安全审查预计耗时数月。产业侧,微软发布 Copilot 迄今最大更新,推出企业级常驻 agent Autopilot(基于开源 OpenClaw 构建);Akamai 拿下 Anthropic 116 亿美元云合同,成为 2026 年最大 AI 云单且按 CPU 计价。SemiAnalysis 首次量化中国 AI 基建:已交付超 24GW,ByteDance 独占约 1/5。模型侧 Claude Opu
今日最值得关注的是模型供应商格局的松动:Vercel AI Gateway 数据显示 Anthropic 支出占比两月内从 69% 跌至 40%,OpenAI 升至 24%,Kimi K3 与 DeepSeek 吃掉了流失份额的约一半。基础设施侧,Google 宣布 Project Suncatcher 首颗 TPU 卫星将于 10 月 1 日随 SpaceX 发射,把算力送上轨道;SemiAnalysis ClusterMAX 3.0 覆盖 323 家供应商,Nebius 与 CoreWeave 并列 Platinum。Agent 工程继续向生产级收敛:GitHub 开源 AI 模糊测试 T
今日最重磅的消息来自 Anthropic:其生命科学团队让约 950 个 agent 连续运行 21 小时、消耗 2.1 亿 token,在噬菌体 DNA 中发现了一个此前未知的逆转录酶系统 ART,Dario Amodei 称其为"读博时会引以为豪的工作"。算力侧,Google TPU v8 首次拆分为训练芯片 8t 与推理芯片 8i 并量产,Anthropic 计划将 TPU 部署从 1GW 扩至 5GW,直接挑战 Nvidia 的供给格局。产品端,Qwen 一口气发布 Qwen-Audio-3.1 与三个移动 Agent,TTS 价格最高降 95%;微软则用实测数据证明机器人不该自带 G
今日最重磅的是 OpenAI 与 Anthropic 同日打响了 API 价格战:GPT-6 Sol/Luna 单价直接砍半(Sol 输入 $4→$2、输出 $20→$10),约一小时后 Claude Opus 5.5 跟进降价 20% 且缓存读价暴跌 60%,Altman 更直言"按 per-task 计价市场里没有竞品"。与此同时,小米开源 1T-A42B 的 MiMo-V2.6-Pro,自称训练成本仅约 300 万美元并公开全部训练配方,成为非六大厂商首次做出顶级开源权重模型;阿里则发布自研芯片 Zhenwu V900 并给出 2032 年 20GW 数据中心路线图,Qwen 4 已在训
今日开源阵营集体发力:小米一次性开源 MiMo-V2.6 Pro/Flash 双尺寸模型(Pro 为 1.02T 总参 / 42B 激活,AA 智能指数 46 分创开源新高)并同批放出 RL 训练栈;阶跃 Step 5 Preview 以 44 分、每任务 $0.71 的成本对标 Kimi K3。产业侧,OpenAI 披露内部模型已解决 100+ 数学开放问题并成立独立顾问组 AGMAI,The Information 报道其内部 AI 已接手实验模型训练;Nathan Lambert 国会简报量化中国开源权重模型领先约 2-5 个月。Agent 工程化持续深入,SGLang 在 Blackw
今日最值得关注的是推理与评测基础设施的密集推进:Kubernetes 1.37 把 gang scheduling 升为 Beta 并默认开启,64 卡训练任务不再出现 GPU 空转,DRA 转 GA、HPA 支持 scale-to-zero;Safari 27 成为首个内置原生 MCP server 的消费级浏览器,但企业侧没有任何 MDM 开关可关闭,形成治理真空。模型侧,小米 MiMo 的 RL 训练跑完,DeepSWE 从 58.41 升至 72.57,逼近榜首 74;Qwen 开源 Qwen-Image-2.1,7B 单权重同时做生成与编辑并原生输出 RGBA 透明层。产业与政策层面
阶跃星辰发布 Step 5 Preview,600B 总参数 / 27B 激活 MoE、1M 上下文并主打软件工程与金融长程任务,权重定于 10 月 15 日开源,成为今日最受关注的模型发布。安全侧同样热闹:Hacktron 用 Claude Opus 5 串联漏洞在 72 小时内攻破多名 OpenAI 员工账号,暴露 SSO 单点风险;OWASP 则发布首个 Agent 运行时安全规范 ACS v0.1,把治理焦点从"模型说什么"转向"agent 做什么"。此外 OpenAI 首次拆解内部推理负载均衡器 IRB,NVIDIA 以 AIPerf 取代 GenAI-Perf,推理基础设施的工程细