AI周报 2026-W34

本周 AI 领域有一条清晰的主线:能力的增长节奏正在逼迫评估、治理和安全体系同步提速。Sam Altman 宣布暂停部分前沿 RL 训练(本周最重磅的产业事件),理由是能力进步超出了安全和对齐的节奏。与此同时,NVIDIA 的 AVO agent 在 ARC-AGI-3 上完成全部 183 关拿下 100%,Ornith-1.5 通过自我改进训练追平 Claude Opus 4.8——能力端与安全端在同一步频上加速,形成张力。 第二条线是评测与训练环境的范式转移:从静态、零样本的基准走向实时、长时程、自生成的环境。本周的 FM-Bench(AnalogyAI)用 20 年足球管理模拟检验长期决策,EnvHarness(Google)让静态环境学会自适应演化,Wuying-Browser-Agent(阿里云)则直接引入平均 37.9 步的 BrowserBench——评测不再测"能不能",而是测"能否长期稳定地做"。 第三条线是推理优化进入工程精细阶段:LFM2.5-DSpark(Liquid AI)的推测解码带来 3.2 倍加速,LMSYS 的权重缓存守护进程把引擎加载从 495 秒压到 0.63 秒。成本曲线在多个层面被压低。

推荐周报 2026-W34

本周(2026-08-16 ~ 2026-08-22)推荐系统研究围绕三条主线展开:工业级系统从"分场景模型"走向"统一架构"、生成式推荐从"能离线跑"转向"可上线服务"、Agent 化推荐进入工程化和评估规范化阶段。 主线1:统一架构加速整合多业务流。 小红书的 OneModel 用单个模型统一自然推荐、广告和商家三条流量线,线上广告侧 CTR 提升 8.18%;Meta 的 UniDot 从 FM 点积视角统一序列建模与特征交互。两篇工作的共同指向是——存储和算力红利消退后,多场景碎片化部署的工程成本成为主要矛盾。 主线2:生成式推荐加速落地。 快手的 OGR 实现了端到端生成有序 slate,线上 Effective Views 提升 1.120%,NDCG@5 在工业数据上提升 48.2%。EchoRec 将多 token 预测从效率工具拓展为密集监督信号。生成式推荐本周的关键词是"产出物"——不只是生成单个 item,而是生成有序列表。 主线3:Agent 化推荐系统的工程化。 阿里巴巴的 PILOT 将 LLM agent 用于实验管理和策略搜索,搜索效率从 53.3% 提升到 93.3%;微软的 AdsWorldEngine 在对话广告场景让 agent 与工具协同进化,线上 RPM 提升 22%。Agent 推荐正在从单点推理走向流程治理。

推荐算法日报 - 2026-08-22

[量化压缩成为检索系统降本增效的核心战场]:今日多篇论文聚焦 Embedding 量化压缩,但思路已从"均匀比特分配"转向"结构感知"。Microsoft 提出基于 Matryoshka 几何结构的可变比特分配(PQ 提升 8%、SQ 提升 18%),Virginia Tech 的 CrossQ 则通过任务对齐的跨 token 条件量化,在 4 B/token 下实现 64x 存储压缩且保留 98% 全精度 MRR@10。核心洞察:量化不应只最小化重建误差,而应服务于检索排序目标——"winne

AI 技术日报 - 2026-08-22

今日 AI 领域迎来多重里程碑:NVIDIA 以 120 亿美元"反向执行收购"Poolside,创始人留任获 10 亿美元、员工获 60 亿美元,同时微软确认首批生产型 Vera Rubin 芯片交付,算力饥渴正在重塑产业边界。模型侧,DeepSeek 发布多模态新模型对标 Opus 4.8,Harvey 推出法律专用模型 Tenet,Gemma 4 31B 以约 1/40 成本匹敌 Sonnet 5 回答质量。基础设施层面,乌兰察布 12.5GW 数据中心承诺超 Stargate,中国 AI 产业首次大规模自建基础设施;Percy Liang 启动 535B 参数全程开源训练,UC Ber

推荐算法日报 - 2026-08-21

LLM 从"编码器"走向"推理体":今日多篇论文(PILOT、TTP、GateDiffInt、rEDMRec)不再将 LLM 当作静态文本编码器,而是让其扮演主动推理、意图解耦、实验设计等角色。LLM 正从特征提取工具升级为推荐系统的"大脑",通过推理蒸馏、Agent 协作等方式在控制成本的前提下注入深度语义理解。; 多模态与多场景走向"大一统":Netflix 用多模态嵌入统一五类画布资产模型,小红书 OneModel 统一自然推荐/广告/商家三大业务流排序。业界正从"每个场景/模态一个模型"

AI 技术日报 - 2026-08-21

今日 AI 领域最重磅的消息当属 NVIDIA 以 60 亿美元收购 Poolside 的"模型工厂"业务,芯片巨头亲自下场整合模型生产能力,研究员普遍收到 NVIDIA offer。与此同时,Z.ai CEO 唐杰宣告"参数规模已死",GLM 5.3 的飞跃全部来自长时程环境 RL 训练,后训练 Scaling Law 成为新范式。医疗 AI 迎来里程碑:Moderna/Merck 个性化 mRNA 癌症疫苗 III 期成功,1137 人入组双终点均优于单药。开源生态方面,社区发布最激进 Qwen3.8-27B 无审查版,18/18 红队通过,引发开源 vs 安全激烈讨论。此外,Harvey

推荐算法日报 - 2026-08-20

[生成式推荐从"生成候选"走向"端到端生成结果":今日多篇论文(OGR、DEPT)不再将生成式模型局限于召回阶段,而是直接端到端生成最终推荐结果(有序 Slate)或统一"查询扩展+检索"。核心挑战从"如何生成"转向"如何让生成目标与最终排序/检索目标对齐"——OGR 用列表级偏好规划 + 奖励引导策略优化,DEPT 用文档嵌入保持微调解决"移动目标"问题。工业落地价值极高,尤其 OGR 已在快手线上验证。; [紧凑 LLM 成为落地主角,效率与效果之争进入新阶段:FLEXRec、CARA 等论

AI 技术日报 - 2026-08-20

今日 AI 领域围绕"隐私安全"与"Agent 工程化"双主线展开。OpenAI 预览 Private Safety Processing,试图调和 Zero Data Retention 承诺与跨交互安全监控的矛盾,正面回应 Anthropic 的企业客户隐私优势;同时 CFO 确认 2027 年上市时间表,商业化路径进一步清晰。开源侧,Ornith-1.5 以自改进策略训练发布三档模型,比肩 Claude Opus 4.8;Qwen3.8-27B 发布 4 天登顶 Cline 本地模型榜首。地缘政治层面,美国出口管制漏洞曝光——中国 AI 公司借道东南亚远程租用 Nvidia 算力,RAS

推荐算法日报 - 2026-08-19

[工业级系统落地成为主旋律]:今日多篇重磅论文来自 Google、Meta、Amazon、PayPal 等一线大厂,且均已在生产环境部署验证。Google Discover 的 SDF 系统将内容过时问题分解为 supersession 和 decay 两种机制并分别建模,两年部署用户投诉下降 54.9%;Meta 的 UniDot 统一特征交互与序列建模,斩获 KDD Cup 2026 工业赛道亚军。工业界正从"单点模型优化"转向"全链路系统级问题拆解",且更强调可部署性和推理成本控制。; [

AI 技术日报 - 2026-08-19

今日 AI 领域动作密集:OpenAI 罕见暂停部分前沿 RL 训练,CEO Sam Altman 与首席科学家 Jakub Pachocki 公开表态"安全信心将越来越决定 AI 进步速度",并签署 Pacing the Frontier 协调倡议。模型竞争白热化,智谱发布 GLM-5.3,Intelligence Index 60 分持平 Kimi K3,agentic Elo 跃至 1770 仅次于 Claude Opus 5;DeepSeek 开源 harness 却遭独立复测分数争议,较官方低 9-33 分。产业资本端,Anthropic 营收 run rate 突破 $65B 并密

推荐算法日报 - 2026-08-18

对话式推荐进入 Agent 化与可靠性双轨时代:今日多篇论文聚焦对话式推荐,但技术路线明显分化。Microsoft 的 AdsWorldEngine 走全 LLM Agent 路线,通过 Orchestrator 与 Tool 协同进化实现自改进;而 Stanford/MIT/Amazon 的 MACS 则走混合路线,将语言理解交给 LLM、把约束执行交给确定性模块。两条路线都强调"可靠性"——前者用 Opportunity Gate 控制广告侵入性,后者用确定性过滤保证硬约束不漂移。对工业界而

AI 技术日报 - 2026-08-18

今日 AI 领域迎来基础设施层的标志性并购:Stripe 以 70 亿美元收购 OpenRouter,模型路由层价值重估,AI 聚合时代开启。与此同时,LiteLLM 供应链攻击波及 2,500+ 公司、434,000 条 CI/CD 管道,成为 2026 年最大 AI 供应链安全事件。NVIDIA 为 OpenAI 提供 4.25 吉瓦 AI 工厂算力,20 年 6000 亿美元算力承诺揭示约束已从芯片迁移到电力。模型侧,Grok 4.6 在 Agentic 指数并列第一且成本仅为 Claude 的 1/4,Qwen3.8-27B 被列为首个达前沿水平的本地模型,消费级硬件跑出超 100 t

1
...
45678
...
30