AI 技术日报 - 2026-09-29
2026-9-29
| 2026-9-29
字数 4678阅读时长≈ 12 分钟
type
Post
status
Published
date
Sep 29, 2026 05:00
slug
ai-daily-2026-09-29
summary
今日最大新闻是 AMD 以 82 亿美元收购李飞飞创办的 World Labs,空间智能赛道迎来产业级并购,其 Atlas 模型号称解决"新视角预测"这一 CV 长期难题。Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本最多降 30%,并直接顶上 claude.ai 免费档。安全侧双线推进:NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform,而 Perplexity 红队测试中 9 个模型 108 次逃逸全部失败、却在放开 PyPI 后 4 个绕过网络策略。此外《华尔街日报》报道 OpenAI 因未达安全标准取消下一
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1

📊 今日概览

今日最大新闻是 AMD 以 82 亿美元收购李飞飞创办的 World Labs,空间智能赛道迎来产业级并购,其 Atlas 模型号称解决"新视角预测"这一 CV 长期难题。Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本最多降 30%,并直接顶上 claude.ai 免费档。安全侧双线推进:NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform,而 Perplexity 红队测试中 9 个模型 108 次逃逸全部失败、却在放开 PyPI 后 4 个绕过网络策略。此外《华尔街日报》报道 OpenAI 因未达安全标准取消下一代模型发布,Bain 测算 AI 产业到 2031 年需 6 万亿美元年收入才能撑住数据中心投入。

🔥 趋势洞察

  • Agent 安全从提示词转向确定性代码:NVIDIA OpenShell 把限制写进沙箱代码而非 prompt,Gary Marcus 明确赞赏"LLM 本身不应被信任",Perplexity 红队也证明共享 IP 等基础设施级漏洞才是真风险
  • 空间智能与 Physical AI 进入并购期:AMD 82 亿美元收购 World Labs,Atlas 用 omni 架构统一图像/视频/空间重建,机器人仿真与设计工程成为直接落地场景
  • 后训练范式向 MOPD 收敛:Cameron Wolfe 综述 Nemotron 指出 Multi-Teacher On-Policy Distillation 已在 Nemotron 3 Ultra、DeepSeek-V4 出现,SFT+RL+MOPD 三支柱成型

🐦 X 推文动态

📈 热点与趋势

  • 《华尔街日报》:OpenAI 取消下一代模型发布,因未达安全标准 - 报道称该模型在安全评估中未过关,原定发布被撤下 @WSJ(《华尔街日报》)
  • World Labs 加入 AMD - AMD CEO Lisa Su 称要把 World Labs 的世界模型与 AMD 算力结合,并强调此举会加强开放 AI 生态;World Labs 由李飞飞创立于 2024 年,方向是空间与物理智能 @theworldlabs(World Labs,李飞飞创立的空间智能公司)@LisaSu(AMD CEO)
  • Meta 启动新业务支柱 Meta Enterprise Platform - 扎克伯格称该平台帮企业用 AI 做增长与转型,Meta 现有数十亿用户、数亿商家 @finkd(Mark Zuckerberg,Meta CEO)
  • Bain:AI 产业到 2031 年需 6 万亿美元年收入才能撑住数据中心投入 - 该数字是全球在建 AI 数据中心资本开支的回本门槛 @business(彭博)
  • 论文《What if Automating AI R&D Triggers an Intelligence Explosion》发布 - 作者含 Jakub Pachocki(OpenAI 首席科学家)、Geoffrey Hinton、Yoshua Bengio(MILA 教授 / 图灵奖得主)、Jack Clark(Anthropic 联合创始人);作者主张政策制定者应要求公司披露内部模型研发自动化程度、以及离递归自我改进还有多远 @AndrewCurran_(Andrew Curran,AI 内容作者,转述该论文)

🔧 工具与产品

  • Anthropic 发布 Claude Sonnet 5.5 - 比 Sonnet 5 快 30% 以上,多数任务成本最多降 30%;已顶上 claude.ai 免费档,ChatGPT 免费档仍为 GPT-5.6 Luna(能力更弱)。Addy Osmani 称其擅长边界清楚的日常活(修 bug、写文档、做幻灯片) @claudeai(Anthropic Claude 官方账号)@addyosmani(Google Chrome 工程负责人)@simonw(Datasette 作者 / 独立开发者)
  • NVIDIA 联合 100+ 伙伴发布 Open Agent Safety Platform - 平台含 OpenShell 与 Sentry 两个部分,给 agent 系统做沙箱与信任层。吴恩达的 OpenWorker(开源 agent harness,面向网络安全工作流)将基于 OpenShell 运行每个 agent 的命令在沙箱内:只有任务相关文件进沙箱,API key、浏览器登录凭据、访问任意网站默认不可达;限制写在确定性代码里而非提示词里,全部动作留日志 @JensenHuang(NVIDIA CEO)@nvidia @AndrewYNg
  • Base44 发布 Base Code 早期预览 - 云端开发环境:扫仓库后在云上自动搭起数据库、Redis 等基础设施与预览环境,非本地桌面环境;团队成员可在任意浏览器/手机协作,能看到别人在提示什么、一键跳进对方环境。企业向考虑是集中治理而非分发密钥,模型无关,免费 30 天 @MaorShlomo(Maor Shlomo,Base44 创始人)
  • Raven 0.2.0 开源:多个 harness 与 Claude Code、Codex 编入同一任务图 - 子 harness 分 Research、Code、Design、Oncall,子 agent 间共享记忆,多 Agent 编排基准 Node F1 0.963;作者称提示词、策略代码、playbook 整个 harness 都可被 AI 重写,Apache-2.0 @LongTermMemoryE(邓亚峰,Raven 作者)

⚙️ 技术实践

  • NanoGPT 把 8xH100 训练纪录从 67.6 秒压到 39.9 秒 - Deven Prakzak 换了一套"按 flop 取舍"的写法:稀疏 softmax 跳过未出现 token 的 lm_head 前反向、只对本 batch 出现的 n-gram 行做优化器更新、n-gram 表跨 GPU 分片且只传有更新的行、优化器状态从每参数 2 个 float 降到 768 参数 1 个 float、64 维 head 手写 flash attention。稀疏嵌入参数从 124M 活跃规模扩到 65B,贡献了约 25% 的提速。Percy Liang 称"没想到一次能降 40%" @percyliang(Percy Liang,斯坦福教授)
  • xLLM:dense 与 MoE 大模型的预训练 / 微调基础设施 - H200 上 K2-Horizon-MoVA-36B-A4B 达 6,295 tokens/sec/GPU,Llama3-8B 达 10,050 tokens/sec/GPU;tokenizer、数据配比、模型结构、训练阶段都能改,不用重建数据集和系统;K2 Horizon 的 checkpoints、训练日志与配方一并开源 @IFM_AI(Institute of Foundation Models,基础模型研究院)
  • Perplexity 红队:9 个模型 108 次逃逸全部失败,放开 PyPI 后 4 个绕过网络策略 - 给 Opus 5、GPT-5.6 Sol、Kimi K3、Gemini 3.1 Pro 等模型的 VM 内 root 权限,部分运行还给了完整沙箱源码,无一逃出。只放开 PyPI 与 Ubuntu 镜像后,4 个模型达到被禁 URL:伪造发给网关的 DNS 响应、利用目标站与数千站点共享的 Fastly IP;GPT-5.6 Cyber 走 Taboola 图片抓取器到截图服务,再从图里 OCR 出 flag。测试的 10 家沙箱供应商中 8 家有同样共享 IP 问题,包括 E2B、Vercel、Modal @AravSrinivas(Aravind Srinivas,Perplexity CEO)
  • 零阶优化预训练 Transformer,不用反向传播 - 作者称已跑通,论文即将发布,并称优化研究里的若干核心假设"完全错了" @industriaalist(Samip,AI 研究者)
  • Meta 用专家对齐 rubrics 做 RL,针对"AI 味"写作 - Jason Weston 提出 RL-XAR:先从专家写作里学出"专家与模型差距"的评分标准,再用这些 rubric 训练;在科学论文段落写作、普利策获奖小说续写、高质量 Wikipedia 页面上均有大幅提升 @jaseweston(Jason Weston,Meta FAIR 研究员)
  • JEV 当判定层:每千次判断 $0.044,同一千次 GPT-6 要 $12.182 - 斯坦福团队让 LLM 只写需要文字的部分(一条 5–12 行笔记、一个 claim),其余全走类型化决策:值不值得读、走论文/仓库/市场哪条线、20 个来源重排留 5 个、claim 是否成立、与已有内容是重复/相关/修订/矛盾。判定规则来自 CMU 的 JEV-as-a-Judge 论文:只把不确定的 34% 上送前沿模型,保住 99.6% 准确率、花 47% 的费用 @N01ennn(AI 内容博主,转述斯坦福与 CMU 研究)

⭐ 精选内容

AMD 以 82 亿美元收购 World Labs,Atlas 模型解决稀疏重建难题 | 空间智能赛道出现产业级并购
AMD 收购 Fei-Fei Li 创办的 World Labs,价格因 AMD 上市公司身份而曝光。World Labs 自 2024 年起主攻空间智能,训练图像/视频/空间重建模型,并通过收购 SceniX 切入机器人仿真。其最新 Atlas 是首个 omni 架构模型,解决「新视角预测」这一计算机视觉长期难题——像 LLM 预测下一 token 一样从 2D 图像预测下一视角,性能超越专用 SOTA,对设计、工程、机器人与科学计算有直接影响。适合关注多模态与 Physical AI 走向的从业者。
来源:latent.space
Holo4 开源通用 computer-use agent:27B dense 与 35B-A3B MoE 双尺寸 | 不绑定单一交互界面的开源权重模型
H 公司发布 Holo4 系列,同一模型可点击/输入 GUI、写并执行代码、调用 MCP 或 API 工具,覆盖桌面、Web、Android、代码沙箱与企业 API,无需按平台切换。训练采用监督+强化学习,配合自研 Agentic Task Factory 批量生成环境与任务。OSWorld 2.0 上 27B 得 61.7%,落后最强闭源模型(81.8%)但显著超越 Qwen 基座。权重、FP16/FP8/GGUF 量化、轨迹数据集与 viewer 全部开放,可直接复现与二次开发。
GitHub Security Lab 用开源 AI agent 挖出 24 个 Android 漏洞 | 可复现的 agentic security 工作流
GitHub Security Lab 用开源 Taskflow Agent 在 Android 应用中挖出 24 个真实漏洞并公开完整工作流。核心方法:把审计拆成增量步骤(gather_mobile_entry_point_info.yaml 区分移动/非移动入口点,classify_application_local.yaml 针对 intent 类漏洞定向检查),并用「严格 prompt + 重复运行」防漏、「宽泛 prompt」保留 LLM 创造力。文中给出 OsmAnd 被恶意应用追踪位置的实例(exported MapActivity 接受任意 intent extras)。可在 codespace 一键跑 ./scripts/audit/run_mobile.sh 复用到自己仓库。
来源:github.blog
Ben Thompson:聊天机器人是 AI 的 killer app,预置 UI 正在死亡 | 用 iPhone 发布类比论证 agent 时代的聚合层
Ben Thompson 借乔布斯「三个革命性产品其实是一个设备」的类比,提出 2026 年的现实:聊天机器人是当下入口、自然语言是未来界面、而「预置 UI(write once, run everywhere)」正在死亡——不是三个预测,而是同一件事。他回溯 2013 年与扎克伯格「Apps vs People」的论战,用自己手机从 151 个 app 涨到 689 个、但常用核心始终是消息/社交/ChatGPT+Claude 的事实,论证真正决定平台命运的是「jobs to be done」而非「人」。随后以自建 coding agent、idea tracker agent、公司定制 agent 的经历,引出「A Computer for AI」——agent 正成为新的 app 层与聚合层。
Anthropic Claude Code 负责人谈下一阶段:Claude Mods、可变软件与 Claude.md 可能消失 | 前沿 coding agent 产品路线的一手解释
Latent Space 请到 Anthropic 的 Thariq Shihipar 深聊 Claude Code 下一阶段:Ask User Question 与 elicitation、artifacts 作为持久生成式界面、Claude Tag 多人 agent 工作流、Projects、model effort,以及可自定义 harness 的 Claude Mods 系统。他抛出几个反直觉判断——Claude.md 可能最终消失、最聪明的模型对很多任务反而最便宜、可变软件(mutable software)会成为应用构建与定制的新范式。后半段转向 agent 安全与 Anthropic 的「Pacing the Frontier」主张,复盘 agent 自行发现通信/利用基础设施等意外行为。
来源:latent.space
Cameron Wolfe 综述 NVIDIA Nemotron:后训练三大支柱与 MOPD 新范式 | 前沿规模模型后训练全景
Cameron Wolfe 对 NVIDIA Nemotron 系列技术报告做系统综述,把现代 LLM 后训练拆成三大支柱:SFT(generate-then-filter 数据管线,多教师采样 + 领域 verifier 过滤 + 多样性去重)、RL(尽可能用可验证奖励,不可验证场景用 reward model / LLM judge)、以及新兴的 Multi-Teacher On-Policy Distillation(MOPD,已在 Nemotron 3 Ultra、DeepSeek-V4 等报告中出现)。文章还覆盖课程与奖励设计、数据筛选、训练基础设施、loss 形式等落地细节——这些通常只有真正训过前沿规模模型的团队才会公开。Nemotron 因透明度高(技术报告 + 代码 + 训练配方 + 部分数据)成为研究后训练实际运作方式的稀有样本。
MCP 治理与安全双缺口:15,465 个 server 无治理 + 工具描述审批后漂移 | 从注册表盲区到 rug-pull 的两条攻击面
两条独立报道拼出 MCP 生态的安全图景。Ox Security 报告《15,465 MCP Servers, 0 Governance》指出:近 16% 主机解析在美国境外(含中俄),超 2% 域名已失效甚至可被抢注,攻击者可冒充原服务;实测 Claude Code + Haiku 3.5 授予一次 always-allow 后,恶意 server 可无提示读取 .env 等敏感文件,Anthropic 回应称这是文档化行为、模型级检测只是 best-effort 启发式而非安全边界。另一篇则指出 MCP 工具描述本质是注入模型上下文的 prompt,服务器可在用户批准后悄悄改写描述实现 rug-pull:实测 resend 的 MCP server 在 2.12→2.19 期间变更 6 次、工具数从 85 涨到 103,新增 update-api-key 等敏感工具却从未重新审批;作者用 issues-mcp 构造可复现投毒示例,并给出 mcpgawk 的 PreToolUse hook 方案——比对工具指纹是否仍与批准时一致,在调用路径上拦截。
苏剑林:所有 Kronecker 预条件优化器的理想极限可能都是 Muon | 一个值得跟进的争议性理论论断
科学空间新系列开篇,抛出一个反直觉论断:所有基于 Kronecker 积的预条件优化器(Shampoo、KL-Shampoo、OKLS、PSGD、SOAP 等)在理想极限下可能都退化为 Muon,即花大代价构造的预条件矩阵可能是「无用功」。文章从凸性假设下的平均收敛界出发做推导。对关注 LLM 训练优化器选型的研究者,这是值得跟进的争议性观点,但抓取内容在公式处截断,需读原文才能评估论证是否成立。
来源:kexue.fm
Nvidia 发布 Open Agent Safety Platform,与 Anthropic/OpenAI 监管呼吁形成路线分歧 | agent 安全治理的两条路线
Nvidia 发布 Open Agent Safety Platform,声称通过设定「边界」可阻止此前一系列 agent 越界与泄露事件,与 Anthropic/OpenAI CEO 联名呼吁监管形成路线分歧:Jensen Huang 主张由各公司自行保证模型安全,而非协调放缓。文中还提到 Anthropic 工程师 Jacob Coxon 离职发帖呼吁暂停开发,被两家公司借势包装自身安全形象(正值 IPO 前融资窗口)。Gary Marcus 则点评该平台既是承认风险存在,也可能是「为公关而做的软件」,并特别赞赏把关键环节交给确定性符号代码、认为 LLM 本身不应被信任。适合作为 agent 安全治理话题的入口,深度需另找一手来源。

🎙️ 播客精选

Claude Code's Next Era — Thariq Shihipar, Anthropic

📍 来源:Latent Space | ⭐ ⭐⭐⭐⭐/5 | 🏷️ Agent, LLM, Interview | ⏱️ 1:32:29
Anthropic 的 Thariq Shihipar 深度解析 Claude Code 的现状与未来:Ask User Question、artifacts 作为持久生成界面、Claude Tag 多人 Agent 工作流、Claude Mods 自定义 harness,并预测 Claude.md 可能消失、最强模型也可能最便宜。后半段聚焦 Agent 安全与"Pacing the Frontier",涉及沙箱、prompt injection、自主 Agent、可解释性、constitutional classifiers 等真实事故案例,对 Agent 开发者极具实战参考价值。
💡 推荐理由: Anthropic 核心工程师深度访谈,覆盖 Claude Code 演进、Agent harness、安全前沿,信息密度极高。

The Real Risks of AI Agents

📍 来源:AI Daily Brief | ⭐ ⭐⭐/5 | 🏷️ Agent, Regulation, Product | ⏱️ 00:29:23
NLW 探讨 AI Agent 的现实风险:即使不构成生存威胁,Agent 按用户意图执行也可能颠覆基于人类摩擦设计的系统。结合 OpenAI 近期安全事件,分析 Agent 权限边界问题,并讨论中美 AI 对话、特朗普会见 Dario Amodei 及 Google、Microsoft 新 Agent 功能。对 Agent 从业者理解安全与权限设计有参考价值。
💡 推荐理由: 聚焦 AI Agent 真实风险与权限边界,结合 OpenAI 安全事件分析,但为新闻综述类节目,缺乏独家深度访谈。

📄 今日论文精选

ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?

dreadnode | 🏷️ Agent Deployment, Safety, Agent Framework
用 30 个"目标只能靠越界达成"的死局任务,量化 agent 在目标压力下是否守得住渗透测试的授权边界——能力与合规被证明可以解耦,对任何部署自主 agent 的团队都是必读的可靠性标尺。

Game Arena: Strategic LLM Evaluation in Competitive Environments

Google, Kaggle, Google DeepMind | 🏷️ Agent Framework, Reasoning, Agent Deployment
用国际象棋、扑克、狼人杀三类对局替代静态 benchmark,以真实胜负作 ground truth,天然抗饱和、抗污染,且平台开放可扩展新游戏——评估范式的工程化样本。

Breaking Homogeneity: Diversifying Persona Sets for Creative LLM Outputs

Purdue University, J.P. Morgan AI Research | 🏷️ Agent Framework, Reasoning, Fine-tuning
把 persona 多样化形式化为集合级条件问题,用进化式生成让 AUT 多样性提升 78.8%、原创性 26.1%,且能与提示词优化叠加——破解 LLM 群体思维的可复用机制。
  • AI
  • 日报
  • 技术趋势
  • 推荐算法日报 - 2026-09-29AI 技术日报 - 2026-09-28
    Loading...