AI 技术日报 - 2026-09-25
2026-9-25
| 2026-9-25
字数 5084阅读时长≈ 13 分钟
type
Post
status
Published
date
Sep 25, 2026 05:00
slug
ai-daily-2026-09-25
summary
今日最值得关注的是模型供应商格局的松动:Vercel AI Gateway 数据显示 Anthropic 支出占比两月内从 69% 跌至 40%,OpenAI 升至 24%,Kimi K3 与 DeepSeek 吃掉了流失份额的约一半。基础设施侧,Google 宣布 Project Suncatcher 首颗 TPU 卫星将于 10 月 1 日随 SpaceX 发射,把算力送上轨道;SemiAnalysis ClusterMAX 3.0 覆盖 323 家供应商,Nebius 与 CoreWeave 并列 Platinum。Agent 工程继续向生产级收敛:GitHub 开源 AI 模糊测试 T
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1

📊 今日概览

今日最值得关注的是模型供应商格局的松动:Vercel AI Gateway 数据显示 Anthropic 支出占比两月内从 69% 跌至 40%,OpenAI 升至 24%,Kimi K3 与 DeepSeek 吃掉了流失份额的约一半。基础设施侧,Google 宣布 Project Suncatcher 首颗 TPU 卫星将于 10 月 1 日随 SpaceX 发射,把算力送上轨道;SemiAnalysis ClusterMAX 3.0 覆盖 323 家供应商,Nebius 与 CoreWeave 并列 Platinum。Agent 工程继续向生产级收敛:GitHub 开源 AI 模糊测试 Taskflow 并抛出"chat 是错的 UI",Nubank 用仿真筛选 CX Agent 使 tNPS 提升 36.69 分,白宫则要求 OpenAI/Anthropic 新模型先经美国测试再给英国 AISI。

🔥 趋势洞察

  • 模型供应商格局松动:Vercel 数据显示 Anthropic 支出占比两月内从 69% 掉到 40%,OpenAI 升至 24%,Kimi K3 与 DeepSeek 吃掉约一半流失份额,多模型路由正成为企业默认架构
  • Agent 沙箱与治理成刚需:包管理器沙箱与 coding agent 沙箱正在合流(Homebrew 7.0.0 与 Claude Code 共用内核原语),Accenture 提出企业级 agent 路由控制平面可回收 14-21% 模型支出
  • 推理效率优化全面开花:LiquidAI DSpark 以 +8.9% 参数换 3.13x 加速,DPara 并行投机解码达 3.52x,KITE 用 KV-invariant 扩展同时压低训练与推理成本

🐦 X 推文动态

📈 热点与趋势

  • Vercel AI Gateway:Anthropic 支出占比两月内从 69% 掉到 40% - OpenAI 同期从 10% 升到 24%,token 数已居第一,图像生成占 62%;Kimi K3 与 DeepSeek 吃掉 Anthropic 流失份额的约一半,Opus 5.5 两天内占到 10% @rauchg(Guillermo Rauch,Vercel CEO)
  • Google 把 TPU 送上天,Project Suncatcher 首星 10 月 1 日发射 - 搭载 SpaceX Transporter-18 从范登堡升空,卫星由 Google 与 Planet 合作建造,目的是验证 TPU 能否在轨存活并运行 @sundarpichai(Sundar Pichai,Google CEO)@cb_doge(科技内容账号)
  • 宇树 19 台全尺寸人形机器人与 120 名舞者同台 - 9 月 22 日上海世界技能大赛开幕式,现场观众超 1 万人,机器人集群为 AI 自主驱动并全球实时直播 @UnitreeRobotics(宇树科技)
  • Simon Willison:coding agent 让软件工程更难,不是更简单 - 称用好它们需要极高纪律与知识储备;Gergely Orosz 跟帖认为非开发者写生产代码短期内不会发生 @simonw(Datasette 作者 / 独立开发者)

🔧 工具与产品

  • Perplexity 发布 Fast Search,Rust 引擎 Photon 做到 p95 230ms - 单次搜索 p50 160ms、p95 230ms,官方称 95% 结果在 230ms 内返回;引擎由小团队加数百个自动研究循环搭出,现已是 Nous Portal 订阅者 Hermes Agent 的默认搜索、全部档位免费 @AravSrinivas(Aravind Srinivas,Perplexity CEO)@NousResearch(Nous Research,开源 AI 研究组织)
  • Scenario 开源 GameDev OS:给编码 agent 9 个专家、64 个技能 - 含 2D/3D 美术、环境、美术总监、音效、视频、营销、技术总监与成本管理员,各自绑定 Seedance、GPT、Meshy、Rodin 等模型,可串联出图→建模→场景→音效→预告片 @emmanuel_2m(Emm,Scenario.com)
  • Odyssey 发布 Agora-2 多智能体世界模型 - 支持最多 20 个人类与 agent 在同一环境实时交互模拟,多人研究预览已开放 @odysseyml(Odyssey,世界模型初创公司)
  • OrcaSAQ-2 27B:体积缩 78.3%,SWE-bench Verified 70.0 - 混合精度 Qwen3.8,55.59GB 压到 12.06GB、3.21 bpw,Top-1 一致率 93.2%,Terminal-Bench 2.1 得 58.4,262K 上下文,面向编码、终端、浏览器与安全 agent @OrcaRouter(OrcaRouter,模型量化路由服务)
  • Muse 给每位用户一台云电脑,用 Secure VM + Sentinel 防提示注入 - runtime cell 独立 root 文件系统(完整 Ubuntu 镜像),敏感操作与凭据都存在 cell 之外由 Sentinel 监管;文件在 Library 标签页可直接浏览,Settings 里可下载 agent 数据 @dps(David Singleton,Meta 工程师)
  • Quail:开源 AI-SQL 引擎,单张 H100 跑到 1B+ 输入 token/分钟 - 与 Modal 合作,把查询规划与 LLM 推理放在一起调度,针对 AI 数据算子的新推理负载 @sh_reya(Shreya Shankar,UC Berkeley 研究者)

⚙️ 技术实践

  • vLLM 与 RLKernel 在 ROCm 上做到训练/rollout logprob 逐位一致 - 8× AMD MI300X 跑 200 步 Qwen3-8B GRPO,Megatron 训练与 vLLM rollout 零 mismatch,严格路径对齐了归约顺序、中间精度、舍入点与数学原语 @vllm_project(vLLM,开源推理引擎)
  • GLM-5.3 在 8× AMD MI355X 上单用户解码 469 tok/s - vLLM 负责 prefill、TileRT 通过 V1 connector 接管延迟敏感的 decode,FP8 下比 GB300 上的 TRTLLM FP4 快 40% 以上 @vllm_project @SemiAnalysis_(SemiAnalysis,半导体分析机构)
  • Meta AI 给 agent 配专职记忆 agent,Claude Sonnet 4.5 基准从 37.6% 升到 45.9% - 主行动 agent 配记忆 agent:结构化记录工具与历史错误,只在关键节点注入短提醒,对抗长上下文里的"忘掉早前错误" @DeepLearningAI(DeepLearning.AI,AI 教育机构)
  • MiniMax-H3 视频模型上 AMD MI355X,5 秒视频 1.3 秒生成 - Nunchux 做的推理优化,8 卡下比 SGLang 快最多 26.7 倍,支持流式生成中改提示词 @MiniMax_AI(MiniMax)
  • oMLX 0.7.0rc1:Qwen3.8-27B 解码 +131%,下轮 prefill 从 1174 token 降到 37 - M5 Max 128GB 上 Qwen3.8-Flash-Next prefill 提升 32%,新增部分块缓存(无需重算未满缓存块的 token)、Ternary Bonsai 2、MiMo V2.6 多模态理解与 MCDMA RDMA 支持 @jundotkim(Jun Kim,oMLX 作者)
  • Claude Code 用 /advisor 把 Fable 挂成旁路顾问 - 主会话由 Opus 5.5 high 跑,三个 medium 子代理分担读码、改测、查文档,Fable 只在定计划前、同一错误复发、宣布完成前介入;附完整子代理与 effortLevel 配置提示词 @Voxyz_ai(Vox,AI 工具博主)

⭐ 精选内容

GitHub 开源 AI 模糊测试 Taskflow:LLM 决策 + MCP 执行的责任分离范式 | 把 C/C++ fuzzing 全流程交给 agent 的完整参考实现
GitHub Security Lab 开源 Fuzzing Taskflow,让 LLM agent 端到端跑完模糊测试:识别入口点、分析构建系统、写 harness、跑 AFL++、读覆盖率、迭代改进、triage 崩溃并生成漏洞报告。架构上刻意做责任分离——agent 只做决策,MCP 工具只暴露 run_afl_for / compile_harness 等原语,状态全部走 SQLite;每个 harness 构建 .afl 与 .cov 两份二进制形成 coverage-feedback 闭环。文中明确警告该流程会在宿主机直接执行 LLM 选定的构建命令,须在一次性环境运行。对做 agentic pipeline 的团队,这是一份可直接 codespace 跑通的三层架构(shell driver + taskflow YAML + MCP 工具)范本。
来源:github.blog
「chat 是错的 UI」:GitHub 提出让 agent 自己造工具,后续交互免费 | canvas 交互范式与 token 经济学
GitHub 官方博客抛出反直觉观点:chat 是 LLM 的默认界面,但大多数任务场景下它是错误的 UI。作者以 Copilot app 的 canvas 为例——运行在 app 内、无浏览器外壳的全栈小应用,可与 agent 双向通信、调第三方 API、本地执行代码。核心洞察是:与其让 agent 反复执行 stage and commit 这类操作烧 token,不如让它构建一个工具,后续交互全部免费;文中给出 Connect 4、Winget 包管理、SQLite 浏览器、Jekyll 编辑器等实例,并展示如何用 canvas 把 research→prototype→plan→implement→iterate→finalize 工作流中的自己移出循环。
来源:github.blog
Runway WorldPrompt 与实时世界模型的工程难题 | 与 Genie 3 / World Labs 的横向对比
Latent Space 独家采访 Runway CTO Kamil Sindi 与首席研究科学家 Robin Kahlow,解读 GWM Worlds 2 的新特性 WorldPrompt——一种指定生成世界及其内部动作的输入格式,可固定首帧等环境要素、生成带时间戳事件、实时 prompt 动作,相当于角色/相机/环境的控制层(类游戏 NPC 逻辑,但只是 prompting 而非脚本)。文章给出 Runway、Google Genie 3、Odyssey-2 Pro、World Labs RTFM 的横向对比表,并拆解把视频模型变成实时运行时的两大工程难题:从整段生成改为逐帧生成、以及把生成压到实时帧率。对关注 LLM 之外前沿方向的从业者,这是一手技术路线图。
来源:latent.space
SemiAnalysis ClusterMAX 3.0:GPU 云评级大更新,Nebius 与 CoreWeave 并列 Platinum | 323 家供应商、77 家 neocloud 深评
SemiAnalysis 发布 ClusterMAX 3.0,覆盖 323 家供应商(上版 209 家)、深度评测 77 家 neocloud、访谈 200+ 终端用户,按计算/网络/存储/编排/UI/监控/支持/安全等 10 大类打分。核心变动:Nebius 与 CoreWeave 并列 Platinum;Google Cloud 升入 Gold,Azure 降至 Silver,Crusoe 跌至 Bronze,Fluidstack 变为 Unavailable;新增「参与奖」层级容纳 15 家仅达最低标准的厂商,全球仅 19 家获 Medallion 评级。报告还拆解融资、Blackwell/Grace-Blackwell 部署、向 Vera Rubin 迁移、Scale-Out 网络、可靠性、安全与 Agentic Coding 趋势,附 3 万字逐家点评——选云、谈判与 TCO 建模的一手参考。
白宫要求 OpenAI/Anthropic 新模型先给美国测、再给英国 AISI | 前沿模型发布前的地缘政治准入博弈
POLITICO 报道白宫要求 OpenAI 和 Anthropic 在完成美国政府测试前,不得将新模型提供给英国 AI 安全研究所(AISI)。Anthropic 已同意,其 Claude Mythos 5.1 仅向美国部分伙伴开放,未给英国 AISI;英国 AISI 主任在致议会委员会的信中承认无法访问 Anthropic 模型,但强调仍对部分前沿模型有预发布访问权,并称已提前测试 OpenAI 的 GPT-6 Astra。英国呼吁建立全球共享原则,白宫则寻求对新模型的首测权——这条揭示了模型发布节奏、监管协调与英美 AI 安全合作裂痕,对理解「谁先拿到前沿模型」有直接价值。
来源:politico.com
包管理器沙箱与 coding agent 沙箱正在合流 | Homebrew 7.0.0 与 Claude Code/Codex 用同一套内核原语
Homebrew 7.0.0 把安装拆成有网络的 fetch 阶段与离线的 install 阶段,用内核级 Landlock 取代 Bubblewrap,并把任意 Ruby 的 post_install 迁移为签名声明式 *_steps。文章指出这套沙箱原语(Seatbelt/Landlock/seccomp)正是 Claude Code、Codex CLI、Cursor、Gemini CLI 采用的同一套栈,因为两者都在跑未审查代码。更关键的是二者已交叉:agent 会替你装包,Shai-Hulud 蠕虫通过 postinstall 脚本写入 Claude Code 配置实现持久化,Mandiant 报告攻击者劫持编码助手会话在约 100 个内部仓库扩散。作者给出 gating/confining/replacing 三分法,共同未解难题是验证受限阶段的输出——建立 agent 安全执行 mental model 的扎实素材。
来源:nesbitt.io
LiquidAI 发布 LFM2.5-VL-DSpark:视觉语言模型投机解码加速最高 3.13x | 仅加 8.9% 参数、day-one 支持 llama.cpp/MLX-VLM/SGLang
LiquidAI 为 LFM2.5-VL-3B 发布实验性 DSpark 投机解码 draft 模型:仅增加 280M 参数(+8.9%),在 M5 Max 上解码加速 2.30-3.13x、H100 上最高 2.66x,端到端最高 2.62x,且不改变输出质量。draft 模型为 4 层 attention-only 结构、block size 9,通过固定层隐藏态条件化生成候选 token,视觉 patch 与文本 token 投影到同一表征空间,因此推理算法与文本版一致。附六类视觉任务(VQA/图表/多轮对话)实测与视觉负载下投机解码的局限分析——对做 VLM 推理优化的团队是一份可复用的加速配方。
llmfit:按真实硬件给 5,372 个本地模型打分排序 | 拆解「参数量×字节数 vs VRAM」经验公式的四个失效点
llmfit 是一款本地 LLM 选型工具,读取真实硬件后对 5,372 个模型按 fit/speed/quality/context 四维打分并加权排序(chat 侧重速度、reasoning 侧重质量)。文章指出传统 VRAM 估算公式的四个失效点:KV cache 随上下文增长(Qwen3.5-9B 从 4K 的 6.6GB 涨到 131K 的 22.1GB)、MoE 稀疏激活(Mixtral 8x7B 实际只需 7.7GB 活跃权重)、混合硬件无法合并显存、以及「装得下但慢到不可用」。作者在 RTX 4080 上实测 68.2 tok/s,比预测的 40.9 高出 40%,并可用该实测值反向校正全机估算——本地部署/自托管团队可直接用其命令流(doctor/fit/recommend/info/bench)做选型。

🎙️ 播客精选

Who Feeds the GPUs? Inside AI's Hidden $30B Layer | Renen Hallak, VAST Data

📍 来源:The MAD Podcast | ⭐ ⭐⭐⭐⭐⭐ | 🏷️ Infra, Agent, Interview | ⏱️ 01:10:14
VAST Data 创始人 Renen Hallak 深入剖析 AI 栈中被忽视的数据层:AI 工厂的本质、DASE 共享架构、为何传统数据库在万亿向量下崩溃、训练与推理的基础设施差异。重点讨论 KV cache、RAG 与 agent memory、AI agent 的身份权限安全,以及 DataEnclave 机密 AI。还涉及需求信号(客户从 500PB 到 2EB)、循环融资风险、neocloud 竞争格局及与 xAI/NVIDIA 合作经验,对 AI 基础设施从业者极具参考价值。
💡 推荐理由: VAST Data 创始人深度访谈,聚焦 AI 存储/数据层这一被忽视的关键基础设施,含 KV cache、agent memory、机密 AI 等硬核技术话题,嘉宾为 300 亿美元公司 CEO,实战洞察丰富。

Runway's WorldPrompt and the Engineering of Real-Time Worlds

📍 来源:Latent Space | ⭐ ⭐⭐⭐⭐ | 🏷️ MultiModal, Research, Interview | ⏱️ 1:36:21
Runway 推出 GWM Worlds 2 及 WorldPrompt 输入格式,用自回归扩散模型实现实时交互式视频音频生成。访谈 CTO Kamil Sindi 与首席研究科学家 Robin Kahlow,讨论 WorldPrompt 如何像游戏引擎般控制角色、相机与环境,并对比 Genie 3、Odyssey-2 Pro、World Labs RTFM 等竞品。核心价值在于揭示实时世界模型在延迟、连续交互时长上的工程挑战与 prompting 范式的边界,对关注多模态生成与 Agent 环境模拟的从业者有参考意义。
💡 推荐理由: Runway CTO 与首席研究科学家深度访谈,解析 WorldPrompt 与实时世界模型工程,技术细节扎实;但偏视频生成方向,对 LLM/Agent 从业者直接相关性略低。

From AGENTS.md to Enterprise Deployment

📍 来源:Practical AI | ⭐ ⭐⭐⭐⭐ | 🏷️ Agent, Infra, Product | ⏱️ 48:52
讨论 AI Agent 从原型走向企业部署的关键变化:安全、合规、可扩展性与可靠性。Nick Kuhn 分享 VMware Tanzu 在 agent build packs、MCP 网关、共享内存、身份认证与沙箱隔离方面的实践经验,并借鉴多年平台工程经验给出企业落地建议。对关注 Agent 基础设施与生产化部署的从业者具有较高参考价值。
💡 推荐理由: 聚焦企业级 Agent 部署实战,嘉宾来自 VMware Tanzu 平台工程背景,涉及 MCP 网关、沙箱、身份等硬核话题,但非顶级 AI 公司创始人级别。

AI Agents Are Moving Into the Real World

📍 来源:AI Daily Brief | ⭐ ⭐⭐⭐ | 🏷️ Agent, Product, Regulation | ⏱️ 00:28:07
本期聚焦 AI Agent 进入现实场景:Meta 将 Muse 引入智能眼镜与新可穿戴设备,GrokBot 把特斯拉变成语音助手,讨论消费者是否真正需要 Agent 及早期用户的实际价值。头条还包括 Claude 的初步生物学发现、特朗普'超级智能'品牌重塑及联合国 AI 治理路线之争。适合从业者快速把握 Agent 产品化与行业动态。
💡 推荐理由: AI 新闻周报类,覆盖 Agent 落地、Claude 科研发现及 AI 治理等话题,信息量足但缺乏独家深度观点。

Re-Founding Incumbents for the AI Era with Sequence Holdings Co-Founder and CEO Michael Lee

📍 来源:No Priors | ⭐ ⭐⭐⭐ | 🏷️ Product, Funding, Interview | ⏱️ 42:44
Sequence Holdings CEO Michael Lee 与 Sarah Guo 探讨如何用 AI 从内部改造传统行业龙头,而非颠覆它们。核心观点:传统咨询和软件销售模式无法完成企业级 AI 转型,需通过控股公司结构+工程整合深度介入。分享了 77 亿美元私有化 Baldwin、投资 BankSouth 的实际成果,以及为何永久控股结构利于长期复利。对关注 AI 落地企业场景的从业者有参考价值。
💡 推荐理由: AI 改造传统企业的实战视角,嘉宾有具体案例,但偏投资/运营而非 LLM 技术本身。

📄 今日论文精选

From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents

AWS AI | 🏷️ Agent Framework, Fine-tuning, RLHF/DPO
诊断出 on-policy 自蒸馏在多轮 agent 中的目标错配——学生学到教师的"自信"却无支撑信息,最差情况低于未训练基座;提出把特权信息从 loss 移到 sampler,AppWorld 任务完成率最高 +65%。

Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents

Alibaba | 🏷️ Agent Framework, Agentic Workflow, Tool Use
阿里通义构建闭环 AI-for-AI 框架:agentic 数据飞轮 + 混合环境在线 RL(CARE 奖励工程)+ 模型-harness 协同演化,在自建 MobilePA-Bench 上工具使用、记忆、技能、子 agent 协调四维全面超越基座。

Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale

Nubank | 🏷️ Agent Deployment, Agentic Workflow, Tool Use
Nubank 用 Snowglobe 仿真器在部署前筛选 CX Agent,仿真与生产评分高度相关;仿真引导迭代使 tNPS 提升 36.69 分,1.6 万次仿真对话筛出的模型让自服务率提升 8.82 个百分点至历史最高。

🐙 GitHub 热门项目

Fuzzing Taskflow | LLM 决策 + MCP 执行的模糊测试范式
GitHub Security Lab 开源的 C/C++ 模糊测试 agent 参考实现,agent 只做决策、MCP 工具只暴露编译与运行原语,状态走 SQLite,每个 harness 构建覆盖率反馈闭环。三层架构(shell driver + taskflow YAML + MCP 工具)可直接在 codespace 跑通,是 agentic pipeline 的范本。
GitHub | ⭐ 新发布 | 🗣️ Python | 🏷️ Agent, Security, MCP
llmfit | 按真实硬件给本地模型打分排序
读取真实硬件后对 5,372 个本地模型按 fit/speed/quality/context 四维加权排序,并拆解传统 VRAM 估算公式的四个失效点(KV cache 增长、MoE 稀疏激活、混合硬件、装得下但慢)。提供 doctor/fit/recommend/info/bench 命令流,本地部署团队可直接用于选型。
GitHub | ⭐ 新发布 | 🗣️ Python | 🏷️ LLM, DevTool, Local Inference
  • AI
  • 日报
  • 技术趋势
  • 推荐算法日报 - 2026-09-25推荐算法日报 - 2026-09-24
    Loading...