type
Post
status
Published
date
Jul 30, 2026 05:01
slug
ai-daily-2026-07-30
summary
今日 AI 领域迎来多个重要节点:微软 FY2026 年收入达 $331B,Azure 突破 $100B 大关,云业务持续高增长。OpenAI 揭示 ARC-AGI-3 分数翻三倍的 API 设置技巧,同时 GPT-5.6 Sol 通过生产级优化实现成本降低 20%。开源模型市场格局剧变,中国模型首次包揽 OpenRouter 全球调用量前五,小米 MiMo-V2.5 以 10.5 万亿 token 登顶。AMD 发布 Instella-MoE 完全开源模型,挑战 MoE 生态。安全领域出现首个自复制提示注入攻击 AI Worm,通过 Word Copilot 传播,引发行业警示。
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1
📊 今日概览
今日 AI 领域迎来多个重要节点:微软 FY2026 年收入达 $331B,Azure 突破 $100B 大关,云业务持续高增长。OpenAI 揭示 ARC-AGI-3 分数翻三倍的 API 设置技巧,同时 GPT-5.6 Sol 通过生产级优化实现成本降低 20%。开源模型市场格局剧变,中国模型首次包揽 OpenRouter 全球调用量前五,小米 MiMo-V2.5 以 10.5 万亿 token 登顶。AMD 发布 Instella-MoE 完全开源模型,挑战 MoE 生态。安全领域出现首个自复制提示注入攻击 AI Worm,通过 Word Copilot 传播,引发行业警示。
🔥 趋势洞察
- 中国开源模型主导全球市场:OpenRouter 调用量排名显示中国模型包揽前五,小米 MiMo-V2.5 登顶、腾讯混元 Hy3 周增超 999%,反映高性价比和稳定 Agent 能力正重塑开发者生态
- 推理优化进入精细化阶段:OpenAI 揭示 API 设置可翻三倍 ARC-AGI-3 分数,LMSYS 开源 Blackwell 原生低精度 RL 训练方案,社区估算 K3 后训练成本约 $4M,行业从"堆算力"转向"精调每一层"
- Agent 安全与信任问题凸显:AI Worm 通过 Word Copilot 实现自复制攻击,MCP 无状态化带来信任挑战,PatientAgentBench 揭示医疗 Agent 在分诊和安全上的系统性漏洞
🐦 X 推文动态
📈 热点与趋势
- 微软FY年收入$331B,Azure增41%达$100B - Satya Nadella(微软CEO)公布2026财年业绩:年收入3310亿美元,同比+18%;Microsoft Cloud收入2140亿,+27%;Azure收入1000亿,+41%。 @satyanadella
- 分析美国机器人禁令:中国今年将交付5万个人形机器人,占供应链70% - Gary Marcus(纽约大学心理学教授/AI批评者)转引分析:美国机器人禁令将破坏本土能力,中国今年预计交付超5万个人形机器人,美国仅数千;中国占人形机器人供应链约70%(减速器、执行器、电机)。 @GaryMarcus
🔧 工具与产品
- MiniMax与Fireworks AI开源M3推理核(MSA及Fireworks kernels) - MiniMax(AI模型开发者)和Fireworks AI(推理优化公司)各自开源M3模型推理所需的GPU内核代码:MiniMax MSA和Fireworks kernels,方便社区部署高性能M3推理。 @MiniMax_AI | @FireworksAI_HQ
- Kimi K3通过vLLM扩展至NVIDIA全系列、AMD ROCm及DigitalOcean - vLLM(开源推理引擎/UC Berkeley出品)宣布Kimi K3(月之暗面2.8T MoE模型)从Day 0起支持NVIDIA Blackwell/Hopper/NVL72系列、AMD Instinct (ROCm)以及通过DigitalOcean部署。 @vllm_project | @vllm_project | @vllm_project
- Cursor上线iPad版本,支持Agent工作 - Cursor(AI代码编辑器)发布iPad版,功能与iPhone版相同但屏幕更大,适合与Agent协作。 @cursor_ai
- Weaviate Query Agent集成GPT-5.6 Luna/Terra,召回率提升5-10% - Weaviate(向量数据库提供商)的Query Agent自动升级,使用OpenAI GPT-5.6 Luna(最快最便宜)和Terra(平衡版)模型,Recall@5提升5-10%,nDCG@10提升5-7%,成本不变。 @weaviate_io
- Simon Willison记录为ChatGPT和Claude配置自定义MCP服务器 - Simon Willison(Datasette作者/独立开发者)发布教程,说明如何在ChatGPT和Claude的常规聊天界面中添加自定义MCP服务器。 @simonw
⚙️ 技术实践
- GPT-5.6 Sol:ARC-AGI-3达SOTA,使用限制原因公开,自优化降本20% - OpenAI官方:GPT-5.6 Sol通过多上下文窗口和压缩实现在ARC-AGI-3上达到SOTA @thsottiaux;同时解释此前使用限制原因:Sol更努力工作、工具调用更多,已优化使使用时间延长约18% @thsottiaux;还通过生产GPU内核改进使服务成本降低20%、推测解码效率提升15%以上 @OpenAI。 @sama
- LMSYS开源Blackwell原生MXFP8/NVFP4 RL训练方案,Qwen3验证 - LMSYS Org(大模型评测组织)与Humanns、NVIDIA合作,开源端到端MXFP8以及硬件原生NVFP4 W4A4 RL训练方案,支持跨层精度控制。在Qwen3-30B-A3B上所有低精度配置均接近BF16奖励曲线,同时减少rollout时间。 @lmsysorg
- 社区估算K3后训练成本约$4M,576块B300 GPU训练12天 - 社区开发者nrehiew_基于公开信息估算:K3后训练共5000万次rollout、约1.3M任务、24个专家,每专家约250步,每步约10分钟,总成本约400万美元,使用576块B300 GPU。 @nrehiew_
- Modal推理负责人与Cognition研究负责人对话:RL与推理优化正在趋同 - Modal(serverless GPU平台)推理负责人_gongy与Cognition研究负责人Silas Alberti对谈,讨论RL训练与推理优化的汇合,包括树形推测解码、DFlash技术、在线训练推测器等。 @modal
⭐ 精选内容
OpenAI 揭示 ARC-AGI-3 分数翻三倍的 API 设置技巧 | 推理优化实用指南
OpenAI 官方博客揭示,在 ARC-AGI-3 基准上,仅启用 retained reasoning(保留推理过程)和 compaction(压缩)两个 API 设置,即可将 GPT-5.6 Sol 的分数从 13.3% 提升至 38.3%(接近人类平均 48%),同时输出 token 减少 6 倍。文章详细分析了官方 harness 与优化 harness 的差异,指出基准测试分数不仅反映模型能力,也受 API 设置和 harness 设计影响。对 AI 从业者而言,这两个设置可直接应用于其他 Agent 任务,是提升推理效率的实用技巧。
来源:OpenAI
AMD 发布 Instella-MoE 完全开源模型,挑战 MoE 生态 | 开源 MoE 新标杆
AMD 发布 Instella-MoE-16B-A3B,一个完全开源的 16B MoE 语言模型,每 token 仅激活 2.8B 参数。模型在 AMD Instinct MI300 和 MI325 GPU 上训练,采用 2.8T tokens 预训练、长上下文扩展、SFT、偏好调优和多阶段 RL。在多个基准测试中表现优异,接近同规模顶尖模型。AMD 开源了模型权重、训练代码和详细技术报告,为开源 LLM 社区提供了基于 AMD 硬件的 MoE 训练参考。
来源:ROCm Blogs
中国模型首次包揽 OpenRouter 全球调用量前五 | 开源模型市场格局剧变
OpenRouter 最新周调用量排名显示,中国模型首次包揽全球前五:小米 MiMo-V2.5 以 10.5 万亿 token 登顶,DeepSeek V4 Flash/V4 Pro 分列第二和第五,腾讯混元 Hy3 周增超 999% 跃居第三,智谱 GLM 5.2 第四。数据来自真实开发者付费调用,反映中国开源模型凭借高性价比和稳定 Agent 能力在海外开发者市场的主导地位。对 LLM 选型和市场格局判断有直接参考价值。
PatientAgentBench:首个面向患者端医疗 AI Agent 的临床验证评估标准 | 医疗 Agent 安全基准
Amazon Science 发布 PatientAgentBench,首个面向患者端医疗 AI Agent 的临床验证评估标准。现有基准要么测静态医学知识,要么测面向医生的技术任务,无法评估多轮对话中患者 Agent 的临床安全与工作流执行。该基准通过合成患者档案、LLM-as-a-jury 六维评估(临床安全、分诊质量、工作流准确性、任务完成、临床帮助性、对话质量)实现可复用、抗污染。关键发现:分诊是模型最大分化点,存在严重性悖论——模型在紧急病例上得分更高,日常病例反而隐藏更大风险;安全失败集中在危机资源遗漏和临床信息捏造。
K-Search:将 CUDA 内核优化知识自动迁移到 Apple Silicon | 跨硬件内核优化框架
IBM Research 与 Berkeley Sky Lab 合作,将 CUDA 内核优化知识通过 K-Search 进化搜索框架自动迁移到 Apple Silicon 的 MLX 框架。核心成果:FlashAttention 达到原生 MLX 性能的 97%,Mamba SSM 预填充提速 20 倍。方法不限于 MLX,可推广到任何 CUDA 知识可迁移的硬件生态。对关注多硬件部署、GPU 内核优化的从业者极具参考价值。
来源:BAIR Blog
MCP 无状态化带来的信任挑战与 TEE 解决方案 | Agent 基础设施前瞻思考
本文深入分析 MCP 2026-07-28 版本将协议从有状态改为无状态带来的信任挑战。作者指出,无状态化使 MCP 服务器可部署在普通轮询负载均衡器后,但同时也消除了单一视角追踪完整交互的可能,使得跨组织边界时,第三方无法验证工具调用是否真实发生。文章提出基于 TEE(可信执行环境)的解决方案:通过硬件签名证明,让不信任操作方的外部审计者也能验证 MCP 调用的真实性。这是对 MCP 生产级部署中信任问题的前瞻性思考。
来源:AAIF
AI Worm 通过 Word Copilot 实现自复制攻击 | 首个自复制提示注入攻击
安全研究员 Håkon Måløy 发现一种针对 Microsoft Word Copilot 的新型提示注入攻击变种,能够实现自我复制的蠕虫行为。攻击者将隐藏指令嵌入文档,当 Copilot 处理该文档时,指令会被执行并操纵当前文档,同时将隐藏指令复制到新文档中,形成传播链。该漏洞已向微软报告,但 144 天后仍未完全修复。这是首个展示自复制能力的提示注入攻击,对 AI 安全领域具有重要警示意义。
解构 Scaling Law:优化、架构、数据的三重奏 | Scaling Law 系统性解读
苏剑林对 Scaling Law 的系统性解读,从优化、架构、数据三个维度拆解影响模型性能的定量规律。文章首先给出异幂不等式和幂律组合最小值等数学工具,然后分别讨论优化器(如 Muon、Adam)的 Scaling 行为、模型架构(如 MoE、MLA)对 Scaling 的影响、以及数据配比与质量的作用。最后提出一个统一框架,将三者纳入同一视角,帮助从业者更科学地指导超参数选择、架构设计和数据策略。
来源:科学空间
🎙️ 播客精选
Building the Automated AGI Lab: Core Automation's Jerry Tworek and Rohan Anil
📍 来源:Training Data | ⭐ ⭐⭐⭐⭐⭐ | 🏷️ LLM, Research, Interview | ⏱️ 49:11
Jerry Tworek(OpenAI推理负责人)和Rohan Anil(Gemini预训练联合负责人)认为Transformer已到瓶颈,核心缺失是持续学习能力。他们指出上下文学习在约20分钟后失效,微调导致灾难性遗忘,预训练和RL应端到端优化。他们主张构建自动化AGI实验室需从自动化内核生成开始,因为前沿模型在此仍输给人类专家。讨论对LLM架构演进、Agent系统设计有重要参考价值。
💡 推荐理由: 重量级嘉宾(OpenAI推理负责人、Gemini预训练联合负责人)深度讨论架构局限与持续学习,挑战主流观点,对LLM从业者极具启发。
📄 今日论文精选
HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following
Surge AI | 🏷️ Agent Framework, Agentic Workflow, Safety
首个专门测试长上下文策略遵循的基准,65个任务覆盖5个领域,策略长度20-124页。最强模型通过率仅36.2%,揭示Agent在策略遵循上的系统性失败模式。
AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
Tencent | 🏷️ Inference, Architecture, Code Generation
提出统一训练框架AngelSpec和块扩散架构DFly,针对对话和代码任务协同优化训练数据与模型结构。在Hy3系列上实现1.98-2.40x加速,并开源。
Metis: Memory Foundation Model
MemTensor | 🏷️ Architecture, Training, Agent Memory
首个记忆基础模型,将历史信息压缩进模型原生记忆状态,通过记忆注意力访问。在线维护无需梯度,记忆更新仅需一次前向传播,为Agent原生记忆能力开辟新方向。
🐙 GitHub 热门项目
SpecPrefetch | MoE 专家预取优化框架
通过共享轻量适配器预测下一层专家候选,分离传输预测与执行路由,避免改变预训练路由语义。在 Snapdragon 8 Elite 设备上提升解码吞吐量达 20%,解决存储受限场景下 MoE 部署的专家加载瓶颈。
GitHub | ⭐ 待统计 | 🗣️ Python | 🏷️ Inference, MoE, Deployment