AI 技术日报 - 2026-07-24
2026-7-24
| 2026-7-24
字数 5347阅读时长 14 分钟
type
Post
status
Published
date
Jul 24, 2026 05:01
slug
ai-daily-2026-07-24
summary
今日 AI 领域迎来多项重磅动态:DeepSeek CEO 泄露电话透露其算力规模约 2 万张 H 等效卡,并优先采购 NVIDIA 芯片,同时招聘信息暗示正为管理 10 万卡集群做准备。Andrew Ng 发布开源 Agent OpenWorker,可完成文档交付、Slack 消息发送等任务;ChatGPT 推出 Sites 功能,支持从想法到托管网站的一步构建。Qwen 发布 Audio-3.0-TTS,支持 16 语言和内联标签控制,登顶 TTS 榜单。Etched 获 3 亿美元 C 轮融资,估值 103 亿美元。Google 发布首份 ATLAS 报告系统定义 AI 经济,OpenA
tags
AI
日报
技术趋势
category
AI技术报告
icon
📰
password
priority
1

📊 今日概览

今日 AI 领域迎来多项重磅动态:DeepSeek CEO 泄露电话透露其算力规模约 2 万张 H 等效卡,并优先采购 NVIDIA 芯片,同时招聘信息暗示正为管理 10 万卡集群做准备。Andrew Ng 发布开源 Agent OpenWorker,可完成文档交付、Slack 消息发送等任务;ChatGPT 推出 Sites 功能,支持从想法到托管网站的一步构建。Qwen 发布 Audio-3.0-TTS,支持 16 语言和内联标签控制,登顶 TTS 榜单。Etched 获 3 亿美元 C 轮融资,估值 103 亿美元。Google 发布首份 ATLAS 报告系统定义 AI 经济,OpenAI 与 Anthropic 罕见联手警告开源 AI 风险。论文方面,Together AI 的 SonicSampler 实现 LLM 采样 10-16 倍加速,NVIDIA 的 NOOA 提出 Agent 即 Python 对象的新范式。

🔥 趋势洞察

  • 算力军备竞赛白热化:DeepSeek CEO 泄露电话揭示 2 万 H 卡规模,招聘暗示 10 万卡集群管理,Google 优先将 TPU 用于 AGI 研究而非出租,算力争夺从芯片层面延伸到分配策略层面
  • Agent 走向生产级与开源化:Andrew Ng 发布 OpenWorker、ChatGPT Sites 功能、Amazon Bedrock AgentCore 静默故障检测、Motorway 评估蓝图等,Agent 从演示走向可观测、可评估的生产级部署
  • AI 芯片与推理效率竞赛升级:Etched 获 103 亿美元估值、Cerebras 晶圆级芯片深度访谈、MiniMax M3 在 AMD MI355X 接近 B200 性能、Qdrant 边缘推理延迟降至 0.1ms,推理效率成为新战场

🐦 X 推文动态

📈 热点与趋势

  • DeepSeek CEO泄密电话:约2万H等效卡,优先买NVIDIA,华为950需4换1 - Teortaxes(独立研究者)引用梁文峰(DeepSeek CEO)泄露电话称,DeepSeek当前约2万张H等效卡,大部分为最近1-2月到货。梁表示仍优先买NVIDIA,愿意溢价购买“不合规”卡;华为950超节点可完全替代GB200/GB300但需4:1换卡、软件落后2年。训练下一代模型需5万张GB300或20万张华950。@teortaxesTex | @KonstantinPilz
  • 分析显示DeepSeek招聘暗示管理10万卡集群 - Teortaxes分析DeepSeek招聘“AI Computing Cluster Performance Engineer”要求管理10万卡集群,含超节点,训练导向。与梁文峰公开说的“计算资源仍很小”存在矛盾。@teortaxesTex
  • Demis Hassabis祝贺Kanishka Naranyan任英国AI部长,后者详述AI规划 - Demis Hassabis(DeepMind联合创始人)祝贺Kanishka Naranyan(新上任英国AI部长)任职。Naranyan在推文中列出48小时内行动:与Arm CEO沟通英国AI冠军定位、与AI安全研究院(AISI)讨论留住全球AI安全人才、与工会讨论AI对就业影响。@demishassabis | @KanishkaNarayan

🔧 工具与产品

  • Andrew Ng发布开源agent OpenWorker:交付文档、发Slack、更新日历 - Andrew Ng(AI教育者/Coursera联合创始人)推出OpenWorker,开源agent可完成交付文档、发送Slack消息、更新日历等任务。运行于Mac(Windows即将支持),支持GPT 5.6 Sol、Claude Fable、Gemini 3.6、开源模型(Kimi、GLM、DeepSeek、Inkling)或Ollama本地运行。自带API key,数据不离开本地。@AndrewYNg
  • ChatGPT Sites功能:可构建部署网站到Cloudflare Workers,含SQLite持久化 - Simon Willison(Datasette作者)指出ChatGPT在“Work”模式下可使用Sites功能,从想法到托管网站/应用一步完成,支持静态网站、全栈应用、持久化存储、认证、API连接、即时发布。@simonw | @reach_vb
  • Etched获3亿美元C轮融资,估值103亿美元,建设推理集群生产设施 - Etched(AI推理芯片公司)宣布从Sequoia、a16z、Jane Street、Argo、SK Hynix融资3亿美元,估值103亿。已开设8万平方英尺、10MW设施加速推理集群生产和原型开发。Tri Dao(FlashAttention作者)祝贺称团队在硬件设计和kernel上都表现出色。@Etched | @tri_dao
  • Qwen发布Audio-3.0-TTS:支持内联标签控制、16语言,TTS榜单登顶 - Qwen(阿里通义千问)推出Audio-3.0-TTS,Flash版用于实时交互,Plus版高质量生成。新增细粒度内联标签控制(耳语、愤怒、呼吸、笑声)、自然语言风格控制(“像睡前故事一样慢慢读”)。支持16语言,从嘈杂参考音频也能生成干净输出,单次最长3分钟。@Alibaba_Qwen
  • Qdrant Edge边缘检索延迟0.1ms vs 云上52ms - Qdrant(开源向量数据库)在Vector Space Day SF演示Qdrant Edge,相同检索引擎和API,去除网络跳转后延迟从52ms降至0.1ms。适用于机器人、无人机、可穿戴设备等边缘场景。@qdrant_engine

⚙️ 技术实践

  • Sakana AI发布Fugu-Ultra v1.1:动态编排前沿模型,性能提升7.9点 - Sakana AI(日本AI实验室/集体智能研究)发布Fugu-Ultra v1.1,动态编排最新前沿模型实现性能提升,在ProgramBench和Terminal Bench 2.1上提升显著;即使agent池中没有Fable 5,在复杂编码和推理任务上仍超过Fable 5。价格与v1.0相同。@hardmaru | @SakanaAILabs
  • MiniMax M3在AMD MI355X全栈优化:接近NVIDIA B200性能 - MiniMax(AI公司)发布技术博客,展示M3(428B MSA稀疏MoE多模态基础模型)在AMD MI355X上通过ATOM+ATOMesh全栈优化。核心升级包括EAGLE3推测解码、Page-16 KV Cache实现1M超长上下文、层级FP8量化避免视觉/MoE精度损失、分布式P/D分离架构。@MiniMax_AI | @RyanLeeMiniMax
  • PrimeIntellect在vLLM上实现万亿级agentic RL训练:28 H200节点<5分钟步骤 - vLLM(开源推理引擎)宣布PrimeIntellect的prime-rl 0.6.0在其平台上运行agentic RL训练GLM-5.1(万亿参数MoE),在SWE任务上序列长度131k,使用FP8、宽专家并行、prefill/decode分离、KV cache卸载(原生+Mooncake)和vllm-router,28节点H200每步<5分钟。@vllm_project | @RedHat_AI
  • Poolside AI开源小模型Laguna S,同时公开完整评测数据集 - swyx独立分析指出Poolside AI(编码AI公司)异常开放:不仅发布Laguna S(小模型,编码表现超过Think Machines),还公开了完整评测数据集,含6个公共基准、每个4轮运行、每轮数百轮turn,供独立验证是否rewardhack。@swyx | @latentspacepod
  • Black Forest Labs发布FLUX 3:统一图像视频音频和动作预测,用于机器人 - Emad Mostaque(Stability AI前CEO)转发,Black Forest Labs推出FLUX 3多模态模型,统一生成图像、视频、音频和动作预测。与mimic和Audi合作扩展到机器人动作预测。@EMostaque | @bfl_ai
  • AntLingAGI发布Ling-3.0:混合KDA+MLA注意力,原生256K可扩展1M - AntLingAGI推出Ling-3.0,采用5:1混合KDA(键值微分注意力)+MLA(多头潜在注意力)层。KDA提供细粒度长程记忆控制,1/64专家激活使MoE计算更高效。原生256K上下文,可扩展至1M。@AntLingAGI | @SonglinYang4
  • Weaviate讲解agentic RAG上下文工程:查询增强/检索/记忆/工具/代理五系统 - Weaviate(开源向量数据库)发布视频讲解agentic RAG实质是上下文工程问题。拆解5个子系统:查询增强(翻译模糊多部分输入)、检索(选择分块策略平衡精度和上下文)、记忆(分离短时上下文和长时外部记忆)、工具(清晰描述、schema和正确时机)、代理(决策编排层,放大上游上下文失败)。@weaviate_io

⭐ 精选内容

Google 发布首份 ATLAS 报告,系统定义 AI 经济 | 量化 AI 产业宏观格局的权威框架
Google 发布首份 ATLAS 报告,首次系统定义并量化 AI 经济。报告提出涵盖 AI 投资、部署、就业影响等维度的衡量框架,包含全球 AI 投资规模、行业渗透率、劳动力市场变化等关键数据。这是理解 AI 宏观经济影响的重要参考,为从业者提供产业格局的宏观视角,可用于战略规划和行业沟通。
来源:Google Blog
Poolside 联合创始人深度访谈:Model Factory 系统揭秘,8B 参数模型击败大模型 | Coding Agent 领域的独特工程实践
Poolside 联合创始人 Eiso Kant 在 Latent Space 访谈中深度披露其 Model Factory 系统:70 人团队每月运行 1-2 万次实验,通过流式数据训练、低精度计算、Agent 自动修改训练管线,将模型从预训练到发布压缩至 8 周。最新 Laguna S 模型(118B 总参/8B 激活)以 1/10 参数击败 Thinking Machines 大模型。Eiso 直言 MCP 和传统工具调用“愚蠢”,认为未来 Agent 应直接写脚本。还涉及 5 亿美元融资、开源策略、RL 前移等话题。对 Coding Agent 开发者和模型训练工程师有直接启发,多个反直觉观点值得讨论。
来源:Latent Space
Amazon Bedrock AgentCore 推出静默故障检测功能 | Agent 生产级可观测性的重要实践
Amazon Bedrock AgentCore 推出 insights 功能,解决 AI Agent 生产环境中“仪表盘全绿但用户投诉不断”的静默故障问题。它通过分析 trace 数据,自动发现 11 类行为故障(幻觉、错误动作、指令违反等),聚类排序并给出根因分析,无需预设规则。同时提供用户意图分析和执行洞察,帮助开发者从被动排查转向主动模式发现。对在生产环境中运行 Agent 的团队,这是一份可直接参考的可观测性实践指南。
来源:AWS Blog
Motorway 与 AWS 联合发布 Agent 生产评估蓝图:错误率从 1/8 降至 1/50 | 端到端 Agent 评估流水线的工程标杆
Motorway 与 AWS 合作构建了端到端的 AI Agent 评估流水线,将错误率从 1/8 降至 1/50,检测时间从数小时缩短至数分钟。文章详细介绍了双阶段评估策略(构建时+生产监控)、三层评估框架(工具使用、推理、输出质量)以及五阶段部署流水线(含质量门禁)。配套开源仓库提供可部署蓝图,核心原则(三层框架、pass^k 一致性指标)与云厂商无关。对构建生产级 Agent 评估体系的团队有直接借鉴价值。
来源:AWS Blog
Ethan Mollick 发布 Agent 时代 AI 选型指南 | 一线教授对 ChatGPT 与 Claude Agent 模式的实用对比
Ethan Mollick 的最新 AI 选型指南,聚焦 agent 时代如何选择 ChatGPT 和 Claude 的模型、思考层级及 agent 模式(Work/Cowork)。包含具体场景建议(高 stakes 用最强模型、低 stakes 免费模型即可),以及实际案例演示 agent 如何自动处理邮件、准备演示。对从业者快速理解当前 agent 产品能力边界和选型策略有直接参考价值。
Scale AI 发布专业推理基准 PRBench 法律版:GPT-5 Pro 仅得 0.37 分 | 揭示 LLM 在专业场景的系统性弱点
Scale AI 发布 Professional Reasoning Benchmark (PRBench) 法律版,由 182 位专家设计 1100 道真实专业问题,覆盖 114 个国家。当前最佳模型 GPT-5 Pro 仅得 0.37 分(满分 1),揭示模型在过程透明性、不确定性处理等关键维度存在系统性弱点。该基准填补了 MMLU/GPQA 等学术基准与真实专业应用之间的鸿沟,为 LLM 在金融、法律等高价值场景的落地提供了关键评估工具。
来源:Scale Labs
Google 被曝优先将 TPU 用于 AGI 研究而非出租 | 算力分配策略揭示基础设施格局新动向
Google CEO Sundar Pichai 在 Q2 财报电话会上透露,Google 正在管理其 TPU 加速器集群,优先用于 AGI 研究而非出租给客户。同时,Google 也在增加第三方算力采购以应对 G-Cloud 需求。这一策略揭示了 Google 在算力分配上的内部优先级,对理解 AI 基础设施格局有重要参考价值,与 AMD/Anthropic 合作形成对比——算力争夺正从芯片层面延伸到分配策略层面。
来源:The Register
OpenAI 与 Anthropic 罕见联手,共同警告开源 AI 风险 | 闭源实验室的政策联盟与监管博弈
OpenAI 与 Anthropic 罕见联手,在华盛顿共同警告中国开源大模型的风险,主张加强监管。此举引发关于监管捕获、蒸馏是否构成 IP 盗窃的激烈辩论。文章揭示了闭源实验室与开源社区之间的核心矛盾,以及特朗普政府内部正在制定的 AI 安全标准框架。对关注 AI 政策、竞争格局的从业者具有重要参考价值。
来源:Axios

🎙️ 播客精选

The Biggest Chip Ever Built — Why OpenAI Runs On It | Cerebras CEO Andrew Feldman

📍 来源:The MAD Podcast | ⭐ ⭐⭐⭐⭐⭐ | 🏷️ LLM, Infra, Interview | ⏱️ 01:12:41
Cerebras CEO Andrew Feldman深入探讨AI推理瓶颈,解释为什么推理速度(tokens per second per user)成为关键。他对比GPU、ASIC、SRAM与HBM的差异,指出Agent应用放大延迟问题,并分析快速推理如何重塑RL、推理模型和SaaS。还讨论了Cerebras的晶圆级芯片设计、与TSMC的合作、CUDA护城河以及AI基础设施泡沫。
💡 推荐理由: Cerebras CEO深度访谈,聚焦推理瓶颈、芯片架构、Agent延迟等核心话题,实战经验丰富,观点独到,对AI从业者极具价值。

Inside the Model Factory — Eiso Kant, Poolside AI

📍 来源:Latent Space | ⭐ ⭐⭐⭐⭐⭐ | 🏷️ LLM, Agent, Open Source | ⏱️ 1:54:33
Poolside AI联合创始人Eiso Kant深入探讨了模型工厂(Model Factory)的工程系统,包括每月1-2万次实验、流式数据训练、低精度计算、Agent自动编写代码和评估结果。他分享了从2015年投入1200万美元构建代码语言模型到如今Laguna S模型超越10倍规模对手的经历,强调开源权重和开放研究的重要性,认为100家基础模型公司比5家寡头更好。他还讨论了强化学习将前移到预训练阶段、MCP和传统工具调用“愚蠢”、模型-硬件协同设计、以及从编码Agent到AGI的路径。
💡 推荐理由: 重量级嘉宾深度访谈,Poolside AI联合创始人分享模型工厂、开源策略、Agent技术等前沿话题,对LLM/Agent从业者极具价值。

E245|藏在大模型背后的新闻人:GPT们的回复是这样写出来的

📍 来源:硅谷101 | ⭐ ⭐⭐⭐⭐ | 🏷️ LLM, Product, Interview | ⏱️ 46:00
本期探讨内容工程师(Content Engineer)如何将新闻、编辑等文字工作技能转化为AI对话系统的工程标准。嘉宾分享如何拆解“好内容”、训练AI理解言下之意、处理多轮对话中的语境破碎,以及系统提示词、少样本示例等具体技术。讨论AI谄媚作为产品设计问题、AI商概念,以及文科生在AI时代的职业价值迁移。对LLM产品经理、对话系统开发者有直接启发。
💡 推荐理由: 聚焦内容工程师这一新兴岗位,深入探讨如何将人文素养转化为AI工程标准,嘉宾有实战经验,对LLM产品差异化有独特洞察。未给5分因非重量级嘉宾或重大事件。

Building an Autonomous Delivery Experience with DoorDash Co-Founders Andy Fang and Stanley Tang

📍 来源:No Priors | ⭐ ⭐⭐⭐⭐ | 🏷️ LLM, Agent, Robotics | ⏱️ 49:19
DoorDash联合创始人Andy Fang和Stanley Tang讨论如何将AI和自主技术融入配送服务。核心内容包括:Ask DoorDash自然语言界面(基于LLM)如何改变用户发现餐厅和下单的方式;自主配送机器人Dot在凤凰城运营两年多所解决的硬件和操作挑战;多模态策略(机器人+人工)的重要性;以及“第一和最后100英尺”问题。他们强调AI不是取代而是增强人类配送员,并分享了规模化自主技术的经验。对关注LLM应用、机器人技术和AI产品落地的从业者极具启发。
💡 推荐理由: DoorDash联合创始人深度访谈,分享Ask DoorDash(LLM驱动)和自主配送机器人Dot的实战经验,涉及多模态策略、硬件挑战等,对AI从业者很有价值。未给5分因非纯技术深度讨论。

Surviving the New Economics of a Post-Agentic World

📍 来源:Practical AI | ⭐ ⭐⭐⭐⭐ | 🏷️ Agent, Product, Funding | ⏱️ 35:36
播客讨论了AI Agent大规模部署后对经济、企业和劳动力的深远影响。核心观点包括:数字劳动力变得充裕,Agent管理Agent,企业规模超越人类劳动力限制。节目分析了传统软件经济护城河的侵蚀、资本流动和生产力重新定义。对AI从业者而言,提供了理解Agent技术商业影响和未来趋势的宏观视角,但未深入技术实现细节。
💡 推荐理由: 深度探讨后Agent时代的经济变革,对AI从业者具有前瞻性洞察,但缺乏具体技术细节或独家嘉宾访谈。

📄 今日论文精选

SonicSampler: Unified Tile-Aware Kernels for LLM Sampling and Speculative Verification

Together AI | 🏷️ Inference, Agent Deployment, Architecture
统一 tile-aware Triton 内核垂直融合 LLM 采样管线,含新颖两阶段 top-k 算法,实现 10-16 倍加速,并完全兼容 CUDA Graph,对动态推理服务负载意义重大。

Autonomous Topology Mutation: Safe Runtime Restructuring for Multi-Agent LLM Systems

Huawei | 🏷️ Agent Framework, Multi-Agent, Safety
提出运行时拓扑突变机制,结合三个形式化不变式安全重构多 Agent 团队结构,代码任务成功率从 3.3% 提升至 61.7%,为 Agent 系统弹性伸缩提供新范式。

OpenForgeRL: Train Harness-native Agents in Any Environment

Microsoft Research | 🏷️ Agent Framework, RLHF/DPO, Tool Use
轻量级代理+K8s 编排解耦训练与推理,支持任意 Agent 框架和环境的端到端 RL 训练,在多个 GUI 和工具使用基准上超越更大模型,开源框架有重要工程价值。

🐙 GitHub 热门项目

SonicSampler | 统一 LLM 采样加速内核
Together AI 开源的 Triton 内核套件,垂直融合完整采样管线(logit 处理、token 选择、推测验证),含新颖两阶段 top-k 算法,实现 10-16 倍加速。完全兼容 CUDA Graph,支持动态批量执行,对 LLM 推理部署有直接优化价值。
GitHub | ⭐ 待确认 | 🗣️ Python | 🏷️ Inference, Kernel, LLM
OpenForgeRL | 端到端 Agent RL 训练框架
Microsoft Research 开源框架,通过轻量级代理+K8s 编排实现任意 Agent 框架和环境的端到端 RL 训练。在 ClawEval、OSWorld 等基准上超越更大模型,支持 Codex、OpenClaw 等多种 harness,是 Agent 强化学习训练的基础设施级工具。
GitHub | ⭐ 待确认 | 🗣️ Python | 🏷️ RL, Agent, Training
  • AI
  • 日报
  • 技术趋势
  • 推荐算法日报 - 2026-07-24推荐算法日报 - 2026-07-23
    Loading...