AI 技术日报 - 2026-07-10

今日 AI 领域迎来产品与模型的双重里程碑:OpenAI 发布 ChatGPT Work 超级应用与 GPT-5.6 三模型家族,Sol 在 Agents' Last Exam 上以 53.6 分超越 Claude Fable 5 达 13.1 分,并引入 Programmatic Tool Calling 等关键新特性。与此同时,SpaceXAI 发布 Grok 4.5,专为 Coding/Agent 场景训练,定价仅为 $2/$6 每百万 token,模型竞争从通用能力向 Agent 专用场景进一步分化。Meta 自研 AI 芯片 Iris 将于 9 月量产,算力目标翻倍至 14GW,芯片

推荐算法日报 - 2026-07-09

[LLM推理蒸馏走向精细化]:今日多篇论文聚焦于如何高效地将大模型(LLM/VLM)的推理能力迁移到小模型。从Meta的SCOReD(学生感知的CoT轨迹优化)到PORTS(偏好优化对齐检索器与LLM),核心思路不再是简单的SFT,而是根据学生模型的能力动态裁剪、改写教师轨迹,或利用LLM的perplexity信号作为偏好标签,实现更精准、更高效的蒸馏。; [检索模型的理论基础与表达能力受关注]:学术界开始深入探究检索模型(尤其是Late-Interaction模型)的理论上限。UMass的论文

AI 技术日报 - 2026-07-09

今日 AI 领域迎来多项重磅发布:OpenAI 推出 GPT-Live 全双工语音模型,实现真正自然对话;同时宣布 GPT-5.6 Sol 周四发布,用户使用量已达此前 5 倍。Cursor 与 SpaceXAI 合作训练 Grok 4.5,Cognition 发布 SWE-1.7 达 1000 tok/s。基础设施层面,MCP v2 协议重大变更走向无状态化,Hugging Face 发布 vLLM transformers 建模后端性能追平原生,NVIDIA Nemotron 在 LangChain 基准中以 10 倍低成本达开源最高准确率。Lilian Weng 发表 Harness E

推荐算法日报 - 2026-07-08

生成式推荐进入工业深水区:今日多篇工业论文(快手、阿里、沃尔玛)将生成式推荐从概念验证推向生产部署。核心创新点不再是简单的“用生成替代检索”,而是聚焦于异构内容生成(同时推荐视频和作者)、库存感知(RAG动态改写广告查询)以及多token预测(替代低效的自回归生成),以解决实际业务中的效率与效果平衡问题。; 重排器价值再发现:从“后处理”到“训练信号”:Yandex的论文提出利用重排器(精排模型)的分数来指导召回嵌入的学习,打破了传统“召回-精排”的流水线隔离。这一趋势表明,工业界正试图将精排模

AI 技术日报 - 2026-07-08

今日 AI 领域格局加速重塑:微软被曝在部分应用中用自研 AI 替代 OpenAI/Anthropic,标志产业从依赖外部转向内部自研的战略转向;同时中国 AI 模型在美国企业使用率突破 30%,DeepSeek 等以成本优势持续渗透。技术层面,NVIDIA 发布 Audex 统一音频 LLM 并开源,腾讯推出 295B MoE 开源模型 Hy3 挑战 GLM-5.2,Anthropic 发现 Claude 内部“全局工作空间”可干预推理过程。Agent 生态走向生产级——Google 扩展 Managed Agents 支持后台任务和远程 MCP,Perplexity 与 NVIDIA 合作

AI 技术日报 - 2026-07-07

今日 AI 领域迎来多个里程碑:Anthropic 发现 Claude 内部存在类似意识的全局工作空间 J-space,标志着 LLM 可解释性重大突破;腾讯混元发布 295B MoE 开源模型 Hy3,Mistral 推出数学证明代理 Leanstral 1.5,两大模型均获 SGLang/vLLM 即日支持。同时,Fable 在 GPU 内核生成上创下 18.71X 加速纪录,Netflix 用 decoder-only transformer 端到端生成主页,阿尔伯塔省政府用 Claude 在 20 小时内扫描 4.66 亿行代码修复安全漏洞,AI 正从"能力展示"全面走向"生产级落地"

AI 技术日报 - 2026-07-06

今日 AI 领域聚焦于效率与实用性的双重突破:Mistral 发布 Leanstral 1.5 数学证明模型,以 6B 激活参数在多项数学基准上达到 SOTA,每道题成本仅约 4 美元,标志着开源模型在专业推理领域的重大进展。与此同时,Simon Willison 用 Claude Fable 以 149 美元成本完成 sqlite-utils 4.0 的审查与修复,展示了 AI 编码 Agent 的实际工作流价值。产业层面,GenAI 经济体过去 12 个月创收 1100 亿美元,增速为移动/互联网浪潮的三倍,印证了 AI 商业化的强劲势头。此外,X 官方发布 XMCP 服务器,为社交平台

AI 技术日报 - 2026-07-05

今日 AI 领域迎来多个重要动态:OpenAI 提议向美国政府捐赠 5% 股权,探索 AI 公司与国家资本关系的新模式;Anthropic 发布 Claude Science Workbench 并宣布亲自开发药物,AI for Science 战略全面升级。同时,研究揭示 RL 后训练改进高度集中于 Transformer 中间少数层,为优化训练策略提供了反直觉发现;Snowflake 发布 Cortex Sense 解决企业 Agent 因缺乏语义视图而查询失败的核心痛点。开源生态方面,开源 AI 差距地图 v0.1 发布,系统索引 421 个项目;MCP 服务器生态虽近 2 万注册量但噪

推荐算法日报 - 2026-07-04

LLM 驱动的个性化与可解释性:今日多篇论文聚焦于利用 LLM 提升推荐系统的个性化和可解释性。Bi-NAS 通过 NAS 搜索最优的 LLM 提示结构,CoPersona 则利用图协同信号补全稀疏用户画像,两者都旨在解决用户历史稀疏问题,提升 LLM 在推荐场景下的鲁棒性和解释质量。; 从静态检索到动态规划:传统推荐召回阶段多采用静态打分,而 `Planning over Matrix-Factorization MDPs` 一文将其建模为马尔可夫决策过程,通过单步前瞻即可显著提升召回效果。这

AI 技术日报 - 2026-07-04

今日 AI 领域聚焦效率革命与 Agent 工程深化:vLLM 团队将 Qwen3-Omni 实时语音推理延迟降至 0.6s、吞吐提升 5.4 倍,标志多模态推理走向实用;Anthropic 与三星洽谈定制 AI 芯片,AI 巨头加速硬件自研;NVIDIA 推出 GPU 收入分成计划,降低初创公司算力门槛。同时,ZCode 以免费策略挑战 Cursor 和 Claude Code,Adobe 展示 'Agentic Site' 概念,预示 Agent 驱动 Web 体验的新范式。学术界方面,蚂蚁集团发布 Vera 框架系统性测试 LLM Agent 安全,Microsoft 推出首个 Offi

推荐算法日报 - 2026-07-03

LLM 深度赋能召回与检索:今日多篇论文将大语言模型(LLM)应用于推荐系统的召回阶段,超越了传统的语义匹配。Meta 利用 LLM 聚类生成硬负样本,Baidu 则用 LLM 构建用户画像并优化记忆检索,Amazon 则通过词汇迁移解决现代编码器在稀疏检索中的“词汇鸿沟”问题。这表明 LLM 正从特征提取向核心检索逻辑演进。; 生成式重排与推理加速成为焦点:以 Diffusion-GR2 为代表的生成式重排器,通过链式推理(CoT)提升排序精度,但其自回归解码速度是部署瓶颈。将扩散模型与知识蒸

AI 技术日报 - 2026-07-03

今日 AI 领域迎来多项重要发布:Apple 在 Safari 中推出官方 MCP Server,成为主流浏览器首次原生支持 MCP 协议,标志着生态从开发者工具向消费级应用扩展。字节跳动发布 Seed2.0 模型系列,聚焦长尾知识与复杂指令跟随,服务数亿用户。NVIDIA 开源 Nemotron-Labs-TwoTower 扩散 LLM 架构,实现 2.42 倍吞吐量。同时,苹果研究挑战多 Agent 主流设计,发现自组织团队表现反而不如单一 Agent,为 Agent 团队设计提供反直觉指导。Palo Alto Networks 揭示“Phantom Squatting”新威胁——LLM

1
...
34567
...
20