TODAYAI DAILY

今日 AI 日报2026-07-24

OpenAI 将 GPT-Live 全双工语音控制引入 Codex 和 ChatGPT 桌面应用;英伟达GPU上月球 | TodayAI

要闻速览/

Breaking News

今天最值得先看的 AI 变化。

OpenAI 将 GPT-Live 全双工语音控制引入 Codex 和 ChatGPT 桌面应用

据 VentureBeat 报道,OpenAI 在推出 GPT-Live 全双工音频模型两周后,将其集成到 ChatGPT 桌面应用(macOS 和 Windows),并与 Codex 和 ChatGPT Work 等智能体系统打通。GPT-Live 能够同时听和说,无需严格的轮流对话,可将复杂推理委托给后台模型如 GPT-5.5。此次更新使软件工程师可以通过自然语音指令编排多线程编码任务、审查拉取请求和调试应用,标志着“免提”软件开发取得进展。OpenAI 最初于 2026 年 7 月 8 日发布 GPT-Live,本次是将该能力扩展至开发工作流。

来源:VentureBeat AI·原文

研究人员提出多模态深度学习框架检测铁路弓网电弧

arXiv 上的一项新研究提出 MultiDeepSAD 框架,用于检测电气化铁路系统中弓网接口的电弧事件。该框架结合高分辨率图像和力测量数据,扩展了 DeepSAD 算法以支持多模态,并引入针对图像和力数据的伪异常生成技术来增强训练。研究团队构建了两个数据集:一个来自瑞士联邦铁路(SBB)的真实数据,另一个来自公开视频和合成力数据。实验表明,该方法能有效区分电弧与其他瞬态现象,有助于防止接触部件加速磨损和系统性能下降。该研究由 Dong、Eleni Chatzi 和 Olga Fink 完成。

来源:arXiv cs.LG·原文

Black Forest Labs 发布 FLUX 3:可生成图像和 20 秒带音频视频,初期仅限早期访问

据 VentureBeat 报道,Black Forest Labs(BFL)发布了 FLUX 3,这是一个多模态前沿模型,联合训练图像、视频和音频生成,并支持机器人视觉和动作。FLUX 3 并非拼接独立模型,而是共享同一底层架构。该模型提供四个产品线:FLUX 3 Video(可选原生音频生成)、FLUX 3 Image、FLUX 3 Action 以及即将开源的 FLUX 3 Dev。FLUX 3 Video 和 FLUX 3 Action 目前通过“Early Access”计划有限开放。这是 BFL 首次公开视频生成模型,公司强调其“视觉智能”愿景,希望企业将创意生成、仿真、计算机使用和机器人视为同一能力的应用。

来源:VentureBeat AI·原文

大公司/

Big Names

主流 AI 公司、平台和芯片厂商动态。

英伟达将 GPU 送上月球,AI 芯片首次进入太空

英伟达正在将 GPU 送往月球,这是人工智能芯片首次进入太空领域。该计划有望为月球基地的 AI 计算基础设施提供支撑,对 NASA 和商业航天任务的实时数据处理与自主操作产生深远影响。此举不仅展示了英伟达在极端环境下的技术布局,也可能催生新一代太空 AI 应用。

来源:TechCrunch AI·原文

Meta 新广告用末日歌曲宣传 AI 乐观主义,被批不当

Meta 发布了一则旨在展现 AI 乐观前景的广告,但背景音乐选用了 David Bowie 的《Five Years》,这首歌讲述的是人类得知只剩五年生命的绝望故事。这一选曲引发广泛批评,被认为与广告主题严重不协调,凸显科技公司在 AI 宣传中缺乏文化敏感性。事件反映了 AI 乐观叙事与公众情绪之间的张力,也提醒企业在品牌沟通中需更加谨慎。

来源:TechCrunch AI·原文

AMD 发布 Helios AI 机架级系统,挑战英伟达

AMD 发布全新 Helios AI 机架级系统,直接对标英伟达的同类产品。该系统专为大规模 AI 训练和推理设计,计划今年晚些时候开始向客户发货。这一举措有望打破英伟达在 AI 加速器市场的主导地位,为数据中心提供更多选择。Helios 的推出也意味着 AMD 在 AI 基础设施领域加大了投入,未来可能影响云计算和企业的采购决策。

来源:TechCrunch AI·原文

OpenAI 向所有美国用户开放 ChatGPT Health 功能

OpenAI 宣布 ChatGPT Health 已面向所有美国用户开放,用户可集成 Apple Health、Function 和 MyFitnessPal 等个人健康数据,获得个性化健康建议。这一功能使 ChatGPT 进入医疗健康领域,提供了更贴近生活的应用场景。然而,健康数据涉及高度隐私,OpenAI 需在功能便利性、数据安全和合规之间取得平衡,以避免潜在的监管风险。

来源:TechCrunch AI·原文

开发者与 Agent/

Developer & Agents

开发者工具、开源项目、API、SDK、Agent 框架和工作流。

HarnessRouter:通过单一 API 集成全球最佳 AI Agent

HarnessRouter 是一个新产品,提供统一的 API 接口,让开发者能够将来自不同来源的最佳 AI 代理集成到自己的应用中。它旨在简化代理编排和调用流程,降低集成多个代理服务的复杂性。适用于需要快速组合多种 AI 功能的场景,如智能助手、自动化工作流等。目前已在 Product Hunt 上架,吸引开发者关注。

来源:Product Hunt AI·原文

基于解释的运行时验证提升 ML 驱动的光网络可靠性

arXiv 最新论文提出一种基于解释的运行时验证方法,用于确保机器学习模型在光网络自动化中的决策可靠性。该方法通过评估模型解释的一致性和物理合理性,在决策执行前识别并拦截不确定的输出,避免错误决策影响服务质量、资源效率和网络稳定性。实验基于光路传输质量分类场景展示了其有效性。对于构建可信的 AI 代理自动化系统,这种验证机制提供了重要参考。

来源:arXiv cs.LG·原文

Fluree AI:为每个 AI Agent 提供可信上下文

Fluree AI 推出新服务,旨在为 AI 代理提供可信的上下文信息。通过该平台,开发者可以确保代理所使用的数据来源可靠、语义一致,从而减少幻觉和错误决策。它可能基于知识图谱或可信数据库技术,为代理的推理提供坚实基础。适用于需要高准确性的企业级 AI 应用,如金融、医疗等领域的自动化。

来源:Product Hunt AI·原文

Screenpipe (YC S26):记录工作过程并转化为 Agent

Screenpipe 是一款本地应用,能录制你的屏幕和音频,赋予 AI 代理可搜索的记忆,使其了解你的工作上下文。创始人 Louis 在 Hacker News 上发布,该项目来自 YC S26。它可帮助自动化重复任务,如生成标准操作流程。所有数据本地存储,保障隐私。对于希望构建个人或团队级自动化代理的开发者,提供了一个实用的基础设施。

来源:Hacker News RSS·原文

LangChain 推出 Eval Engineering Skill:自动生成 Agent 评估任务

LangChain 发布了 Eval Engineering Skill,该工具能自动扫描 Agent 的代码仓库和运行轨迹,结合用户访谈内容生成评估方案,并直接输出可在 Harbor 上执行的评估任务。这大幅降低了手动编写评估用例的工程成本,使开发者能更高效地验证 Agent 行为。通过将评估工程化,LangChain 正在推动 Agent 开发从“手工测试”走向“自动化评估”,有助于提升 Agent 在生产环境中的可靠性和可维护性。

来源:LangChain Blog·原文

研究与模型/

Research & Models

模型、论文、推理、多模态和技术突破。

深度参数化量子电路的双重下降现象

量子机器学习中的核心挑战之一是理解参数化量子电路(PQC)的缩放行为。最新研究显示,随着模型参数增加,基于梯度的PQC在未见数据上的性能可能提升,出现双重下降现象,这与传统认为更大模型会导致泛化能力下降的观点相反。研究通过加一扰动技术和随机矩阵谱性质提供了理论支持,并在多个数据集上通过数值实验验证了该行为。该发现表明,更深层的PQC不一定表现出更差的泛化性能,为量子机器学习提供了谨慎乐观的理由。

来源:arXiv cs.LG·原文

神经网络训练可解性的新复杂性理论边界

尽管神经网络在机器学习中至关重要,但其最优训练的计算复杂度仍未完全明确。最新研究为线性激活和ReLU激活的神经网络训练确定了新的多项式时间可解性上界。对于ReLU网络,该研究证明了所有隐藏神经元出度为1的架构的多项式时间可解性,改进了先前算法。对于线性激活网络,通过满足新数据吞吐条件的架构,首次识别出非平凡的多项式时间可解类。这些结果推动了神经网络可训练性边界的理论发展。

来源:arXiv cs.LG·原文

Muon优化器加速Grokking的关键成分:正交化

Muon优化器在模算术任务上比AdamW更快达到Grokking阈值。通过消融实验发现,加速效果主要来自正交化(Newton-Schulz迭代),而非谱范数约束。正交化使优化器在约3倍低的谱范数下达到泛化,且嵌入更新幅度相当。将Newton-Schulz迭代从5次减至1次可更快达到阈值,但会导致模型解脆弱易崩溃,仅在低学习率下稳定;标准的5次迭代则对学习率更鲁棒。研究还表明谱缩放可被移除而不影响性能。

来源:arXiv cs.LG·原文

融资与商业化/

Funding & Commercialization

AI 融资、并购、估值、商业化、定价和市场竞争。

AI芯片初创公司Etched估值飙升至103亿美元

由三位哈佛辍学生创立的AI芯片初创公司Etched,宣布完成新一轮融资,估值达到103亿美元,吸引了多位知名投资者。Etched推出了新型芯片和内存组件,号称无需GPU即可加速任意AI模型的推理过程。这一估值表明市场对非GPU架构的AI推理硬件需求旺盛,Etched的产品有望为大型模型部署提供更低成本、更高效率的选择。

来源:TechCrunch AI·原文

企业AI基础设施支出增速远超成本可见性

VentureBeat Pulse Research对107家企业的调查显示,AI基础设施支出正在加速增长,但大多数企业缺乏对相关成本的清晰衡量。当前多数企业依赖超大规模云平台和模型API,但下一个投资方向正转向专用计算,多数受访者计划在一年内更换或增加供应商。采购决策更看重集成度和总拥有成本,而非单一代币价格。有趣的是,GPU利用率普遍低于50%,不足半数的企业能严密追踪计算成本,形成了“重投资、弱可见性”的计算缺口。

来源:VentureBeat AI·原文

政策、监管与产业/

Policy, Regulation & Industry

AI 政策、监管、产业落地、公共治理和基础设施变化。

Google 发布 Gemini Live 视觉问答功能,实时识别实物并解答

Google 宣布 Gemini Live 新增视觉问答功能。用户可通过摄像头对准复杂说明书、错误代码或独特物体,AI 能实时识别并给出解释。该功能基于多模态模型,进一步拓展了 AI 助手的实用场景。此举表明 Google 在消费级 AI 交互上持续加码,与苹果、微软等对手争夺日常助手入口。从产业角度看,视觉问答能力将推动客服、维修指导等领域的效率提升,但也引发隐私与滥用担忧。

来源:Google AI Blog·原文

白宫内部辩论如何应对日益强大的中国 AI 模型

据 WIRED 报道,特朗普政府内部正就如何应对中国日益强大的 AI 模型展开辩论。讨论焦点包括扩大出口管制、加强技术封锁,或通过联合盟友进行竞争。这反映出美国对中国 AI 能力快速提升的焦虑,政策层面可能加速出台限制措施。从产业影响看,若管制收紧,中美 AI 供应链、开源生态及人才流动将受冲击,全球 AI 竞争格局可能进一步分化。

来源:WIRED AI·原文

建设者观察/

AI Builders

AI 产品、模型、Agent、开发者工作流和创业判断的一手观察。

Claude官方:语音对话现已支持Opus和Sonnet模型,并可在对话中调用邮箱日历等工具

Claude官方账号宣布,语音对话功能现已能够使用用户聊天中拥有的更多模型,包括Claude Opus和Sonnet。同时,Claude可在对话中途调用已连接的第三方工具,如邮箱和日历。这意味着AI语音助手正从单纯语音问答转向集成多模型与工具调用的智能体形态,对构建端到端自动化工作流的开发者具有直接参考价值。

来源:Follow Builders·原文

Garry Tan(YC CEO):废除并改革CEQA,阻止NIMBY滥用监管阻碍住房建设

Y Combinator CEO Garry Tan呼吁废除并改革加州环境质量法案(CEQA),认为该法案被NIMBY滥用,成为阻挠加州各地住房建设的工具。虽然这条推文直接讨论住房政策,但其底层逻辑对AI创业者同样重要:过度和滥用监管可能扼杀创新与增长,提醒AI创业者需关注政策风险,并主动参与监管设计。

来源:Follow Builders·原文

Matt Turck(风投合伙人):创始人融资时,盈利自举业务比烧钱的AI实验室更受风投青睐

风险投资人Matt Turck观察到,当创始人为一个盈利且自筹资金的业务进行融资时,风投的反应与为新实验室烧掉数亿美元算力的项目形成鲜明对比。这暗示AI创业者应该更加关注商业模式的可持续性,而非盲目押注算力规模;盈利能力和自举能力在当下融资环境中正在成为加分项。

来源:Follow Builders·原文

Madhu Guru:优秀建设者理解AI模型的不规则前沿,优秀领导者理解团队的不规则前沿

Madhu Guru指出,顶尖的AI建设者能够准确把握模型能力的“锯齿前沿”,即了解模型在哪里强、哪里弱;而优秀的领导者则需同样理解团队成员技能与潜力的不规则分布。这一观点提醒AI产品与技术管理者:在快速迭代中,既要精确定位模型能力边界,又要善于识别和发挥每个人才的特色,从而最大化团队效能。

来源:Follow Builders·原文

Aaron Levie(Box CEO):AI对就业负面影响小于预期,自动化特定任务反增需求

Aaron Levie 引述 Anthropic 经济学家研究指出,AI 至今仍需人类操作才能产生价值,大多数职位只能部分自动化而非完全替代。自动化特定任务反而提升整体产出,维持甚至增加对相关岗位的需求,即杰文斯悖论。他以软件工程为例,AI 代理大幅提升代码产出,但开发者仍需管理协调代理,因此软件工程师需求并未下降,反而因新项目可行而增加。这对AI产品设计的启示在于:应聚焦增强人类而非替代,代理工具需保留人工监督与决策环节。

来源:Follow Builders·原文