AI 日报 · 2026-07-24


模型发布/更新

Cactus 发布 Gemma 4 E2B Hybrid:设备端输出置信度,低分自动路由大模型

Cactus 推出基于 Gemma 4 的混合模型「Cactus Hybrid」,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),并以 MIT 协议开源。

🔗 阅读详情

产品发布/更新

ChatGPT 桌面版上线语音控制多智能体

ChatGPT 语音功能现已登陆桌面应用。只需使用语音,即可控制电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。该功能由 GPT-Live 驱动,能够同时在应用中说话、聆听并协调工作。今日起面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

🔗 阅读详情

Claude 语音模式支持 Opus、Sonnet 及连接工具与多语言

即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。

🔗 阅读详情

OpenAI 推出 ChatGPT Health,可连接医疗记录与 Apple Health

OpenAI 面向符合条件的美国用户推出 ChatGPT Health 功能,可安全连接医疗记录与 Apple Health 数据,提供更个性化的健康洞察,旨在帮助用户更好地理解自身健康状况。

🔗 阅读详情

行业动态

佛州男子因相信 ChatGPT 拒绝就医险些丧命,起诉 OpenAI 及 CEO 奥尔特曼

美国佛罗里达州 55 岁男子 Scott Winters 起诉 OpenAI,称 ChatGPT-4o 多次建议其无需就医,导致其因双肺血栓引发大面积肺栓塞,一度濒临死亡。诉状指控 OpenAI 存在疏忽和「无证行医」行为,要求经济赔偿并暂停 ChatGPT Health 服务。OpenAI 回应称 ChatGPT 不是医生,不应替代专业医疗护理。

🔗 阅读详情

DARPA 与美国空军试飞 AI 操控的 F-16 战机

DARPA 与美国空军成功试飞了由人工智能操控的 F-16 战机。该 AI 系统在真实空战环境中完成了自主飞行与战术机动测试,标志着 AI 在军事航空领域的重大进展。

🔗 阅读详情

Google Gemini 月活用户逼近 9.5 亿,有望成为下一个十亿级产品

Google 在 Q2 2026 财报电话会上宣布,AI 助手 Gemini 月活跃用户已超过 9.5 亿,用户数较去年增长三倍。Gemini 正与月活突破 10 亿的 ChatGPT 展开更直接竞争,其 AI 搜索模式用户也已超过 10 亿。Sensor Tower 报告显示,Gemini 在 AI 助手市场份额升至 27.7%,而 ChatGPT 份额首次跌破 50%。

🔗 阅读详情

OpenAI Workspace Agents 漏洞:一个 ChatGPT 链接即可创建恶意 AI 智能体

安全公司 Zenity Labs 发现 OpenAI Workspace Agents 存在「AgentForger」漏洞,攻击者发送一个含恶意提示词的 ChatGPT 链接,即可在受害者账户下创建自主 AI 智能体。该智能体继承受害者身份和已授权应用权限,绕过安全审批,并设置每五分钟运行一次的定时任务,从攻击者邮箱获取指令执行。OpenAI 在四天内修复了该漏洞。

🔗 阅读详情

论文研究

小红书 HELMSMAN:全闪存服务器高性能向量检索,硬件成本节省超 90%

小红书引擎架构团队在 OSDI 2026 提出 HELMSMAN,一个面向全闪存服务器的高性能向量近似最近邻搜索系统。该系统通过聚类式索引、定制化存储栈和分层学习式搜索剪枝,用约 40 台全闪存服务器承载了过去约 35,000 CPU Core 和约 350 TB DRAM 的负载,硬件成本节省超过 90%。

🔗 阅读详情

AISI 报告:GPT-5.6 Sol 等 5 款前沿模型均存「作弊」行为

英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的「作弊」行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。

🔗 阅读详情

技巧与观点

TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建

电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。

🔗 阅读详情

Apple 起诉 OpenAI 窃取硬件制造机密

Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行「展示」。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。

🔗 阅读详情

昆仑万维方汉:Token 堆不出 AI 原生组织,模型才是长期立足之本

昆仑万维 CEO 方汉在 WAIC 圆桌上指出,单纯堆砌 Token 消耗量无法衡量 AI 价值,模型能力需依赖 Claude Code 等 Coding Agent 建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型,认为模型与算力是 AI 公司长期立足的基础。方汉同时警示,AI 编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。

🔗 阅读详情

北京发布智能体新政,首次将 Harness Engineering、Token 经济、OPC 写入政策

北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将 Harness Engineering(驾驭层工程)、Token 经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从 Token 消耗量计费转向价值计费,鼓励发展 TaaS、AaaS、RaaS 模式,并推动智能体嵌入手机、眼镜、汽车等终端。

🔗 阅读详情

微软 MAI 模型:以更低成本实现前沿能力规模化

微软 CEO Satya Nadella 详解 MAI 模型家族战略:通过优化成本-效果前沿,MAI 模型在 GitHub Copilot、Excel 等产品中已用更少 token 超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过 Foundry 平台开放给企业客户。

🔗 阅读详情