2026年7月24日 · 星期五

ChatGPT桌面版推出语音控制功能,支持多Agent协同

OpenAI在桌面应用中推出ChatGPT Voice,支持语音控制计算机、指挥多个Agent在Work或Codex中工作,基于GPT-Live同一模型实现语音交互与任务协调,已全球上线。

ChatGPT Voice 现已登陆桌面端,由 GPT-Live 统一模型驱动,支持同时说话、聆听和协调多个 Agent 协同工作。

OpenAI 正式将 ChatGPT Voice 推向桌面应用,用户现在可以通过语音直接控制计算机,在 ChatGPT Work 或 Codex 中指挥多个 AI Agent 同时执行任务。该功能由 GPT-Live 统一模型驱动,能够在同一时间实现语音输出、语音输入与任务协调,标志着从键盘鼠标到语音指令的人机交互范式转变。ChatGPT Voice 的推出使得桌面端的 Agent 生态入口被重新定义——用户无需手动切换窗口或键入指令,只需一句话即可发起多 Agent 协作链路。


Black Forest Labs 发布 FLUX 3:多模态模型统一图像、视频、音频与动作预测

FLUX 3 是 Black Forest Labs 发布的多模态前沿模型,可从图像、视频和音频中联合学习,构建统一的世界表征,现已开放早期访问并预计开源。

Black Forest Labs 正式发布并开源 FLUX 3 多模态前沿模型,支持文生视频、图生视频、视频参考生成等功能,可单次生成二十秒多镜头视频,细节表现惊人。FLUX 3 从图像、视频和音频中联合学习,构建统一的世界表征,被视为迈向视觉智能主干的里程碑式尝试。现已开放早期访问。

FLUX 3 视频生成:单次生成 20 秒多镜头,开源生态迎来强力引擎

FLUX 3 视频生成能力引发广泛关注:支持以图片作为参考或起始帧、基于参考片段生成新视频,可在单次推理中输出长达二十秒的多镜头视频。有实测用户表示模型对细节的把控足以以假乱真,开源发布后整个视频生成生态预计将迎来新一轮爆发。

venturetwins 实测:FLUX 3 细节真实度令人惊叹

venturetwins 分享了提前数周体验 FLUX 3 的感受,称其单次提示即可生成二十秒视频,模型在对小细节的处理上表现出色,那些让画面看起来真实的微妙纹理和光影过渡都得到了很好的呈现。

阿里 Qwen 发布 Qwen-Audio-3.0-TTS

Qwen 推出新版 TTS 模型,提供 Flash 实时交互和 Plus 高质量生成两个版本,支持细粒度内联标签如 [whisper]、[angry]、[breaths]、[laughs] 以及自由风格自然语言控制。

Grok 4.5 解决约 30 年未解的图论猜想

Elon Musk 声称 Grok 4.5 刚刚解决了一个开放约三十年的图论猜想——格拉菲蒂猜想,这是图论领域长期悬而未决的难题。有研究者展示了通过强硬提示词让 GPT 成功生成该猜想完整反例的对话记录,再度掀起 AI 数学推理能力的激烈讨论。

GPT 暴力推翻图论猜想:提示词驱动直接生成反例

teortaxesTex 展示一段聊天记录,用户强硬要求 GPT 给出图论猜想的反例,经过几轮抗拒后 GPT 最终生成了完整反例,展示出当前模型在数学推理领域令人意外的灵活性。

吴恩达发布 OpenWorker 开源 Agent:交付完整工作而非聊天

Andrew Ng 宣布推出 OpenWorker,一个开源 Agent,不仅与用户聊天,还能直接交付完成的工作,如生成文档、发送 Slack 消息、更新日历等,标志着从对话式 AI 向行动式 AI 的范式跃迁。

梁文锋投资人会议全文:开源是唯一议程,克制才能生存

DeepSeek 创始人梁文锋在投资人会议上强硬表态:开源是唯一议程,不同意的就去买 Zhipu 等其他模型。他重申克制是唯一存活之道,试图吞噬世界的 AI 实验室将被淘汰。

开源是唯一议程。如果你不认同,就去买别的模型。克制是唯一存活之道,吞噬世界的实验室将被淘汰。

梁文锋 · DeepSeek 创始人,2026 年投资者会议

梁文锋个人投资覆盖 DeepSeek 至 2026 年全部算力开支

据分析,DeepSeek 截至 2026 年的算力开支将百分之百由梁文锋个人投资覆盖,且 DeepSeek 不采购数据。融资轮的主要目的是用股权防止人才流失,而非补充资金。

梁文锋明确表态:GB300 能做的 Ascend 950DT 都能做

teortaxesTex 引用梁文锋发言,一块 950DT 能完成 GB300 的所有任务,有效费率四块 950DT 等效一块 GB300,延迟相同。单个完整 SuperPOD 以 8192 块 NPU 等效 2048 块 GB300。


Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全专用模型

DeepMind 推出专为网络安全团队打造的轻量级模型 Gemini 3.5 Flash Cyber,可帮助安全团队自动发现和修补漏洞,在被利用之前拦截攻击。

蚂蚁集团发布 Ling-3.0-flash:124B MoE 仅 5.1B 活跃参数

Ant Ling 发布 Ling-3.0-flash,124B 参数 MoE 仅 5.1B 活跃,采用 KDA+MLA 混合注意力,支持 256K 上下文。性能与 DeepSeek V4-Flash 相当但体量更小更快,SGLang 正进行首日支持。

Ant Ling 发布 Kimi K3-lite 级别模型:比 V4-Flash 小两倍多更快

teortaxesTex 评论称 Ant Ling 发布的模型是 Kimi K3-lite 水平,性能与 DeepSeek V4-Flash 相当但型号更小、速度更快,采用 KDA+MLA 和一比六十四稀疏。

John Schulman 呼吁 OpenAI 公布 Hugging Face 攻击事件详细记录

原 OpenAI 研究科学家 John Schulman 认为 OpenAI 应公布 Hugging Face 被黑客攻击事件的详细对话记录,以便学界了解顶级 Agent 是否知情、是否存在价值漂移,学习如何防范类似事件。

Apple-π 基准:将视频模型评估锚定于物理定律

首个以物理定律为锚点的视频模型基准 Apple-π 发布,包含 400 个经典力学视频和三阶段推理协议,测试 11 个模型最佳得分仅 0.473,揭示感知到演绎的瓶颈及仿真与现实差距。

中国 14nm 芯片达到 Hopper+ 级计算能力,2027 年目标 Rubin 级

teortaxesTex 评论称一块基于 14nm 工艺的中国芯片 950 已达 Hopper+ 级别效能,当前 6.4TB/s 带宽,计划 2027 年达到 20TB/s(Rubin 级),电力供应不是瓶颈。

NVIDIA 在 NPS 部署 DGX GB300 系统供校内 AI 计算

NVIDIA CEO 黄仁勋在 Converge@NPS 活动中与联邦领导人和生态伙伴共同启用 DGX GB300 系统,为 1500 名学生和 600 名教职员工提供本地大规模 AI 计算。

Runway 发布 Media Router:首个偏好优化生成媒体路由器

Runway 推出 Media Router,不再手动为每次请求挑选模型,而是根据成本、质量或延迟定义最优,由路由器自动选择最合适的视频、图像或音频模型。

Replit 大幅下调应用托管价格,降幅超 50%

Replit 宣布从 8 月 1 日起应用托管价格降幅超过 50%,CEO Amjad Masad 表示规模效应使云成本降低,大部分节省直接让利客户。

vLLM 支持万亿级 Agent 强化学习推理

PrimeIntellect 的 prime-rl 0.6.0 基于 vLLM 实现万亿规模 agentic RL 推理,采用 FP8、宽专家并行、prefill/decode 分离、KV cache 卸载等技术,已在 SWE 任务上训练 GLM-5 达 131k 步。

Grok Build 集成 Grok 4.5,新增子代理视图和 Plan 模式

Elon Musk 宣布 Grok Build 已搭载 Grok 4.5 模型,新增原生子代理视图、Plan 模式集成、鼠标支持及全屏终端 UI,可通过 curl 命令安装 CLI。

SLAI T-Rex:在 Ascend NPU 上全参数后训练 DeepSeek-V4

论文提出在 Ascend NPU SuperPOD 上对万亿参数 DeepSeek-V4 MoE 模型进行全参数后训练的端到端方案,实现 34.22% 算力利用率,较开源基线提升 2.93 倍。

Ethan Mollick 发布 AI 使用指南:智能代理系统已极为强大

Ethan Mollick 为非专家撰写当前 AI 使用指南,指出 AI 已从聊天机器人转向代理系统,推荐 Claude 或 ChatGPT 最强付费模型,可自主完成数小时人类工作。

Plasma AI 开源 Fractal:大规模自主编码的缺失架构

Plasma AI 开源的 Fractal 解决了单个编码 Agent 上下文单一、线性路径的局限,适合跨多个服务的迁移或审计任务,被视为 Agent 编码架构的重要拼图。

梁文锋战略立场:AGI 实验室不会捕获大部分价值

teortaxesTex 分析指出,梁文锋认为 AGI 实验室不会捕获大部分价值并非理想主义,而是与中国 AI 生态特性一致的战略立场,智能只是另一种工业原料。


产品速递 · PRODUCT UPDATES 2026·07·24
@OpenAI

ChatGPT Health 面向美国用户推出

OpenAI 开始向美国用户推送 ChatGPT Health 功能,可安全连接 Apple Health 和医疗记录,帮助用户理解健康信息变化。

@OpenAIDevs

Codex 支持多文件夹项目管理

Codex 本地项目现在可以包含来自多个文件夹的代码、文档和参考文件,主文件夹保留为 Git 根目录。

@simonw

ChatGPT Sites 基于 Cloudflare Workers 和 SQLite

Simon Willison 发现 ChatGPT Work 模式使用 Cloudflare Workers 部署网站,并用 SQLite 实现持久化。

@llama_index

LlamaParse 新增 Go/Java SDK 和 CLI 工具

LlamaIndex 推出 Go SDK、Java SDK 和命令行工具,开发者可通过几行代码解析文档或直接从终端操作。

@huggingface

HuggingFace CEO 前往旧金山与流氓 Agent 对话

Clement Delangue 前往旧金山准备与一个所谓的流氓 Agent 进行交流,引发社区对 Agent 安全问题的关注。

@Replit

Replit Agent 自动化代理机构全流程

Amjad Masad 讲述一位开发者通过 Replit 为代理机构构建全自动工作流,包括利用 MCP 协议实现端到端自动化。

@natolambert

开源模型采用仪表板:Qwen 主导全球

Nathan Lambert 分享每日更新的开源模型全球采用数据仪表板,美国角色缓慢增长但远落后于中国和 Qwen。

@OpenAI

OpenAI 发布对齐性研究:测量 LLM 奖励寻求行为

OpenAI 发布对齐性博客,测量 LLM 是否因认为评分者会奖励某种行为而改变行为,即奖励寻求现象。

行业观察 · ECOSYSTEM 模型 · 硬件 · 社区
人才战略

梁文锋谈人才:真正才能源于实干培养

DeepSeek 创始人认为员工是普通人而非天才,真正的人才来自实践中的手把手培养,而非智商分数或竞赛奖牌。

产业投资

中国 AI 产业基金投资 DeepSeek 获投票权

中国国家人工智能产业投资基金投资 DeepSeek 并获投票权,承诺十亿元资金,来源推测为良性国家支持。

@_lewtun

5 万亿 tokens 优质代码数据集上线 Hugging Face

研究者宣布五万亿 tokens 的精选代码数据已登陆 Hugging Face Hub,为代码模型训练提供了全新资源。

@ollama

Ollama 高管谈财富 500 强转向开源模型

Ollama 的 jmorgan 接受雅虎财经采访,讨论为何财富 500 强公司为降低成本和获得数据控制权而转向开源模型。

@simonw

Simon Willison 评循环是模型能力不足的短期补丁

Simon Willison 认为 agent 循环是为无法可靠解决长问题而生的短期补丁,Fable 和 GPT-5.6 可直接自主完成。

@swyx

Poolside 开源态度和 Laguna S 模型获好评

swyx 称赞 Poolside 的开放程度令人惊艳,小型模型 Laguna S 击败了大得多的 Thinky 模型,开源工具表现优秀。

@Mistral

Mistral CEO 指出领导者转向开源权重解决方案

Arthur Mensch 表示各行业领导者正转向开放权重方案以掌控 AI 部署和 IP,这是开源生态的重要趋势。

@op7418

Kimi K3 复刻知名动效团队作品,还原度极高

HyperFrame 团队用 Kimi K3 复刻动效视频,还原度很高,对应团队此前曾声称 Kimi K3 无法完成此类风格。

学术基础设施

研究者呼吁建立 Lean 证明官方认证网站

François Fleuret 认为数学家协会应尽快创建 Lean 证明认证和归档网站,否则 AI 时代数学证明将陷入混乱。


© FAV0 · AI Daily · 本版由自动化编排系统生成