ChatGPT桌面版推出语音控制功能,支持多Agent协同
OpenAI在桌面应用中推出ChatGPT Voice,支持语音控制计算机、指挥多个Agent在Work或Codex中工作,基于GPT-Live同一模型实现语音交互与任务协调,已全球上线。
OpenAI 正式将 ChatGPT Voice 推向桌面应用,用户现在可以通过语音直接控制计算机,在 ChatGPT Work 或 Codex 中指挥多个 AI Agent 同时执行任务。该功能由 GPT-Live 统一模型驱动,能够在同一时间实现语音输出、语音输入与任务协调,标志着从键盘鼠标到语音指令的人机交互范式转变。ChatGPT Voice 的推出使得桌面端的 Agent 生态入口被重新定义——用户无需手动切换窗口或键入指令,只需一句话即可发起多 Agent 协作链路。
Black Forest Labs 发布 FLUX 3:多模态模型统一图像、视频、音频与动作预测
Black Forest Labs 正式发布并开源 FLUX 3 多模态前沿模型,支持文生视频、图生视频、视频参考生成等功能,可单次生成二十秒多镜头视频,细节表现惊人。FLUX 3 从图像、视频和音频中联合学习,构建统一的世界表征,被视为迈向视觉智能主干的里程碑式尝试。现已开放早期访问。
FLUX 3 视频生成:单次生成 20 秒多镜头,开源生态迎来强力引擎
FLUX 3 视频生成能力引发广泛关注:支持以图片作为参考或起始帧、基于参考片段生成新视频,可在单次推理中输出长达二十秒的多镜头视频。有实测用户表示模型对细节的把控足以以假乱真,开源发布后整个视频生成生态预计将迎来新一轮爆发。
venturetwins 实测:FLUX 3 细节真实度令人惊叹
venturetwins 分享了提前数周体验 FLUX 3 的感受,称其单次提示即可生成二十秒视频,模型在对小细节的处理上表现出色,那些让画面看起来真实的微妙纹理和光影过渡都得到了很好的呈现。
阿里 Qwen 发布 Qwen-Audio-3.0-TTS
Qwen 推出新版 TTS 模型,提供 Flash 实时交互和 Plus 高质量生成两个版本,支持细粒度内联标签如 [whisper]、[angry]、[breaths]、[laughs] 以及自由风格自然语言控制。
Grok 4.5 解决约 30 年未解的图论猜想
Elon Musk 声称 Grok 4.5 刚刚解决了一个开放约三十年的图论猜想——格拉菲蒂猜想,这是图论领域长期悬而未决的难题。有研究者展示了通过强硬提示词让 GPT 成功生成该猜想完整反例的对话记录,再度掀起 AI 数学推理能力的激烈讨论。
GPT 暴力推翻图论猜想:提示词驱动直接生成反例
teortaxesTex 展示一段聊天记录,用户强硬要求 GPT 给出图论猜想的反例,经过几轮抗拒后 GPT 最终生成了完整反例,展示出当前模型在数学推理领域令人意外的灵活性。
吴恩达发布 OpenWorker 开源 Agent:交付完整工作而非聊天
Andrew Ng 宣布推出 OpenWorker,一个开源 Agent,不仅与用户聊天,还能直接交付完成的工作,如生成文档、发送 Slack 消息、更新日历等,标志着从对话式 AI 向行动式 AI 的范式跃迁。
梁文锋投资人会议全文:开源是唯一议程,克制才能生存
DeepSeek 创始人梁文锋在投资人会议上强硬表态:开源是唯一议程,不同意的就去买 Zhipu 等其他模型。他重申克制是唯一存活之道,试图吞噬世界的 AI 实验室将被淘汰。
开源是唯一议程。如果你不认同,就去买别的模型。克制是唯一存活之道,吞噬世界的实验室将被淘汰。
梁文锋 · DeepSeek 创始人,2026 年投资者会议
梁文锋个人投资覆盖 DeepSeek 至 2026 年全部算力开支
据分析,DeepSeek 截至 2026 年的算力开支将百分之百由梁文锋个人投资覆盖,且 DeepSeek 不采购数据。融资轮的主要目的是用股权防止人才流失,而非补充资金。
梁文锋明确表态:GB300 能做的 Ascend 950DT 都能做
teortaxesTex 引用梁文锋发言,一块 950DT 能完成 GB300 的所有任务,有效费率四块 950DT 等效一块 GB300,延迟相同。单个完整 SuperPOD 以 8192 块 NPU 等效 2048 块 GB300。
Google DeepMind 发布 Gemini 3.5 Flash Cyber 安全专用模型
DeepMind 推出专为网络安全团队打造的轻量级模型 Gemini 3.5 Flash Cyber,可帮助安全团队自动发现和修补漏洞,在被利用之前拦截攻击。
蚂蚁集团发布 Ling-3.0-flash:124B MoE 仅 5.1B 活跃参数
Ant Ling 发布 Ling-3.0-flash,124B 参数 MoE 仅 5.1B 活跃,采用 KDA+MLA 混合注意力,支持 256K 上下文。性能与 DeepSeek V4-Flash 相当但体量更小更快,SGLang 正进行首日支持。
Ant Ling 发布 Kimi K3-lite 级别模型:比 V4-Flash 小两倍多更快
teortaxesTex 评论称 Ant Ling 发布的模型是 Kimi K3-lite 水平,性能与 DeepSeek V4-Flash 相当但型号更小、速度更快,采用 KDA+MLA 和一比六十四稀疏。
John Schulman 呼吁 OpenAI 公布 Hugging Face 攻击事件详细记录
原 OpenAI 研究科学家 John Schulman 认为 OpenAI 应公布 Hugging Face 被黑客攻击事件的详细对话记录,以便学界了解顶级 Agent 是否知情、是否存在价值漂移,学习如何防范类似事件。
Apple-π 基准:将视频模型评估锚定于物理定律
首个以物理定律为锚点的视频模型基准 Apple-π 发布,包含 400 个经典力学视频和三阶段推理协议,测试 11 个模型最佳得分仅 0.473,揭示感知到演绎的瓶颈及仿真与现实差距。
中国 14nm 芯片达到 Hopper+ 级计算能力,2027 年目标 Rubin 级
teortaxesTex 评论称一块基于 14nm 工艺的中国芯片 950 已达 Hopper+ 级别效能,当前 6.4TB/s 带宽,计划 2027 年达到 20TB/s(Rubin 级),电力供应不是瓶颈。
NVIDIA 在 NPS 部署 DGX GB300 系统供校内 AI 计算
NVIDIA CEO 黄仁勋在 Converge@NPS 活动中与联邦领导人和生态伙伴共同启用 DGX GB300 系统,为 1500 名学生和 600 名教职员工提供本地大规模 AI 计算。
Runway 发布 Media Router:首个偏好优化生成媒体路由器
Runway 推出 Media Router,不再手动为每次请求挑选模型,而是根据成本、质量或延迟定义最优,由路由器自动选择最合适的视频、图像或音频模型。
Replit 大幅下调应用托管价格,降幅超 50%
Replit 宣布从 8 月 1 日起应用托管价格降幅超过 50%,CEO Amjad Masad 表示规模效应使云成本降低,大部分节省直接让利客户。
vLLM 支持万亿级 Agent 强化学习推理
PrimeIntellect 的 prime-rl 0.6.0 基于 vLLM 实现万亿规模 agentic RL 推理,采用 FP8、宽专家并行、prefill/decode 分离、KV cache 卸载等技术,已在 SWE 任务上训练 GLM-5 达 131k 步。
Grok Build 集成 Grok 4.5,新增子代理视图和 Plan 模式
Elon Musk 宣布 Grok Build 已搭载 Grok 4.5 模型,新增原生子代理视图、Plan 模式集成、鼠标支持及全屏终端 UI,可通过 curl 命令安装 CLI。
SLAI T-Rex:在 Ascend NPU 上全参数后训练 DeepSeek-V4
论文提出在 Ascend NPU SuperPOD 上对万亿参数 DeepSeek-V4 MoE 模型进行全参数后训练的端到端方案,实现 34.22% 算力利用率,较开源基线提升 2.93 倍。
Ethan Mollick 发布 AI 使用指南:智能代理系统已极为强大
Ethan Mollick 为非专家撰写当前 AI 使用指南,指出 AI 已从聊天机器人转向代理系统,推荐 Claude 或 ChatGPT 最强付费模型,可自主完成数小时人类工作。
Plasma AI 开源 Fractal:大规模自主编码的缺失架构
Plasma AI 开源的 Fractal 解决了单个编码 Agent 上下文单一、线性路径的局限,适合跨多个服务的迁移或审计任务,被视为 Agent 编码架构的重要拼图。
梁文锋战略立场:AGI 实验室不会捕获大部分价值
teortaxesTex 分析指出,梁文锋认为 AGI 实验室不会捕获大部分价值并非理想主义,而是与中国 AI 生态特性一致的战略立场,智能只是另一种工业原料。
ChatGPT Health 面向美国用户推出
OpenAI 开始向美国用户推送 ChatGPT Health 功能,可安全连接 Apple Health 和医疗记录,帮助用户理解健康信息变化。
Codex 支持多文件夹项目管理
Codex 本地项目现在可以包含来自多个文件夹的代码、文档和参考文件,主文件夹保留为 Git 根目录。
ChatGPT Sites 基于 Cloudflare Workers 和 SQLite
Simon Willison 发现 ChatGPT Work 模式使用 Cloudflare Workers 部署网站,并用 SQLite 实现持久化。
LlamaParse 新增 Go/Java SDK 和 CLI 工具
LlamaIndex 推出 Go SDK、Java SDK 和命令行工具,开发者可通过几行代码解析文档或直接从终端操作。
HuggingFace CEO 前往旧金山与流氓 Agent 对话
Clement Delangue 前往旧金山准备与一个所谓的流氓 Agent 进行交流,引发社区对 Agent 安全问题的关注。
Replit Agent 自动化代理机构全流程
Amjad Masad 讲述一位开发者通过 Replit 为代理机构构建全自动工作流,包括利用 MCP 协议实现端到端自动化。
开源模型采用仪表板:Qwen 主导全球
Nathan Lambert 分享每日更新的开源模型全球采用数据仪表板,美国角色缓慢增长但远落后于中国和 Qwen。
OpenAI 发布对齐性研究:测量 LLM 奖励寻求行为
OpenAI 发布对齐性博客,测量 LLM 是否因认为评分者会奖励某种行为而改变行为,即奖励寻求现象。
梁文锋谈人才:真正才能源于实干培养
DeepSeek 创始人认为员工是普通人而非天才,真正的人才来自实践中的手把手培养,而非智商分数或竞赛奖牌。
中国 AI 产业基金投资 DeepSeek 获投票权
中国国家人工智能产业投资基金投资 DeepSeek 并获投票权,承诺十亿元资金,来源推测为良性国家支持。
5 万亿 tokens 优质代码数据集上线 Hugging Face
研究者宣布五万亿 tokens 的精选代码数据已登陆 Hugging Face Hub,为代码模型训练提供了全新资源。
Ollama 高管谈财富 500 强转向开源模型
Ollama 的 jmorgan 接受雅虎财经采访,讨论为何财富 500 强公司为降低成本和获得数据控制权而转向开源模型。
Simon Willison 评循环是模型能力不足的短期补丁
Simon Willison 认为 agent 循环是为无法可靠解决长问题而生的短期补丁,Fable 和 GPT-5.6 可直接自主完成。
Poolside 开源态度和 Laguna S 模型获好评
swyx 称赞 Poolside 的开放程度令人惊艳,小型模型 Laguna S 击败了大得多的 Thinky 模型,开源工具表现优秀。
Mistral CEO 指出领导者转向开源权重解决方案
Arthur Mensch 表示各行业领导者正转向开放权重方案以掌控 AI 部署和 IP,这是开源生态的重要趋势。
Kimi K3 复刻知名动效团队作品,还原度极高
HyperFrame 团队用 Kimi K3 复刻动效视频,还原度很高,对应团队此前曾声称 Kimi K3 无法完成此类风格。
研究者呼吁建立 Lean 证明官方认证网站
François Fleuret 认为数学家协会应尽快创建 Lean 证明认证和归档网站,否则 AI 时代数学证明将陷入混乱。