头版头条 · 前沿模型
DeepSeek 发布 V4-Pro,Agent 能力全面升级
同日开源 DeepSeek Harness 智能体框架;V4-Pro 与 V4-Flash 引入弹性推理力度,并原生支持 OpenAI Responses API。
DeepSeek 今日正式发布新一代模型 DeepSeek-V4-Pro,并同步推出 V4-Flash 的弹性推理力度。官方表示,这一代带来显著的 Agent 升级与生产级收益:简单任务可选用低推理档位,日常 Agent 工作流切换至高推理档位,复杂任务则启用最高档位,从而在成本与效果之间取得平衡。
新模型原生支持 OpenAI Responses API,并对智能体编程场景做了针对性优化。SGLang 团队同日宣布对 DeepSeek-V4-Pro-0813 提供 Day 0 支持,并放出 checkpoint 与配套工具仓库。社区普遍认为,相比此前的预览版,正式版在智能体编码能力上又向前迈进了一大步。
配套的开源智能体框架 DeepSeek Harness v0.1 进入开发者预览,采用 MIT 协议,基于 Cordis 元框架构建。发布后一小时左右,其仓库星标数即逼近两万,成为当日开源社区最热门的话题之一。
OpenAI
GPT-5.6 Sol 预览 Ultrafast 模式:最高提速 14 倍
OpenAI 预览了 GPT-5.6 Sol 的 Ultrafast 模式,宣称推理速度最高可达此前的 14 倍。该模式将率先在 OpenAI API 面向部分客户开放,并随算力扩容逐步向更多企业放量。
Google DeepMind
Gemini 3.7 Flash 发布,编码与知识工作更强
Google DeepMind 正式发布 Gemini 3.7 Flash,在编码、知识工作与 Web 开发等任务上显著增强。Sundar Pichai 称,距 3.6 Flash 发布仅三周,新版本在编码与 Agent 任务上再获明显提升。
影像 · 开源
MiniMax 开源日:H3 视频模型与 Music3 音乐模型
通用视频模型 H3 可处理文本、图像、视频与音频;开放权重音乐模型 Music3 定位生产级。
MiniMax 同日发布通用视频模型 H3 与开放权重音乐模型 Music3。H3 可处理文本、图像、视频和音频输入,并与 Magnific 合作举办展示活动;Music3 已本地落地 ComfyUI,团队称将保持开源直至 AGI 到来。
模型 · 基准
Grok 4.6 上架 Perplexity,WANDR 性价比领跑
Grok 4.6 现已在 Perplexity 与 Perplexity Computer 可用。据 WANDR 基准,Grok 4.6 处于性能与效率的帕累托前沿,以低逾 60% 的成本追平 Fable 5 的成绩。
评论
软件自进化,也许是个伪命题
有评论指出,软件自进化可能只会带来更大的混乱。插件要么是一次性用完即弃,要么就需要设计、验证与维护,并非当前模型能力所能自进化。与其押注可自进化的技能,不如等待模型本身的自学习能力更进一步。
我们很快将进入一个新时代:智能体工作的延迟瓶颈,不再是模型推理速度,而是工具调用。
ChatGPT 将能记住电脑上的使用历史
桌面端新增 Computer History,未来交互更个性化,也无需反复解释背景。
Claude Code 桌面端加入自动续跑
新增自动继续复选框,配额重置后可从断点自动接着跑。
Cursor 收购 Firetiger 团队
该团队打造面向生产软件的 Agent,可在上线后持续处理问题,打通从写码到运维的闭环。
一条命令接入 AI Gateway
自动配置 8 款主流编码 harness,汇聚 30 多家提供商 300 多个模型。
云端 Agent 启动提速 3 倍
得益于后台持续准备的构建环境,可承接更长周期任务。
AI 成为媒体娱乐的新计算范式
基于 Vera Rubin 平台,Runway 将 Gen-4.5 实时生成引入创作流程。
Qwen3.8-27B 预发布页上线
主打高智能密度,预计 8 月 14 日发布,近 4000 人已设置提醒。
DeepSeek-V4-Pro-0813 获 Day 0 支持
checkpoint 与 Harness 仓库均已公开,面向智能体编程场景。
Search as Code 成本再降近一成
六月发布的 SaC 本周优化后,性能提升同时单任务成本下降近 10%。
Sakana Chat 大更新,免登录免费
换装 Fugu 与新版 Namazu 日语模型,支持完整代码执行,可直接 vibe-code。
SCoPE 视频扩散位置编码
面向视频扩散 Transformer 的 Sightline-Coordinate 位置编码方法。
GRPO 换异步训练器,提速 2-4 倍
基准测试中,新的 async trainer 比原有实现快约 2 到 4 倍。