2026年8月25日 · 星期二

Vera Rubin 实测:Agent 每兆瓦吞吐量是 GB300 的 30 倍

NVIDIA 首次公开真实 Agent 负载下的 Vera Rubin 基准:每兆瓦吞吐量最高提升 30 倍,token 成本最多降至三十分之一。

Vera Rubin 实测性能
NVIDIA 首次在硅片上实测 Vera Rubin 运行真实 Agent 工作负载的性能。

NVIDIA 首次在硅片上实测了 Vera Rubin 运行真实 Agent 工作负载的表现。结果显示,相较上一代 GB300 NVL72,每兆瓦吞吐量最高提升 30 倍,单 token 成本最多下降 35 倍。公司强调,Agentic 会话与传统的聊天、摘要负载截然不同:上下文会随会话持续增长,对推理硬件的能效与吞吐提出了全新要求。这一数据首次把「为 Agent 而生的算力」从口号变成可量化的工程指标。

Vera Rubin NVL72 明年 Q4 上轨道

SpaceX 与 Nvidia 合作,把一整套 AI 超算送入太空。

SpaceX 与 Nvidia 合作,设计了一套面向太空环境的 Vera Rubin NVL72 系统,计划于明年第四季度发射入轨,并于 2028 年实现规模化部署。这意味着整套 AI 推理算力第一次被整体打包送上轨道,为在轨训练与近地计算铺路——算力不再只建在数据中心,也开始「上天」。

Sol Engine 让 MiniMax H3 延迟降至 14.93 秒

NVIDIA SANA 团队的 Sol Engine 把生成拆成 4 步低分辨率 H3 草稿加 3 步 LTX 精修,配合 Sol-Attn,将单张 GB200 上 10 秒 768p 视频的延迟从 414 秒压到 14.93 秒——整整快了 27 倍。

Wan3.0 正式发布:一次生成 30 秒视频

简单输入,聪明创作。想象与现实在此相遇。

Wan3.0 生成画面
Wan3.0 已全面可用,发布期提供 30% 折扣。

阿里正式发布 Wan3.0,即日起全面可用。新模型支持文本、图像、音频、视频等多种参考输入,一次生成最长 30 秒的视频,时间一致性更强。发布当天即被 Runway、Pika、fal 等多家平台接入。发布期(8 月 23 日至 9 月 23 日)在阿里云 Model Studio 与 Qwen Cloud 提供 30% 折扣。

小米本地 AI 主机

小米发布本地 AI 主机

搭载自研 O3、O100 与 D100 三颗芯片,支持 120B 与 3B 双模型运行,可切换快慢系统,面向端侧推理场景。

NVIDIA Vera CPU

首颗 Agent CPU Vera 在 SpaceX 部署

NVIDIA 首款为 Agent 设计的 CPU Vera 正在 SpaceX 规模化落地,加速编排、代码执行与数据处理,让 GPU 满负荷、Agent 快行动。

arXiv 开源模型引用统计

中国开源 LLM 引用率升至约 40%

Nathan Lambert 用 Codex 解析 50 万篇论文:2024 年仅 10% 提及中国开源模型,如今约 40% 论文引用中国开源 LLM。

「在捍卫 AI 开放性的战役中,Marin 项目是模型训练开放性的珍贵示范。」

— 吴恩达 · 谈开放研究
Claude 流式渲染

Claude 长回复流式渲染提速约 4 倍

Anthropic 重写流式渲染器,只重绘仍在变化的部分:长答案卡顿减少 9 倍,最差冻结时间缩短 4.5 倍,120Hz MacBook 可稳定 120fps。

Claude MCP 认证

Claude 企业版 MCP 托管认证可用

Team 与企业版管理员可通过身份提供商集中授权 MCP 连接器,工具与数据自动连接,用户无需单独 OAuth。

LDR 世界模型

LDR 世界模型:外推误差降 20 倍

LDR 把潜在状态转移建模为显式运动学积分,在 PhyWorld 上分布内外误差差距缩小 20 倍以上,参数少 26 倍、推理快 143 倍。

小米 0100 芯片拆解

小米神秘芯片 0100 拆解

分析师惊讶于 6nm wafer-on-wafer NPU-DRAM 键合、1.4µm pitch,认为类似 Logic Folding,疑似由台积电代工。

产品 · VOICE

Grok Voice 在 Starlink 大规模服务

马斯克称 Starlink 已大规模使用 Grok Voice 处理客服与销售,展示 AI 语音的规模化落地。

产业 · PARTNERSHIP

Mistral 与 HUMAIN 推进沙特 AI 部署

双方围绕 AI 基础设施、先进模型开发与区域本地化前沿模型展开战略合作。

● 今日快讯 · BRIEFS08·25
● 开源与工具 · OPEN SOURCE08·25
语音

Kotoba 实时语音同传

同时翻译并保留个人音色。

Agent

Grok Build 新增 Browser Use

让 Grok 通过真实浏览器执行任务。

图像

Grok Imagine 新增调色板

新的图像编辑工具,可改变配色等。

基准

ARC-AGI-3 新高 4.58%

Tufa Labs 取得 ARC-AGI-3 新高并开源方案。

模型

Qwen3.8 27B 新增 NVFP4 检查点

FP8 KV cache 搭配 BF16 lm_head 显著改善精度。

论文

McByte 刷新 SportsMOT SOTA

多目标跟踪基准取得新最佳。

产品

Replit Agent 取代 Claude CoWork

更持久、更擅长用代码完成任务。

观点

数据中心禁令对 AI 进步影响小

借推理效率持续提升粗略估算 1GW 容量被禁的实际影响。

学习

Chollet 推荐从零学 LLM

读《Deep Learning with Python》15-16 章,注意力机制讲解极佳。

人事

Sasha Rush 离开 Cursor

知名 NLP 研究者称其为「不可思议的地方」。

观点

GPT-4 曾经惊艳,如今已相对无力

提醒勿轻言 AGI 饱和,模型能力仍在快速提升。

产业

前沿实验室转向垂直 Agent

从模型 API 走向 ChatGPT Health、Claude for Legal 等垂直产品。

RAG

两遍文档处理式 RAG 流行

Codex、Cowork 等 Agent 对文档做两遍处理以解决问题。

模型

Wan 3.0 美学专家参与调优

与美学专家、创意顾问合作,预训练数据更丰富。

视频

Pika 并排对比 WAN 3.0 与 Seedance 2.5

广告生成场景的直观对比。

评测

实测 WAN 3.0:30 秒 1080p 一致性优异

长片段一致性与细节表现突出。

图像

Firefly 推出跨时代提示词包

面向不同时代的提示词工具包。

评测

评测称 Wan 3.0 相比 2.7 是质的飞跃

不是一次大更新,更像全新模型。

● 短讯 · WIRE08·25

© FAV0 · AI Daily