Vera Rubin 实测:Agent 每兆瓦吞吐量是 GB300 的 30 倍
NVIDIA 首次公开真实 Agent 负载下的 Vera Rubin 基准:每兆瓦吞吐量最高提升 30 倍,token 成本最多降至三十分之一。
NVIDIA 首次在硅片上实测了 Vera Rubin 运行真实 Agent 工作负载的表现。结果显示,相较上一代 GB300 NVL72,每兆瓦吞吐量最高提升 30 倍,单 token 成本最多下降 35 倍。公司强调,Agentic 会话与传统的聊天、摘要负载截然不同:上下文会随会话持续增长,对推理硬件的能效与吞吐提出了全新要求。这一数据首次把「为 Agent 而生的算力」从口号变成可量化的工程指标。
Vera Rubin NVL72 明年 Q4 上轨道
SpaceX 与 Nvidia 合作,把一整套 AI 超算送入太空。
SpaceX 与 Nvidia 合作,设计了一套面向太空环境的 Vera Rubin NVL72 系统,计划于明年第四季度发射入轨,并于 2028 年实现规模化部署。这意味着整套 AI 推理算力第一次被整体打包送上轨道,为在轨训练与近地计算铺路——算力不再只建在数据中心,也开始「上天」。
Sol Engine 让 MiniMax H3 延迟降至 14.93 秒
NVIDIA SANA 团队的 Sol Engine 把生成拆成 4 步低分辨率 H3 草稿加 3 步 LTX 精修,配合 Sol-Attn,将单张 GB200 上 10 秒 768p 视频的延迟从 414 秒压到 14.93 秒——整整快了 27 倍。
Wan3.0 正式发布:一次生成 30 秒视频
简单输入,聪明创作。想象与现实在此相遇。
阿里正式发布 Wan3.0,即日起全面可用。新模型支持文本、图像、音频、视频等多种参考输入,一次生成最长 30 秒的视频,时间一致性更强。发布当天即被 Runway、Pika、fal 等多家平台接入。发布期(8 月 23 日至 9 月 23 日)在阿里云 Model Studio 与 Qwen Cloud 提供 30% 折扣。

小米发布本地 AI 主机
搭载自研 O3、O100 与 D100 三颗芯片,支持 120B 与 3B 双模型运行,可切换快慢系统,面向端侧推理场景。

首颗 Agent CPU Vera 在 SpaceX 部署
NVIDIA 首款为 Agent 设计的 CPU Vera 正在 SpaceX 规模化落地,加速编排、代码执行与数据处理,让 GPU 满负荷、Agent 快行动。

中国开源 LLM 引用率升至约 40%
Nathan Lambert 用 Codex 解析 50 万篇论文:2024 年仅 10% 提及中国开源模型,如今约 40% 论文引用中国开源 LLM。
「在捍卫 AI 开放性的战役中,Marin 项目是模型训练开放性的珍贵示范。」
— 吴恩达 · 谈开放研究

Claude 长回复流式渲染提速约 4 倍
Anthropic 重写流式渲染器,只重绘仍在变化的部分:长答案卡顿减少 9 倍,最差冻结时间缩短 4.5 倍,120Hz MacBook 可稳定 120fps。

Claude 企业版 MCP 托管认证可用
Team 与企业版管理员可通过身份提供商集中授权 MCP 连接器,工具与数据自动连接,用户无需单独 OAuth。

LDR 世界模型:外推误差降 20 倍
LDR 把潜在状态转移建模为显式运动学积分,在 PhyWorld 上分布内外误差差距缩小 20 倍以上,参数少 26 倍、推理快 143 倍。

小米神秘芯片 0100 拆解
分析师惊讶于 6nm wafer-on-wafer NPU-DRAM 键合、1.4µm pitch,认为类似 Logic Folding,疑似由台积电代工。
Grok Voice 在 Starlink 大规模服务
马斯克称 Starlink 已大规模使用 Grok Voice 处理客服与销售,展示 AI 语音的规模化落地。
Mistral 与 HUMAIN 推进沙特 AI 部署
双方围绕 AI 基础设施、先进模型开发与区域本地化前沿模型展开战略合作。
开源持久化 Agent 框架 Headlong
面向持续思考的自主 Agent 的开源微框架。
Grok Bot 0.18.0 源码遭完整还原
打包未关闭 source maps,Bennett 逆向还原源码并发布非官方重建扩展。
汤森路透基于 Qwen 自研模型
CTO 称自建模型以降低对 Anthropic 的依赖,基座选用阿里 Qwen。
sPTC 投机式工具调用
生成过程中投机执行工具调用,必要时丢弃结果,类似 CPU 推测执行。
GLiNER2.5 架构最大升级
fastino 推出 GLiNER2.5,官方称是 GLiNER 架构迄今最重要更新。
Andrew Gordon Wilson 加入
负责持续学习、合成数据、长程 RL 环境与架构等方向。

WAN 3.0 上线 Runway
支持多参考输入,一次生成视频与音频。

Pika 上线 WAN 3.0
30 秒生成、20 项参考输入,API 价格最高低 35%。

Higgsfield 开源 AI 动画短片
提示词与资产全部公开,并启动百万美元电影节。

Firefly 上线 AI 音乐生成
Generate Music 可为任意时刻添加配乐。

Runway Ruby 转专业交付格式
任意模型输出可转 16-bit EXR、10/12-bit ProRes 与 HEVC。

InfinityEdit 无限视频编辑
轻量点火适配器让视频模型对无限流视频持续应用编辑。

C.Wolf 发布 RL for LLMs 指南
覆盖策略梯度、PPO、GRPO 等,从第一性原理到前沿。
Kotoba 实时语音同传
同时翻译并保留个人音色。
Grok Build 新增 Browser Use
让 Grok 通过真实浏览器执行任务。
Grok Imagine 新增调色板
新的图像编辑工具,可改变配色等。
ARC-AGI-3 新高 4.58%
Tufa Labs 取得 ARC-AGI-3 新高并开源方案。
Qwen3.8 27B 新增 NVFP4 检查点
FP8 KV cache 搭配 BF16 lm_head 显著改善精度。
McByte 刷新 SportsMOT SOTA
多目标跟踪基准取得新最佳。
Replit Agent 取代 Claude CoWork
更持久、更擅长用代码完成任务。
数据中心禁令对 AI 进步影响小
借推理效率持续提升粗略估算 1GW 容量被禁的实际影响。
Chollet 推荐从零学 LLM
读《Deep Learning with Python》15-16 章,注意力机制讲解极佳。
Sasha Rush 离开 Cursor
知名 NLP 研究者称其为「不可思议的地方」。
GPT-4 曾经惊艳,如今已相对无力
提醒勿轻言 AGI 饱和,模型能力仍在快速提升。
前沿实验室转向垂直 Agent
从模型 API 走向 ChatGPT Health、Claude for Legal 等垂直产品。
两遍文档处理式 RAG 流行
Codex、Cowork 等 Agent 对文档做两遍处理以解决问题。
Wan 3.0 美学专家参与调优
与美学专家、创意顾问合作,预训练数据更丰富。
Pika 并排对比 WAN 3.0 与 Seedance 2.5
广告生成场景的直观对比。
实测 WAN 3.0:30 秒 1080p 一致性优异
长片段一致性与细节表现突出。
Firefly 推出跨时代提示词包
面向不同时代的提示词工具包。
评测称 Wan 3.0 相比 2.7 是质的飞跃
不是一次大更新,更像全新模型。