头版头条 · COVER STORY
OpenAI 上线 GPT-6.1 Sol Ultrafast
Ultrafast 今日在 API、Codex 与 ChatGPT Work 同步上线,速度最高达 Sol 标准版的 8 倍,智能水平接近 Astra。
OpenAI 正式把「快」做成了新一代产品的默认值。GPT-6.1 Sol 的 Ultrafast 版本今天在 API、Codex 与 ChatGPT Work 三个入口同步放出,官方给出的核心卖点只有一句:以最多八倍于 Sol 标准版的速度,提供接近 Astra 的智能水平,让「想到即所得」的构建体验成为可能。
从今天起,开发者可以在同样的调用里获得更低的等待延迟,而不必为速度牺牲推理质量。对正在卷 Agent 工作流与实时交互的团队而言,这意味着把「等模型回话」从关键路径上拿掉——创意一旦冒出,代码与文本几乎同时跟上。这是继上月 Sol 以五分之一价格逼近 Astra 之后,OpenAI 在「性价比」赛道上的又一步提速。
谷歌发布 Gemini 通用工作 Agent
在 Gemini at Work 大会上,Google Cloud 推出单一通用工作 Agent,可调用企业业务上下文,回答问题、处理知识工作并生成内容。
产业 · INDUSTRY
Anthropic 向 Genesis 计划投 1.5 亿美元
三年内投入 1.5 亿美元支持联邦 Genesis Mission,用 AI 加速科学与技术发现,并向 15 个以上联邦机构提供 Claude 模型与技术支持。
产品 · PRODUCT
Claude Max 与 Team 新增月度 API 额度
Max 5x 每月 100 美元、Max 20x 200 美元,Team 最高共享 500 美元,可用于 Claude API、Playground、Managed Agents 与 Agent SDK。
2023—2026 年多数 AI 进展指标贴合指数曲线,同期 AI 资本开支增速仍在加快——把 AI 视作以投资为输入的系统,值得警惕。
— François Chollet
图像 · IMAGE
Midjourney 测试图像生成思考模式
Alpha 网站上线 thinking mode 测试,官方称可提升提示词准确度、排版与一致性,并邀请用户试用反馈。
产品 · PRODUCT
Sonnet 5.5 缓存读取价格减半
Claude Platform 缓存读取降至每百万 token 0.10 美元,Agent 类工作负载成本约降 20%,仅限 API、不影响 Claude Code 额度。
Claude 参与绘制首张紫外全天图
天体物理学家与 Claude Science 合作完成第一张完整紫外天图,处理了此前从未在紫外波段观测过的大片天区。
谷歌发布 EmbeddingGemma 2 端侧嵌入模型
新一代开源多模态嵌入模型,主打端侧效率,支持代码、图像、视频、音频与文本。
vLLM v0.31.0 发布,适配 DeepSeek-V4.1-Flash
717 次提交、307 位贡献者,新增 FlashMLA 大注意力、NVFP4 KV 缓存、DeepGEMM 稀疏 MQA 与 vllm preload 快速重启。
谷歌 AMIE 完成首个临床对话诊断研究
《柳叶刀》发表与 BIDMC 合作的前瞻研究,AMIE 作为患者可对话的研究系统,在真实急诊场景中测试诊前问诊。
vLLM 发布全模态统一服务运行时报告
技术报告介绍 vLLM-Omni,统一承载语音助手、视觉生成、世界模型与机器人闭环等全模态生成负载。
Meta 发布 RoboJEPA 机器人世界模型
JEPA 预测器从 22M 扩到 8B 参数、覆盖 12 种机器人本体;潜 rollout 误差随算力呈幂律下降,并可预测下游规划表现。
争议 · DEBATE
人类数学协会批评 OpenAI 数学成果发布
OpenAI 一次性发布 700 多份高难数学问题手稿,AHM 认为其绕过科研规范,是展示权力而非推进数学。批评指出,数学家并未要求这项工作,一次性倾倒数百份文件更像一次权威展示,而非可复现的学术贡献。
安全 · SAFETY
Neel Nanda 质疑 OpenAI 解雇安全研究员
他认为三名安全研究员同期被解雇的理由难以接受,若事实无误,OpenAI 的做法无法合理化。
论文提出 Agent 可塑性度量
衡量智能体把经验沉淀为工具、技能与记忆并迁移到留出环境的效率,前沿模型学习曲线差异显著,训练内收益外推有限。
Iris-3B:无 VAE 的像素空间文生图模型
3B 参数从零预训练,走 256→512→1024 课程直接生成像素,权重与代码以 Apache 2.0 开源。
JAX-Lean 转译器可形式验证 ML 代码
Sasha Rush 构建 JAX 到 Lean 的转译器,可证明张量谜题解与规范一致;目前假设实数,不处理浮点与 GPU 底层。
微软开源跨平台沙箱库 mxc
支持 Windows、macOS 与 Linux,底层分别调用 processcontainer、bubblewrap 与 seatbelt,为 Agent 等场景提供分层隔离。
TermGrade 开源终端 Agent 强化学习环境
面向终端 Agent 的高质量 RL 环境与全部轨迹(含 1.4 万条失败记录)及训练切分一起开源。
最大 Agentic LLM 推理数据集发布
206B tokens、12,002 个会话、1,186,582 次 LLM 请求与 1,213,347 次工具调用。
NVIDIA 发布 Long-WAM 世界动作模型
将上下文从 0 秒扩展到 19.2 秒,RoboCasa GR-1 上成功率从 63.3% 提升到 78.7%。
Workhorse 让人形机器人学会全身操作
Unitree G1 仅凭自身相机与本体感受,从真人示范中学习,完成用手和踢腿分拣箱子、接住抛来的箱子与爬过手提箱。
Emllick:真 Agent 时代缺少生产力 RCT
他指出自去年真 Agent 出现以来,类似早期聊天机器人 RCT 的严格研究明显缺失,可能低估了大效应。