2026年10月2日 · 星期五

谷歌发布 Gemini 4 Argon 前沿模型

DeepMind 新一代前沿模型主打编码、企业知识与复杂工作流,被视为谷歌重返第一梯队的关键一役。

Google DeepMind 正式发布新一代前沿模型 Gemini 4 Argon,把目标直接对准编码、企业知识与复杂工作流三大场景。与过去几代主打通用对话不同,Argon 更强调在真实生产环境中处理长链路任务:从跨文件代码重构,到企业级知识检索,再到多步骤工作流的自动编排。业内普遍把这次发布视为谷歌在大模型竞赛中重新回到第一梯队的关键动作——紧随其后,第三方评测机构 Artificial Analysis 的数据显示,Argon 在智能指数上已与 OpenAI 的 GPT-6 Astra 打平,而每 token 成本仅约为后者的六成。

Claude Code 开放 Mod 自定义能力

Anthropic 宣布 Claude Code 现可被用户以 Mod 方式改写行为与界面。

Anthropic 宣布 Claude Code 现在可以被用户自行改造:只需几行 TypeScript 就能改变它的行为、定制界面,甚至替换成自己的功能。这些 Mod 以插件形式随行分发,用户在 CLI 或桌面端通过 /plugin 即可安装,也可以直接让 Claude 帮你写一个。

Google DeepMind · 生物安全

DeepMind 推出 SynthID Bio 生物水印

全球首次把不可感知的签名直接嵌入蛋白质序列,且不影响其生物功能,为 AI 生成的生物设计加上可溯源标识。

NVIDIA · 推理加速

GPT-6 Astra Ultrafast 在 NVIDIA 上提速 8 倍

NVIDIA 称 GPT-6 Astra Ultrafast 运行在 Blackwell GPU 上,结合针对 OpenAI 模型的持续推理优化,在代码生成、工具调用与交互式应用上最高提速 8 倍。

Perplexity · 决策模型

Perplexity 开源 27B 决策模型与 Decisions API

Perplexity 开源多模态决策模型 pplx-decider-27b,并在新 Decisions API 上以每百万输入 token 4 美分、输出免费的价格提供,官方称后续还会继续降价。

基座 LLM 与现代推理模型的关键差异,不在符号工具调用,而在于从「直觉给出答案」转向「归纳出产生答案的程序」。

— François Chollet

Black Forest Labs 发布 FLUX 3 Image

基于多模态 FLUX 3 主干,擅长多轮编辑,原生支持最高 4K 生成,并可用边界框做精准局部编辑与生成;开放权重版本即将推出。

Runway 发布实时视频操作系统 Continuum

Runway Labs 公布 Project Continuum 早期预览:围绕实时视频界面构建的操作系统研究应用,展示 Portals、视觉思考、响应式视频界面等交互方式。

GLM 5.3 系列上线 Cursor

GLM 5.3 与 GLM 5.3 Flash 已在 Cursor 上线,官方称 GLM 5.3 Max 是 CursorBench 4.0 上得分最高的开放权重模型。

Tavus 发布通过视频图灵测试的模型 Griffin

Tavus 称 Griffin 是首个通过视频图灵测试的模型,48% 与其实时视频对话的人以为对面是真人。

循环扩散 Transformer:小模型超越大模型

在每个去噪步内重复运行共享 Transformer 块来扩展计算,260M 模型在多项文生图基准上超过 6.5 倍大的模型,推理算力低 4.9 倍。

今日要闻 · AI 简报10.02 · 模型与产品
Cloudflare

开源首批自研模型 clef

Cloudflare Workers AI 团队在 Hugging Face 发布 clef 与 clef-flash,采用 Apache 2.0 许可,被称是 Jev 的替代方案。

数据集 · DATASET

9TB 第一视角视频开源发布

eidon.ai 在关停前将 9TB 第一视角视频数据开源到 Hugging Face,用于机器人学习与具身智能研究。

LlamaIndex

推出文档抽取代理 Extract v2.5

面向文档抽取的前沿代理系列,主打成本可控的高质量结构化抽取。

Synthesia

推出交互式 AI 数字人 Sessions

面向实时教练、面试与引导式对话的一组交互式 AI 数字人。

Alibaba · 视频

阿里 Wan3.0 登顶视频生成榜单

Wan3.0 在 Artificial Analysis 新榜单上综合排名第一,官方称生成质量门槛仍在持续提高。

OpenAI

奥特曼:6.1 Sol 增长最快,负载已改善

Sam Altman 称 6.1 Sol 是 OpenAI 增长最快的模型,此前高负载下响应偏慢,现已明显好转。

评测 · BENCHMARK

Gemini 4 Argon 以 60% 成本追平 GPT-6 Astra

Artificial Analysis 数据显示,Argon 在智能指数上与 GPT-6 Astra 持平,而每 token 成本约为后者 60%。

论文 · DISTILLATION

Nemotron 报告:多教师在线策略蒸馏的兼容性

MOPD 中部分教师模型彼此不兼容,学生模型需在自身 rollout 上训练。

强化学习 · RL

多 Harness 强化学习:同一模型跨框架表现差异

同一模型在不同 agent 框架中表现差异明显,提出在 Claude Code、Codex 等真实 harness 内部用 RL 训练开放模型来弥合差距。

论文 · DATA

Adaption 发布 Invent a Dataset 技术报告

从零数据、仅凭一段自然语言描述生成可训练数据集,扩展到 2 万条时多样性优势扩大至 37%。

评测 · AGENT

新评测 cua-speedrun 揭示电脑代理速度差距

统一环境比较 computer-use agent,同分模型速度相差可达 4.4 倍,例如 Astra 与 Kimi K3。

AI 自我组织能力被低估:88 小时解数学难题

Ethan Mollick 撰文称,最被低估的是 AI 的自我组织能力。

他承认此前低估了 AI 的这项能力——这又是「苦涩的教训」的一例。他原以为需要人类像管理者那样为 agent 分工、设计组织结构,但 AI 自己就能学会。真正改变他看法的是「蜂群」:OpenAI 用数千 agent、约 270 万条消息,在 88 小时内解决了 Navier-Stokes 相关问题,而协调结构极简。Meta 的 Muse、OpenAI 的 dots 等个人 agent 也已能接入账户、主动指出用户错误并自行制定计划。

产品与模型 · PRODUCT10.02 · 中区

用 SAM 3.1 + Ideogram 4.5 搭室内设计应用

读取 Zillow 房源照片,用 SAM 3.1 分割、Ideogram 4.5 改装修风格,整套房屋约 1.5 美元,单次编辑仅 0.06 美元。

短讯 · WIRE10.02 · 下半页
© 2026 FAV0 · AI Daily · 今日 AI 圈 · 由版面编辑自动编排