前沿模型 · FRONTIER MODEL
谷歌发布 Gemini 4 Argon 前沿模型
DeepMind 新一代前沿模型主打编码、企业知识与复杂工作流,被视为谷歌重返第一梯队的关键一役。
Google DeepMind 正式发布新一代前沿模型 Gemini 4 Argon,把目标直接对准编码、企业知识与复杂工作流三大场景。与过去几代主打通用对话不同,Argon 更强调在真实生产环境中处理长链路任务:从跨文件代码重构,到企业级知识检索,再到多步骤工作流的自动编排。业内普遍把这次发布视为谷歌在大模型竞赛中重新回到第一梯队的关键动作——紧随其后,第三方评测机构 Artificial Analysis 的数据显示,Argon 在智能指数上已与 OpenAI 的 GPT-6 Astra 打平,而每 token 成本仅约为后者的六成。
开发工具 · DEVELOPER TOOLS
Claude Code 开放 Mod 自定义能力
Anthropic 宣布 Claude Code 现在可以被用户自行改造:只需几行 TypeScript 就能改变它的行为、定制界面,甚至替换成自己的功能。这些 Mod 以插件形式随行分发,用户在 CLI 或桌面端通过 /plugin 即可安装,也可以直接让 Claude 帮你写一个。
DeepMind 推出 SynthID Bio 生物水印
全球首次把不可感知的签名直接嵌入蛋白质序列,且不影响其生物功能,为 AI 生成的生物设计加上可溯源标识。
GPT-6 Astra Ultrafast 在 NVIDIA 上提速 8 倍
NVIDIA 称 GPT-6 Astra Ultrafast 运行在 Blackwell GPU 上,结合针对 OpenAI 模型的持续推理优化,在代码生成、工具调用与交互式应用上最高提速 8 倍。
Perplexity 开源 27B 决策模型与 Decisions API
Perplexity 开源多模态决策模型 pplx-decider-27b,并在新 Decisions API 上以每百万输入 token 4 美分、输出免费的价格提供,官方称后续还会继续降价。
基座 LLM 与现代推理模型的关键差异,不在符号工具调用,而在于从「直觉给出答案」转向「归纳出产生答案的程序」。
— François Chollet
图像生成 · IMAGE
Black Forest Labs 发布 FLUX 3 Image
基于多模态 FLUX 3 主干,擅长多轮编辑,原生支持最高 4K 生成,并可用边界框做精准局部编辑与生成;开放权重版本即将推出。
操作系统 · RESEARCH APP
Runway 发布实时视频操作系统 Continuum
Runway Labs 公布 Project Continuum 早期预览:围绕实时视频界面构建的操作系统研究应用,展示 Portals、视觉思考、响应式视频界面等交互方式。
代码助手 · CURSOR
GLM 5.3 系列上线 Cursor
GLM 5.3 与 GLM 5.3 Flash 已在 Cursor 上线,官方称 GLM 5.3 Max 是 CursorBench 4.0 上得分最高的开放权重模型。
视频生成 · VIDEO
Tavus 发布通过视频图灵测试的模型 Griffin
Tavus 称 Griffin 是首个通过视频图灵测试的模型,48% 与其实时视频对话的人以为对面是真人。
论文 · PAPER
循环扩散 Transformer:小模型超越大模型
在每个去噪步内重复运行共享 Transformer 块来扩展计算,260M 模型在多项文生图基准上超过 6.5 倍大的模型,推理算力低 4.9 倍。
开源首批自研模型 clef
Cloudflare Workers AI 团队在 Hugging Face 发布 clef 与 clef-flash,采用 Apache 2.0 许可,被称是 Jev 的替代方案。
9TB 第一视角视频开源发布
eidon.ai 在关停前将 9TB 第一视角视频数据开源到 Hugging Face,用于机器人学习与具身智能研究。
推出文档抽取代理 Extract v2.5
面向文档抽取的前沿代理系列,主打成本可控的高质量结构化抽取。
推出交互式 AI 数字人 Sessions
面向实时教练、面试与引导式对话的一组交互式 AI 数字人。
阿里 Wan3.0 登顶视频生成榜单
Wan3.0 在 Artificial Analysis 新榜单上综合排名第一,官方称生成质量门槛仍在持续提高。
奥特曼:6.1 Sol 增长最快,负载已改善
Sam Altman 称 6.1 Sol 是 OpenAI 增长最快的模型,此前高负载下响应偏慢,现已明显好转。
Gemini 4 Argon 以 60% 成本追平 GPT-6 Astra
Artificial Analysis 数据显示,Argon 在智能指数上与 GPT-6 Astra 持平,而每 token 成本约为后者 60%。
Nemotron 报告:多教师在线策略蒸馏的兼容性
MOPD 中部分教师模型彼此不兼容,学生模型需在自身 rollout 上训练。
多 Harness 强化学习:同一模型跨框架表现差异
同一模型在不同 agent 框架中表现差异明显,提出在 Claude Code、Codex 等真实 harness 内部用 RL 训练开放模型来弥合差距。
Adaption 发布 Invent a Dataset 技术报告
从零数据、仅凭一段自然语言描述生成可训练数据集,扩展到 2 万条时多样性优势扩大至 37%。
新评测 cua-speedrun 揭示电脑代理速度差距
统一环境比较 computer-use agent,同分模型速度相差可达 4.4 倍,例如 Astra 与 Kimi K3。
评论 · COMMENTARY
AI 自我组织能力被低估:88 小时解数学难题
Ethan Mollick 撰文称,最被低估的是 AI 的自我组织能力。
他承认此前低估了 AI 的这项能力——这又是「苦涩的教训」的一例。他原以为需要人类像管理者那样为 agent 分工、设计组织结构,但 AI 自己就能学会。真正改变他看法的是「蜂群」:OpenAI 用数千 agent、约 270 万条消息,在 88 小时内解决了 Navier-Stokes 相关问题,而协调结构极简。Meta 的 Muse、OpenAI 的 dots 等个人 agent 也已能接入账户、主动指出用户错误并自行制定计划。
H3 助 Utopai X 登视频榜第二
文生视频榜单首次登场即排名第二,仅次于 Wan 3.0。
JEV-27B-VL 开放权重多模态决策模型
号称首个开放权重、接近 SOTA 的多模态决策模型。
HuggingChat 接入 MCP 与模型自动选择
新增 ML Intern 与 Omni 模式,可按请求自动挑选开源模型,并支持通过 MCP 接入数据。
Computer 支持对话内交互图表
对话线程内直接生成交互式图表,金融数据采用 TradingView Lightweight Charts。
Ideogram 4.5 上线 ComfyUI
修复漂移的编辑模型,多轮编辑保持图像其余部分不变。
Rauch:未来属于验证工程
Vercel CEO 认为 agent 承担编码后,验证工程将成为核心,测试分为确定性与 agent 式两类。
Hardmaru:AI 的未来属于编排者
下一阶段未必是更大的模型,而在于像鱼群一样协作的编排能力。
AC2:把信用分配给动作块的 Actor-Critic
由 critic 为块末状态打分,使策略无需终端奖励即可更新。
应用 · SHOWCASE
用 SAM 3.1 + Ideogram 4.5 搭室内设计应用
读取 Zillow 房源照片,用 SAM 3.1 分割、Ideogram 4.5 改装修风格,整套房屋约 1.5 美元,单次编辑仅 0.06 美元。
无随机性的 Reinforce 入门
以离散随机变量讲解期望方差,再引入蒙特卡洛估计与降方差方法。
arXiv 因投稿激增限制作者投稿量
AI 领域首当其冲。
AI 安全运动:大帐篷还是小帐篷
梳理存在风险是否真实而迫近、聚焦长期主义能否带来更好政策的分歧。
Gemini 4 输出扩展到 100 万 token
此前百万级只指输入上下文,多数模型输出上限为 64K。
Grok Bot 增强软件构建与协作
可把编码任务转交 Cursor、通过 GitHub 管理 PR。
Grok 百科发布 v0.3 版本
条目由读者提议、对照来源核查并经 Grok 审核。
提供 200 美元 Pro 编码套餐
类似 OpenAI 的 Pro 套餐,无 5 小时、周或速率限制,额度用完即止。