谷歌发布新一代前沿模型 Gemini 4 Argon
主打编码、企业知识工作与网络安全防御的复杂工作流,今日通过 Fairwind 计划向受信任测试者滚动开放。
谷歌 DeepMind 今日发布新一代前沿模型 Gemini 4 Argon,把目标直接对准编码、企业知识工作与网络安全防御这几类复杂工作流。与以往强调通用对话不同,官方这次格外突出它在多步骤、长链路任务中的可靠性,并宣布从今日起通过 Fairwind 计划,先向一批受信任的测试者滚动开放。
在新模型发布前的几个小时内,围绕它的讨论已经铺满社交网络。谷歌 CEO 皮查伊提前放出预告,称 Gemini 4 Argon 在复杂工作流、网络防御与软件工程上达到前沿水平,谷歌内部团队已经在大规模使用;DeepMind CEO 哈萨比斯则强调,公司选择先把模型交给政府与受信任的网络防御者,之后再逐步扩大可用范围。一次发布,同时牵动模型能力、企业落地与安全治理三条线索。
Runway 发布开源权重世界动作模型 Praxis-1
把视频预训练的能力,转化为对真实机器人的控制。
Runway 今日发布 Praxis-1,一个开放权重的世界动作模型,把公司在视频预训练上积累的能力,转化为对真实机器人的控制。官方的核心判断很简单:机器人的演示数据是稀缺的,但视频数据近乎无限。因此,与其堆叠昂贵的机器人采集,不如让策略模型直接从海量视频里学习,再通过轻量微调适配到新的机器人本体上。这被团队视为一次从“生成世界”到“理解并作用于世界”的关键跨越。
Ideogram 4.5 发布:最精准的编辑模型
官方称其消除了多轮编辑中的伪影堆积、像素偏移与色彩漂移,让反复编辑不再越改越糊。新模型已在 Ideogram、API 与多家合作平台上线,开放权重也将很快放出。
Cohere 发布 Embed 5 系列嵌入模型
新系列包含面向前沿能力的 Embed 5 Pro 与主打低延迟的 Embed 5 Fast,官方称之为新的 SOTA 嵌入模型家族。
Meta 提出上下文语言模型 CLM
CLM 把上下文当作可编辑文件而非只追加的对话,在 24 小时多仓库 agent 群任务上,同算力得分提升 65%。
SGLang 把 Qwen3.8-27B 改造成决策模型
团队用 SGLang 原生 /v1/decisions 把 LLM/VLM 变成分类与打分模型,改造后的多模态版本以低于 100ms 的决策速度通关宝可梦火红。
Anthropic 上线开发者站点 claude.dev
新站点汇集 Claude 工程深度文章、Claude Code 与 API 指南、团队经验分享,并藏了一些彩蛋,原文档站继续保留。
Perplexity 开源上下文嵌入模型 pplx-embed-v2
新模型在编码文档片段时保留整篇文档视野,在 ConTEB 与 turbopuffer 的 context-bench 上刷新 SOTA。
“它在复杂工作流、网络防御与软件工程上展现出前沿性能,谷歌内部团队已经在大量使用。” —— 谷歌 CEO 皮查伊
DeepMind 开源 SynthID Bio,给 AI 蛋白打水印
哈萨比斯宣布把 SynthID 引入生物学,为 AI 生成的蛋白质加水印,并以开源工具形式放出,相关成果发表在 Nature。在 AI 与生物技术加速交汇的当下,让机器生成的蛋白质可追溯,被视作一项关键的基础能力。
本地支持 Jev 类决策模型
自主效果营销引擎 Ads
世界界面模型 Solaris
邮件即可派活的 Computer
首届峰会定档 11 月
Argon 先给网络防御者
小企业 AI Agent 使用报告
报告探讨小企业如何用 AI agent 获客、做产品和管理财务,并与 ASBDC 合作提供线下培训。
ChatGPT 推出可分享的主页
Shareable profiles 把用户创建的 Sites 与插件聚合在一起,方便他人查找、复用和展示。
发布 MCP 与 CLI
可把 Claude Code、ChatGPT 或自建 agent 接入 Hedra 的图像、视频与世界模型。
V4.1 Flash:1.3 秒出图
官方称从提示词到出图仅需 1.3 秒,方向确定后可用 V4.1 Pro 以 2048×2048 精修。
推出可被优化改写的模块 Flex
Flex 的实现不是固定提示词而是可被 GEPA 重写的代码,优化器能把任务拆成多个预测器加普通 Python 代码。
让 LLM 直接编辑上下文
放开模型对上下文的管理权限,可获得更好的长程记忆与更省算力的适应能力。
Argon agent 优化数据中心内存
一队 Argon agent 分析全集群性能遥测并自动应用内存优化,落地后释放超 300 TiB 内存。
DeepSeek 内核优化让昇腾可训练
评论者称凭借 DeepSeek 的 kernel 功力,昇腾生态如今已具备端到端训练可行性。
发布 ExplorationBench 基准
该基准衡量 AI 系统的探索能力:能否自己提出假设、设计实验并从结果中学习。
Stripe 收购 OpenRouter
播客讨论收购动因,涉及模型路由、日处理 10T 以上 token 与万亿级 token 经济。