Claude 四项能力转正,智能体开始接管没有 API 的软件
Computer use、浏览器工具、Skills API 与 Files API 正式 GA,Claude 现在可以直接在真实应用里点按、填表、读写文件。
Anthropic 本周把四项长期处于预览的能力推向正式可用。Computer use 让 Claude 直接操控电脑界面,浏览器工具让它在真实网页上完成搜索、点击与提交,Skills API 让团队把可版本化的技能封装给智能体调用,Files API 则让文件在会话之间可复用。官方强调,这四件事共同瞄准一个长期被忽视的盲区:大量企业软件与遗留系统根本没有开放接口,智能体过去只能望而却步。如今,Claude Managed Agents 可以基于版本化技能与可复用文件构建,每项任务的往返次数随之下降,自动化终于能落进那些最难啃的后台流程。
Codex 开源 harness:把智能体嵌进团队已有工具
OpenAI 发布「Codex as a platform」:开源 Codex harness 支持将智能体嵌入团队现有工具,而不是逼你迁移到通用编程助手。它负责管理上下文、调用工具、执行审批等 agent 循环,应用仍掌控界面、工具与操作边界。博客展示了 Codex app-server 与 SDK 等开放组件,并举出安全分析、支持工单、任务板等落地场景。在 ARC-AGI-3 测试中,保留推理与上下文压缩把 GPT-5.6 Sol 的得分从 13.3% 提升到 38% 以上。
Gemini 3.7 Flash 登顶 ARC-AGI:84.6%、每任务 0.25 美元
ARC Prize 公布 Google Gemini 3.7 Flash 的已验证成绩:ARC-AGI-2 得分 84.6%(每任务 0.25 美元),ARC-AGI-1 得分 95.5%(每任务 0.12 美元)。与上一代相比,抽象推理能力与性价比同步跃升——flash 级模型开始逼近高价旗舰的水平,价格却低了一个量级,这可能是本周最值得注意的性价比信号之一。
AI 真正的网络安全风险,不是模型本身,而是攻防双方在权力、能力与资源上的不对称。
Clement Delangue · Hugging Face 联合创始人
Claude Code 新增「简洁」输出风格
Claude Code 现在可以在 /config 中把输出风格设为 Concise:先给结果、回复更短,需要完整细节时再展开。也可以在 settings.json 里设置 "outputStyle": "Concise"。这条小更新在发布当天就获得了超过 250 万次浏览。
Replit 免费模式上线,由 GPT-5.6 Luna 驱动
Replit 推出 Free Mode,把 OpenAI GPT-5.6 Luna 接入免费层,主打「最大化产出、最小化成本」。官方称这让智能的获取成本前所未有地低,配合 Codex 负责背后的 git 管理与 CI,vibe coding 的门槛进一步下探。
Muse Spark 1.2:从视觉到代码,再到物理动作
Meta 预告新多模态模型支持把视觉直接转成可运行代码,并把感知转成物理动作。
Muse Spark 1.2 覆盖广泛的多模态任务:既能「把视觉变成能用的代码」,也能「把感知翻译成物理动作」,并为真实企业场景中常见的视频密集工作流带来更强的音视频理解能力。Meta 同时预告了内部评估框架 WildArtifactBench,用胜率与 Elo 分数而非严格的标准答案来评估智能体在复杂真实任务上的表现。
Pika 推出音频模型家族,音乐低至每分钟 0.015 美元
Pika 一次性发布音乐(Pika Music)、音效(SFX)、语音(Speech)与视频配乐(Soundtrack)四类音频模型,统一通过 Pika API 调用。其中音乐模型成本低至每分钟 0.015 美元,号称比同类便宜最多 10 倍,并支持叠加多种输入来精确控制生成结果。
fx:6.3MB、启动 10 微秒的极简编码代理
Guillermo Rauch 展示了用 Zig 编写的命令行编码代理 fx:体积仅 6.3MB,启动约 10 微秒,可编译为静态 ELF 二进制或更小的 libfx.wasm。他以此断言:AI 将推动基础设施走向原生优化,fx 完成任务的速度可以比其他代理启动还快。
Codex 不止写代码:税务试办处理 7000 份申报
gdb 透露,一个基于 Codex 开源 harness 的报税试办项目处理了 7,000 份申报表,准备时间缩短约三分之一。开发者可以直接在这个开源 harness 上搭建自己的产品,而不必局限于编程工具。
Grok Build 换装 Grok 4.6,新增子代理视图
Grok Build 现已由新模型 Grok 4.6 驱动,新增原生子代理视图、Plan Mode 集成、鼠标支持及全屏终端 UI。可通过 curl 安装脚本一键部署,把终端里的 agentic 编码体验进一步做厚。
Qwen3.8-27B cookbook 加入 DFlash2 配方
SGLang 把 DFlash2 配方加入 Qwen3.8-27B cookbook:该稠密混合 GDN 视觉语言模型支持 BF16/FP8/NVFP4 W4A4 检查点与内置 MTP,可在 H200、RTX PRO 6000、RTX 5090 及 DGX Spark 上单卡运行,社区反馈 NVFP4 + DFlash2 效果不错。
ChatGPT Work 与 Codex 接入 1000 亿级网页检索
OpenAI 上线 ExaAILabs 插件,让 ChatGPT Work 和 Codex 可以访问 100B+ 网站、论文与文档。对做深度调研与长程任务的智能体而言,检索口径一下子被拉宽。
Ornith-1.5 上线 vLLM,MIT 许可、9B 到 397B
自称自我改进的模型家族,编码与 agentic 任务在开源模型中居前,`vllm serve` 一行即可拉起。
Google 发布视觉语言模型 TIPS
主打空间感知,面向稠密视觉理解任务,已上线 Hugging Face。
GPT-Image-2 支持透明背景
API 预览版可生成可复用素材,用于商品图、平面设计与营销物料。
Claude Managed Agents 联手 AG-UI
新 cookbook 将托管智能体与 CopilotKit 的开放 Agent-User Interaction Protocol 结合,驱动多种界面。
NeMo Switchyard:给 agent 工作流做模型路由
开发者可依据自己的质量、延迟与成本标准,在模型池中为每个步骤选择合适模型。
Computer History 进入欧洲三国
EEA、英国与瑞士的 ChatGPT Pro/Business/Enterprise 用户可在 Mac 上使用,跨应用记忆让会话更个性化。
Aperture 用 Luma 做生产层:CPA 降 75%
广告投放成本下降 75%、预算规模放大 9 倍,真正的故事是把每个 brief 与假设沉淀成可复用的基础设施。
Qwen3.8-27B 获社区热捧
阿里 Qwen 团队向 Unsloth 致谢,称「更小更锐利」的 Qwen3.8-27B 是献给开源社区的礼物。
Recraft Studio 一次接入五个外部模型
Grok Imagine Image 2、Minimax H3、Flux 3 Video、Qwen Image 3 Pro 与 Reve 2.1,在同一画布上切换生成。
Wan 3.0:传文档、图片或网站即可生成
上传任意输入,Wan 3.0 将按你的意图生成内容,进一步模糊了「理解」与「生成」的边界。
Codex 做代码迁移:从数年缩到数周
gdb 再次为 Codex 站台,称大规模代码迁移的周期被从「以年计」压缩到「以周计」。
Vercel 要做「agent 的 AWS」
rauchg 直言正在为智能体时代搭建基础设施,把部署、运行时与工具链打包成 agents 的底座。
GEN-1.5 的秘诀在重复性动作数据
Jim Fan 解析 GEN-1.5 热潮:人类采集数据中天然重复的运动,是其泛化的关键来源。
AI 生成反例,推翻一个猜想
François Chollet 贴出一个 AI 生成的反例,直言「这个猜想是错的」。
三个 24 小时值班的智能体
Graham Neubig 的日常:一个盯训练、一个修 CI 与合并冲突、一个每天 6 点出工作计划。
GLM-5.3 在 DeepSWE 拿到 69 分
智谱团队转发:GLM-5.3 在官方 DeepSWE 排行榜上取得 69 分,工程能力继续爬坡。
Codex 与 ChatGPT Work 共享只读线程
用只读链接把 PR、深潜或项目交接背后的过程与推理分享给别人。
ChatGPT Sites 支持团队协作
添加协作者为编辑者,Codex 在幕后处理 git 管理与 CI。
WildArtifactBench:用胜率评估智能体
放弃严格标准答案,改用人类与智能体偏好裁判的胜率与 Elo 分评估复杂真实任务。
NVIDIA 以 60 亿美元买下一座模型工厂
swyx 播客解读 NVIDIA 收购案,称这座「模型工厂」正在批量产出对标 Thinky 的模型。
李开复:为什么 95% 的公司仍在真正的 AI 转型上失败
李开复与作者的对谈即将上线,聚焦企业 AI 转型困境。作者指出,绝大多数公司仍无法实现真正的 AI 转型,因此撰写了《AI NATIVE》一书——电子书与有声书将于 9 月 15 日发布,精装版 11 月 3 日上市。对谈刻意绕开了「AI 取代工作」「AGI 时间线」这些老生常谈,转而讨论组织能力、流程重塑与落地执行这些更不性感、却真正决定成败的问题。