2026年8月21日 · 星期五

Claude 四项能力转正,智能体开始接管没有 API 的软件

Computer use、浏览器工具、Skills API 与 Files API 正式 GA,Claude 现在可以直接在真实应用里点按、填表、读写文件。

Anthropic 宣布 Claude Platform 四项能力进入正式可用(GA)。

Anthropic 本周把四项长期处于预览的能力推向正式可用。Computer use 让 Claude 直接操控电脑界面,浏览器工具让它在真实网页上完成搜索、点击与提交,Skills API 让团队把可版本化的技能封装给智能体调用,Files API 则让文件在会话之间可复用。官方强调,这四件事共同瞄准一个长期被忽视的盲区:大量企业软件与遗留系统根本没有开放接口,智能体过去只能望而却步。如今,Claude Managed Agents 可以基于版本化技能与可复用文件构建,每项任务的往返次数随之下降,自动化终于能落进那些最难啃的后台流程。

AI 真正的网络安全风险,不是模型本身,而是攻防双方在权力、能力与资源上的不对称。

Clement Delangue · Hugging Face 联合创始人

Muse Spark 1.2:从视觉到代码,再到物理动作

Meta 预告新多模态模型支持把视觉直接转成可运行代码,并把感知转成物理动作。

Muse Spark 1.2 面向视频密集型企业工作流强化音视频理解。

Muse Spark 1.2 覆盖广泛的多模态任务:既能「把视觉变成能用的代码」,也能「把感知翻译成物理动作」,并为真实企业场景中常见的视频密集工作流带来更强的音视频理解能力。Meta 同时预告了内部评估框架 WildArtifactBench,用胜率与 Elo 分数而非严格的标准答案来评估智能体在复杂真实任务上的表现。

PIKA · 音频

Pika 推出音频模型家族,音乐低至每分钟 0.015 美元

Pika 一次性发布音乐(Pika Music)、音效(SFX)、语音(Speech)与视频配乐(Soundtrack)四类音频模型,统一通过 Pika API 调用。其中音乐模型成本低至每分钟 0.015 美元,号称比同类便宜最多 10 倍,并支持叠加多种输入来精确控制生成结果。

VERCEL · 推理框架

fx:6.3MB、启动 10 微秒的极简编码代理

Guillermo Rauch 展示了用 Zig 编写的命令行编码代理 fx:体积仅 6.3MB,启动约 10 微秒,可编译为静态 ELF 二进制或更小的 libfx.wasm。他以此断言:AI 将推动基础设施走向原生优化,fx 完成任务的速度可以比其他代理启动还快。

OPENAI · CODEX

Codex 不止写代码:税务试办处理 7000 份申报

gdb 透露,一个基于 Codex 开源 harness 的报税试办项目处理了 7,000 份申报表,准备时间缩短约三分之一。开发者可以直接在这个开源 harness 上搭建自己的产品,而不必局限于编程工具。

XAI · 智能体

Grok Build 换装 Grok 4.6,新增子代理视图

Grok Build 现已由新模型 Grok 4.6 驱动,新增原生子代理视图、Plan Mode 集成、鼠标支持及全屏终端 UI。可通过 curl 安装脚本一键部署,把终端里的 agentic 编码体验进一步做厚。

SGLANG · 部署

Qwen3.8-27B cookbook 加入 DFlash2 配方

SGLang 把 DFlash2 配方加入 Qwen3.8-27B cookbook:该稠密混合 GDN 视觉语言模型支持 BF16/FP8/NVFP4 W4A4 检查点与内置 MTP,可在 H200、RTX PRO 6000、RTX 5090 及 DGX Spark 上单卡运行,社区反馈 NVFP4 + DFlash2 效果不错。

OPENAI · 插件

ChatGPT Work 与 Codex 接入 1000 亿级网页检索

OpenAI 上线 ExaAILabs 插件,让 ChatGPT Work 和 Codex 可以访问 100B+ 网站、论文与文档。对做深度调研与长程任务的智能体而言,检索口径一下子被拉宽。

今日短讯 · INDUSTRY BRIEFS 08.21 · AI 圈
VLLM

Ornith-1.5 上线 vLLM,MIT 许可、9B 到 397B

自称自我改进的模型家族,编码与 agentic 任务在开源模型中居前,`vllm serve` 一行即可拉起。

GOOGLE

Google 发布视觉语言模型 TIPS

主打空间感知,面向稠密视觉理解任务,已上线 Hugging Face。

OPENAI

GPT-Image-2 支持透明背景

API 预览版可生成可复用素材,用于商品图、平面设计与营销物料。

ANTHROPIC

Claude Managed Agents 联手 AG-UI

新 cookbook 将托管智能体与 CopilotKit 的开放 Agent-User Interaction Protocol 结合,驱动多种界面。

NVIDIA

NeMo Switchyard:给 agent 工作流做模型路由

开发者可依据自己的质量、延迟与成本标准,在模型池中为每个步骤选择合适模型。

OPENAI

Computer History 进入欧洲三国

EEA、英国与瑞士的 ChatGPT Pro/Business/Enterprise 用户可在 Mac 上使用,跨应用记忆让会话更个性化。

LUMA

Aperture 用 Luma 做生产层:CPA 降 75%

广告投放成本下降 75%、预算规模放大 9 倍,真正的故事是把每个 brief 与假设沉淀成可复用的基础设施。

QWEN

Qwen3.8-27B 获社区热捧

阿里 Qwen 团队向 Unsloth 致谢,称「更小更锐利」的 Qwen3.8-27B 是献给开源社区的礼物。

RECRAFT

Recraft Studio 一次接入五个外部模型

Grok Imagine Image 2、Minimax H3、Flux 3 Video、Qwen Image 3 Pro 与 Reve 2.1,在同一画布上切换生成。

WAN

Wan 3.0:传文档、图片或网站即可生成

上传任意输入,Wan 3.0 将按你的意图生成内容,进一步模糊了「理解」与「生成」的边界。

OPENAI

Codex 做代码迁移:从数年缩到数周

gdb 再次为 Codex 站台,称大规模代码迁移的周期被从「以年计」压缩到「以周计」。

VERCEL

Vercel 要做「agent 的 AWS」

rauchg 直言正在为智能体时代搭建基础设施,把部署、运行时与工具链打包成 agents 的底座。

观点与模型 · SIGNALS 08.21 · 信号

李开复:为什么 95% 的公司仍在真正的 AI 转型上失败

李开复与作者的对谈即将上线,聚焦企业 AI 转型困境。作者指出,绝大多数公司仍无法实现真正的 AI 转型,因此撰写了《AI NATIVE》一书——电子书与有声书将于 9 月 15 日发布,精装版 11 月 3 日上市。对谈刻意绕开了「AI 取代工作」「AGI 时间线」这些老生常谈,转而讨论组织能力、流程重塑与落地执行这些更不性感、却真正决定成败的问题。

© 2026 FAV0 · AI Daily · 由版面编辑自动编排