2026年8月3日 · 星期一

Karpathy 用《指环王》首段测试 Opus 5 渲染能力

Karpathy 用《指环王》测试 Opus 5 创作力

Karpathy 提出全新评测思路:给 Opus 5 约一百万 token 预算(约 10 美元),输入《指环王》开篇段落,以三种不同视觉风格渲染呈现。实验旨在超越简单 SVG 绘图的旧范式,探测大模型在长上下文预算下的创意执行力与叙事敏感度。该推文获超两万三千次点赞和近三百万观看。

Vercel CEO:内部 AI 代理已全面接管日常工作

Vercel CEO Guillermo Rauch 披露,公司构建了一个名为 @v 的 AI 代理,已渗透至每位员工日常。交互频次与 token 消耗量呈指数级增长。Rauch 大胆预测,以此趋势外推,AI 代理未来完全可运营整家公司——从日常事务、代码审查到跨团队协作,代理边界正在急剧扩张。

@v 的实践折射出更宏大的趋势:AI 正从辅助工具向组织运营中枢演变,Vercel 为「AI 代理驱动型组织」提供了生动的原型。

Simon Willison 盘点近期 AI 公开信博弈

从微软推动的「开放权重」信到 Anthropic 反蒸馏表态,再到《为前沿设限》倡议,AI 治理正在形成多方角力的公开话语场。

近期 AI 领域涌现多封态度鲜明的公开信,Simon Willison 在其博客中做了系统梳理。7 月 24 日,微软推动的《开放权重与美国 AI 领导力》获逾 235 家公司与组织签署,包括英伟达、亚马逊、YC、Linux 基金会,以及随后加入的 OpenAI,明确反对以安全担忧禁止开放权重模型。信中指出开放权重可被独立审查、改进和再训练,蒸馏技术更是创新扩散的关键手段。

Anthropic 是少数未签署该信的重要 AI 实验室。CEO Dario Amodei 随后单独发文呼吁打击「工业规模蒸馏」——即对手绕过研发投入直接蒸馏前沿模型——但同时明确不主张立法禁止开放权重。7 月 28 日,《为前沿设限》公开信获得更多关注,主张对最强模型实施监管门槛。Willison 盘点揭示,AI 治理核心分歧已从「要不要监管」转向「在哪里划线、由谁来划」,而开放权重正在成为这场辩论的试金石。

Replit Design 将任意界面提取为设计系统

Replit Design 可将任意界面提取为设计系统

Replit 推出 Design 功能,能将任意画面蒸馏为包含色彩、字体与样式的实时风格指南,确保品牌输出一致性,彻底告别设计交接与风格漂移。该功能将截图或参考 UI 自动解析为全量设计系统,实现从视觉灵感到生产规范的零摩擦转换。

Seedance 2.5 单张图片即可生成完整场景

Seedance 2.5 图生视频已达生产级

Higgsfield 宣布 Seedance 2.5 图生视频能力生产就绪,单张静态图可生成完整动态场景,即将在平台正式上线。

Grok 现在可分析任意视频

马斯克宣布 Grok 获得视频分析能力,用户可将任意视频上传进行内容解读。此功能标志 xAI 多模态理解迈入新阶段,推文浏览量逾五百五十万。

Chollet:AI 正靠「打补丁」应对深度学习瓶颈

François Chollet 指出 AI 领域已开始以「补丁」方案应对深度学习根本局限,这一趋势自 2024 年底显现并渗透全行业。但他警告长期看 AI 必须转向下一阶段架构——绕开根本问题只是迂回。

DeepSeek V4 Flash 长程任务获好评

Graham Neubig 实测 DeepSeek V4 Flash 后高度评价其长程任务能力,表示极少偏离主线,可能取代 GPT Sol/Terra 和 GLM-5.2 成为新一代日常主力模型。

ChatGPT Work 内置浏览器可截图并一键部署

Simon Willison 持续挖掘 ChatGPT Work 能力边界,发现其内置浏览器可截图保存,并能将 Web 应用部署至 Cloudflare Workers 实现一键上线。OpenAI 正将 Work 打造为轻量级全栈开发环境。

MiniMax H3 推动开源视频大跃进

开发者社区高度期待 MiniMax H3 开源发布,认为其将推动开源视频模型迈出实质性一步,本地视频生成能力有望迎来颠覆性提升。

V4-Flash 0731 的四档推理强度控制

DeepSeek V4 Flash 内置四档推理强度

TeortaxesTex 披露 V4-Flash(0731 版)内置 nothink/low/high/max 四种思维努力模式,V4-Pro 仅提供低中两档。GA 版本将全面重构基于 RL 的推理引擎。

Liquid AI 用 FTPO 消解推理「末日循环」

Liquid AI 提出 Antidoom 方法,利用最终 Token 偏好优化(FTPO)技术将推理模型 doom-loop 发生率降低最高 90%,对原有行为影响极小。

DeepSeek R1 的 RL 发现独立于 o1

TeortaxesTex 撰文强调 DeepSeek 在 R1 中发现的推理 RL 路径与 OpenAI o1 本质独立,重合部分仅来自已披露内容。他认为目前仅 OpenAI 真正掌握了「推理强度」的内生控制。

「为应对深度学习局限,AI 领域已开始应用『补丁』方案。但长期看,AI 必然走向下一阶段架构。」

— François Chollet

业内观察:AI 实验室整合已成必然

Nathan Lambert 回顾 2024 年预判,当时敏锐观察者已将实验室整合视为必然——训练成本逐年数量级增长,小型实验室生存空间急剧收窄。两年后的当下,这一预测正在加速兑现。

DeepMind 安全团队面试允许用 AI 代理

Neel Nanda 透露 Google DeepMind AGI 安全团队所有工程面试均已开放 AI 代理辅助。他认为日常工作离不开代理协同,面试场景也不应人为切断这一环节,在 AI 招聘中尚属前沿。

DeepSeek API 低价并非倾销

Jun Song 回应外界对 DeepSeek API 低价的疑虑,驳斥「倾销抢占市场」的说法,指出成本优势源于深厚技术积累与工程创新,而非恶意价格竞争。

Hugging Face CEO:AI 应加速而非减速

Clement Delangue 针对近期 AI 网络攻击风波发声,承认风险评估必要,但强调不应因此放缓发展节奏——他认为 AI 有能力让世界更安全,正如历次重大技术变革。

LLM 国际象棋引擎登录 LiChess 自主对战

Amjad Masad 开发的 LLM 象棋引擎接入 LiChess 平台自主运行,与人类玩家与机器人对弈,ELO 1253,已累积 115 局棋谱。这是部署大模型到竞技游戏的罕见成功案例。

用进化算法增强编码智能体自改进能力

cwolferesearch 指出许多 RSI 式论文用编码智能体爬山式优化结果,若引入进化/遗传算法框架,有望解锁更强的自改进能力。如何设计高效的「智能体进化框架」仍待大量探索。

MSLK 内核库靠 AI 代理生成参考文档

Meta 的 MSLK 项目原本无文档,开发者让 AI 代理为其生成完整一页参考,涵盖量化、调度、MX 格式等要点,并附带 llms.txt 版本供其他代理使用。

工具与产品08·03

© 2026 FAV0 · AI Daily · 自动编排