Karpathy 用《指环王》测试 Opus 5 创作力
Karpathy 提出全新评测思路:给 Opus 5 约一百万 token 预算(约 10 美元),输入《指环王》开篇段落,以三种不同视觉风格渲染呈现。实验旨在超越简单 SVG 绘图的旧范式,探测大模型在长上下文预算下的创意执行力与叙事敏感度。该推文获超两万三千次点赞和近三百万观看。
Vercel CEO:内部 AI 代理已全面接管日常工作
Vercel CEO Guillermo Rauch 披露,公司构建了一个名为 @v 的 AI 代理,已渗透至每位员工日常。交互频次与 token 消耗量呈指数级增长。Rauch 大胆预测,以此趋势外推,AI 代理未来完全可运营整家公司——从日常事务、代码审查到跨团队协作,代理边界正在急剧扩张。
@v 的实践折射出更宏大的趋势:AI 正从辅助工具向组织运营中枢演变,Vercel 为「AI 代理驱动型组织」提供了生动的原型。
Simon Willison 盘点近期 AI 公开信博弈
从微软推动的「开放权重」信到 Anthropic 反蒸馏表态,再到《为前沿设限》倡议,AI 治理正在形成多方角力的公开话语场。
近期 AI 领域涌现多封态度鲜明的公开信,Simon Willison 在其博客中做了系统梳理。7 月 24 日,微软推动的《开放权重与美国 AI 领导力》获逾 235 家公司与组织签署,包括英伟达、亚马逊、YC、Linux 基金会,以及随后加入的 OpenAI,明确反对以安全担忧禁止开放权重模型。信中指出开放权重可被独立审查、改进和再训练,蒸馏技术更是创新扩散的关键手段。
Anthropic 是少数未签署该信的重要 AI 实验室。CEO Dario Amodei 随后单独发文呼吁打击「工业规模蒸馏」——即对手绕过研发投入直接蒸馏前沿模型——但同时明确不主张立法禁止开放权重。7 月 28 日,《为前沿设限》公开信获得更多关注,主张对最强模型实施监管门槛。Willison 盘点揭示,AI 治理核心分歧已从「要不要监管」转向「在哪里划线、由谁来划」,而开放权重正在成为这场辩论的试金石。
Replit Design 可将任意界面提取为设计系统
Replit 推出 Design 功能,能将任意画面蒸馏为包含色彩、字体与样式的实时风格指南,确保品牌输出一致性,彻底告别设计交接与风格漂移。该功能将截图或参考 UI 自动解析为全量设计系统,实现从视觉灵感到生产规范的零摩擦转换。
Seedance 2.5 图生视频已达生产级
Higgsfield 宣布 Seedance 2.5 图生视频能力生产就绪,单张静态图可生成完整动态场景,即将在平台正式上线。
Grok 现在可分析任意视频
马斯克宣布 Grok 获得视频分析能力,用户可将任意视频上传进行内容解读。此功能标志 xAI 多模态理解迈入新阶段,推文浏览量逾五百五十万。
Chollet:AI 正靠「打补丁」应对深度学习瓶颈
François Chollet 指出 AI 领域已开始以「补丁」方案应对深度学习根本局限,这一趋势自 2024 年底显现并渗透全行业。但他警告长期看 AI 必须转向下一阶段架构——绕开根本问题只是迂回。
DeepSeek V4 Flash 长程任务获好评
Graham Neubig 实测 DeepSeek V4 Flash 后高度评价其长程任务能力,表示极少偏离主线,可能取代 GPT Sol/Terra 和 GLM-5.2 成为新一代日常主力模型。
ChatGPT Work 内置浏览器可截图并一键部署
Simon Willison 持续挖掘 ChatGPT Work 能力边界,发现其内置浏览器可截图保存,并能将 Web 应用部署至 Cloudflare Workers 实现一键上线。OpenAI 正将 Work 打造为轻量级全栈开发环境。
MiniMax H3 推动开源视频大跃进
开发者社区高度期待 MiniMax H3 开源发布,认为其将推动开源视频模型迈出实质性一步,本地视频生成能力有望迎来颠覆性提升。
DeepSeek V4 Flash 内置四档推理强度
TeortaxesTex 披露 V4-Flash(0731 版)内置 nothink/low/high/max 四种思维努力模式,V4-Pro 仅提供低中两档。GA 版本将全面重构基于 RL 的推理引擎。
Liquid AI 用 FTPO 消解推理「末日循环」
Liquid AI 提出 Antidoom 方法,利用最终 Token 偏好优化(FTPO)技术将推理模型 doom-loop 发生率降低最高 90%,对原有行为影响极小。
DeepSeek R1 的 RL 发现独立于 o1
TeortaxesTex 撰文强调 DeepSeek 在 R1 中发现的推理 RL 路径与 OpenAI o1 本质独立,重合部分仅来自已披露内容。他认为目前仅 OpenAI 真正掌握了「推理强度」的内生控制。
「为应对深度学习局限,AI 领域已开始应用『补丁』方案。但长期看,AI 必然走向下一阶段架构。」
— François Chollet
业内观察:AI 实验室整合已成必然
Nathan Lambert 回顾 2024 年预判,当时敏锐观察者已将实验室整合视为必然——训练成本逐年数量级增长,小型实验室生存空间急剧收窄。两年后的当下,这一预测正在加速兑现。
DeepMind 安全团队面试允许用 AI 代理
Neel Nanda 透露 Google DeepMind AGI 安全团队所有工程面试均已开放 AI 代理辅助。他认为日常工作离不开代理协同,面试场景也不应人为切断这一环节,在 AI 招聘中尚属前沿。
DeepSeek API 低价并非倾销
Jun Song 回应外界对 DeepSeek API 低价的疑虑,驳斥「倾销抢占市场」的说法,指出成本优势源于深厚技术积累与工程创新,而非恶意价格竞争。
Hugging Face CEO:AI 应加速而非减速
Clement Delangue 针对近期 AI 网络攻击风波发声,承认风险评估必要,但强调不应因此放缓发展节奏——他认为 AI 有能力让世界更安全,正如历次重大技术变革。
LLM 国际象棋引擎登录 LiChess 自主对战
Amjad Masad 开发的 LLM 象棋引擎接入 LiChess 平台自主运行,与人类玩家与机器人对弈,ELO 1253,已累积 115 局棋谱。这是部署大模型到竞技游戏的罕见成功案例。
用进化算法增强编码智能体自改进能力
cwolferesearch 指出许多 RSI 式论文用编码智能体爬山式优化结果,若引入进化/遗传算法框架,有望解锁更强的自改进能力。如何设计高效的「智能体进化框架」仍待大量探索。
MSLK 内核库靠 AI 代理生成参考文档
Meta 的 MSLK 项目原本无文档,开发者让 AI 代理为其生成完整一页参考,涵盖量化、调度、MX 格式等要点,并附带 llms.txt 版本供其他代理使用。
瑞士建 500MW GPU 集群配套巨型电池
瑞士计划在三国电网交汇处建设 1.2GW/2.1GWh 巨型电池储能设施,顶部部署 500MW GPU 集群。项目名 FlexBase,预计 2028-29 年投运,GPU 型号与运营商待定。
CodePilot 更新素材库并适配 V4 Flash
CodePilot 0.63.0 新增素材库功能,支持将 GPT-Image 2.0 生成图片和 AI 生成的 HTML 加入库并打标签。适配 DeepSeek V4 Flash 0731,增加推理强度选项,并解耦 Agent 框架依赖。
Code Pilot 全平台支持回归
Code Pilot 支持全平台及 Cloud Code、AI SDK、CodeX 三种 Agent 框架自由切换,兼容所有主流 Token Plan。此前短暂移除的 Linux 构建已在 0.64.0 恢复。