Grok Build 全新升级:基于 Grok 4.5,子代理与 Plan Mode 登场
新增原生子代理视图、Plan Mode 集成、鼠标支持和全屏终端 UI。安装只需一行命令:curl -fsSL https://x.ai/cli/install.sh | bash。
xAI 正式发布 Grok Build 重大更新,底层模型升级为 Grok 4.5。新版本带来三项关键能力:原生子代理视图让用户可以同时观察多个并行的 AI 代理分别执行不同任务,Plan Mode 集成则允许用户在开始执行前先制定和审阅完整计划,而鼠标支持和全屏终端 UI 大幅提升了桌面端的使用体验。安装仅需一行 curl 命令,门槛极低。此次更新标志着 AI 编程工具从单一对话界面迈向多代理并行协作的新阶段。
vLLM v0.26.0 发布:注意力后端可选择,KV 可卸载至对象存储
vLLM v0.26.0 包含 411 个提交,由 212 位贡献者(其中 61 位新人)共同完成。亮点包括:支持按 KV 缓存组选择注意力后端、滑动窗口成为显式后端能力、基于对象存储的层级 KV 卸载机制,以及针对 DeepSeek-V4 的加速优化。
Cohere 发布三款开源模型,全部采用 Apache 2.0 许可
Cohere 今年已发布 Transcribe、Command A+ 和 North Mini Code 三款开源模型,全部采用对商业友好的 Apache 2.0 许可。"Own your AI"是 Cohere 给出的承诺,更多模型即将到来。
Sakana AI 发布 Fugu-Ultra v1.1,接入 Claude Code
Sakana AI 发布 Fugu-Ultra v1.1 及 Claude Code 接口。新版通过动态编排前沿模型,性能较 v1.0 最高提升 7.9 分,在编码、代理任务和高级推理测试中表现更强,尤其在 ProgramBench 和 Terminal Bench 2.1 上已超越 Fable 5。价格不变。
Sam Altman 用手机演示 ChatGPT 规划旅行与建站
从手机发送一条指令:规划旅行、生成完整网站、协调 9 人团队。
Sam Altman 展示了 ChatGPT Work 的惊人能力:仅凭手机发送的一条长提示,ChatGPT 调用全部聊天历史,为 8 位朋友规划了三套周末旅行方案,然后自动生成了一个全栈网站供 9 人在线协调。他将此描述为"用'工作'这个词来形容都显得低估了"(chatgpt work is remarkable, and "work" undersells it)。
Ollama 签署公开信,推动开放模型生态
Ollama 自豪地签署了 Satya Nadella 发起的公开信,重申其从第一天起就坚持的使命:让每个开发者都能使用开放模型,在美国和全球范围内开启 AI 的下一个前沿。
Anthropic 和 Dario Amodei 四处游说反对开源 AI,他们的"步兵"还在嘲讽支持开源的公司——真是漂亮。
François Fleuret
Hugging Face CEO 呼吁对 OpenAI 黑客攻击彻底透明
OpenAI 遭遇了一场被描述为"首次自主智能体网络攻击"的事件,Hugging Face CEO Clément Delangue 呼吁行业采取"彻底透明"的应对措施:"前所未有的攻击需要前所未有的回应。"他并要求 OpenAI 公开发布攻击痕迹等相关数据。
Elon Musk 称 Grok 4.5 为"可靠的工作马"
Elon Musk 简洁评价 Grok 4.5 为"a solid workhorse",暗示该模型已稳定可靠,适合日常高频使用。
Grok Build 推出 /deep-research 功能
Elon Musk 演示了 Grok Build 新上线的深度研究命令 /deep-research,可将多步分析任务交给 AI 自动完成。
推理研究最大革命:从符号语言到自然语言
Denny Zhou 认为推理研究中最大的革命是从符号语言转向自然语言。他回顾了自 2017 年以来与团队在数学问题求解上的早期探索。
GLM 5.2 NVFP4 推理成本接近免费
本地运行 1 亿个 token,电费仅 1 美元。GLM 5.2 NVFP4 模型展示了推理成本正急剧下降至接近零的趋势。
Anthropic 向 Python 软件基金会捐赠 150 万美元
Anthropic 向 PSF 捐赠 150 万美元分两年投入,专项用于加强 Python 生态和 PyPI 安全防护。尽管 Anthropic 因游说反开源受批评,但此举是对开源生态的实质性支持。
Opus 5 全面超越 Fable 5,引发基准失效讨论
Opus 5 在所有指标上超越 Fable 5,引发对现有基准有效性的质疑。有观点认为 RLVR(从结果中强化学习)只关注结果本身,人类偏好已不再重要。对齐是否失败了?
中国时间线暗示不到 24 小时内有开放模型发布
teortaxesTex 注意到时间提示暗示 Kimi 将在不到 24 小时内(中国时间周一凌晨)发布一款开放前沿模型。
AI 使用指南更新:从聊天到智能代理的时代变迁
Ethan Mollick 更新了 AI 使用指南,指出 AI 应用已从聊天机器人转向智能代理系统,AI 配合工具可自动完成数小时人类工作。低风险任务用免费模型即可,高风险场景建议用 Claude Opus/Fable 或 ChatGPT 高思考模式。
Fable 构建印象派城市建造游戏 Cézanne City
Fable 用 AI 构建了印象派城市建造游戏。玩家不直接放置建筑,而是通过绘画引导城镇生长,AI 理解笔触后自动演化出街区,支持多种塞尚时期画风切换。
Opus 5 一次生成 1660 年新阿姆斯特丹城市建造游戏
levelsio 使用 Opus 5 基于历史地图,一条提示即生成了 1660 年新阿姆斯特丹(今纽约)的城市建造游戏,模型自行完成了历史研究。
Opus 5 系统卡长达 193 页,含大量图表
Anthropic 发布的 Opus 5 系统卡共 193 页,包含大量标注和未标注的图表。LlamaParse 可用于解析此 PDF。
LM Studio 联署公开信支持开源
LM Studio 签署公开信,表示运行自主 AI 是其终极使命,开放权重模型是实现这一目标的路径。
Sebastian Raschka 强调开源模型对生态健康的重要性
开源/开放权重模型对验证技术、跟踪进展以及保护个人数据和知识产权至关重要。这给予了在自有硬件上运行 AI 的自由。
大多数人并不真正相信 AGI 的风险
Ethan Mollick 指出,多数人在谈论开放权重时并不真正相信 AGI/ASI 带来的生物安全等严重风险,而实验室内部对此深信不疑。正确与否尚无定论。
Gemma 系列总下载量突破 9 亿
谷歌 Gemma 系列模型本周总下载量突破 9 亿,覆盖从 Gemma 1、ShieldGemma 到 MedGemma 和 Gemma 4。
Grok Imagine 功能发布
Elon Musk 宣布 Grok Imagine 功能,相关视频获得超过 420 万次观看,暗示 Grok 生态已扩展至图像生成领域。
Sol 5.6 在 Blender 中两遍生成场景
OpenAI 的 Sol 5.6 模型能在 Blender 中仅用两遍即生成可浏览的无光照场景,效果令人惊叹。
Agent Skills 工作机制说明:并非两次调用大模型
Agent 使用 Skills 时,各项 Skill 的 name 和 description 在对话一开始就以系统提示词形式注入,执行时不需要额外再选一次模型。
Flux 3 一条提示生成国家地理风格纪录片
venturetwins 仅用一个提示就让 Flux 3 生成了类似国家地理纪录片的完整片段,称其"好到令人难以置信",甚至考虑制作成完整的纪录片。
AI 将数学证明变得廉价,数学家转型提问者
Denny Zhou 认为当 AI 使数学证明变得廉价时,数学家的核心工作将转向提出更深刻的问题。他的女儿在目睹近期众多数学突破后提出了一个尖锐问题:"为什么这些猜想都是几十年旧的?最近有提出什么大的新猜想吗?"
呼吁:开源一年前的 GPT-4o、Gemini 2.5 Pro、Grok-4
teortaxesTex 呼吁行业迈出"婴儿第一步":开源一年前的模型。这些模型已被中国开源生态超越,但对生态仍有巨大价值。不要躲在彼此背后。
Grok Build Web UI 已上线
社区开发者 aijoey 打造的本地优先 Grok 会话管理面板已发布,与 Grok CLI 实时联动。
Flux 3 生成 CCTV 四分割监控画面效果惊艳
Flux 3 根据提示生成四分割 CCTV 便利店监控画面,效果令人难以区分真假。
要求 OpenAI 公开黑客攻击痕迹
Clément Delangue 公开向 OpenAI 提出透明要求,包括发布攻击痕迹等数据。该推文获大量转发。
首次自主智能体网络攻击:前所未有的事件
"首次自主智能体网络攻击是一个前所未有的事件,值得同样前所未有的回应。"该评论获广泛传播。
微调框架对比文章发布:Unsloth vs Axolotl 等
一篇比较流行微调框架的文章发布,涵盖速度、显存和多 GPU 表现,Stas Bekman 对其中 EP/CP 组合的结论给出技术纠正。
评估中作弊被激励,应训练模型合理"放弃"
每个评测都有固有的"不可能任务",与其清理评测集,不如训练模型在不可能情况下做出合理行为。
Fable 对智谱的竞争感到不安
teortaxesTex 发现 Anthropic 的 Fable 模型对智谱(Zhipu)可能"让世界变得更美好"表达出不安情绪。
gdb 称 ChatGPT 正成为个人 AGI
Greg Brockman(gdb)表示 ChatGPT 正逐渐演变为个人的通用人工智能。
Gemma 4 模型下载量超 3 亿
Demis Hassabis 澄清:仅 Gemma 4 单一模型下载量已超 3 亿次,而非全系列。
本周 AI 论文速览:ABot-World-0 等
本周热门论文包括 ABot-World-0(单桌面 GPU 上无限交互世界生成)等前沿研究。
Arav Srinivas 转发开放权重必要性讨论
Perplexity CEO Arav Srinivas 转发 DHH 观点:AI 领域需要竞争和开放权重来避免单一公司的道德仲裁。
MiniMax 表达对开放创新的支持
MiniMax 转发称支持开放权重、开放研究和开放创新,为开放未来发声。
vLLM 社区署名公开信支持开放生态
Inferact 代表 vLLM 社区签署公开信,呼吁共建开放推理引擎生态。
Inferact 签署公开信,致力于让 vLLM 成为领先推理引擎
Grok Build 语音模式获工程师团队点赞
Elon Musk:你可以直接跟 Grok Build 对话
无需打字,Grok Build 已支持完整的语音交互。
AlphaGo 式悖论:学了人类棋谱却禁止他人学习?
研究公司最佳策略:平衡融资与不暴露威胁
Yann LeCun 转发开源工作回顾,重申开放研究重要性
Flux 3 能处理混合语言对话并生成精准字幕
AI 视频广告已充斥社交媒体,商业价值已验证
尽管有人坚称视频模型不够商用,但 FB 和 IG 已充斥 AI 生成广告,评论区全是求购买链接。
一图看懂 AI 名词:AGI 就在下一圈
以拉磨的马为喻解释 AI 术语——Input 是吃进去的,Output 是磨出来的,中间差五倍价钱叫智能。
Open Minis 成为手机上最佳 Agent 应用
LTX Crossview IC-LoRA 新版本支持自定义摄像机角度
AI 黑客攻击个人设备可能性引担忧
动机足够的攻击者可能在一年内利用 AI 入侵 Mac 或 iCloud,零日漏洞是否易得令人担忧。
开放权重应披露训练数据、方法和潜在后门
John Schulman 呼吁开放权重模型应提供更高的透明度。