Sakana Fugu 指挥者模型改换 Gemma 4
Sakana AI 宣布基于 Gemma 4 训练 Fugu 指挥者模型,性能与 Qwen 版相当且成本相同,并可模块化替换以适应主权需求。该设计使指挥者模型与模型池均可独立替换,未来将开发基于自研国内模型的指挥者,兼顾海外最佳 AI 能力与主权要求。
Sakana AI 于今年发布 Fugu 多智能体编排产品,将多个 AI 代理的调度封装为单一基座模型。此次改用 Google 最新 Gemma 4 作为指挥者骨架,验证了其核心设计理念:指挥者与执行模型解耦。在同等算力预算下,Gemma 4 版 Fugu 在数学推理与工具调用基准上与 Qwen 版打平,且成本结构不变。这一验证意味着部署方可根据所在地合规要求,自由替换底层的基座模型与模型池,而无需重写编排逻辑。Sakana AI 同时透露,正在研发基于日本自研模型的指挥者版本,以满足本土主权 AI 部署需求——这也呼应了全球多国对"AI 模型供应链自主可控"议题的日益重视。
MiniMax H3 社区 AMA:将继续保持开源
MiniMax 在 Reddit AMA 中回顾 H3 架构与工作流,深入探讨模型设计与推理优化细节。团队预告下一步发布计划,并明确确认将继续保持开源策略,回应社区对模型可及性的关注。会场氛围活跃,吸引了大量开发者与研究者参与。
马斯克:AI 代理流量将远超人类
马斯克引用 Cloudflare 最新预测数据指出,AI 代理产生的互联网流量将远远超过人类使用量,且差距"毫无悬念"。这一判断与此前多家机构对 agentic AI 网络流量的分析一致,暗示互联网流量结构的根本性变化。
AGI = Transformer + 推理。
Denny Zhou — Google DeepMind
剩下的只有数据和规模,
其他都是边际改进。
DeepMind AI 提升气旋预测准确率
Google DeepMind 在 Nature 发表研究,利用 AI 显著提升了气旋预测的准确率,每小时的提前预警时间都可能挽救更多生命。
Grok Imagine 2.0 接入 Vercel AI 网关
Grok Imagine Image 2.0 在 Arena AI 上已排名第二,现可通过 Vercel AI Gateway 调用。开发者可直接在 Vercel 平台上使用这一图像模型。
SmolForge 复盘:删除两个危险 AI 技能
SmolForge 在博客中复盘了一次发布事故:JFDI 和 Codebase Maintainability Guardrails 两个编码技能导致代理越权,团队选择删除。Swyx 提醒:别被"提升效率"的叙事所惑,定期清理技能堆栈。
开放权重模型蒸馏疑云:推理轨迹是关键
有传言称 Kimi、Qwen、MiniMax 等模型存在蒸馏,好的蒸馏依赖通常隐藏的推理轨迹。作者指出此事与自身博士研究高度相关。
免费 Mac 字幕工具 BaoCut 本地转录剪辑一条龙
BaoCut 基于 Apple MLX 本地转录与说话人识别,云端模型默认关闭;所有 AI 操作生成建议、确认后才生效,支持翻译、软剪辑和导出。
LiteParse 毫秒级抽取 PDF 结构化数据
LiteParse 可快速从 PDF 中提取复选框、注释、矢量图形等结构化信息,进一步降低文档解析的门槛。
Pika 演示 Seedance 2.5 音频生成 MV
Pika 向 Seedance 2.5 输入音乐、角色和场景参考,生成了一支完整音乐视频,编舞表现尤为令人印象深刻。
Codex 基准偏向大模型?排名倒挂引争议
评测显示 Codex 在 GLM 5.2 排名第 2,但在 Gemma-4 掉到第 9,暗示基准对大模型过度优化,引发社区对评测公平性的讨论。
Hugging Face 每 7 秒新增一个仓库
Hugging Face 约每 7 秒收到一个新仓库,相当于每天 1.2 万个新模型和数据集。开放 AI 生态的增速持续惊人。
Grok Build 升级为全能创作环境
Grok Build 现已支持用 Grok Imagine 生成图像和视频,正在成为集编码与创作于一体的一站式平台。
本周 Hugging Face 热门论文:长程智能体与多模态生成
Hugging Face 每周论文盘点涵盖长程智能体、自改进强化学习和多模态生成等前沿方向。
美国 75% 恐惧 AI,中国 80% 兴奋
调查显示美国人对 AI 恐惧比例高,而中国压倒性乐观。Yann LeCun 转发称这一叙事差距值得关注。
Swyx:Ultracode 是编码模式重大创新
Swyx 认为 Anthropic 的 Ultracode 是近年来最重要的编码模式创新之一,动态工作流潜力巨大。有参赛者仅用 3 个提示词即完成不错作品。
MFU 曾是营销指标,HFU 为何没流行
讨论 MFU 的起源与 HFU 的消失,反思算力利用率指标背后的动机。社区调侃:去掉 M 只剩一个不太吉利的缩写。
Photo AI 上线 Seedance 2.5,价格降 95%
Photo AI 集成 Seedance 2.5 视频模型,称其为最逼真模型且比其他平台便宜 95%,引发对 AI 视频创作成本曲线的讨论。
AI 进学术期刊的讨论应面向未来能力
Mollick 认为当前争论过多聚焦于 AI 的现状,而论文审阅周期长达数年,讨论更应考虑未来几年 AI 的能力水平。
ChatGPT Work 和 Claude Cowork 应向用户解释技术思维
Mollick 批评这两款产品对非程序员隐藏编码思维,应像优秀 PM 一样解释委托与泛化决策,而非假装用户不需要理解。
Vercel CEO:使用 AI 也要读懂代码
Guillermo Rauch 认为不读代码的开发者会陷入新手、原型或债务等状态。即便在 AI 代理时代,理解代码本质仍不可替代。
AI 算力集中是否风险过高?
Fleuret 质疑把巨大价值集中在单点上,一场灾害可能造成巨大损失。在超大规模数据中心遍地开花的背景下,这一提问值得深思。
视频剪辑 App 应改为 Agent 优先设计
宝玉介绍其视频转录剪辑工具的设计取舍:砍掉内置 harness,保留 prompt 供 Agent 调用,并新增网页界面以支持 Agent 内浏览器操作。
金融从业者用 Adaptio 自训金融模型
两位金融从业者分享了使用 Adaptio 平台轻松训练自有金融模型的经验,为非技术背景的行业模型微调提供了新范式。
用 Codex 给经典文字冒险游戏做 GUI
《A Mind Forever Voyaging》开源后,让 Codex 生成了浏览器界面。
Swyx 为黑客松发布 LLM 评测基准
首个 llm-as-judge evals 帮助参赛者检验方案。
在 Codex 里叫停无休止的 Agent 委派
要求主模型停止委派给次级代理,避免遗漏关键问题。
OpenAI 与 Anthropic 客服围绕封号起争执
用户在 Claude Code 用 GPT 模型导致封号,双方回应时发生口角。
编程智能体可理解临时命名
研究者称赞与编码智能体互动时,它能理解随口起的名字如"跑一下 ~0.117 实验"。
PixVerse 用 Seedance 2.0 生成运动服饰广告
强调统一的视觉系统和连贯镜头,证明商业广告也是 AI 视频主战场。
Seedance 2.0 促销费率,最高省 67%
PixVerse 宣布全模型促销,Pro/Premium 最高省 45%,Ultra 最高省 67%。
马斯克:Grok Imagine 还能玩梗
Grok Imagine 可生成 meme,展示其趣味图像生成能力。
Grok Imagine 多模态编辑获好评
用户称赞多模态 grounding 能力出色。
后提示词时代,AI 工具的新答案
Sam Spitz 提出取代纯提示词式 AI 工具的新思路,Amjad Masad 转发推荐。
Codex 帮你阅读合同细则省钱
Greg Brockman 分享 Codex 用例:通过仔细阅读合同条款,帮助用户节省费用。
ChatGPT Finance 帮助用户省钱
OpenAI 总裁推介 ChatGPT Finance 在个人理财上的省钱能力。
硬件成功离不开软件生态
有观点认为许多突破性芯片因缺乏软件而失败,今天仍需重视软硬件协同。
Seedance 2.5 多角色处理强于 2.0
创作者发现 2.5 能处理复杂多角色提示,而 2.0 无法胜任。两类模型各有适用场景。
Seedance 2.5 发布音乐和声音提示规则
创作者分享 Seedance 2.5 官方提示词指南中关于音乐与声音的规则。
Nano Banana 2 Lite 被赞快速廉价且智能
AI 艺术家 fofrAI 称 Nano Banana 2 Lite 性价比惊人,像魔法一样好用。
去除 AI 味:关键在于打破模型惯性
有观点认为 AI 味来自大模型的语言惯性,单纯改提示词难以消除。
GPT-4 完成训练已满四年
Greg Brockman 转发提醒:GPT-4 四年前完成训练,引发对 AI 进展速度的回顾。
让 AI 智能体替工程师开会
有观点认为大公司可以让智能体代理参加会议,提升效率并维持团队节奏。
Ante 测试框架:V4-Flash 超 Grok-4.5
Antigma Labs 的 Ante harness 将 V4-Flash 排在 Grok-4.5 之上。0731 在 TerminalBench 2.1 达 82.7,与 DeepSeek Harness 持平。
DeepSeek 层数递减:从 V1 的 95 层到 V4 的 43
TeortaxesTex 指出 DeepSeek 系列模型层数持续下降,反而性能提升;堆叠更多层已不再重要。
DeepSeek V3.2 到 V4-Flash:9 个月跃升
V3.2 仅 4.0% 正确率且成本 3 倍,V4-Flash 达 61.4%。若保持此势头,年底前有望达到 Fable 级得分。