英伟达发布 550B 指令跟随教师模型
Hugging Face 上架一款 550B 参数指令跟随模型,主打约束遵循与结构化任务,为业界蒸馏与后训练提供强力教师底座。
这条消息经由 Hugging Face 官方转发而来。550B 参数的规模放在开源社区里已相当可观,但更值得留意的是它的定位——不是又一款通用聊天模型,而是专门用来「教」其他模型遵循约束、完成结构化任务的教师模型。随着后训练与蒸馏成为缩小开源模型与前沿模型差距的主流路径,一个高质量、可公开获取的教师模型,价值正在被迅速放大。对许多团队而言,与其从零训练,不如以这样的教师模型为锚点,再叠加自身的偏好对齐与领域数据,把有限的算力集中到真正差异化的能力上。
1T 模型重启:8.8 分钟降至 32 秒
SGLang 与蚂蚁、阿里合作推出 Weight Cache Daemon,让模型权重常驻 GPU 缓存,崩溃后无需重新加载。这篇发布在 LMSYS 官方博客的工程记录,展示了大模型推理系统在故障恢复上的关键突破——服务可用性从此不再被「重启一次要等近十分钟」所绑架。
Vercel 发布 Is Agentic,评估网站对 AI 代理的可读性
输入网址即可得到代理可发现、检索、理解内容的评分,并输出失败证据、改进建议与一次代理导航旅程。报告可通过稳定链接、JSON API 与 MCP 获取,分数反映特定时间点的快照,不适用项不扣分。对正在为 agent 时代重构站点的团队而言,这是一份把「可被机器读懂」变成可度量指标的实用清单。
OpenAI 下调 GPT-5 API 与积分定价
在持续推高能力上限、同时改善效率的过程中,OpenAI 宣布下调 GPT-5 系列的 API 与 credit 价格。这条由 Sam Altman 转发的官方通告,延续了近期前沿模型「能力上探、成本下探」的双线节奏——一边让更强模型进入更多工作负载,一边把单位成本压到更低的门槛。
NVIDIA 编码框架满分通过 ARC-AGI-3 公开关
自建 CUDA 内核优化编码框架,25 个公开游戏、183 个关卡全部通关,拿下满分。
Clement Delangue 在转发中写道:有了 agent,我们正从一个「运行、优化、后训练自己的模型与内核都相当困难」的世界,走向一个把这一切门槛大幅拉低的世界。NVIDIA 用一套自建的编码 harness 去优化 CUDA 内核,并在 ARC-AGI-3 的 25 个公开游戏、183 个关卡中拿到 100% 通过率——这不仅是一次榜单成绩,更是在暗示:下一阶段的算力与内核优化,可能将由模型自己来完成。
Gemini 3.7 Flash 首周创增长纪录
Sundar Pichai 表示,Gemini 3.7 Flash 在第一周就打破了此前所有 Gemini 的增长纪录,成为谷歌增长最快的模型,现已在搜索与 Gemini 应用中运行。开发者社区的踊跃反馈,让这家公司再次确认了「更快、更省」路线对市场的吸引力。
GLM-5.3 在 KernelBench-Mega 实现 21.4 倍加速
GLM-5.3 在 KernelBench-Mega 上达到 21.4 倍 PyTorch 基线,前代 GLM-5.2 为 11.1 倍;配合 Kimi 线性解码,可在 RTX PRO 6000 上运行。一次接近翻倍的代际跃升,印证了国产模型在「系统级代码优化」这条细分赛道上正在快速补位。
绝大多数 AI 工作负载,最终都会跑在开放模型上。
谷歌 Antigravity 上线远程控制
Antigravity 新增 Remote Control,用户可从任何现代浏览器访问自己的 active 会话。
MiniMax H3 主打多语言与字符精准还原
官方强调 H3 能精确保留所有语言和字符,并在 MiniMax Design 中把该能力发挥到极致。
Anthropic CEO:Agent 采用速度远超预期
Dario Amodei 表示 agentic 采用速度极快,容易让人忘记整个领域已经走了多远。
Anthropic 称将提供最低价格与最高能力
Amodei 称会致力于给客户全市场最低价,同时提供最高能力上限。
Higgsfield 上线 x Grok Bot 营销代理
新用户可获 100 积分,用一组机器人完成一人营销公司的工作。
fx CLI 支持 Grok 与 Codex 订阅
开源极简编码代理 CLI fx 现已支持 Grok 和 Codex 订阅,可在沙盒中即时试用。
Vercel AI Gateway 开放权重占比创新高
开放权重 token 占比 8 月达 62%,两个月前仅 28.4%。Guillermo Rauch 认为这很可能只是开始——企业采用仍处早期,harness、CLI 等入口还在铺开。
Runway 净收入留存率超 300%
高管分享公司 NRR 已超过 300%,营收在近几个月内增长一倍以上。
fx 编码代理驱动个人浏览器 Mini
Rauchg 用开源编码代理 fx 构建了个人浏览器 Mini,用于屏幕共享与直播,并测试了开放模型。
Ethan Mollick 对神秘模型 Ox Alpha 持保留态度
在其早期实验中表现尚可,但即便在开放权重里也谈不上前沿,与 Kimi K3 对比仍不占优,测试仍在继续。
Codex 与 Claude Code 已能自动填表
Mollick 说,让它们「帮我填掉邮件里要交的表单」这类低风险又耗时的杂事,已经可以放心交给它们完成,无需再干预。
别把 ELI5 当成默认解释方式
LLM 的一大好处是能当「跨领域通用翻译器」;与其要千篇一律的通俗解释,不如让它「结合我已知的东西来讲」。
响马:工程师不会消失,但工作方式会变
工具化会一直进化到 ROI 低于人力的边界,然后需要更多人力去补齐最后的缝隙——像买了洗碗机,最终还要人擦边角。
现阶段画图最佳方式或是 HTML
HTML 训练得最好、画出来效果最好,又方便编辑、可转换其他可编辑格式。
AI 硬件的付费点应是什么?
应该让用户付费拿到自己用硬件获得的上下文,而不是反过来把数据锁在厂商那里。
「rewrite python to rust」是魔法提示词
Graham Neubig 感叹,这一句就能让程序快上 40 倍。
让学习重新变得「持续」
Arohan 转述 Rich Sutton:如果不是有人把「学习」绑架成静态学习,我们根本不用叫它「持续学习」。
数据是静止的计算
「训练把它在硅片中复活,重新运转起来。」
国产 flash 模型的「疯狂思考」问题
ox 与 DS Flash 常在复杂任务上过度思考,有时十几分钟才吐一个字,怀疑是过度后训练超出了参数承受极限。
rasbt 详解 Claude 新的水印流程
针对这一热门话题,作者在原有说明基础上进一步拆解其实现原理与工作机制。