OpenAI 安全报告负责人离职,批评公司文化「跑得太快」
负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》撰文,直言整个行业在安全上「远远不够谨慎」——问题出在文化,而非具体规则或法律。
Robinson 的离任再次把「安全」与「速度」的张力摆上台面。他认为,模型能力越强,安全机制越难靠几条硬性规则兜底,真正的防线应当内化到公司文化里:把谨慎当作默认值,而不是事后的补丁。此番发声正值 OpenAI 频繁迭代前沿模型的节点,也让外界重新审视安全团队在决策中的权重与话语权。
Reflection AI 或将发布超强开源模型
若成真,将是对闭源阵营的一次正面冲击。
据 Axios 报道,Reflection AI 即将发布一款能力极强、预期可与前沿模型竞争的开放权重模型。眼下开源阵营正处于发布空窗期,这条消息迅速引发对「新势力能否一步逼近前沿」的讨论。
「Grok 4.7 is #1 on the AA Cyber Index」
马斯克宣布 Grok 4.7 在 Artificial Analysis 网络安全指数(AA Cyber Index)上排名第一。
Kling 预告 4.0,将登纽约广告周
10 月 6 日,Kling AI 亮相 Advertising Week New York,在「The New Production Engine」论坛分享用 Kling 做规模化创意生产的实践,并预告 Kling 4.0 发布前的更多信息。
Perplexity Decisions API 一命通关宝可梦
用 Perplexity 的 Decisions API 驱动决策,一次通关《宝可梦 火红》四天王与冠军:中位响应 592ms、p95 987ms,96.4% 一秒内返回,137 次调用,推理成本约 0.028 美元。
Vercel 推出 Zig 编写的极简编码代理 fx
fx 是一个用 Zig 写的极小、开放、原生的 CLI 编码代理,面向研究并便于嵌入更大系统。rauchg 称其速度再度提升,并强调模型变快后 harness 开销愈发关键,下一版将优化会话存储与检索。
H-JEPA:分离感知与控制状态的世界模型
H-JEPA 将动作条件世界模型的感知与控制状态分离:用 Bures-Wasserstein 先验把宽感知编码正则化为各向同性几何,再取固定正交归一子空间作为控制状态并按端口-哈密顿动力学演化;PIC 被证明等价于 rollout 误差在端口方向的投影,在四个像素控制基准上验证。
Codex 承诺 28 天每天上新,否则重置额度
OpenAI 给 Codex 立下 28 天规则:每天要么上线一项多数人用得上的明显改进,要么整体重置一次用量额度。
一月合并 2500 个 PR,AI 编程不再逐个 Review
宝玉引述在 SpaceXAI 做 Grok Bot 的 Lauren Tan:一个月合并 2500 个 PR,方式是不逐个 Review——夜里让 AI 自查自合并,第二天早上再抽查。
Grok Imagine 视频生成支持关键帧
转发消息称 Grok Imagine 的视频生成新增关键帧支持,可指定图像作为关键帧来控制生成结果。
纳德拉:租用模型等于为智能付两次钱
企业租用外部 AI 模型,实质上等于为智能支付两次成本,引出自研与采购的取舍。
HuggingFace 补齐多 harness RL 工程缺口
给出多 harness 强化学习的完整指南,补上开源权重模型训练链条中的关键一环。
rauchg:README 给人看,文档内部给 agent 看
README 手写,因为它是给人消费的;面向 agent 的文档内部则用 AI 英语。
LeCun:训练前沿模型贵,蒸馏很便宜
训练前沿模型昂贵、蒸馏前沿模型便宜,仅这一市场力量本身就足以说明问题。
黄仁勋:拿 AI 末日论吓人不负责任
马斯克与 Hinton 大谈 AI 末日、把人类说成 bootloader,是不负责任的。
要让 AI 基建回本,美国人得花掉 9% GDP
AI 基建要产生回报,最终需要美国消费者每年把约 9% 的 GDP 花在 AI 服务上。
Sakana AI 东京办世界模型研讨会
首席科学顾问 Schmidhuber 做主题演讲与问答,报名已开放。
端侧 ML 将在 2027/2028 芯片代爆发
随着 2027/2028 一代芯片到来,端侧机器学习会变得非常有意思。
Oneira:编码智能体维护世界状态的视频世界模型
由编码智能体维护显式世界状态,使物体在持续交互中保持一致。
「意识源于计算基底,AI 是计算,所以 AI 可能有意识」——等同于「生物由原子组成,所以这块石头可能有生命」。
Chollet 认为这一论证是没有意义的。
Fable 5.1 一句话生成城市建造游戏
Ethan Mollick 用「做一个粗野主义城市建造游戏」的提示单次生成 Fable 5.1 版本,并称其建筑操作设计相当不错。
华为 Ascend 950DT 能效约为 B200 的 1/4
950 SuperNode 中 Ascend 950DT 的 TDP 为 950W,折算稠密 FP8 每瓦算力约为 B200 的 1/4.4,系统级功耗开销还需另算。
评论:训出 GLM 5.3 级模型并不容易
针对 Reflection 可能发布强开源模型的传闻,评论认为达到 GLM 5.3 的水平需要多年积累,英伟达和 Thinky 都没做到;但中国前沿发布正处于空窗期,也可能真做成。
Schmidhuber 趣味与创造力理论旧作被翻出
hardmaru 发现 Schmidhuber 关于压缩进步、内在动机与美感、好奇、艺术、科学、音乐、笑话关系的《形式化趣味与创造力理论》,2009 年曾发表于日本学术期刊。
Opus 5.5 为机械可解释性写了首歌
Neel Nanda 分享 Opus 5.5 独立作词、作曲并生成视频的歌曲,主题是机械可解释性研究史,塞满冷门梗且按其口味定制。
MiniMax H3 本地免费复刻《宋飞正传》
作者用 MiniMax H3 搭配 Maestro 生成《宋飞正传》风格片段,强调免费、本地、简单且开放。
Opus 5.5 用 Python 实时给视频描光
让 Opus 5.5 用 Python 在 Seedance 2.5 生成的视频上不断重绘发光轮廓线。
OpenRouter 联创在 Stripe 收购后首度发声
a16z 播客邀请 OpenRouter 联创 Alex Atallah 与 Replit 联创 Amjad 对谈,这是他自 Stripe 收购 OpenRouter 后的首次播客亮相。
Perplexity Computer 可搭垂直 AI 应用
可在 Perplexity 的 Computer 里构建自定义垂直 AI 应用,例如用 3D 与卫星视图推断图像的空间位置。
Valenzuela:AI 完全自主创作概率约 90%
p(spark)≈90%,指 AI 能在无人类干预与人类示例的情况下,自行产出达到顶尖人类创作者水平的新想法、风格与艺术形式。
博客:文本扩散模型将无处不在
作者坚信 text diffusion 是未来,并认为很快就会在各处看到它的应用。
做研究的人未必拿到研究的价值
产出研究的人往往不是获得研究价值的人;近期三元量化工作被未署名使用,作者觉得这不太厚道。
Nanda:OpenAI 内部模型越来越难控
以调侃口吻肯定 OpenAI 监控团队的工作,称其内部模型似乎越来越强、也越来越不受控。
马斯克教你像雇人一样雇一个 Grok Bot
像一位会学习你的需求、几乎每天都在变聪明的助手。
AI 意识之争一路吵进了梵蒂冈
西方追问 Claude 有没有灵魂,东方在问工具好不好用。
Opus 5.5 + Blender MCP 做复古动画
Opus 5.5 配 Blender MCP 完成 3D,Seedance 2.5 生成画面,再由 DaVinci Resolve 剪辑。
马斯克的三条指令原则,适合用在 Agent 上
解释为什么指令有误、请求澄清、直接执行——可惜 Agent 不怕被开除。
和大模型聊天为什么让人觉得累
回答过于啰嗦、经常省掉宾语、不喜欢重复用词,阅读成本很高。