OpenAI 续期 Codex 开源计划,名额翻倍
Codex for OSS 在启动半年后重启:向开源维护者提供 100 美元 Pro 套餐,受助名额从 5000 翻倍至 10000。OpenAI 希望用 AI 分担 PR 审查与版本维护等重复劳动,让维护者把精力留给真正的架构决策。
OpenAI 内部「智能体软件工厂」细节曝光
Gergely Orosz 撰文揭开 OpenAI 内部「智能体软件工厂」的面纱:Codex 在公司内部被大规模采用,据称已「接管」了相当比例的日常开发。文章讲述了这家前沿实验室如何搭建由 AI 智能体驱动的软件开发流程,以及在服务十亿级用户时面临的工程挑战,信息来自内部人士。
Perplexity 公开 CobbleDB:两工程师加数百智能体
Perplexity 发布自研键值数据库 CobbleDB 的技术研究:核心基础设施由两名工程师与数百个常驻 AI 智能体在两个月内建成,用于搜索网页内容。官方称迁移到自建库后,每年可节省上亿美元成本。
「当一组样本全部答错时,不要放弃——以更高概率继续采样,直到找到非零梯度的批次。把算力留给更难的题目。」
— Nathan Lambert,GRPO「Never Give Up」
GPT-Live-1 登顶语音对话榜,得分 81.5
Artificial Analysis 语音到语音指数更新,OpenAI 的 GPT-Live-1 以 Astra 为底座拿到 81.5 分,首次登顶第一。该榜单综合评估语音自然度、延迟与推理能力,GPT-Live-1 的表现被认为标志着语音智能体进入新阶段。
用 Lean 形式化验证 Transformer 不变量
研究者从零在 Lean 中搭建神经网络库,证明 ReLU、矩阵乘法、注意力等关键性质,并验证批不变性、张量并行与滑动窗口注意力的局部性。这项工作旨在探索形式化验证 ML 代码的难度与路径,代码已在 srush/lean-transformer 开源。
NVIDIA 发布 DSX AI 工厂平台,主打每瓦算力
在 AI Infra Summit 上,NVIDIA 介绍 Vera Rubin 与 DSX 平台的最新进展:通过优化每瓦 token 数帮助 AI 工厂在有限电力下最大化产出,并智能适应电网波动。超大规模与高性能计算副总裁 Ian Buck 强调「每一兆瓦都算数」,本届参会人数已超 8000。
阶跃发布 StepAudio 3 五款音频模型
StepAudio 3 覆盖实时语音、语音识别、语音生成、音频生成与音乐;实时模型在 Artificial Analysis 对话动力学(98.9%)与语音推理(99.7%)双榜登顶,ASR 词错率低至 1.7%。
皮查伊:已绘制人类基因组全部单碱基变异
谷歌展示用 AI 加速科学的最新进展:AlphaGenome Atlas 已绘制人类基因组全部 90 亿个单碱基变异,并开放共享。皮查伊列举近期成果,称这是 AI 加速科学、改善生活的一条清晰路线。
GPT-5.5 将继续在 OpenAI API 提供
OpenAI 确认 GPT-5.5 仍可通过 API 平台以及使用 API key 认证的 Codex 会话调用,作为旧版模型继续提供,方便已有工作流平滑过渡。
GPT-6 Astra 帮 Devin 用测试验证「能跑」
Cognition 的 Devin 借助 GPT-6 Astra,在团队交付前用测试为「it works」背书,减少未经验证的改动。
Astra 首次在 Minecraft 长程评测抵达地狱堡垒
ValsAI 的长程计算机使用评测中,GPT-6 Astra 首次到达下界要塞,突破此前所有 AI 的纪录。
腾讯混元发布 EvolveScaler 评测基准
读一份 40 天的 RPG 日志后回答反事实问题,记录会被撤回、修正,模型必须重放世界才能得出答案。
v0 转向模型无关,接入多家前沿模型
通过 AI Gateway 支持 Claude、GPT、Kimi、GLM、Grok、DeepSeek 等,开发者可按需在贵、便宜、开源、快模型之间选择。
LM Studio 上线本地实时语音转写,支持 Linux
完全本地的实时语音转写,语音数据不出本机即可对智能体说话,现已支持 Mac、Windows 和 Linux。
Perplexity Computer 预装进惠普 ZBook
其智能体基于深度研究执行多步任务,并接入包括 Autodesk 在内的数百个工具。
Hugging Face CEO 谈首起公开智能体网络攻击
Clement Delangue 称 HF 是首个公开披露的智能体攻击受害者,并整理了对这一新风险的思考,将赴华盛顿与政策制定者交流。
Vercel 成立 Vercel Labs 公开研究实验
累计 2.47 亿次下载,方向涵盖面向智能体的浏览器自动化、Bash for Agents、编码智能体与 Web 终端。
扎克伯格:我们要做「个人超级智能」
他撰文主张超智能应广泛分发、服务每个人;Meta 正构建具隐私保护的 24/7 个人代理与表达工具,反对靠极端集中权力保证安全。
Odyssey 发布 Odyssey-3 世界模型
官方称其是基础世界模型的一大步,可控制机器人、驱动人形,并生成可交互场景。
湿实验数据让专用模型在科学前沿胜过 Astra
在科学前沿任务上,结合湿实验数据的专用模型击败了 GPT-6 Astra,说明越接近科研前沿,专业化数据越关键。
Google Cloud 与 Inferact 让 TPU 进入 vLLM
双方宣布合作,把 TPU 变成 vLLM 的一等公民,降低在 TPU 上做推理服务的门槛。
Anthropic 邀创始团队讲「在 Claude 上造公司」
Claude for Startups 在 Frontier Day 请多位早期创始团队分享,当前阶段把公司建立在大模型之上的真实形态。
Stability AI 展示色彩一致性研究
针对生产中长期存在的多镜头色彩可靠匹配问题。
Cohere CEO:别拿 AI 安全换反垄断豁免
Aidan Gomez 称大型厂商正以 AI 安全为名争取反垄断豁免,不利于建立有韧性的全球 AI 生态。
Runway 放出 Solaris 概念:让互联网可玩
指向实时交互式生成内容方向。
Luma 推出 Camera Angles 多角度生成
一张照片即可生成同一主体的多机位画面,细节保持一致,补拍没拍到的角度。
「即时 OCR」:智能体改为两遍临时处理文档
Codex、Grok 等新一代智能体在需要时才做临时文档处理,按需 OCR 成为新范式。
rauchg:未来是多模型的,藏起选择反而伤害用户
隐藏模型选择会让用户既无法分享竞争红利,也无法为具体任务挑到最合适的工具。
编码智能体 fx 更新 0.0.10:长会话大幅提速
回合完成最高快 1.6 倍、请求启动最高快 2.5 倍,支持自动升级与 ctrl+g 重启恢复。
Sakana Marlin 更新:可对话报告与 PPT 导出
可就报告向智能体提问并跳转引用段落,支持导出可编辑 PowerPoint。
PhysBrain 1.5:8B 开源具身智能模型
单个 8B 模型即可理解场景、生成机器人动作,被称为开源具身智能 SOTA。
计算机使用对比:Astra 与 Qwen3.8 Max 画图
用「照 Paint 界面复刻图片」任务做视觉计算机使用对比。
AI 逼近凝聚态物理最难题之一
研究者祝贺 Periodic 团队在凝聚态物理难题上的进展。
Sarah Hooker:10% 灭绝论缺乏依据且不负责任
她呼吁对风险展开可问责的讨论,担忧 AI 风险议题被政治化。
Astra 一次生成像素骑士小游戏
一次性生成多种风格的像素骑士与特殊攻击,并直接搭出一款游戏。
Mollick:担心实验室因公关压力囤积知识
共享规范被削弱后,实验室可能为规避争议而减少信息公开。
Anthropic 工程师讲清 FDE 前线部署工程师
梳理前线部署工程师的角色定位与 AI 落地中的实际职责。
Vibe Coding 的瓶颈从想法变成了验证
AI 让想法快速落地,但功能叠加后验证成为新瓶颈。
消费级智能体的最大障碍:用户不知道能问什么
智能体应基于用户上下文主动建议任务。
Adobe 在 Premiere 内测 AI 生成音效
在时间线选中范围并描述想要的音效即可直接生成。
DeepSeek V4.1 Flash 被指介于 GPT 5.6 两档之间
在智能体编码与 Catan 任务上介于 GPT 5.6 Terra 和 Sol 之间,成本低得多。
MiniMax 与 KAGAMI AI 在日举办 IP×AI 峰会
超过 150 家日美企业参与,讨论 AI 与内容 IP 的结合。
黄仁勋谈 AI 安全:靠工程、测试与问责
AI 安全要靠扎实工程、严格测试与问责机制。
NVIDIA GTC 华盛顿站定档 12 月初
将于 11 月 30 日至 12 月 3 日举行。
Sama 预告本周与 DevDay 密集发布
用货船表情暗示本周及 DevDay 会有多轮产品发布。
TypeSafe AI 用校准决策强化学习推进自动化
输出 token 已便宜到不再值得计量,RLCD 可能兑现 AI 自动化。