Anthropic 公布三项指标,追踪 AI 自我研发进度
AI 越来越强大,也越来越被用来建造「自己的下一代」。
Anthropic 提出三项衡量指标,其中包括「有多少 AI 研发由 AI 自己完成」,希望把前沿系统的进展更透明地呈现给公众。这三项指标试图回答一个越来越难绕开的问题:当模型开始参与训练下一代模型时,进步的速度究竟该如何度量。
Claude Code 上线 Projects:一次对话拆成并行云端会话
Claude Code 桌面端与网页版推出 Projects 测试版。一个项目即一次对话,模型自行把工作拆成多个线程、作为并行云端会话运行、在它们之间传递上下文,并在你离开后继续推进。
今天的 AI 数学之于数学,就像数值积分之于微分方程——你能拿到想要的数字,却得不到任何额外的洞见。
—— François Fleuret
生命科学验证计划开放,Mythos 首度亮相
生命科学从业者可首次在专门设计的安全保障下使用 Mythos 模型开展生物学工作。
Ternary Bonsai 2 27B 发布:体积仅为全精度 1/9
PrismML 基于 Qwen3.8 27B 推出三值模型 Bonsai 2 27B,规模压缩到全精度对应版本的九分之一。
Codex 语音代理上线,由 GPT-Live-1 驱动
在 Codex 里与语音代理对话,边说边指挥代码仓库操作。
开源生物模型降本进展
让生物学家常用的开源专业模型运行成本更低,覆盖分子结构建模、药物分子设计与突变效应预测。
Codex 用量视图细化到子代理与会话
开发者可查看任务、子代理与单个会话对额度的贡献,便于调整工作流。
Appshots 登陆 Windows 版 ChatGPT
让 ChatGPT 直接获取你正在使用的应用上下文,调试、取 UI、搬数据都不用再复制粘贴。
Astra for Law 内建数据隐私与 73 个插件
数据隐私是核心能力,另有 26 个合作伙伴插件与 47 个社区插件用于法律工作。
Grok @Bot 现在有了声音
Grok 的机器人账号新增语音能力,交互形态继续外扩。
前沿模型风险真实,但企业落地仍太慢
最强大未发布模型的风险担忧有其道理,但企业 AI 采用的真实节奏仍远不够快。

vLLM 上 Kimi K3 吞吐提升 2.2–2.8 倍
vLLM 社区在调度、KDA 状态与 MoE 内核上拆解优化,公布基准与复现命令。

Computer 推出「努力」预设
把编排模型与推理深度组合成预设,控制 Computer 完成任务的深度与成本。

Enhance Frame Rate 帧率插值模型
把任意素材转换到 25、30、48、60 或 120 fps,兼容 NTSC 的 59.94 标准。

自定义连接器,接入企业 HTTPS API
管理员可把公开可访问的 REST API 用 API-key 鉴权接入,团队无需等第一方连接器。

Bionic 智能体上线会话内省与引用
代理可检索自身会话历史,长上下文与多次压缩处理能力更强,也可用 @ 引用其他会话。

新一代 Pika:为创作者打造的 AI 创意平台
面向创作工作流的 AI 平台,强调简洁、全面,输出标准更严格。

GPT Image 2.5 Flare 对阵 Recraft V4.1 Pro
第二轮图像模型对比,覆盖动漫、写实人物与光影场景。

Cohere 预告 North 2,10 月发布
新一代 North 系列将于 2026 年 10 月面世。

Vidu S2:从绿幕到无限世界的实时编辑
S2-Editing 支持实时切换风格、服装、主体与背景,编辑即时可见。

Wan3.0 单镜头 30 秒,进入真实生产
从 5 秒、15 秒到 30 秒直出,加入导演级控制与多视频引用。

ODYSSEUS:Kling 3.0 全片生成的长片
Fountain 0 的新片由 Ash Koosha 执导,每个镜头均独家由 Kling 3.0 生成。
World Labs Atlas 用 32 张照片造实时园区漫游
NVIDIA 基于开放平台展示 Voyager,从 32 张园区照片生成实时可探索路径。
FLARE-AI:开源 AI 缺陷报告系统
审计 12 个缺陷报告系统,结合 32 家机构 49 位专家反馈设计,支持一次提交后向多个开发者与协调者分发机器可读报告。
Agora:把 Git 当作集体自主研究的共享记忆
13 个语言模型 worker 无中央调度运行近 12 天,产出 1703 条贡献,指标从 3.39 降至 1.899 bits/byte。
LimiX-2:面向通用结构化数据智能
情境机制网络联合建模表格上下文,单模型支持分类、回归与缺失值填补,在 TabArena、TALENT、BCCO 均列第一。
Schmidhuber 回顾 1987 年以来的递归自我改进
从 Meta Evolution、自修改策略、Gödel Machine 到现代 LLM 智能体,梳理四十年 RSI 脉络。
Narayanan:AI 是「常态技术」,未来需要人机协同
除非出现递归自我改进式断裂,常态技术框架仍成立;他提出人机「共同超级智能」愿景。
评估模型 Jev 上线 Vercel AI Gateway
面向软件快速结构化决策,返回选项、分数与布尔概率,可用于分类、路由与自动验证。
GLM-5.3 自我优化推理系统
10 万块国产加速器,两周内吞吐提升 3.2 倍。
Projects 改版:Tag 架构 + Thread
先上 Claude Code 测试版,借鉴 Slack 线程。
UIUC 成立协调式智能体生物学中心
贝克曼研究所种子基金,跨信息与分子生理学。
GPT-6 Astra 纯代码做宣传视频
配乐、音效、组件全部由模型处理,无生成模型。
直播 MiMo-V2.6 RL 训练
自动化评估测试,实时显示训练成本。
Grok Bot 支持 1Password 登录
免输密码即可登录网页与软件,且避免泄露。
Jev:系统 1 模型新范式
极速、超低价、不经过语言系统,也许通向 AGI。
模型选择不再重要,产品才是关键
重点从选模型转向产品到底在做什么。
未来一年软件产出或超历史总和
Vercel 前 10 年 10 亿次部署,最近 10 个月再增 14 亿。
用 Claude Projects 3D 重建埃科图书馆
处理图片视频与记录,重建约 3.3 万册藏书。