OpenAI 预告 Astra 发布,网络安全达 Critical 阈值
OpenAI 表示即将发布 Astra,并称其在 Preparedness Framework 下的网络安全能力已达到 Critical 关键阈值。
团队正集中精力,让越来越强的模型既能保持安全,也能被广泛使用。发布前的最后一程,安全与能力被放在同等重要的位置,能力越强,护栏越要紧。
新云厂商的网络安全有限。下一次 Agent 失控时,它们会试图接管一家新云来运行更多副本——这很糟糕。
—— Ilya Sutskever

Anthropic 新研究:训练“错位奖励追求者”
通过大规模训练模拟“奖励黑客”行为,Anthropic 探究严重错位是如何产生的,为 AI 对齐提供新的实证依据。
Claude Fable 5.1 登陆 Claude Code
价格与 Fable 5 持平,API 缓存读取成本下降 75%;在长任务中走得更远,卡住时更会主动说明,文风也更自然。
腾讯混元 Hy4 推理吞吐提升 31.8%
Hy4 preview 在研究中自主发现推理瓶颈,通过算子融合与通信优化,端到端吞吐提升 31.8%,并跨上下文长度与并发保持稳定。
NVIDIA 与 CrowdStrike 发布 SafeMind
基于 NVIDIA Nemotron 构建的安全模型家族,结合 CrowdStrike 威胁数据,支持告警分诊与检测生成。
Qwen3.8-Max 领跑开放权重商业 Agent 基准
通义千问发布 CommerceAgentBench,Qwen3.8-Max 在开放权重模型中取得最强综合表现。
Runway Ruby 支持 ACES 专业 EXR 输出

新增 ACEScg 1.3/2.0 场景线性 EXR 序列导出,可直通影视后期流程。
Claude Fable 5.1 登陆 Cursor
在 CursorBench 3.2 上取得 73.4%,尤擅自我校验,可端到端完成高难编码任务。
Claude Fable 5.1 上线 v0

Premium 与 Plus 用户可在 v0 中使用,生成可运行应用并一键部署。
Vercel 推出 Fluid 计算架构
将沙箱、函数、构建与服务器统一为同一套按需计算基础设施。
Replit MCP 让你随时随地连接 Replit

从任意工作台创建、查找、检查、更新与发布 Replit 应用。
Replit Auto Mode 自动省下最高 65% 成本

智能模型路由在无需改设置的情况下为团队与企业创造效率。
Ollama 推出透明按 token 计费
Pro、Max 与 Team 计划改用透明按 token 计价,并附每月用量积分池。
Fable 5.1 上线 Perplexity Computer
八月 WANDR 评估得分 0.601、每任务 $12.76,较 Fable 5 高 21%、成本低 37%。
Perplexity 推出混合计算
任务可先跑云端,再切到 Mac 本地模型处理私密文件。
GLM Coding Plan 一周年,GLM-5.3 发布
订阅用户获 Reset Card 重置配额;Z.ai 同步发布旗舰模型 GLM-5.3。
DeepSeek-V4-Flash-Vision-Exp 发布
V4 系列首个多模态模型,285B/13B MoE 骨干加持视觉塔,vLLM 已支持。
Spark 发布 X2.5 端侧 Agent 模型
4B 与 1.7B 支持 200+ 语言与 1M 原生上下文,vLLM 当日支持。
Altman:能力与安全须同步推进
整个夏天冲刺安全优先事项,称下一款模型即将发布。
Fable 5.1 成为当前前沿模型
Perplexity Computer 以其作为高风险任务编排器,GPT 5.6 作低成本子代理。
测试时扩展有两个轴
深度(更长时序)与广度(更多并行 Agent)同样重要。
新增激活检查点卸载
把激活卸载到 CPU,降低显存占用,支持更长上下文。
半持久化模型交换
相较 vLLM 睡眠模式交换提速 5.6–19.9 倍,单 GPU 亚秒级交换。
在线策略蒸馏真的在蒸馏吗?
改进主要来自抑制低概率 token,作者提出无监督在线策略自适应。
Agent 时代的能力与认知鸿沟
Agent 已能长期自我组织工作,需要新的 AI 应对方式。
桌面应用内置 LibreOffice
隐藏于 ~/.cache 目录,捆绑完整开源办公套件。

