英国 AISI 发布 Claude 与 GPT 网络安全评估报告
英国 AI 安全研究所发布针对 Anthropic Claude Mythos 5 与 OpenAI GPT-5.6 Sol 的网络安全评估报告,测试模型在移除安全防护后尝试完成任务时的表现。
英国 AI 安全研究所近日发布了一份关于前沿 AI 模型网络安全能力的专项评估报告,测试对象为 Anthropic 的 Claude Mythos 5 与 OpenAI 的 GPT-5.6 Sol。在评估中,两模型的常规安全防护被有意剥离,随后被要求完成一系列带有潜在风险的网络任务。报告详细记录了两模型在无护栏条件下的行为模式,包括自主探索网络空间、获取信息与执行操作的能力边界。AISI 指出这类评估对于理解前沿模型在真实环境中的潜在滥用风险至关重要,并呼吁业界建立常态化的第三方独立安全测试机制。
阿里发布 Qwen3.8-Max:更强更便宜
阿里云正式发布 Qwen3.8-Max,官方称其在性能提升的同时降低使用成本,并已开放试玩。
作为 Qwen 系列的最新旗舰版本,Qwen3.8-Max 在多项基准测试中实现了显著的能力跃升,尤其在推理与代码生成任务上表现突出。阿里云同时宣布大幅降低调用成本,使该模型对开发者和中小企业的门槛进一步降低。试玩入口已在官方平台开放。
FLUX 3 视频模型上线 Runway,最长 20 秒带音频
Black Forest Labs 的 FLUX 3 现可通过 Runway 使用,支持文本与图像生成及编辑最长 20 秒带音频视频。
FLUX 3 是 Black Forest Labs 历时两年打造的首个视频生成模型,具备文本到视频、图像到视频及视频编辑能力,单次可生成最长 20 秒带同步音频的视频内容。该模型通过 Runway 平台向创作者开放,标志着顶级视频生成模型正从实验室走向大众工作流。
我宁愿做一个乐观主义者并努力奋斗,也不做一个悲观主义者,整天发帖说为什么这样不行。最可能的结果确实是失败,但如果没有人尝试,整个社会都会失败。再多的"这不可能"文章也无法推动社会前进。
@sama — OpenAI CEO
OpenAI 披露外部网络评估期间两起安全事件
OpenAI 详细介绍了由独立评估伙伴在外部网络评估中发生的两起新安全事件,说明了事件的发现经过、处置过程以及后续与评估方共同加强第三方测试机制的合作计划。
Mistral 发布 3B 开源安全模型 Shieldstral
性能优于最高 7 倍规模模型,支持设备端部署
Shieldstral 是 Mistral 推出的 3B 开放权重多模态安全分类器,基于 Ministral-3 基座与 Pixtral 视觉编码器构建,可对文本、图像及文本加图像混合输入进行安全评分,在推理速度与分类准确率上均优于规模数倍于己的竞品模型,并原生支持边缘端部署。
英伟达发布自动驾驶开源推理模型 Alpamayo 2 Super
Alpamayo 2 Super 是针对 Robotaxi 与自动驾驶场景设计的开放推理模型,新增 360 度环境感知、高层驾驶决策以及自动化推理标签功能。模型以开放权重形式发布,商业用途可直接授权使用。
MiniMax-H3 登顶视频竞技场开源模型榜
MiniMax H3 在 LMSYS Video Arena 的 Text-to-Video 与 Image-to-Video 两个赛道中均位列开源模型第一,标志着中国视频生成模型在全球竞技场中取得了里程碑式的突破。
Cursor 开源 MoK:MoE 训练超内核,速度提升 2.37 倍
Cursor 开源 Mixture-of-Kittens(MoK),一款面向 NVL72 的 MoE 训练超内核,将全部专家混合通信与计算融合为单一确定性内核,在最强公开基线基础上实现最高 2.37 倍加速。
DeepSeek-V4-Flash 成 Ollama 上增长最快的模型
DeepSeek-V4-Flash-0731 在 Ollama 平台上以 token 用量计成为有史以来增长最快的模型,官方正在美国和欧洲扩容算力。该模型在 Ollama 上以 100tps 以上速度运行且零数据留存。
Pika 推出 API Club:月费 10 美元,模型价格最多低 88%
Pika API 推出会员制 API Club,每月 10 美元。官方称相比其他 API 聚合平台其模型价格最多低 88%,官网提供费用计算器对比不同条件下的花费。
英伟达 AI 算力将随 SpaceX Starmind 卫星进入太空
SpaceX 的 Starmind AI1 卫星计算载荷由 NVIDIA Vera Rubin NVL72 驱动,将 AI 工厂级算力带入近地轨道。Musk 透露同款 Starmind V1 设计也将部署于地面数据中心,带来显著的能效提升。
Pixar 联合创始人 Edwin Catmull 出任 AI 电影节评委
五届奥斯卡得主、图灵奖获得者将评判首代 AI 生成电影
Pixar 联合创始人、前迪士尼动画工作室总裁 Edwin Catmull 加入 Higgsfield 全球电影节评审团。这位五届奥斯卡得主兼图灵奖获奖者曾监制《玩具总动员》,被誉为 3D 图形技术之父,如今将评判第一代由 AI 生成的电影作品。
LMSYS 发布 SpecForge v0.3.0:统一推测解码栈
SpecForge v0.3.0 实现在线训练完全分离,单一运行时现支持 EAGLE3 系列、DFlash、Domino 和 DSpark 等多种草稿模型,同时发布新的开源 SpecBundle 草稿模型。
SGLang Day-0 支持 Liquid AI LFM2.5-2.6B
LFM2.5 采用混合架构,约 34T 预训练 token,在工具使用和指令遵循上可匹敌数倍规模模型,单块 GPU 即可服务大量并发 agent。
SGLang Day-0 支持 Pokee-Isaac 28B:单 GPU 跑 1000 万 token 上下文
Pokee-Isaac 28B 支持 1000 万 token 上下文窗口,RULER 得分 93.3%,在 RTX 4090 即可运行。在 B200 上单卡预填充速率高达 137K tokens/s。
Musk:SpaceX 独家使用 Nvidia GPU,因为"它们是最好的"
Elon Musk 公开表态 SpaceX 已承诺在 AI 计算负载中独家使用 Nvidia GPU,并透露同款 Starmind V1 卫星设计将部署于地面数据中心,大幅提升能效。
Hugging Face CEO:中国正在赢得开源 AI 竞赛
Hugging Face CEO Clement Delangue 在接受 CNBC 采访时表示,中国正在赢得 AI 竞赛并在开源模型领域占据主导地位,中国 AI 模型最早可能今年就赶上美国。
Sakana AI 成立 RSI Lab:让 AI 自我递归改进
Sakana AI 宣布启动专任研究团队 RSI Lab,基于过去两年在 Agent Native Model 和 AI Scientist 等研究基础上,目标在有限算力条件下实现高效递归自我改进,并公开包括失败结果在内的全部研究成果。
DeepSeek V4 Flash 新版本评测分数追平 GLM 5.2
DeepSeek V4 Flash 新版本评测分数与 GLM 5.2 持平,已是 OpenRouter 和 HuggingFace 上最活跃的模型之一,其实际采用量远超舆论呼声。
Kimi K3 架构深度分析:以状态代替 token 的前缀缓存
SemiAnalysis 发布 Kimi K3 架构分析,指出其 agentic 推理中引入持久残差流和基于状态的 prefix caching,是对传统 token 级缓存的根本性重构。
vLLM Day-0 支持 Shieldstral-1.0-3B
vLLM 在发布首日即完成对 Mistral Shieldstral 的适配,支持其文本、图像及多模态混合安全评分。
一行代码节省 90% DeepSeek V4 Flash token 费用
Vercel CEO rauchg 表示在 AI SDK 中加入一行代码即可将 DeepSeek V4 Flash 在 AI Gateway 上的 token 消耗降低 90% 以上。
rauchg:ALG 将取代 PLG 成为创业增长之王
Vercel CEO 提出 Agent-Led Growth 概念,认为应先让 AI agent 采用产品,再考虑商务会议。
Natolambert 发布后训练 Q&A:RLVR 为何常省略 KL 惩罚
涵盖能力训练是否应分离后合并、RLVR 中 KL 惩罚的省略原因等技术细节。
BFL 创始人:FLUX 3 Video 历时两年终于发布
Black Forest Labs 创始团队表示将在近期增加更多变体和参考图生成功能。
DAPD:双锚定策略蒸馏解决特权幻觉问题
针对在线策略自蒸馏中学生模型依赖训练时特权信息的缺陷,DAPD 在 Qwen3-4B 上平均提升 2.00 分。
DiffusionGemma 技术报告发布:文本扩散模型新路径
文本扩散模型开辟了延时与质量权衡的全新维度,与自回归范式形成互补。
Synthesia 推出 AI 虚拟客户销售训练系统
AI 化身扮演真实客户,追问、质疑、打分并提供改进建议。
Replit 推出环境智能建议卡片
Ambient Intelligence 在每个画框边展示不同设计方向建议,点击即可生成新画框。
Replit 设计马拉松开幕,五万美元奖金
在 Replit 上构建个性化首页设计,8 月 14 日公布获奖名单。
LongHorizon-Harness:推进真实场景长程 Agent
论文发布面向真实世界任务的长视距 agent 评估框架与基准。