Google Cloud 与 Inferact 让 TPU 原生支持 vLLM
Google Cloud 与 Inferact 宣布合作,让 TPU 在 vLLM 推理框架中成为“一等公民”。长期以来,TPU 在开源推理生态中的支持一直落后于 GPU,此次合作旨在显著提升 TPU 上的推理表现,为更多团队以更低成本在云端跑通大模型服务铺路。
Perplexity 与 NVIDIA 扩展本地 AI 到 Windows PC
Perplexity 宣布扩大与 NVIDIA 的合作,在搭载 RTX GPU 的 Windows PC 上提供“不限量”的本地智能。以 Perplexity harness 为基础,AI 能力被下沉到终端设备,隐私、离线可用性与响应速度成为新的卖点。
vLLM 首日支持 Intern-S2-397B
Intern-S2-397B 是面向长周期科学研究的科学多模态 MoE,总参数 397B、激活 17B,基于 Qwen3.5 混合线性/全注意力架构,支持 262K 上下文,并以 MTP 加速推理。vLLM 在发布当天即提供 Day-0 支持,同时给出 BF16 与 FP8 两种检查点的运行方式。
SGLang 首日支持 Intern-S2-397B
SGLang 也在首日支持 Intern-S2-397B。这一 397B 多模态基础模型面向科学智能与长程 Agent,其预训练范式尤其特别——直接从原始科学文献页面学习,无需额外解析。多模态、推理、编码与科学智能体能力被集成于同一模型。
「我们必须避免人类失去对未来的控制。AI 必须始终服务人类——为此,我们需要对齐与保障机制。」
WeatherNext 3:把天气预测送进电网
DeepMind 发布 WeatherNext 3,为电网运营商以及风电、光伏发电企业提供风机高度风速与太阳辐射预测。在可再生能源占比持续上升的背景下,更精准的天气预测可直接转化为更清洁、更智能的能源调度,帮助电网应对波动性。
GPT-6 Astra 在 Codex 中助力端到端测试
一位 Perplexity 工程师用 GPT-6 Astra in Codex 构建测试 harness,并 mock 第三方 API 响应,从而端到端验证各组件如何协同工作。
MiniMax H3 开放权重,推进视频生成
H3 视频生成模型支持原生立体声与多模态参考控制;开源社区正让它更快、更易接入、更便于在其之上构建。
ChatGPT 桌面语音降价 60%
OpenAI 将桌面版 Codex 与 Work 的语音价格下调约 60%,同时 ChatGPT 桌面语音吞吐提升 2.4 倍。
腾讯发布音频编辑模型 AuK
腾讯在 Hugging Face 发布 AuK,被称作音频版 nano banana,可编辑音频内容、音色与情感语气。
Cohere 发布 Parse 5 文档解析模型
Cohere 推出 Parse 5,声称能显著降低文档解析成本,直击“为解析文档付费过多”的痛点。
Synthesia 发布 Express-3 虚拟形象
Express-3 头像模型的唇形同步与动作更自然,视频生成速度提升 2 倍,所有套餐均可使用。
Recraft 上线 Gemini Omni Flash 1.1
新增 Google Gemini Omni Flash 1.1 模型,可快速生成视频,并支持以首帧与末帧两张图像作为参考。
Grok Build 由 Grok 4.6 驱动并更新
升级至 Grok 4.6,新增原生 subagent 视图、Plan Mode 集成、鼠标支持与全屏终端 UI。
验证器与技能,正成为新的“框架”
Guillermo Rauch 认为,Agent 的表现取决于你给它的 proof-checkers、编译器、类型系统与 linter——verifiers 加 skills 正在取代传统框架的位置。
Sam Altman 呼吁前沿实验室负责任
Sam Altman 表示,随着进步轨迹日益陡峭,世界有理由相信前沿 AI 公司会负责任行事;每个前沿实验室都必须兑现这一点。
黄仁勋谈 AI 监管、开源与基建
在 All-In Summit 上,黄仁勋讨论了 AI 的下一步——从合理监管、开放模型,到对 AI 基础设施的持续投资。
Runway 2026 年 ARR 增长超以往总和
Runway CEO 称,2026 年新增 ARR 已超过此前所有年份总和,仅过去 30 天新增就超过了 2025 全年。
Cohere CEO:AI 生存风险讨论偏科幻
Cohere CEO Aidan Gomez 在 Bloomberg 采访中称,AI 生存风险辩论过于科幻,“终结者式”场景不应进入公共讨论。
Aidan Gomez 反对少数公司垄断 AI 规则
Aidan Gomez 批评让两三家硅谷公司充当 AI 创造者、守门人与规则制定者的想法。
Runway 实时视频模型让草图动起来
Runway Labs 实验展示实时视频模型驱动的绘图应用,能边画边将草图动画化。
Replit 推出 Routines 监控生产数据
Replit 推出 Routines,可按计划监控生产数据,再由 Agent 调查需要推理的异常,用更少的 token 获得更多洞察。
LlamaIndex 提倡 Agent 即时 OCR
LlamaIndex 介绍两阶段即时 OCR 模式,避免 Agent 提前解析所有页面,节省成本与时间。
Adobe Firefly 推出免费 AI 图像放大
Adobe Firefly 上线免费在线 AI 图像放大工具,提升分辨率、清晰度与锐度并保留细节。
Vidu Q3-Mix 实现跨镜头角色一致性
Vidu Q3-Mix 支持参考控制与风格转换,在多镜头间保持角色、故事与视觉细节一致。
ChatGPT 帮父母发现罕见遗传病
一对父母用 ChatGPT 整理问题与医生沟通,最终帮助识别女儿罕见的遗传病与脑活动异常。
Vercel 招募 Google Cloud Run 创造者
Vercel 欢迎 Google Cloud Run 的创造者 Steren 加盟,由其领导 Fluid 计算产品线,并称 Agents 是下一前沿。
FlyOCR:用果蝇脑连接组读 PDF
利用雄性果蝇 CNS 连接组训练模型读取 PDF 的趣味实验。
Recraft 对比 GPT Image 2.5 Flare
发布多类创意场景下的图像生成对比。
Kling AI 在 TIFF 探讨 AI 影视制作
在多伦多国际电影节讨论 AI 如何降低影视制作成本。
StepAudio 3 在旧金山举办实时 AI 活动
演示、AMA 与实时 AI 生产实践小组讨论。
Arthur Mensch:企业应自建 AI
建议企业不要放缓自建 AI 模型和系统的步伐。
计算机正变成人机工作空间
Perplexity CEO 认为计算机正在演变为人类与 AI 共同工作的空间。
SAS:可端到端训练的稀疏注意力
将选择器连续分数注入 softmax 门控,让稀疏注意力可反向传播。
Sakana Namazu 进入医疗证据检索
日本医疗 AI 公司 Iris 将其引入 Evidence Finder 工具。
commit-rewriter 整理 Git 提交信息
Simon Willison 发布的本地 Python Web 应用。
两个大模型争论线形文字 A 破译
Ethan Mollick 用两个模型提出未破译文字的翻译假设。