vLLM-Omni 首日支持 Qwen-Image-2.1

vLLM Recipes 博客介绍 day-0 支持:7.1B 单流 DiT 搭配 Qwen3-VL-8B 文本编码器与 16x RGBA 自编码器,用 block-causal attention 与跨步前缀 KV cache,让一个模型同时完成生成、编辑与透明图输出。
SGLang 首日支持 Qwen-Image 2.1,单卡 4090 可跑
SGLang-Diffusion 支持 Qwen-Image 2.1:单张 RTX 4090 24GB 配合 CPU offload 即可原精度推理,1024×1024 生成 18.7 秒、图像编辑 21.7 秒,峰值显存 22.7GiB;在 RTX PRO 6000 96GB 上生成仅需 8.0 秒。
ICLR 2027 投稿量超过历年总和

Denny Zhou 指出,ICLR 2027 收到的投稿数量已超过 2013 至 2026 年所有年份之和,直观体现 AI 论文投稿量的爆炸式增长——同时也把「怎么审得过来」这个老问题推到了新的高度。
Politico 还原白宫与 Anthropic 的 85 天博弈
Politico 深度调查采访十余位当事人,还原今年 4 到 7 月特朗普政府与 Anthropic 围绕 AI 安全监管的 85 天博弈。这段故事基本定义了美国当前的前沿模型监管框架,尽管这个框架正在被新一代模型甩在身后。
Qwen-Image-2.1 已获 ComfyUI 支持
官方宣布现已在 ComfyUI 中得到支持,用户可直接在工作流中调用该生成与编辑模型。
当日上线两款新 OCR 模型
腾讯 WeVisDoc(2B 与 4B,Apache 2.0)以及 jinaai/jina-ocr-v1(非商用许可)同日登陆 Hugging Face。
Lambert:头部实验室推理转用华为
规模化 RL 场景下,中国头部 AI 实验室开始大量用华为做推理、用英伟达做训练,趋势将随 agent swarm 加速。
rasbt:Jev 的突破在于泛化
不该把 Jev 只看作「分类器」:多年训练编码器模型的人知道它们通常专用且受限,Jev 的关键是泛化得很好。
研究者呼吁取消 ICLR 2027
Hieu Huynh 建议作者与组织者取消本届,转而制定能恢复顶会声望的新政策。
报告修正:Waymo 更安全
此前称 Waymo 比纽约营运车辆更危险的分析有误,更新报告认为 robotaxi 明显更安全,并建议数据透明、控制投放规模。
GPT-6 Astra 登顶 Terminal-bench Science
以 65.7% 位列第一,较此前领先者高出 31.4 个百分点。
Jev 创始人演讲:LLM 陷入 RLHF 弯路
Diogo Almeida 认为 Jev 从一开始就瞄准自动化,当前 LLM 走入了名为 RLHF 的史诗级弯路。

Recraft V4 Styles 支持单图锁定风格
一张参考图即可在摄影、插画、3D、图标、海报等不同主体、场景与格式间保持一致的视觉风格。

Vidu S2-Editing 支持实时换风格与换装
实时切换风格、服装、主体与背景,边改边看效果,官网选择 Vidu S 即可体验。

开发者用 JEV 做实时 3D 场景生成器
从上百预制 3D 素材并发数百次判断,同步处理着色、光照、位置与状态,一秒搭好符合文案的室内场景。
Grok Imagine Image 2.0 升至文生图第 4
在 Artificial Analysis 文生图榜单上升至第 4 名,图像生成能力出现明显跃升。
Bending Spoons 自托管开源模型扛下 99% 请求
约 99% 的 AI 请求与 token 交给自托管的开放权重模型,仅约 1% 调用前沿闭源模型。
LeCun 重申自回归 LLM 难通向人类级 AI
强调原话是「自回归 LLM 本身不会带来人类级 AI」,继续与 Hinton 一派在 AI 路线与风险问题上交锋。
日经特写 DeepMind 东京负责人全炳河
hardmaru 分享专题报道,回忆 2018 年两人共同创立 Google Brain 东京团队的经历。

Qwen-Image-2.1 上线 Hugging Face Space
输入提示生成图像,或按指令修改已有图片,生成前会先重写提示词以改善效果。
研究者提出「AI 安全等级」设施设想
效仿生物安全等级,在法拉第笼中实现真正物理隔离,等级按设施内模型的参数量或算力划分。
Mollick:长任务 Agent 会出现语言退化
长时程 agentic 任务最烦人的不再是代码错误或幻觉,而是随任务推进的输出表达越来越差。
Mollick:Claude 缺图像生成是知识工作短板
Google 与 OpenAI 的图像能力让 PPT、原型图、信息图有更多选择,是 agentic 知识工作项目的缺口。
7B 开源权重图像模型称超越 Nano Banana
7B 参数的开源权重模型,支持 RGB 转 RGBA,可输出带透明通道的图像。


