Qwen3.8-27B 上线 LM Studio,小尺寸也能打
阿里开源模型 Qwen3.8-27B 正式登陆 LM Studio,可在笔记本上本地运行,官方称其为「笔记本尺寸、前沿级跳跃」。
一场围绕「端侧小模型」的竞赛在这个周末骤然升温。阿里通义千问团队宣布,Qwen3.8-27B 已可在 LM Studio 中直接下载运行——这是一款只有 27B 参数的密集多模态模型,却被寄予跑出「前沿级」能力的期待。过去数月,行业反复争论「小模型能否取代大模型成为默认选择」,而 Qwen3.8-27B 的落地速度给出了一个强信号:从手机到车载再到个人电脑,端侧推理的闸门正在被快速推开。对普通开发者而言,这意味着无需云端 API,也能在一台笔记本上体验接近旗舰的多模态能力。接下来几周,社区围绕它的微调、量化和 Agent 玩法,预计还会持续刷屏。
Runway 上线 Seedance 2.5,主打 1080p 细节
Seedance 2.5 正式在 Runway 上线,并以 1080p 分辨率提供早期访问,官方强调画质细节显著提升。对于正处在「AI 视频工具混战」中的创作者群体,分辨率与细节正是从 demo 走向交付的关键分水岭。
DeepSeek-V4-Pro 云版登陆 Ollama
DeepSeek-V4-Pro-0813 已在 Ollama 云全面上线,Pro/Max 订阅用户可用;服务托管于美国,并支持零数据保留(ZDR)。一行 ollama run deepseek-v4-pro:cloud 即可拉起推理,企业隐私顾虑进一步被压低。
Grok 4.6 接入微软 Copilot
马斯克确认 Grok 4.6 已在微软 Copilot 中提供,模型覆盖版图再下一城。这条仅有 6 个单词的官宣,转发近 1300 次、阅读量超六百万,足见「模型跨平台分发」已成当下最受关注的竞争变量。

vLLM 为 DSpark 引入动态草稿长度
vLLM 更新后,DSpark 可在 DeepSeek-V4-Pro-0813 上动态决定每一步验证的草稿量,首个 7-token 草稿 token 即可生效——此前用户只能为流量固定一个草稿长度,如今推理框架自己来权衡取舍。

Opus 4.6 级模型可本地跑在 MacBook Pro
Hugging Face CEO 转发称,Opus 4.6 Max 级别的智能已能在 MacBook Pro 上本地运行。「旗舰智能本地化」不再是口号——端侧硬件的进步正让前沿模型的体积门槛持续下移。
「Prompting is going away. Delete everything, keep Graph.」
—— Andrej Karpathy(转述)
智谱 GLM5.3 同基座,靠后训练大幅提升
博主点评:GLM5.3 与 GLM5.2 共享同一个 756B 基座,后训练却带来了巨大能力提升;反观 DeepSeek V4 Flash 仅以 304B 参数就展现出强劲实力,并推测 Luna 约在 500B 量级。「后训练」正成为大厂拉开差距的新战场。
Pika 连发 4 款音频模型,价格碾压同行
Pika 一口气放出视频配音、TTS、音乐、音效四款模型,主打超高性价比——配音约为同行半价,音乐低至十分之一。音频生成赛道突然卷起了「白菜价」。
Qwen3.8-27B 牵手联发科,覆盖手机与车载
阿里宣布 Qwen3.8-27B 落地智能手机与车载场景,与联发科合作推动端侧 AI 普及。
Qwen3.8-27B 跑上 RTX Spark
Qwen3.8-27B 可在 NVIDIA RTX Spark 设备上部署,官方已开放下载。
Qwen3.8 开源权重正式发布
Qwen3.8-27B 开放权重,定位原生多模态密集模型,支持多种本地部署方式。
Arcee 开源 Agent 框架 Nac 并开放 API
Arcee 发布开源 Agent harness Nac,面向长时任务,并同步启动开放模型 API 测试。
Ideogram 更新 AI 图像编辑器
新版编辑器支持对象移除、局部修改与绘制功能,图像编辑门槛进一步降低。
DeepSeek-V4-Pro-0813 接入 Novita
Novita 已在 Hugging Face 上支持该模型,具备 100 万 token 上下文窗口。
Grok 4.6 登顶新闻可靠性评测
Grok 4.6 在 RuntimeWire 的 Newsroom Reliability v0.2 基准上以 0.79 分排名第一,超越 GPT-5.6 Sol 与 Claude Opus。马斯克转推后,这条消息阅读量冲到 24 万。
Grok 4.6 通过「The Gauntlet」测试
马斯克宣布 Grok 4.6 跑完了「The Gauntlet」,暗示模型完成高难度 Agent 考核。这条官宣阅读量超 650 万,Agent 评测已成各家宣发的头号舞台。

Raschka 图解 Claude 水印机制
Sebastian Raschka 基于公开材料,解释 Claude 如何在 token 生成时利用高置信候选注入水印。

推特算法更新:视频新增 14 天召回窗口
分析新版开源算法:普通视频引入 14 天 SID 语义召回窗口,关注与双向关系进入推荐模型。

Mercor「大项目」招募超 2.6 万人引热议
AI 数据公司 Mercor 的大型数据项目据报雇佣超 2.6 万名承包商,细节保密,Reddit 上讨论升温。
Anthropic CEO 谈 AI 监管与权力集中
Dario Amodei 回应监管讨论:AI 权力要么集中在少数人手中,要么需要更审慎的制度安排。
HN 热帖:用 Codex 实现内核 232 倍加速
开发者用 Codex 等工具将内核代码加速 232 倍,还用 DeepSeek v4、Opus 5 优化视频编解码与 NEON 内核。
AI 经济:系统变好可能消除采用摩擦
Ethan Mollick 指出:若系统持续改进,传统技术采用摩擦可能失效,方向仍不确定。
前沿 AI 实验室 ARR 超过微软 Windows+Office
ARK 分析师估计,前沿 AI 实验室年化收入已在 6 月底超过微软 Windows 与 Office 收入总和。
DSH 与 Pi 对比:DSH 全面插件化
Pi 走「最小核心 + 用户拼装」,DSH 则把几乎所有能力插件化,骨架基于 Cordis。
湾区私家车自动驾驶成风
《旧金山纪事报》称湾区道路上大量私家车正自行驾驶,被称为一场「安静的革命」。
MiniMax H3 旧金山活动展示视频创作
MiniMax 在旧金山展示创作者如何用 H3 制作商业片和 MV,并进行技术讲解。
Gemini 3.7 Flash 上线 Gemini App
DeepMind CEO 转发确认,Gemini 3.7 Flash 已可在 Gemini 应用中使用。
NVIDIA 发布 MOPD 专家模型
Hugging Face 转发:NVIDIA 发布面向 MOPD 的专家模型,使相关研究更易获取。
llama.cpp 一行命令运行 Qwen3.8-27B
GGUF 格式已支持,可通过 llama serve 配合 draft-mtp 草稿模式直接运行。
智谱邀请安全机构评估 GLM-5.3
智谱向网络安全组织与研究者发出邀请,合作评估 GLM-5.3 的安全风险。
Gauntlet Loop:让 Agent 持续迭代
设定明确标准、拆分任务、不让构建者自评、持续循环,适用于代码、设计、写作与研究。
谷歌研究者:Gemini 3.1 Pro 已够用
hardmaru 认为主流模型已覆盖 99% 日常工作,并非所有人都需要最强编码模型。
英国 AI 创业环境对比加州引热议
加州允许开发者离开大厂次日创业,英国仍有差距,引发对 AI 创业政策的讨论。