Vercel Agent 接入 Slack,可回滚部署更新配置
在 Slack 线程里 @Vercel,即可让 Agent 诊断事件、审查 PR、回滚部署、更新配置,全程无需切换应用。该功能面向 Pro 与 Enterprise 团队开放公测。
腾讯 Hyra 数学再突破:等宽体下界逼近最优
Hyra 将三维 Blaschke–Lebesgue 等宽体通用下界从 0.380799w³ 提升至 0.411040w³,达到 Meissner 猜想最优值的 97.9%。上一次数学更新之后,又连续落地了多项进展。

Cursor 云 Agent 升级:可自主接任务并坚持目标
Cursor 改进云 Agent,让它能从事件中接手工作、持续锁定目标并完成长会话任务。

Claude Managed Agents 新增自托管沙箱记忆
Anthropic 更新 Claude Managed Agents:自托管沙箱中的工作现可保存到记忆,并推出另两项改进。
Sentence Transformers v6 发布
核心变化是支持多向量嵌入模型,有望提升检索与表征能力。
Qwen3.8-27B 登顶 Harvey 基准
阿里 Qwen 称其成为 Harvey 法律 Agent 基准排名第一的开源权重模型,可本地运行。
Vera Rubin 每兆瓦吞吐提升 10 倍
CoreWeave 在 NVIDIA Vera Rubin 平台测得每兆瓦 token/s 提升 10 倍,能效优势凸显。
MiniMax H3 在 Runway 无限量上线
Max 计划用户可在限定时间内无限生成 H3 视频,无次数上限。
Kimi K3 上线 Ollama 云订阅
Ollama 云订阅提供 Kimi K3,并改进价格透明度以展示最佳性能/价格比。
Pika SFX 端到端只需 0.847 秒
50 段共 454 秒音频的本地端到端生成耗时 0.847 秒,定位生产级即时音效。
Pika SFX 比竞品便宜最高 95%
在保持高质量的同时,定价可比竞品低 95%。
GLM-5.3 发布,Terminal-Bench 超越 DeepSeek V4-Pro
Cline 评测显示 GLM-5.3 在 Terminal-Bench 上超越 Fable 与昨日的 DeepSeek V4-Pro 0813。
Kimi Work 发布金融分析师教程
涵盖实时投资者看板、财务模型更新与批量报告生成。
Seedance 2.5 支持参考图延续编辑风格
仅凭几张视觉参考即可迁移剪辑、音乐与运镜风格,现已支持 1080p。
AI 电影制作人作品登顶 Amazon 榜首
CPP 创作者用 AI 混剪真人+AI 影片《S4》登上 Amazon 榜首。
Daybreak Blue 访问故障:部分用户需重新验证
OpenAI 称因技术故障,部分用户访问权限失效,需重新验证并承诺修复。
Topaz 发布 Hyperion 2.5 视频模型
可将 8-bit AI 视频转换为真正的 HDR:ProRes 10-bit 与 EXR 16-bit。
Ornith-1.5 开源 LLM 家族发布
涵盖 9B Dense、35B MoE 与 397B MoE,用自我改进方式训练。
Apache Maka 进入孵化器
首个 Agent Harness 项目,一款本地优先的 AI 桌面助手。
唐杰谈 GLM-5.3:纯靠后训练提升编码 50%
底座仍是约 743B 参数的 GLM-5.2 MoE,每次推理激活约 40B 参数,用一个月长周期强化学习提升编码能力。
Stripe 以 70 亿美元收购 OpenRouter
模型路由正成为显学,OpenRouter 的收购让这一赛道的关注度急剧升温。
emollick:主权 AI 的隐性代价
若主权模型远远落后于前沿,在最吃能力差距的前沿应用(如网络安全)上就要付出实质代价。
AI 让作弊更糟,但早已存在
做作业对期末成绩的提升比例,从 2008 年的 86% 降到 2017 年的 45%——在那之前,学生已经开始从网上抄了。
emollick:Qwen 27B 别迷信榜单
本地跑很香,但做复杂 Agent 任务时明显不如榜单上的其他模型——自己动手测。
GDM:辩论或是可扩展的对齐路径
Debate 被视为少数可能扩展到超级智能的对齐方法之一,团队正在招人。
直觉:压缩是循环,递归是注意力
Compaction 对应 agentic 循环(RNN),recursion(RLM)对应 agentic 注意力。
midtraining 的关键维度
数据配比应强调下游真正关心的领域(数学、代码等)的高质量数据。
硬件或将不再附带驱动
「再过一代,硬件出货附带的将不是驱动,而是给你 Agent 的提示词。」
Red-Blue Pebble 通信模型
重温 Hong & Kung 81:O(n³) 朴素矩阵乘法在缓存受限下的通信行为。
LithosAI 公布首批推理定价
把 agentic 推理推向硬件物理极限,首档定价方案落地。
RAM score:一个扎实的模型指标
以「累计下载量 / 同尺寸类前十分位」衡量开源模型接受度。
独立机构应能检视训练全程
OpenAI 的分享是好的,但安全的最好方式是更多信任、更多双眼睛盯着难题。
Agentic ESOpt:低显存微调长程 Agent
用进化策略以极少 GPU 显存微调长时程 LLM Agent。
CaliBench:视频世界模型能否复现随机性
评估视频世界模型是否还原宇宙真正的随机性。
「一封邮件界面里的体面律师」
Perplexity 创始人 Aravind 对 AI 法律助手的评价。
生成式媒体迎来更多开源权重前沿
开放权重的前沿模型正在向生成式媒体领域扩展。
Anthropic:药物如何结合靶点
许多药物通过与体内特定靶点结合、阻断或改变其行为来起效。
2018 与 2026 的角色互换
「2018:HF 在做青少年聊天机器人,OpenAI 在做 Open AI;2026:HF 在做 Open AI,OpenAI 在做青少年聊天机器人。」
「你们确定不要更多数据中心?」
对算力扩张节奏的一句反问,点出当下基础设施的狂热。
