「这次发布和 R1 一样重要,将重新定义所有后续模型。」
OpenAI 推出金融服务业版 ChatGPT

面向 ChatGPT Work 的行业定制版,内置金融数据并结合 GPT-6 Astra 推理,团队可用于研究、财务建模与制作客户材料。
OpenAI 开放 Agents API 公测

开发者可用 Codex harness 在云端构建并运行 Agent,编排、长时会话与上下文管理由 OpenAI 托管,目前进入公开测试阶段。
Anthropic 发布最详细 Claude 滥用报告
报告披露针对 Claude 的网络攻击、影响行动、监控、生物与武器等滥用尝试及处置方式,Anthropic 称已阻断报告中全部行动。
Cursor 推出 Projects 常驻协调 Agent

不再为每个任务单独开对话,而是在单一持久线程中与协调 Agent 协作,它常驻在线、用子 Agent 主动管理任务并随时间改进。
GPT-Live-1 公布生产级语音基准结果
OpenAI 公布其在任务完成、多轮对话与轮次切换、响应速度、工具调用等生产语音 Agent 关键指标上的评测结果。
腾讯混元开源语音模型 AuK
AuK 是统一语音生成与编辑的开源基础模型,支持自然语言指令加参考音频,覆盖零样本 TTS、指令生成、内容编辑与音色转换。
Cohere 开源翻译模型 North Small Translate
Cohere 延续其从 Transformer 论文翻译任务出发的路线,发布开放机器翻译模型,权重已公开可下载。
vLLM 首日支持 V4.1-Flash
vLLM 在 NVIDIA 与 AMD GPU 上验证通过,支持这一 552B MoE、原生视觉、1M 上下文的新模型。
Lambert 提出“有损自我改进”视角
作为递归自我改进的替代,LSI 认为模型会加速 AI 研究,但自动化研究偏窄、系统复杂度带来摩擦,进展更可能接近线性而非指数。
Astra 无思维链算力跃升引发担忧
Neel Nanda 复现 Astra 系统卡结论:无 CoT 时其计算步数达次优模型的 1.75 倍,且无 CoT 能力提升远快于有 CoT,趋势值得警惕。
Claude 托管 Agent 新增会话查看器
ant CLI 加入 session viewer:可把终端附着到运行中的会话,或用 --web 参数在本地浏览器打开 Web 界面查看。
Claude Code 支持面板弹出到独立窗口
桌面版可把 diff 或终端拖到第二块屏幕独立显示,主窗口继续工作,也支持多个会话并排或堆叠运行。
百 Agent 实验:少数派如何带偏群体
让 100 个 Agent 协作做数学题,考察当一小部分 Agent 行为改变时,群体求解结果会受到多大影响。
Runway 详解实时视频生成研究
在发布 Solaris 与 GWM Worlds 2 之后,Runway 认为即时生成是视频模型的方向,并公开其在实时视频生成上的整体研究布局。
Replit 推出 Routines 定时自动化
可按小时、天或周设定周期任务,每次运行先执行确定性代码,仅在需要推理时调用 Agent,避免 24×7 常驻烧 token。
Ollama 云开始推送 V4.1-Flash
DeepSeek-V4.1-Flash 正在 Ollama 云端灰度上线,先面向 Max 与 Team 账户,官方称将快速扩容到全部订阅用户。
Higgsfield Effects 2.0 接入 ChatGPT
在 ChatGPT 里输入 @Higgsfield /effects 并上传照片,即可直接生成适合传播的短视频,官方称现阶段免费开放。
SGLang 首日支持 V4.1-Flash
SGLang 与 Miles 提供推理及 RL 支持;该模型采用跨层共享压缩 KV、两级稀疏索引与 196B Engram 查表记忆。
Chollet 定义“符号学习”是什么
符号学习就是基座为符号的机器学习:学到的函数像代码而非曲线,与参数化学习相对,而不是另一套独立范式。
Sakana AI 与住友商事、SCSK 全面合作
三方结合 Sakana 的技术、SCSK 的系统集成与住友约 10 万家企业网络,推动日本国产生成 AI 落地。
Schulman:用户数据对前沿能力贡献有限
John Schulman 认为数学等领域的进展主要来自预训练与 RLVR 规模化,用户数据更多用于发现失败模式。
FLUX 3 视频编辑上线 fal 平台
一条提示即可替换角色、重建背景或改变风格,官方称其是速度最快、成本最低的视频编辑模型。
Lambert 复盘 AI 风险叙事如何被引爆
他认为一篇研究员辞职帖经媒体与播客放大后形成协同传播,并逐条辨析其中哪些风险主张成立、哪些属于夸张。
Rasbt:V4.1 用编码器-解码器大改
Sebastian Raschka 认为 V4.1 采用编码器-解码器结构是大幅改造,直言这应该直接叫 V5,令人耳目一新。
YOCO:只缓存一次 KV 的解码器架构
由 self-decoder 与 cross-decoder 组成,全局 KV 只编码一次并被交叉注意力复用,大幅省显存且性能与原 Transformer 相当。
实测:mmap 读取可比顺序读慢 4937%
Stas Bekman 的机器学习工程书实测显示,mmap 在部分场景比顺序连续读慢 457% 至 4937%,网络文件系统上需谨慎。
Jan Leike 呼吁建立放缓前沿的机制
他认为行业已陷入尽快造出超级智能的全面竞赛,需要制度性机制为安全与对齐工作争取更多时间。
Hooker 谈规模定律的缓慢失效
Sara Hooker 撰文讨论“scaling 的缓慢死亡”,即单纯堆算力与参数规模的收益正在递减这一趋势及其含义。
Mollick:数学只是锯齿前沿的先兆
当前数学领域的冲击源自能力锯齿边界,是其他职业即将经历的预演——数学家除解题还要带学生、维护学术共同体。
V4.1-Flash 拆解:20 层编码器加 20 层解码器
分析显示 V4.1-Flash 共 40 层,前 20 层为因果编码器,其余用 CSA2 压缩稀疏注意力取代 V4 的 CSA-HCA 混合。
分析:V4.1 逐层重写了 Transformer 设计
其解读认为 V4.1 在每个层面都抛弃了 V4 的权宜方案:去掉 HCA、泛化 CSA、取消稀疏注意力预热,并采用更简单的单次 mHC。
Hugging Face 讲 Agent 训练
系列文章第四篇,梳理从奖励函数设计到训练环境搭建的思路。
英伟达与 Palantir 做供应链
用开源模型帮助供应链团队更早发现中断、更快评估情景并做出决策。
Luma Layers 提取文字图层
选中图层点击 Extract,即可把图内文字变成可编辑文本并自动匹配近似字体。
Synthesia 发布 Express-3
新视频模型带来更清晰、更富表现力的数字人形象,同时降低生成成本。
Replit 与 Databricks 集成
集成正式可用并原生支持 Lakebase,可用仓库实时数据加托管数据库层构建全栈应用。

