GPT-5.6 Sol自我优化:服务成本降20%,推理效率提升15%
OpenAI部署GPT-5.6 Sol用于自我优化,模型自行改进了生产GPU内核和推测解码,实现显著降本增效。
部署后,OpenAI让GPT-5.6 Sol自我优化运行效率。结果是:生产GPU内核改进使服务成本降低20%,推测解码优化使token生成效率提升超过15%。这些改进在推理和Agent循环中持续叠加,从同样的底层硬件中释放出更多有效算力。
GPT-5.6 Sol在ARC-AGI-3上的表现被Harness束缚
GPT-5.6 Sol已被用于解决数学领域的开放问题,但在ARC-AGI-3的2D益智游戏基准测试中却表现挣扎。OpenAI调查发现,问题出在Harness——它阻止模型记住已学内容。启用两个关键API设置后,模型得分提升三倍。
OpenAI为研究人员免费提供前沿模型,将扩展至10万人
OpenAI推出ChatGPT学术研究员计划,首批1万名科学家、数学家和工程师可免费访问前沿模型,计划到2027年扩展至10万人。该计划旨在加速跨学科的科学发现。
OpenAI低调开源代码安全工具Codex Security CLI
Hacker News率先发现了OpenAI悄悄开源的Codex Security CLI。该工具支持扫描仓库、跨运行跟踪安全发现、验证修复方案,并集成到CI/CD流水线中。目前为早期版本。
MiniMax与Fireworks AI联合开源M3推理内核
MiniMax和Fireworks AI开源了面向NVIDIA Blackwell(SM100)的M3推理内核,包括密集FlashAttention和稀疏top-k注意力内核,以及KV-outer稀疏预填充后端。
腾讯混元开源AngelSpec投机解码框架,实测2倍加速
腾讯混元开源端到端投机解码框架AngelSpec。经测试,DFly在Hy3-A21B上实现了1.98至2.40倍的端到端加速,且吞吐量提升了10%以上。
Replit推出AI驱动设计工具Replit Design
Replit发布AI设计平台Replit Design,通过环境智能实现无提示交互,让设计创作更直观。用户不需要设计语言,每一步Agent都会建议最佳下一步操作。
Perplexity开源Agent安全套件Numbat
Perplexity开源Numbat,这是一个跨平台(macOS/Linux/Windows)的Agent检测与响应层,可为安全团队提供Agent活动的完整可见性,并在执行前阻止高风险操作。
vLLM在Kimi K3上创下单批解码464 tok/s纪录
vLLM搭配DSpark在4×4 GB300上运行Kimi K3,在低熵推理负载下实现464 tok/s的单批解码性能。该基准可完全复现,已提供公开镜像。
Dream-Cubed:AI生成可玩Minecraft世界的新方法
研究团队基于包含数十亿个方块的Minecraft数据集训练3D扩散模型,支持生物群落条件生成、修复和外扩。模型直接在32³分辨率上训练,保留细粒度控制能力。
SKT发布688B稀疏MoE模型A.X K2,开源至Hugging Face
A.X K2是韩国迄今发布的最大开源LLM,总参数量688B,活跃参数33B,采用大规模稀疏MoE架构,已在Hugging Face上公开发布。
AI行业盛行996甚至002工作制,长期缺乏休息将损害创造力和判断力。团队文化比个人能力更关键,而新实验室难以从零追赶成熟团队,因为内部工具、资源和人才积累差距持续扩大。
Nathan Lambert · 谈AI高强度工作文化的不可持续性
OpenAIDevs用GPT-5.6 Sol优化自身基础设施
OpenAI开发者团队使用GPT-5.6 Sol在Codex中优化基础设施,改善推理和Agent循环效率。
Cursor代码编辑器现已登陆iPad
Cursor正式推出iPad版本,提供更大的可视区域以配合AI Agent工作,保留所有iPhone端功能。
v0新增开放权重模型支持,首批引入Kimi K3
v0现已支持Kimi K3等开放权重模型,用户可快速生成全栈Web应用并一键部署为在线网站。
Replit推出Model Selector,支持开放权重模型
新的Model Selector让用户根据任务选择最佳模型,平衡智能、成本和速度。
Grok现已集成至Microsoft Copilot
Elon Musk宣布Grok正式进入Microsoft Copilot工具集,扩展AI助手模型选择范围。
N.Lambert与S.Geng深度探讨Olmo 3后训练与DPO
播客节目详细分析了研究想法如何进入前沿模型,以及DPO在实际应用中的复杂性。
新论文提出相关性感知搜索代理RARG
RARG将相关性转化为执行先验,在浏览问答和推理密集型检索任务中优于现有方法。
HiFi-UMI:仅用高保真演示数据学习可部署机器人策略
便携式数据采集系统将末端执行器精度提升至3mm,后训练效果与遥操作基线持平甚至更优。
AI社区签署公开信,呼吁协调AI发展速度
多位AI研究者签署公开信,认为AI进展太快需要协调节奏,确保存在减速备选方案。
GPT-5.6 Sol解决概率论长期未解问题
Greg Brockman证实GPT-5.6 Sol成功解决了一个概率论领域的长期未解问题。
Hugging Face推出OAuth登录功能
新增Sign-In with Hugging Face按钮,用户可按OAuth方式分享邮箱、创建模型仓库和启动GPU作业。
Cohere Transcribe集成Superwhisper,支持离线转录
Cohere Transcribe现可在Superwhisper中使用,支持离线转录、应用集成和专业词汇召回。
LlamaParse推出UI批量解析,支持最多1万文件
LlamaParse新增批量解析功能,用户可在UI中直接对文件夹进行解析,无需编写代码。
Pika预告Seedance 2.5视频模型即将发布
Pika官方确认新一代视频生成模型Seedance 2.5即将在平台推出。
Z.AI的GLM模型集成Pi Coding Agent
Z.AI的GLM模型现可连接Pi Coding Agent终端编码工具,通过API Key支持代码生成和项目分析。
Vidu与MachGen合作推出Q3 Turbo API,实现秒级视频生成
Vidu Q3 Turbo通过MachGen提供API服务,号称最快商用AI视频推理,现限时免费试用。
Vidu S1推出AI游戏伴侣,支持实时语音互动
Vidu S1模型展示了与宠物、原创角色进行实时对话和情感交互的AI游戏伴侣功能。
Amjad Masad点评当前AI模型性价比格局
Replit CEO对Kimi K3、DeepSeek V4、GPT系列和Anthropic模型进行了简要比较,看好开源模型前景。