Astra 解十道悬题仅花两千美元:OpenAI 下一代模型改写数学研究成本方程式
内部版本 Astra 在数学与理论计算机科学领域一次性攻克十项重大未决问题,包括证明"非 sofic 群的存在性",总推理成本仅约 $2000。Greg Brockman 感慨:以后连 Git 都要被重写了。
Greg Brockman 本周在 X 上透露,OpenAI 内部版本的 Astra 模型以总计约 $2000 的推理成本(按 Sol API 价格折算),在数学与理论计算机科学领域解决了十项重大进展开问题。Sebastien Bubeck 随即确认,其中包括对"非 sofic 群存在性"的严格证明——这是群论中长期悬置的前沿命题。Sam Altman 同步转发了相关消息,引发 AI 研究社区广泛讨论。业界普遍认为,$2000 这个数字标志着顶级 AI 推理已从"百万级算力军备"进入"可负担研究工具"时代。任何小型学术团队都有机会借助 Astra 级别的推理能力来探索此前难以企及的理论前沿。
H3:首个与闭源顶配同台竞技的开源视频模型
MiniMax H3 打破任务与模态边界,在视频生成、语音唇同步同步等多维能力上与闭源前沿模型持平。开源权重近日即将发布,机器人领域被视为其重要落地场景。
DeepSeek-V4-Flash 登陆云端的次日推理速度翻倍
v4-Flash-0731 大幅增强 agentic 能力,上线 Ollama 云端仅一天后推理速度即提升超两倍。现已支持通过 Claude Code 直接调用,DeepSeek 训练社区跟进速度罕见。
Grok 4.5 登顶速度与成本帕累托前沿
马斯克宣布 Grok 4.5 在速度与成本综合维度上位列 Pareto #1。Grok Build CLI 同步获得子代理视图与 Plan Mode 集成,现已可通过 curl 一键安装。
我们热爱开放权重,并计划持续发布开放权重模型与微调工具。但我们不是绝对主义者——误用风险是真实存在的。这是我们思考的安全路径。
John Schulman
Replit Design 集结六大顶级模型,打造一站式 AI 设计平台
Claude、GPT-5、Gemini、Kimi、GLM 齐聚 Replit Design。用户可在同一界面跨模型比较输出并锁定最佳结果,设计工具市场从"选模型"进入"混用模型"新阶段。
SGLang 正式支持 Inkling-Small,双 DGX Spark 集群登场
SGLang 新增对 ThinkyMachines Inkling-Small 模型的原生支持,通过 ConnectX-7 互联的两台 NVIDIA DGX Spark 系统运行,社区贡献者多路并进。
Grok Imagine Video 1.5 登陆 Runway
xAI 的视频生成模型 Imagine Video 1.5 正式上线 Runway 平台,马斯克同步发文称"这种特效过去需要专业公司数月制作"。
Seedance 2.5 进军运动控制视觉特效
Higgsfield 即将发布 Seedance 2.5,主打精确运动控制与电影级 VFX 合成,目标影视后期与广告制作管线。
PixVerse 推出动作保留重建
从真实表演出发,保留运动轨迹后重建全新场景。PixVerse 为每个镜头注入无限可能,重新定义视频创作流程。
Kimi K3 落地 Blackwell NVFP4 四比特量化
Red Hat AI 将 Kimi K3 的 MoE 层量化至 4 比特精度,为 Blackwell GPU 提供配套加速方案,此为 Red Hat FP8-Block 检查点的后继版本。
Perplexity 远程 MCP 服务上线
Perplexity 的 MCP 远程服务器正式开放,开发者可通过一行命令将 Perplexity 接入 Claude Code、Cursor 或 VS Code。
eve:开源 Agentic 框架发布
类似 Next.js 之于前端的定位,eve 提供模型无关、自托管或 serverless 部署的 agent 构建框架,支持持久化执行与人工审批。
François Fleuret:AI 善用工具但尚未学会发明工具
瑞士机器学习专家指出,当前 AI 能极高效率地使用现有方法与工具,但真正意义上的"发明新方法"仍是人类的专属领域。这一论断与 Astra 的数学证明能力形成有趣对照。
编码 Agent 七月战绩:一人发现 PyTorch 至 vLLM 等多个漏洞
开发者 @jxmnop 透露,仅凭"偏执级别的谨慎"配合常规编码 agent,仅在七月份就发现 PyTorch、vLLM、Tinker、FlashQLA 等核心基础设施的多个 bug。
Nato Lambert:LLM 是人类进步的强大引擎
只需主动管理向强大 AI 的过渡,大语言模型将为人类带来巨大福祉。关键在于在释放和治理之间找到正确平衡。
Fleuret:编码 Agent 配足量 GPU 让实验加速两个数量级
每天可验证的想法数量达到了令人咋舌的地步——这一加速比或许比任何单一模型能力的提升都更具变革意义。
2027 视频生成前瞻:一帧即足以推演整个视频
c_valenzuelab 描绘未来:拍一段公园遛狗视频,取第一帧交给最强模型,它就能生成完整的 60 秒画面。这一能力在 MiniMax H3 上已有早期迹象。
Perplexity CEO:两个数量级的改善极其罕见
Aravind Srinivas 评述当前 AI 工具链的加速节奏,称连续两个数量级的效率提升是行业大事——这在历史中很少发生。
文档 OCR 路由器:逐页判定复杂度后分发最优解析器
LlamaIndex 发布文档 OCR 路由方案,能按每一页的内容复杂度自动选择最适合的解析模式。
Cohere Labs 免费 ML 夏季学校直播排名科技类第一
覆盖 NLP 到 LLM 职业规划,吸引二十余国观众参与。下周末继续开讲。
LlamaIndex 亮相拉斯维加斯 AI4 大会
Jerry Liu 将发表"解锁 AI Agent 的文档上下文"主题演讲,展位 1561。
TruffleSec 联手 Hugging Face 开展最大规模 AI 训练数据密钥扫描
旨在排查训练数据中可能泄露的 API 密钥与凭证,提升模型安全基线。
Luma Ray 3.2 登陆 Fuser
保持动作完整,以任意宽高比重构场景。
H3 为具身智能社区敞开大门
开源权重将使机器人社区能自主构建数据引擎和世界模型。
DeepSeek-v4-Flash 限时免费云访问
OpenHands 为新模型上线提供限时免费使用额度。
Clement Delangue 在 CNN 回应 OpenAI 法律争议
关于 $100M 争端的法律行动表态引发开源社区广泛关注。
Google 曾因过于谨慎阻止 DeepMind 发布产品
"下次 VC 问大厂会不会做,这条就是参考答案。"