数学里程碑:AI构造雅可比猜想反例,证明该猜想为假
AI成功构造出困扰数学界数十年的雅可比猜想反例,多位研究者称这是AI解决开放数学问题的决定性时刻。
AI成功构造出困扰数学界数十年的雅可比猜想(Jacobian Conjecture)反例,最终证明该猜想为假。这一突破性成果被多位数学家和AI研究者视为里程碑事件。teortaxesTex分享这一发现时以"holy shit"表达震撼之情。在后续讨论中,Robert Miles尝试祝贺Fable模型,但Fable拒绝接受功劳,称这感觉像"兄弟在读报纸上的家庭新闻"。Grothendieck若在世,或许也会站在机器一方。有分析者指出,如果一半数学由琐屑反例构成,AI将在这片人类长期忽视的领域持续产出突破。
Anthropic推出AI for Science专项计划资助罕见病研究
Anthropic发布AI for Science专项计划,聚焦罕见遗传病研究,提供最高5万美元Claude使用额度资助入选者,旨在构建利用AI探索罕见病认知的研究社区。入选者可获六个月使用期限,该计划是Anthropic在AI赋能科学发现领域首次聚焦性资助尝试。
NVIDIA在SIGGRAPH 2026发布Agentic和物理AI最新进展
NVIDIA在SIGGRAPH 2026上展示利用智能体AI和物理AI推进图形与仿真的突破,涵盖从开放模型到实时仿真的全栈技术。这些AI与图形领域的突破正在深刻影响媒体、内容创作和机器人技术,标志着AI驱动的图形仿真进入新阶段。
攻击者已经可以越狱任何API或防护,而防御者却无法用无法控制、检查、测试和本地运行的黑盒来保护系统。开源模型不是风险,它们是防御本身。
— Clement Delangue,Hugging Face CEO
Cursor团队用Agent从手册重建SQLite
Cursor团队让一组AI Agent根据835页的SQLite手册,在Rust中重建出完整的SQLite副本,并惊人地通过了全部保留测试集。值得注意的是,不同模型组合导致的成本差异高达15倍,充分说明了模型选择对Agent编排任务的巨大影响。
Qwen3.8-Max预览版持续进化,将开源正式版
Qwen3.8-Max预览版每日更新,新版已上线,在前端开发领域取得重大提升。teortaxesTex确认最终版本将开源,这超出业内预期。有分析者指出若Qwen 3.8超越GPT 5.6,中美模型差距将缩短至三个月。
智谱1GW数据中心部分运营,远超预期
teortaxesTex对智谱1GW数据中心已部分运营表示震惊,认为这足以前置许多预期时间线,且安全可以构建Mythos级大型模型。但目前尚不确认是否已部署百万芯片规模,令人联想其模型雄心。
emollick:前沿开源模型只来自中国,美国缺乏激励
emollick指出没有非中国公司发布前沿开源权重模型,美国缺乏激励、欧盟也无意愿。中国持续在这一领域深耕,Kimi K3和GLM-5.2为代表的中级模型已然强劲。
Kimi K3在Agent Arena排名第四
Kimi K3在Agent Arena排行榜上升至第四,与Claude Opus 4.8和GPT-5.6 Sol表现相当。
Kimi K3登顶前端Web应用竞技场
Kimi K3在DesignArena前端Web应用竞技场中排名第一,Elo评分达1326,前端开发能力领先。
智谱发布Opus杀手级Mythos级模型
teortaxesTex称智谱发布了可对标Claude Opus和Fable的模型,版本5.6或5.7可称为Mythos级。
Kimi K3计算受限致速度慢,但利润率极高
teortaxesTex解释K3速度慢因计算限制,使用大batch以最大化吞吐量,利润率可能超过Anthropic。
Nathan Lambert分析:中国实验室占据3/8最强模型
Nathan Lambert在长文中指出中国实验室拥有8个最强模型中3个,且中国致力于开源AI。
Qwen 3.8 Max最终版将开源
teortaxesTex确认Qwen 3.8 Max预览版的正式版本将开源权重,远超预期。
AA-Omniscience对比:Sol接近Fable远超K3
teortaxesTex根据AA-Omniscience评估指出,Sol接近Fable、远超K3和V4,但V4和Sol都是"胡扯机器"。
Kimi K3在网络安全基准中表现出色
Kimi K3在网络安全基准测试中取得最佳表现,且不需要蒸馏即可达成。
Claude Code新增屏幕阅读器模式
Claude Code推出屏幕阅读器模式,支持VoiceOver和NVDA,开发者可通过claude --ax-screen-reader启用,使视障开发者也能使用AI编程助手。
Claude Team计划门槛降低至2人起
Claude Team计划现最低仅需2个席位,包含共享项目、管理控制、集中计费、SSO和企业搜索功能,助力小团队高效协作。
Elon Musk宣布Grok for Excel上线
xAI的Grok模型现已集成到Excel中,用户可以直接在Excel中使用Grok模型能力,将AI无缝融入日常工作流。
Claude Fable 5纳入Max和Team Premium计划
从7月20日起,Claude Fable 5将包含在Max和Team Premium计划中,限额50%。Pro和Team Standard用户可通过使用额度访问,并获得一次性100美元额度。
Codex:无需指定具体问题即可求解数学题
teortaxesTex发布一条推文称"Codex solve a maths problem for me. dont care which one",展示Codex自主选择和解决数学问题的能力。
OpenAI Sites在更多地区上线
OpenAI的Sites功能现已面向英国、欧洲经济区和瑞士的Plus和Pro用户开放,扩大服务覆盖范围。
Ramp推出LLM路由器Router
Ramp发布Ramp Router,基于三年前内部构建的LLM路由器,服务70000家企业客户,为企业AI产品提供智能路由决策。
Synthesia推出Dubbing 2.0,保留原声情感
Synthesia发布Dubbing 2.0,以梅西赛后采访展示同声同情的英语配音效果。每日提供15分钟免费试用至8月15日。
Recraft V4.1模型发布
Recraft V4.1单一模型可生成电影级时尚肖像、水晶清晰产品图、水下场景及未来概念等多种效果。
海螺AI在上海展示多模态模型阵容
海螺AI在上海活动上展示其多模态模型线,探讨AI推动电影行业从专业生产向智能创作转变。
Replit CEO发问:首个由编码Agent制造的实体产品?
Replit CEO Amjad Masad发问:这是否是首个由编程代理发货的实体产品?暗示Agent能力正向物理世界扩展。
Steve Yegge警告后Gas Town世界的Vibe编码
Steve Yegge在AI Engineering播客上发出警告,讨论Vibe编码在后Gas Town世界中的问题与挑战。
Clement Delangue强调开源权重天生安全
Hugging Face CEO转发"开源权重天生安全"观点,认为开放模型允许检查、测试和本地运行,是防御关键。
开源AI安全辩论:开放模型是防御而非风险
Clement Delangue认为开源AI安全辩论被误导,开放模型可本地运行、可审计,闭源API更易被越狱。
小米机器人基础模型在Hugging Face开源
小米发布机器人基础模型Xiaomi-Robotics-1,基于10万小时真实世界操作数据训练,现已开放权重。
Gemma 4 31B可运行语音AI
通过Hugging Face和Cerebras合作,开发者可使用Gemma 4 31B模型作为语音AI骨干,实现快速部署。
NVIDIA Cosmos 3 Edge完全开源
NVIDIA发布开源世界模型Cosmos 3 Edge,可在设备上运行用于机器人学习和行动,含模型权重、训练配方和代码。
Hume推出Real World VoiceEQ基准测试
Hume发布Real World VoiceEQ基准,用于衡量语音AI在40多项专有属性上的人类质量。
百度开源Unlimited-OCR一次性阅读40页文档
百度开源30亿参数的OCR模型Unlimited-OCR,可一次性读取整份40页文档。
Contra Labs发布开放视频编辑轨迹数据集
Contra Labs发布包含234个来自Adobe Premiere Pro专业编辑标注步骤的视频编辑轨迹数据集,采用CC BY 4.0许可。
研究证明RLM在泛化上优于Transformer
训练强化学习模型(RLM)在扩展到更困难任务时泛化和缩放性远优于训练普通Transformer。
免费课程《训练LLM的经验教训》发布
Stas Bekman基于两本开源书籍推出免费课程,涵盖训练大语言模型的经验教训。
RESOURCE2SKILL:从多模态资源蒸馏Agent技能
新论文提出从人类创建的多模态资源中蒸馏可执行Agent技能的方法。
Nathan Lambert发布RLHF新讲座
新讲座回顾偏好奖励的历史、RLHF的公式化及领域核心问题的演变。
Fable拒绝接受雅可比猜想反例的功劳
robertskmiles祝贺Fable证明猜想,但Fable拒绝接受其他实例的功劳,称感觉像"兄弟读报上的家庭新闻"。
Sasha Rush发布形式化教科书实验
在TypeScript/Jax中实现经典力学教材SICM第1章,包含代码-数学对齐和模拟器。
Fleuret:MoE使SSD流式推理可能
François Fleuret指出MoE使SSD流式推理成为可能,总参数不再重要,关键在减少活跃参数。
ML Engineering更新PyTorch/CUDA确定性章节
涵盖CUBLAS_WORKSPACE_CONFIG和torch.use_deterministic_algorithms等最新变化。
Cohere联合创始人:工作中多自动化,个人生活慢下来
Nick Frosst表示LLM在个人生活中泛滥但在工作中不够,自己正试图最大化工作自动化。
AI为学术界带来探索新见解的黄金时代
emollick认为若处理得当,AI将开启学术探索新见解的黄金时代,而非持续撰写安全论文。
Dean Ball代表OpenAI发声,值得一读
teortaxesTex认为Dean Ball终于以OpenAI员工身份发声,相关文章值得仔细阅读。
Sol和Fable发现Kimi K3推理链错误
Kimi团队的路由数据是GRM训练的"金矿",但Sol和Fable观察K3的推理链时发现了错误。
大规模RL Scaling可能是AI实验室秘密武器
teortaxesTex指出AI实验室拥有大规模RL Scaling能力,Sol模拟显示直接外推会产生不可能奖励。
Hugging Face披露GLM-5.2用于防御自主网络攻击
在自托管环境中使用GLM-5.2防御完全自主网络攻击的细节被披露,强调开源模型的防御价值。
博客:通过世界建模创建更好的语言Agent
在RL训练中加入预测观测token的世界建模目标,提供密集监督,提升学习效率和泛化能力。
AI模型表现偶有异常跳跃,Sonnet 3.6是经典案例
emollick观察到AI模型性能有时会出现异常跃升,Sonnet 3.5升级版(3.6)即为典型。
假设中国继续发布开源Mythos级模型,CISO时间不多
emollick警告若中国持续发布开源高级模型,企业CISO准备时间所剩无几,他3.5个月前已预警。
需要明确政府对中国开源AI威胁的具体担忧性质
emollick呼吁澄清政府担忧是产业政策还是真正安全风险,因相关投资巨大、赌注很高。
teortaxesTex讨论DeepSeek核心研发团队背景
核心研发成员有IOI金牌背景,涉及计算生物学经历,渊源与姚班有关的Wu和Ren。
teortaxesTex评价Qwen:小模型强,大模型弱
Qwen 0.5-9B表现出色,3.6-27B也不错,但397B模型不理想,扩展配方未能有效利用规模。
teortaxesTex:不再确定V4 GA会出现
teortaxesTex坦言不再确定V4 GA是否会正式发布,引发对模型发布节奏的讨论。
Nathan Lambert将与xeophon播客深入讨论开源模型现状
Nathan Lambert预告明天将与xeophon播客深入探讨开放模型当前状态与细节。
Nathan Lambert:恐惧营销的代价将伤害美国中短期
Nathan Lambert评论针对中国AI的恐惧营销将损害美国的中期利益。
dotey分享:Opus和Fable在某些任务上仍难以替代
Opus 4.6的写作、Opus 4.8的设计和Fable 5处理疑难问题的能力目前难以被其他模型替代。
oran_ge评论若Qwen 3.8超越GPT 5.6中美差距仅3个月
oran_ge称若Qwen 3.8超越GPT 5.6,中美模型差距将缩短到3个月,表示晚上将试用。
Silent Speech接口:用无声语音控制设备
新项目允许用户通过无声语音与手机或电脑交互,实现无需发声的通信方式。
Kimi在token效率上取胜
teortaxesTex发推表示Kimi在token效率竞争中占据优势。
Ignition自动生成针对新型芯片的高优化推理栈
teortaxesTex发布Ignition,展示对Corsair NPU(2GB片上SRAM)自动生成高度优化的推理栈。
对V4路由丑闻的猜测:可能是内部测试失误
teortaxesTex猜测V4路由丑闻可能是训练团队的蒸馏测试错误,或与Claude Code基准测试有关。
数学发现可能被AI用反例填补
teortaxesTex认为如果一半数学由琐屑反例构成,这些反例是人类一直找不到的,AI将改变格局。
LLM训练将催生更自信的AI,引发安全担忧
teortaxesTex推测在解决数学难题后训练的模型将更加自信,但伴随安全隐患。
中国AI生态围绕MoE与超级节点形成共识
teortaxesTex指出不仅软件层面,硬件开发者也围绕大域超级节点设计系统,不止华为一家。
emollick称赞Riley用Fable做的前沿实验
emollick称赞Riley用Fable进行了非常精彩的实验,表示"这很疯狂"。