2026年8月20日 · 星期四

● 模型与产品 · MODELS & PRODUCTS08·20
● 短讯 · BRIEFS08·20
COMMENT

emollick:主权 AI 的隐性代价

若主权模型远远落后于前沿,在最吃能力差距的前沿应用(如网络安全)上就要付出实质代价。

EDUCATION

AI 让作弊更糟,但早已存在

做作业对期末成绩的提升比例,从 2008 年的 86% 降到 2017 年的 45%——在那之前,学生已经开始从网上抄了。

BENCHMARK

emollick:Qwen 27B 别迷信榜单

本地跑很香,但做复杂 Agent 任务时明显不如榜单上的其他模型——自己动手测。

SAFETY

GDM:辩论或是可扩展的对齐路径

Debate 被视为少数可能扩展到超级智能的对齐方法之一,团队正在招人。

RESEARCH

直觉:压缩是循环,递归是注意力

Compaction 对应 agentic 循环(RNN),recursion(RLM)对应 agentic 注意力。

RESEARCH

midtraining 的关键维度

数据配比应强调下游真正关心的领域(数学、代码等)的高质量数据。

PREDICTION

硬件或将不再附带驱动

「再过一代,硬件出货附带的将不是驱动,而是给你 Agent 的提示词。」

RESEARCH

Red-Blue Pebble 通信模型

重温 Hong & Kung 81:O(n³) 朴素矩阵乘法在缓存受限下的通信行为。

HARDWARE

LithosAI 公布首批推理定价

把 agentic 推理推向硬件物理极限,首档定价方案落地。

METRIC

RAM score:一个扎实的模型指标

以「累计下载量 / 同尺寸类前十分位」衡量开源模型接受度。

SAFETY

独立机构应能检视训练全程

OpenAI 的分享是好的,但安全的最好方式是更多信任、更多双眼睛盯着难题。

PAPER

Agentic ESOpt:低显存微调长程 Agent

用进化策略以极少 GPU 显存微调长时程 LLM Agent。

BENCHMARK

CaliBench:视频世界模型能否复现随机性

评估视频世界模型是否还原宇宙真正的随机性。

PRODUCT

「一封邮件界面里的体面律师」

Perplexity 创始人 Aravind 对 AI 法律助手的评价。

MEDIA

生成式媒体迎来更多开源权重前沿

开放权重的前沿模型正在向生成式媒体领域扩展。

BIOTECH

Anthropic:药物如何结合靶点

许多药物通过与体内特定靶点结合、阻断或改变其行为来起效。

OBSERVATION

2018 与 2026 的角色互换

「2018:HF 在做青少年聊天机器人,OpenAI 在做 Open AI;2026:HF 在做 Open AI,OpenAI 在做青少年聊天机器人。」

INFRA

「你们确定不要更多数据中心?」

对算力扩张节奏的一句反问,点出当下基础设施的狂热。

© 2026 FAV0 · AI Daily · 由版面编辑自动编排