暑假里做了一些趣味的阅读:D
包括网上刷到的博客、奇闻、论文、研究等。
(未写完)
博客与奇闻
DeepSeek 录音
在网上泄露的录音中,梁总反复强调持续学习 continual learning。暑假里,被英伟达投资的 Ilya 他们也在全力突破这一领域。

continual learning 主要就卡在「灾难性遗忘」,需要新的架构或训练范式解决问题。
但如果不仅仅考虑 nn 的权重呢?例如启发式 heuristic 也是一种解法 ⬇️
Auto-research 的良好实例
这篇运用 Codex 辅助竞赛的文章 Auto-research with codex: How I achieved a 232x Faster Kernel over baseline with Codex in GPU Mode’s qr_v2 problem 在 Hacker News 上冲到了第一。数学细节不用太注意,作者主要在讨论自己的方法论。
作者参加了一个比赛,题目给出 GPU 上的大型矩阵 $A$,要求非常快地做 Householder QR 分解。不过不是直接返回 正交矩阵 $Q$ 和上三角矩阵 $R$,而是按照 PyTorch geqrf 的格式,把 $R$ 和构造 $Q$ 所需要的 Householder 信息压进 H, tau 里返回。
排行榜根据各形状和条件案例的几何平均运行时间进行排名。
作者文中的 AGENTS.md 设计值得参考。大致翻译我传到 gist 里了。
这种启发式的 Auto-research 源于 Karpathy,还有翁家翌提出的Heuristic Learning。
Self-Evolving Agent 也是一种启发式,希望 Agent 会修改自身的 prompt 甚至流程等,而最近 DeepSeek Harness 在公开的同时,也发布了一篇 Self-Evolving Agent 论文,如下。
DeepSeek 的 Self-Evolving Agent 论文
A Programming Paradigm for Spatiotemporal Composability 主要关注 Self-Evolving Agent 的时空可组合性,级联撤销组件副作用。原文提到的类型论、范畴论我是第一次了解。插件底层框架是 Cordis。
论文与研究
从群里热传的 KIMI PDF,到 2608.09867
暑假早些时候,各个群里都在刷屏关于 KIMI 等模型蒸馏的 PDF。里面提到的破解 CoT 的方法是可以复现的。不久之后,Stealing Reasoning Traces from Proprietary LLM APIs(2608.09867) 的发布,详细阐述了原理。
上学期我了解 Claude 的 prompt cache 时,没看懂 CoT blob 的回传机制,总是很困惑为什么要反复发给服务端。现在这个现象与机理较为明确了。
这篇论文还设计了一个好看的网页,便于理解:Stealing Reasoning Traces from Proprietary LLM APIs。
要理解这篇论文,需要先明白,你作为 client 能得到语言模型的 CoT 推理 token。具体来说,你通过 HTTPS 把 JSON 请求发给商家的服务器时,这个 JSON 里面包含了语言模型前几次所有的思考 CoT。
这些 CoT 是加密的,不过商家能解密,然后再给语言模型看。语言模型是无状态的,得到了你给的 JSON,才能知道自己前几次的思考。OpenAI 的文档如图:

语言模型本轮的推理也是会发回给用户的,会收到加密 blob:
1 | { |
对于 OpenAI,GPT-5.6 之前发布的模型,在多轮对话中的默认行为是不放前几轮中的推理内容。GPT-5.6 模型默认渲染前几轮中可用的推理内容。
对于 A\,早一些的模型推理也同样是 keep-last-turn-only。更旧轮次的 thinking blocks 即使传回来,API 也会自动剥离。但最新的模型都是完整传 CoT 的。A\ 的加密字段叫作 signature。
1 | { |
这些加密内容使用共享的全局密钥,这样设计的目的是跨 user、跨 session、跨模型型号进行 LLM 服务。而跨模型型号正是这篇论文破解的关键,因为更弱的模型更好进行 CoT 越狱。
一些论文
KIMI K3
KIMI K3,主要重点是 KDA 这种线性注意力,还有上半年网上讨论特别多的 AttnRes。此外还有他们简洁的 MOPD:
其中,3 个领域 * 3 种推理强度,共 9 个专家教师。
在 KIMI K3 发布不久之后,Ali Taha 写的 22580: From GPT2 to Kimi3, Explained 围绕各种线性注意力回顾了语言模型架构,最后还梳理了 AttnRes。
其实没阅读这篇文章之前,我了解的很少,不知道线性注意力的运用是如此广泛。现在 Qwen3.8、KIMI K3 都是线性注意力。不过它也没有一统江湖,DeepSeek V4 走的是 CSA、HCA 压缩这条路。
具体来说,Kimi、Qwen 的 recurrent linear attention 承担大部分层,隔几层插一次 global softmax attention。两种 attention 比例约为 3:1。
有一说一,我比较惊讶的是,AttnRes 论文 v1 是 2026 年 3 月 16 日,而 K3 是 2026 年 7 月公开,中间只有四个月,K3 就有了 Block AttnRes,兵贵神速。目前 Kimi K3 是第一个有残差注意力架构的且公开发布的旗舰大模型。
我记得,上半年网络上有人分享了这样的观点:AttnRes 架构是大创新,需要时间与实验的检验,不一定能很快进入生产;发展情况有待跟进。
但以现在这样的进展来看,AttnRes 应该是在论文发布时就已经做了非常充分的内部实验了,论文的效果完全强到了直接让 Kimi 团队换 backbone 的程度。而且团队对它的 scaling 信心也很高,毕竟 Kimi K3 有 2.8T/104B-active。我记得原 AttnRes 论文里也验证了稳定的 scaling-law improvement。
按理说 AttnRes 应该再火一把的,毕竟这个成果光速进入旗舰模型生产。这个影响应当比论文发出来还要大,不过网上讨论热度好像没有当时论文发表高。