Fork me on GitHub

学习大模型推理的 KV Cache

在上一篇中,我们把一次前向传播完整走了一遍:token 先查表变成向量,然后逐层经过 Transformer Block,每层里用 Q、K、V 三个向量做自注意力,最后从词表分布里挑出下一个 token。我们也知道了生成是自回归(Autoregress...

- 阅读剩余部分 -

学习大模型推理的嵌入与位置编码

在上一篇中,我们看了分词器如何用 BPE 算法把一句话切成子词,再映射成一串整数,也就是 token id 序列。这串整数是分词阶段的终点,却不是模型计算的起点。token id 说到底只是编号,和字典里每个词条的序号没有区别,编号本身不带任何语义...

- 阅读剩余部分 -

学习大模型推理的分词:从文本到 Token

在上一篇中,我们把一次请求的完整旅程走了一遍,画出了整个系列的地图:你敲下的一句话先经过分词变成 token 序列,然后模型在 Prefill 阶段一口气读完问题,接着进入 Decode 循环一个 token 一个 token 地生成回答,每一...

- 阅读剩余部分 -

大模型推理介绍:从一次提问说起

平时用豆包聊天、用 Claude Code 或 Codex 写代码,几乎成了每天的日常。但每次敲下回车之后,从第一个字蹦出来到整段回答写完,中间到底走过了哪些环节,我之前其实一直说不太清楚。最近在系统补大模型推理和训练相关的知识,于...

- 阅读剩余部分 -

学习 Headroom 的压缩管线

在上一篇里,我们从架构的角度把 Headroom 的压缩层俯瞰了一遍:内容进来之后先经过 ContentRouter 分流,再交给三大压缩器处理,中间还夹着 CacheAligner 和一整套贯穿全流程的生命周期事件。那一篇...

- 阅读剩余部分 -

学习 Headroom 的跨 agent 记忆与失败学习

在上一篇里,我们看了 Headroom 的 CCR(Compress-Cache-Retrieve,可逆压缩):压缩时把原文按哈希缓存在本地,模型觉得信息不够,就拿着哈希把原文取回来。它管的是「一次会话内」的信息不丢。这一篇我们看另外...

- 阅读剩余部分 -

学习 Headroom 的 CCR 可逆压缩

在上一篇里,我们学习了 Headroom 的三大压缩器:处理 JSON 数组的 SmartCrusher、基于 tree-sitter 做 AST(抽象语法树) 感知的 CodeAwareCompressor,以及作者自训、在本地推理的文本压缩模型 K...

- 阅读剩余部分 -

学习 Headroom 的三大压缩器

在上一篇中,我们跟着 compress() 走完了整条压缩管线。当时看到 ContentRouter 会先识别一段内容到底是 JSON、代码还是普通文本,再把它交给对应的压缩器处理。这三类文本对应的压缩器分别是 SmartCrusher...

- 阅读剩余部分 -