X 文章

KV Cache:从推理优化到 Runtime 基础设施

过去两年,AI 领域最热门的话题几乎都围绕着知识展开。

KV Cache:从推理优化到 Runtime 基础设施

Prompt。

RAG。

Context。

Memory。

长上下文。

知识库。

大家都在研究同一个问题:

如何让 AI 知道更多东西。

但最近看了一些关于 Agent 和 KV Cache 的论文之后,我开始意识到:

AI 领域正在出现另一类问题。

它不再关心 AI 知道什么。

而开始关心:

AI 是否还在重复思考已经想过的事情。

而 KV Cache,可能是大模型世界第一次系统性解决这个问题的方案。

KV Cache:从推理优化到 Runtime 基础设施

一、什么是 KV Cache

很多文章会从 Transformer 的 Key、Value 和 Attention 开始讲起。

但从工程视角看,KV Cache 可以用一句话概括:

缓存已经完成的计算结果。

注意。

这里缓存的不是知识。

不是文档。

不是记忆。

而是:

已经计算过的 Attention 结果

很多人会把 Context 和 KV Cache 混在一起。

实际上两者解决的是完全不同的问题。

Context 解决:

AI 知道什么。

KV Cache 解决:

AI 已经算过什么。

这是两个不同维度。

KV Cache:从推理优化到 Runtime 基础设施

二、为什么会出现 KV Cache

假设模型已经看到:

今天 天气 很好

然后准备生成下一个 Token。

Transformer 会完成大量计算。

这些计算会产生对应的 Key 和 Value。

问题来了。

下一秒模型继续生成内容时。

前面那部分历史内容并没有变化。

那么:

为什么还要重新计算一次?

于是 KV Cache 出现了。

它把已经完成的计算结果保存下来。

以后直接复用。

从软件工程角度看。

KV Cache 更像:

Computed Cache

计算结果缓存。

而不是:

Data Cache

数据缓存。

三、在 Chat 时代,它只是优化

KV Cache:从推理优化到 Runtime 基础设施

过去大家讨论 KV Cache。

大部分时候是在讨论推理性能。

因为聊天模型的运行方式很简单:

answer = model(prompt)

问一次。

答一次。

结束。

在这种模式下。

KV Cache 的价值主要体现在:

  • 更快的推理速度
  • 更高的吞吐量
  • 更低的服务成本

没有它。

系统仍然能运行。

只是更慢。

所以过去的 KV Cache 更像一种性能优化技术。

四、Agent 时代开始出现变化

但 Agent 出现之后。

情况开始变得有意思。

过去:

answer = model(prompt)

结束。

现在:

while not done: think() act() observe() repair()

Agent 开始持续运行。

持续思考。

持续执行。

持续修正。

这时候会出现一个新的问题:

AI 是否要在每一轮循环里,把过去所有内容重新思考一遍?

如果答案是“是”。

那么成本会迅速失控。

因为 Agent 的运行时间可能是:

5分钟

30分钟

2小时

甚至几天

每一次重新推理。

都会消耗新的计算资源。

于是 Runtime 必须解决一个经典问题:

哪些东西已经算过了?

而 KV Cache 给出的答案是:

已经思考过的内容,不要重复思考。

从这一刻开始。

KV Cache 的角色开始发生变化。

它不再只是让系统跑得更快。

它开始帮助系统持续运行。

五、为什么这件事很重要

最近几年。

AI 领域一直在解决知识问题。

大家研究:

Prompt

Context

RAG

Memory

这些都在回答:

AI 应该知道什么。

但随着 Agent 的出现。

另一个问题开始浮现:

AI 应该如何复用已经完成的计算?

这是一个完全不同的问题。

知识和计算不是一回事。

例如:

产品文档属于知识。

数据库结构属于知识。

业务规则属于知识。

但:

已经完成的推理

已经执行过的规划

已经验证过的结果

这些属于计算过程。

过去的 AI 更多像一个查询系统。

未来的 Agent 更像一个持续运行的系统。

而持续运行的系统都会遇到同一个问题:

重复工作太贵。

六、论文里的一个信号

最近出现的一些研究开始变得有趣。

有人研究:

Persistent KV Cache

让缓存跨会话存在。

有人研究:

Workflow-aware KV Cache

根据 Agent 的执行路径管理缓存。

有人研究:

KV Cache Memory

尝试把 KV Cache 用作工作记忆。

这些方案未必会成为最终答案。

但它们透露出一个共同信号:

研究者开始把 KV Cache 看成 Runtime 资源。

而不是 Transformer 内部细节。

这意味着讨论重点正在发生变化。

过去讨论的是:

如何计算

现在开始讨论:

如何复用计算

七、未来

未来 Agent Runtime 可能会越来越依赖各种形式的 Cache。

KV Cache:从推理优化到 Runtime 基础设施

今天我们看到的是:

KV Cache

未来可能还会出现:

Tool Cache

Planning Cache

Inference Cache

Search Cache

因为所有长期运行的系统最终都会面对同一个问题:

如何避免重复工作。

CPU 如此。

数据库如此。

浏览器如此。

Agent Runtime 大概率也如此。

KV Cache 只是第一块拼图。

八、结语

Prompt 解决输入问题。

Context 解决知识问题。

而 KV Cache 解决的是另一件事:

如何避免 AI 一直重复思考同样的事情。

在 Chat 时代。

KV Cache 更像一种推理优化技术。

在 Agent 时代。

它开始承担新的职责。

帮助系统复用已经完成的计算。

帮助 Agent 以更低成本持续运行。

也许未来真正重要的不是 KV Cache 本身。

而是它背后代表的趋势:

AI 不仅需要知道什么。

还需要记住自己已经想过什么。

而这恰恰是所有成熟 Runtime 都经历过的一次演化。