·约 5 分钟AI笔记

AI 小知识三篇合集:内存、缓存与三种机制


最近读到阮一峰在《科技爱好者周刊》里写的「AI 小知识」系列,一共三篇,用通俗的语言讲清了大模型的几个底层问题。我把三篇的核心内容总结在这篇文章里,原文链接附在文末,强烈推荐读原版。

一、大模型需要多少内存

这一篇回答的问题是:想在自己电脑上跑大模型,该买什么硬件?

两种选择

方案 代表 算力(FP32) 内存 价格
独立显卡 RTX 5090 104.8 TFLOPS 32GB 显存 约 3 万元
板载芯片迷你主机 AMD Strix Halo 14.8 TFLOPS 128GB 统一内存 约 2 万元

直觉上似乎该选独立显卡——算力是板载方案的 7 倍。但正确答案是「不确定」,因为大多数稍大规模的模型,RTX 5090 根本跑不起来

内存容量是第一道门槛

一个 70B(700 亿)参数的模型,按 4 位精度加载,权重就需要约 32.6GB,超出 5090 的 32GB 显存。

而板载芯片组用的是「统一内存」架构——内存由 CPU 和 GPU 共用,128GB 的内存可以尽量多分给模型。苹果 M 系列、AMD Strix Halo、NVIDIA DGX Spark 都是这种设计。

内存带宽是第二道瓶颈

但板载方案有致命弱点:内存带宽(内存向处理器传输数据的速度)。

  • RTX 5090:1792GB/s
  • AMD Strix Halo:256GB/s
  • 苹果 M3 Ultra:819GB/s

模型每生成一个 Token,就要把整个模型从内存读一遍。256GB/s 的带宽跑 40GB 的模型,每秒只能读 6 次,也就是每秒只生成 6 个 Token——完全没法用。

MoE 是解药

「混合专家模型」(MoE)每次计算只激活一部分参数。比如 Qwen3-30B-A3B 有 300 亿参数但每次只激活 30 亿,每个 Token 需要读的数据从 20GB 降到 2GB,这样在迷你主机上也能跑到每秒 100+ Token。

现实的结论

现阶段本地跑大模型,无论哪种硬件都有缺陷:显卡内存不够,板载方案算力和带宽不够。可行的选择是中等规模的 MoE 模型 + 短提示词。另外注意:板载方案处理提示词也很慢(约每秒 95 个 Token),塞一个 4000 Token 的文档要等 40 秒才出第一个字。

二、AI 缓存是什么

这一篇回答的问题是:API 定价表里「缓存命中的输入价格」为什么便宜 50 倍?

为什么输入要收费

大模型处理提示词时,要把文本分解成 Token、转成向量、计算所有 Token 之间的注意力关系——这一步非常消耗算力,所以输入 Token 要收费。

缓存的原理

多轮对话和长程任务中,每一轮都要把之前的内容重新提交给模型。但这些「前缀」是不变的,之前已经算过了——把计算结果缓存起来,下次直接复用即可。

所以缓存命中之所以便宜(比如 DeepSeek 只要 2 分钱,是未命中的 1/50):命中的部分基本不消耗算力,收的其实是存储费

各家的缓存期限

公司 缓存有效期
Anthropic 5 分钟
DeepSeek 10 分钟
OpenAI 10~30 分钟逐步失效
Google 1 小时内逐步失效

超时后缓存被删,同样的提示词就要按全价重新计算。

保持缓存激活

由于命中与未命中价差巨大,AI Agent 工具会定期发请求「保温」。传统做法是每 30 秒发一次,但激活请求本身也收费;考虑到最短缓存期限也有 5 分钟,每 4 分钟激活一次是更省钱的新建议。

三、AI 的三种机制

这一篇回答一个更根本的问题:AI 为什么能回答我们的提问,它怎么知道答案?

非专业人士只需要理解三个机制。

1. 参数机制:知识的压缩

所有大模型本质上都是对人类知识的建模:把知识分解成词元(Token),用无数个参数描述词元之间的关系(权重)。「训练」就是找出这些权重的过程——比如 GLM 5.3 有 7440 亿个参数。

提问时,模型根据这些权重找出概率上最可能的词元,生成答案。

所以大模型本质是一种「压缩-生成」机制:把人类知识压缩进参数,用的时候再生成出来。

2. 推理机制:逻辑的延伸

参数越多效果越好,但参数不可能无限增加(成本和速度都不允许)。好在很多知识不需要记忆,可以推理得到——知道出生率和死亡率,就自然知道净增长率。

推理机制让模型从参数包含的知识出发,用逻辑规则推断出它没有直接记住的知识。

3. 联网机制:实时的补充

再多的参数、再强的推理也有覆盖不到的问题——「今天的股指收盘多少」既不在参数里,也推理不出来。这时就要靠 Agent 或应用框架的联网机制,去互联网搜索。

三者的分工

参数机制 → 模型的基础知识(记住了什么)
推理机制 → 逻辑可得的知识(能推出什么)
联网机制 → 实时外部知识(能查到什么)

三种机制接力,才构成 AI 完整的回答能力。

三篇串起来看

把三篇放在一起,其实是一条完整的线索:

  1. 机制篇解释了模型的知识从哪来——参数是压缩的知识;
  2. 内存篇解释了参数的物理约束——7440 亿个参数要装进内存,还要能被快速反复读取(带宽),这是本地部署的根本瓶颈;
  3. 缓存篇解释了算力的复用——既然提示词前缀不变,就没必要每轮重算,缓存把这份算力省下来,也把价格打了下来。

理解了「参数 → 内存/带宽 → 缓存」这条链路,再看各家模型的定价表和硬件评测,基本就能看懂门道了。

原文链接