AI 小知识三篇合集:内存、缓存与三种机制
最近读到阮一峰在《科技爱好者周刊》里写的「AI 小知识」系列,一共三篇,用通俗的语言讲清了大模型的几个底层问题。我把三篇的核心内容总结在这篇文章里,原文链接附在文末,强烈推荐读原版。
一、大模型需要多少内存
这一篇回答的问题是:想在自己电脑上跑大模型,该买什么硬件?
两种选择
| 方案 | 代表 | 算力(FP32) | 内存 | 价格 |
|---|---|---|---|---|
| 独立显卡 | RTX 5090 | 104.8 TFLOPS | 32GB 显存 | 约 3 万元 |
| 板载芯片迷你主机 | AMD Strix Halo | 14.8 TFLOPS | 128GB 统一内存 | 约 2 万元 |
直觉上似乎该选独立显卡——算力是板载方案的 7 倍。但正确答案是「不确定」,因为大多数稍大规模的模型,RTX 5090 根本跑不起来。
内存容量是第一道门槛
一个 70B(700 亿)参数的模型,按 4 位精度加载,权重就需要约 32.6GB,超出 5090 的 32GB 显存。
而板载芯片组用的是「统一内存」架构——内存由 CPU 和 GPU 共用,128GB 的内存可以尽量多分给模型。苹果 M 系列、AMD Strix Halo、NVIDIA DGX Spark 都是这种设计。
内存带宽是第二道瓶颈
但板载方案有致命弱点:内存带宽(内存向处理器传输数据的速度)。
- RTX 5090:1792GB/s
- AMD Strix Halo:256GB/s
- 苹果 M3 Ultra:819GB/s
模型每生成一个 Token,就要把整个模型从内存读一遍。256GB/s 的带宽跑 40GB 的模型,每秒只能读 6 次,也就是每秒只生成 6 个 Token——完全没法用。
MoE 是解药
「混合专家模型」(MoE)每次计算只激活一部分参数。比如 Qwen3-30B-A3B 有 300 亿参数但每次只激活 30 亿,每个 Token 需要读的数据从 20GB 降到 2GB,这样在迷你主机上也能跑到每秒 100+ Token。
现实的结论
现阶段本地跑大模型,无论哪种硬件都有缺陷:显卡内存不够,板载方案算力和带宽不够。可行的选择是中等规模的 MoE 模型 + 短提示词。另外注意:板载方案处理提示词也很慢(约每秒 95 个 Token),塞一个 4000 Token 的文档要等 40 秒才出第一个字。
二、AI 缓存是什么
这一篇回答的问题是:API 定价表里「缓存命中的输入价格」为什么便宜 50 倍?
为什么输入要收费
大模型处理提示词时,要把文本分解成 Token、转成向量、计算所有 Token 之间的注意力关系——这一步非常消耗算力,所以输入 Token 要收费。
缓存的原理
多轮对话和长程任务中,每一轮都要把之前的内容重新提交给模型。但这些「前缀」是不变的,之前已经算过了——把计算结果缓存起来,下次直接复用即可。
所以缓存命中之所以便宜(比如 DeepSeek 只要 2 分钱,是未命中的 1/50):命中的部分基本不消耗算力,收的其实是存储费。
各家的缓存期限
| 公司 | 缓存有效期 |
|---|---|
| Anthropic | 5 分钟 |
| DeepSeek | 10 分钟 |
| OpenAI | 10~30 分钟逐步失效 |
| 1 小时内逐步失效 |
超时后缓存被删,同样的提示词就要按全价重新计算。
保持缓存激活
由于命中与未命中价差巨大,AI Agent 工具会定期发请求「保温」。传统做法是每 30 秒发一次,但激活请求本身也收费;考虑到最短缓存期限也有 5 分钟,每 4 分钟激活一次是更省钱的新建议。
三、AI 的三种机制
这一篇回答一个更根本的问题:AI 为什么能回答我们的提问,它怎么知道答案?
非专业人士只需要理解三个机制。
1. 参数机制:知识的压缩
所有大模型本质上都是对人类知识的建模:把知识分解成词元(Token),用无数个参数描述词元之间的关系(权重)。「训练」就是找出这些权重的过程——比如 GLM 5.3 有 7440 亿个参数。
提问时,模型根据这些权重找出概率上最可能的词元,生成答案。
所以大模型本质是一种「压缩-生成」机制:把人类知识压缩进参数,用的时候再生成出来。
2. 推理机制:逻辑的延伸
参数越多效果越好,但参数不可能无限增加(成本和速度都不允许)。好在很多知识不需要记忆,可以推理得到——知道出生率和死亡率,就自然知道净增长率。
推理机制让模型从参数包含的知识出发,用逻辑规则推断出它没有直接记住的知识。
3. 联网机制:实时的补充
再多的参数、再强的推理也有覆盖不到的问题——「今天的股指收盘多少」既不在参数里,也推理不出来。这时就要靠 Agent 或应用框架的联网机制,去互联网搜索。
三者的分工
参数机制 → 模型的基础知识(记住了什么)
推理机制 → 逻辑可得的知识(能推出什么)
联网机制 → 实时外部知识(能查到什么)
三种机制接力,才构成 AI 完整的回答能力。
三篇串起来看
把三篇放在一起,其实是一条完整的线索:
- 机制篇解释了模型的知识从哪来——参数是压缩的知识;
- 内存篇解释了参数的物理约束——7440 亿个参数要装进内存,还要能被快速反复读取(带宽),这是本地部署的根本瓶颈;
- 缓存篇解释了算力的复用——既然提示词前缀不变,就没必要每轮重算,缓存把这份算力省下来,也把价格打了下来。
理解了「参数 → 内存/带宽 → 缓存」这条链路,再看各家模型的定价表和硬件评测,基本就能看懂门道了。