Administrator
Published on 2026-09-16 / 20 Visits
0
0

DeepSeek Engram:条件记忆如何成为第二条稀疏轴

DeepSeek Engram 为大模型增加了第二条稀疏轴。MoE 决定激活哪些计算,Engram 决定读取哪些静态记忆。它真正改变的是基础设施:部分容量可以从 GPU 常驻计算转成可预测、可预取的主机内存查表。收益能否成立,取决于带宽、重叠窗口、访问局部性和独立验证。

阅读时间:约 9 分钟

核心结论

  • MoE 提供条件计算,Engram 通过 token N-gram 查表提供条件记忆。
  • 论文在两个受控规模下观察到 U 形分配曲线,将约 20% 到 25% 的稀疏容量分给 Engram 时效果最好。
  • Engram-27B 在作者实验中超过同总参数、同激活参数的 MoE-27B,但仍属于论文团队自己的训练结果。
  • 100B 参数 Engram 表放入主机 DRAM 后,论文原型的最大吞吐损失为 2.8%。该结论只覆盖单 H800、高并发、短序列和 dense backbone 的特定实验。
  • DeepSeek V4.1-Flash 已采用 196B 参数的 Engram;公开仓库只提供会模拟 Attention、MoE 等组件的演示实现,尚不足以复现完整训练与卸载结论。

条件记忆与条件计算解决不同问题

MoE 每次只让 token 经过少量专家。模型总容量可以增加,每 token 激活的计算保持受控。但常见实体、固定搭配和局部静态模式仍要由多层神经计算逐步重建。

Engram 增加一个查表原语:把近期 token 的 N-gram 映射为确定性哈希地址,读取少量可训练 embedding,再通过依赖上下文的门控写回隐藏状态。表再大,每个 token 读取的槽位数仍保持固定,因此论文称其为 O(1) lookup。

两条稀疏轴的资源约束不同:

稀疏轴 地址依据 主要资源 适合处理
MoE 条件计算 运行时隐藏状态与 router GPU 计算和专家通信 动态变换与推理
Engram 条件记忆 token ID 与静态哈希 内存容量和数据搬运 高频静态 token 模式

记忆无法替代计算。论文中的极端分配都较差:纯 MoE 缺少专用查表路径;Engram 占比过高则会损失动态专家容量。

分配实验真正证明了什么

DeepSeek 在两个较小规模上固定总参数与激活参数,只改变 routed experts 和 Engram slots 的分配。两组结果都呈 U 形。报告的最佳点是约 75% 到 80% 稀疏容量保留给 MoE,约 20% 到 25% 分给 Engram。在约 10B 参数实验中,validation loss 从纯 MoE 的 1.7248 降到最佳点附近的 1.7109。

大规模预训练对照固定 262B 训练 token 和 3.8B 激活参数。MoE-27B 与 Engram-27B 都有 26.7B 总参数,后者用 5.7B 参数记忆表替换部分 routed experts。论文报告的变化包括:

  • MMLU:57.4 提升到 60.4;
  • CMMLU:57.9 提升到 61.9;
  • BBH:50.9 提升到 55.9;
  • ARC-Challenge:70.1 提升到 73.8;
  • HumanEval:37.8 提升到 40.8;
  • MATH:28.3 提升到 30.7。

这组结果支持一个有限结论:在该训练配方和模型规模下,部分稀疏容量做显式记忆比全部做 routed experts 更有效。它尚未证明相同分配比适用于其他 tokenizer、数据集、硬件或更大模型。

Engram 把什么移出了 GPU

Engram 的读取地址由 token 序列决定。推理系统可以在 Engram 层执行前计算后续地址,经 PCIe 从主机 DRAM 异步取回 embedding,并与前面 Transformer block 的计算重叠。

token IDs
  → N-gram 确定性地址
  → 主机内存中的 embedding 行
  → PCIe 异步预取
  → GPU 上的上下文门控
  → 写回 residual state

被移出的主要是巨大静态表的常驻存储。选中的 embedding 仍要传到加速器,门控和主干网络仍在 GPU 上计算。训练阶段也无法免费获得这部分容量:论文把表分片到多个 GPU,并用 All-to-All 获取活跃行和分发梯度。

模块放在哪一层也有冲突。越早插入,越能在主干消耗多层计算之前接管静态模式重建;越晚插入,前置计算越有机会掩盖主机内存传输,并且门控拥有更丰富的上下文。论文在 12 层模型上的消融偏向第 2 层,说明建模最优点与系统延迟最优点需要共同求解。

2.8% 开销有明确适用范围

论文将 100B 参数 Engram 表完整放在主机 DRAM,使用基于 nano-vLLM 的原型、单张 NVIDIA H800、512 条并发序列和 100 到 1024 的均匀序列长度。为排除 MoE 通信干扰,实验使用 4B 与 8B dense backbone。

Backbone 基线吞吐 加入主机内存 Engram 变化
Dense 4B 9,031.62 tok/s 8,858.28 tok/s 下降约 1.9%
Dense 8B 6,315.52 tok/s 6,140.02 tok/s 下降约 2.8%

该实验说明,确定性预取在这套配置中能够掩盖大部分传输时间。它没有覆盖低 batch、长上下文、NUMA、PCIe 竞争、分布式 serving、交互式首 token 延迟和 P99 尾延迟。论文测的是聚合吞吐,实时服务往往先在尾延迟上暴露问题。

论文还提出多级缓存:高频 N-gram 放在更快层级,长尾留在大容量慢存储。上述实验反而强制所有读取经过 PCIe,因而是对这条链路的保守测试。生产缓存策略和真实访问分布仍需重新验证。

论文、代码和已发布模型是三层证据

第一层是论文:给出架构、训练对照、消融和原型系统实验,结论由作者团队产生。

第二层是官方 GitHub:提供 Engram 数据流的 standalone demo。README 明确说明,它模拟了 Attention、MoE、mHC 等标准组件。该代码适合理解查表和门控,无法独立复现论文训练表格或主机内存吞吐实验。

第三层是已发布模型。DeepSeek V4.1-Flash 模型卡写明,模型含 196B Engram 参数,并按 token lookup 稀疏访问。这证明 Engram 已进入真实发布架构。V4.1 同时修改了注意力、KV 压缩、残差混合、推测解码、训练数据和后训练,所以其端到端成绩无法单独归因给 Engram。

采用时间线需要纠正早期推测:原始 DeepSeek V4 模型页没有列出 Engram,V4.1-Flash 才明确采用。Qwen3.8-Flash-Next 又提供了第二个工业信号。官方材料描述的配置是 125B 主干加 51B N-gram embedding,每 token 激活 6B 参数。Qwen 引用了 Engram,并使用同技术谱系的多头哈希与上下文门控,但官方名称是 N-gram Embedding。因此,更准确的表述是受 Engram 直接影响的条件记忆设计,而非原样移植。

当前公开证据覆盖作者实验、演示工件和生产模型采用。论文的分配规律与卸载经济性仍需要独立端到端复现。

早期外部结果也提示,语言模型 loss 下降不能直接外推为下游收益。一项基于 Qwen 小模型的社区复现报告,四组实验的 held-out perplexity 下降 22% 到 30%,但 HellaSwag、PIQA 与 ARC-Challenge 没有一致改善。这只是 0.5B 到 4B 规模的一项社区研究,无法推翻 DeepSeek 的大规模结果;它足以说明规模和评测目标会改变结论,perplexity 不能单独充当上线门槛。2026 年出现的 Tokenizer-Agnostic Engram 与 Memory Grafting 又修改了查表设计,也说明条件记忆仍处于快速探索阶段。

Engram 无法替代 RAG

Engram 保存训练得到的参数化记忆,通过 token 模式寻址。内容在训练时形成。RAG 搜索的是可更新、可引用、可做权限控制的外部资料。

高频静态关联和模型容量属于 Engram 的概念边界;新鲜度、出处、删除权、访问权限和文档级证据属于 RAG 或工具系统。两者可以组合:Engram 减少内部重复重建,外部检索提供最新且可追溯的信息。

怎样评测第二条稀疏轴

评测时冻结模型质量目标、硬件和工作负载,至少改变以下维度:

维度 测试变量
Batch 与并发 1、正常负载、饱和
序列形状 短 prompt、长上下文、长 decode
访问局部性 高频 N-gram、混合流量、冷长尾
内存拓扑 本地 DRAM、远端 NUMA、共享 PCIe 负载
任务 事实回忆、多语言短语、推理、代码、长上下文检索
故障 延迟读取、带宽竞争、分片缺失、worker 重启

同时记录 HBM 与主机内存、每 token 传输字节、预取命中率、重叠时间、GPU stall、吞吐、首 token 时间、P50/P95/P99、分任务质量、训练通信与单次成功请求成本。

关键判断不是表能否装进 CPU 内存,而是实际计算窗口能否持续掩盖读取时间。主干更快或链路拥塞时,可用于重叠的预算会缩小。HBM 压力下降之后,PCIe 带宽、主机容量、缓存调度或训练 All-to-All 可能成为新瓶颈。

常见问题

DeepSeek Engram 是什么?

它把近期 token 的 N-gram 哈希到可训练 embedding 表,再通过门控将读取值融合进 Transformer 隐藏状态。

为什么称为第二条稀疏轴?

MoE 稀疏激活计算,Engram 稀疏读取记忆。在固定激活计算预算下,两类容量可以分别分配。

Engram 会把整个模型移到 CPU 吗?

不会。它允许巨大的静态 Engram 表放在主机内存。主干网络、激活计算、被选中的数据和门控仍依赖 GPU。

2.8% 开销是否已有独立验证?

该数字来自作者在 H800、高并发和 dense backbone 上的原型测试。生产使用前应在目标硬件、负载和尾延迟口径下复现。

Engram 与 RAG 是一回事吗?

两者不同。Engram 是训练得到的参数化记忆;RAG 检索可更新的外部文档,并能提供出处。

参考资料

Engram 最重要的价值是拆开资源:静态回忆、动态推理、加速器计算和内存容量无需继续作为一个整体扩展。它最重要的待验证问题同样清楚:真实系统能否长期把这条新记忆路径藏在关键延迟路径之外。


Comment