从 Modal 的 Kimi K2.6 案例提炼一套负载优先的推理调优流程:先测请求形态,再依次处理解码、缓存和路由瓶颈。
DeepSeek V4.1 用 SWA 有界重放压缩持久 KV 缓存。本文拆解缓存命中时变化的状态、已有证据与上线前测试矩阵。
KV cache 操作让预训练模型并发观察、思考和响应成为可能。机制已有实验,生产运行时仍在形成,状态治理将成为新的系统边界。
DiffusionGemma 在 batch 1 下达到 7.1 倍 AR 解码速度,质量、prefill 和并发决定这份收益能否进入真实工作流。