Wener Site

Transformer Glossary

约 2 分钟阅读
标签:Glossary

静态-动态-连续批处理

推测解码

  • 在不牺牲任何输出质量的前提下,降低 LLM 推理的延迟。
  • 用一个小的、快的“草稿模型”大胆预测,再由大的、准的“权威模型”一次性并行验证。
  • 如果草稿模型的预测大部分是正确的,那么系统就用一次大模型计算的成本,成功生成了多个 Token),从而加快速度。
  • 草稿模型 (Draft Model)
  • 权威模型 (Oracle Model)
  • 参考

预填充

  • Prefill
  • 特点
    • 并行度高
    • 计算密集型
    • 批处理友好
  • 生成并填充初始的 KV 缓存

解码

  • Decode / 解码 / 逐词生成
  • 自回归地(Auto-regressive)逐个生成新的 Token。
  • 特点
    • 串行度高: 必须生成第 N 个 Token 后,才能将其作为输入来生成第 N+1 个 Token。这是一个严格的顺序过程。
    • 内存带宽密集型 (Memory-Bound): 每生成一个新 Token,都需要从 GPU 显存中读取整个越来越大的 KV 缓存。这个过程的瓶颈不再是计算,而是 GPU 显存的读写速度。
    • 计算量小: 单个 Token 的生成计算量远小于 Prefill 阶段。

PD 分离

前缀缓存

前缀感知路由

KV 缓存利用率感知负载均衡

KV 缓存卸载

数据张量管道专家混合并行

离线批处理推理

关联信息

反向链接和本文引用的外部资料。

References

标准文档

2 条

其他外链

9 条

另有 1 个未显示 references。

另有 1 个 references 未显示。

最近更新commit 176135cEdit

On this page