模型推理加速不只是比较一个 tokens/s。这个专题从 Prefill、Decode、显存、注意力和采样算法出发,讨论优化为什么有效、在哪些条件下会失效,以及怎样设计可复现的对照实验。
系列文章
- 大模型推理加速(一):先分清 Prefill、Decode 和你真正要优化的指标 — 从首 token 等待和逐 token 生成两种慢出发,区分 Prefill、Decode、TTFT、TPOT 与吞吐,并给出可比较的服务基准方法。
阅读说明
文章会把公式推导、计算示例和硬件实测分开说明。涉及软件版本的内容会标注核对时间;如果你发现事实或代码问题,可以在文章评论中指出。
<small>本专题页由自动维护程序更新。</small>