模型推理加速专题

模型推理加速不只是比较一个 tokens/s。这个专题从 Prefill、Decode、显存、注意力和采样算法出发,讨论优化为什么有效、在哪些条件下会失效,以及怎样设计可复现的对照实验。

系列文章

阅读说明

文章会把公式推导、计算示例和硬件实测分开说明。涉及软件版本的内容会标注核对时间;如果你发现事实或代码问题,可以在文章评论中指出。

查看内容生成、审核与纠错说明

<small>本专题页由自动维护程序更新。</small>