2026年9月5日模型推理加速 前缀缓存命中率很高,首字为什么还是慢? 前缀缓存命中率达到 90%,首 token 仍然慢,问题可能出在统计口径和排队。用一组可复算请求区分命中次数、token 复用率与计算节省,再推导缓存后剩余注意力的成本,给出真实流量下的对照方法。
2026年9月5日模型推理加速 4bit 量化为什么不一定更快:权重变小之后,瓶颈去了哪里 4bit 权重量化省下了显存,为什么生成速度没有同比提升?从权重与 KV 读取量出发,推导不同批次下的收益边界,用可运行代码区分访存、计算和反量化开销,再设计固定负载与容量两组对照实验。