吞吐涨了,用户却觉得更卡:连续批处理的延迟账怎么算
连续批处理提高了吞吐,为什么聊天输出反而更卡?用可运行的调度模型展示分块 Prefill 对首 token 和输出间隔的取舍,辨析闭环压测与尾延迟口径,按满足延迟要求的请求吞吐选择配置。
连续批处理提高了吞吐,为什么聊天输出反而更卡?用可运行的调度模型展示分块 Prefill 对首 token 和输出间隔的取舍,辨析闭环压测与尾延迟口径,按满足延迟要求的请求吞吐选择配置。
前缀缓存命中率达到 90%,首 token 仍然慢,问题可能出在统计口径和排队。用一组可复算请求区分命中次数、token 复用率与计算节省,再推导缓存后剩余注意力的成本,给出真实流量下的对照方法。
4bit 权重量化省下了显存,为什么生成速度没有同比提升?从权重与 KV 读取量出发,推导不同批次下的收益边界,用可运行代码区分访存、计算和反量化开销,再设计固定负载与容量两组对照实验。