2026年9月12日模型推理加速 张量并行该开几卡:从每层两次 All-Reduce 算清加速边界 从活跃 token 数、隐藏维度和实测集合通信延迟出发,判断张量并行该开几卡,并比较单卡多副本与流水线并行的代价,附标准库验证和排障顺序。
2026年9月11日模型推理加速 在线推理能扛多少请求:别用固定并发替代到达率压测 固定并发能测饱和吞吐,却回答不了线上安全 RPS。本文从张量工作量、开放环排队和请求级联合 SLO 出发,用多个独立重复运行的保守下包络判定单副本容量。