张量并行该开几卡:从每层两次 All-Reduce 算清加速边界
从活跃 token 数、隐藏维度和实测集合通信延迟出发,判断张量并行该开几卡,并比较单卡多副本与流水线并行的代价,附标准库验证和排障顺序。
从活跃 token 数、隐藏维度和实测集合通信延迟出发,判断张量并行该开几卡,并比较单卡多副本与流水线并行的代价,附标准库验证和排障顺序。
固定并发能测饱和吞吐,却回答不了线上安全 RPS。本文从张量工作量、开放环排队和请求级联合 SLO 出发,用多个独立重复运行的保守下包络判定单副本容量。
从 Codex MultiAgentV2 的公开 Rust 实现出发,追踪主 agent 如何创建子线程、投递消息、追加任务和等待活动。用一个可运行的状态模型解释消息与执行、等待与完成的区别,再讨论上下文继承、过期结果与文件冲突。
从注意力中间矩阵和显存 IO 出发,用在线 softmax 代码解释 FlashAttention 如何得到精确结果,以及端到端收益为何不等比。
从张量形状推导 KV Cache 显存占用,解释 GQA、分页分配与前缀缓存的区别,并给出容量估算代码。
连续批处理提高了吞吐,为什么聊天输出反而更卡?用可运行的调度模型展示分块 Prefill 对首 token 和输出间隔的取舍,辨析闭环压测与尾延迟口径,按满足延迟要求的请求吞吐选择配置。