Skip to content
Blog of Code
  • 主页
  • 文章
  • 订阅
  • 关于
  • 图集
  • 推理加速
Blog of Code
Close menu
  • 主页
  • 文章
  • 订阅
  • 关于
  • 图集
  • 推理加速
Toggle menu
Blog of Code

作者: Jellow

2026年9月12日模型推理加速

张量并行该开几卡:从每层两次 All-Reduce 算清加速边界

从活跃 token 数、隐藏维度和实测集合通信延迟出发,判断张量并行该开几卡,并比较单卡多副本与流水线并行的代价,附标准库验证和排障顺序。

2026年9月11日模型推理加速

在线推理能扛多少请求:别用固定并发替代到达率压测

固定并发能测饱和吞吐,却回答不了线上安全 RPS。本文从张量工作量、开放环排队和请求级联合 SLO 出发,用多个独立重复运行的保守下包络判定单副本容量。

2026年9月9日AI Agent 工程

Codex 怎么和子 agent 协作:从一次任务分派看消息、上下文与状态管理

从 Codex MultiAgentV2 的公开 Rust 实现出发,追踪主 agent 如何创建子线程、投递消息、追加任务和等待活动。用一个可运行的状态模型解释消息与执行、等待与完成的区别,再讨论上下文继承、过期结果与文件冲突。

2026年9月8日模型推理加速

大模型推理加速(四):推测解码为什么不改变分布,什么时候反而更慢

用三 token 概率例子推导推测解码的接受与修正分布,再用接受率和轮次成本判断它何时加速、何时变慢。

2026年9月7日模型推理加速

大模型推理加速(三):FlashAttention 为什么更快,又没有省掉哪些计算

从注意力中间矩阵和显存 IO 出发,用在线 softmax 代码解释 FlashAttention 如何得到精确结果,以及端到端收益为何不等比。

2026年9月6日模型推理加速

大模型推理加速(二):KV Cache 到底占多少显存,PagedAttention 又解决了什么

从张量形状推导 KV Cache 显存占用,解释 GQA、分页分配与前缀缓存的区别,并给出容量估算代码。

2026年9月5日模型推理加速

吞吐涨了,用户却觉得更卡:连续批处理的延迟账怎么算

连续批处理提高了吞吐,为什么聊天输出反而更卡?用可运行的调度模型展示分块 Prefill 对首 token 和输出间隔的取舍,辨析闭环压测与尾延迟口径,按满足延迟要求的请求吞吐选择配置。

文章分页

1 2 … 58 >
登录

主要作为CZT的博客使用

欢迎大家订阅更新

网址:www.cztcode.com

Github:https://github.com/CZT0

本页面浏览人数:4 次浏览

TOP10文章

  • 2022中科大先研院计专11408经验分享 - 3,621 浏览
  • CTF解密MISC(二) - 2,847 浏览
  • 《8小时转职Golang工程师》超时强踢功能的BUG修复 - 2,330 浏览
  • Mac软件分享 - 2,316 浏览
  • DRAM刷新方式 - 2,286 浏览
  • 科林明伦杯 - 1,788 浏览
  • Google play上架流程 - 1,647 浏览
  • IDEA JSP 热部署 - 1,634 浏览
  • VUE3之Component(一) - 1,507 浏览
  • Koa的简易目录结构设计 - 1,497 浏览

订阅更新

订阅

分类

  • AI Agent 工程
  • Android
  • APP开发
  • C++
  • CTF
  • Flutter
  • Golang
  • Java
  • Linux
  • MyBatis
  • next.js
  • node.js
  • Spring
  • Vue
  • Web
  • 模型推理加速
  • 深度学习
  • 算法
  • 综合

友情链接

T4rn's Universe
End-donkey
冻葱Tewi
BtoAI

推理加速专题

从指标、显存到解码算法,查看完整系列

© 2026 Blog of Code. Designed By CZT