Tech Stack
语言:Golang Python C TypeScript Java
前端:React Vue Android Next.js
后端:Gin Beego FastAPI Node.js SpringBoot
数据库:MongoDB MySQL RabbitMQ Redis
算法:NLP LLM Leetcode
最新内容
大模型推理加速(二):KV Cache 到底占多少显存,PagedAttention 又解决了什么
从张量形状推导 KV Cache 显存占用,解释 GQA、分页分配与前缀缓存的区别,并给出容量估算代码。
Jellow 2026年9月6日 09:00
吞吐涨了,用户却觉得更卡:连续批处理的延迟账怎么算
连续批处理提高了吞吐,为什么聊天输出反而更卡?用可运行的调度模型展示分块 Prefill 对首 token 和输出间隔的取舍,辨析闭环压测与尾延迟口径,按满足延迟要求的请求吞吐选择配置。
Jellow 2026年9月5日 10:29