vLLM 生产部署笔记:从 PagedAttention 到 OpenAI 兼容接口陈老师·2026/06/25·871 阅读为什么吞吐比 HuggingFace 原生高那么多、KV cache 显存怎么算、以及上线前必须改的几个环境变量。#本地部署#vLLM#推理优化