vLLM 生产部署笔记:从 PagedAttention 到 OpenAI 兼容接口
陈老师··871 阅读
为什么吞吐比 HuggingFace 原生高那么多、KV cache 显存怎么算、以及上线前必须改的几个环境变量。
为什么吞吐比 HuggingFace 原生高那么多、KV cache 显存怎么算、以及上线前必须改的几个环境变量。
从拉模型到跑起来的完整记录,包括 OLLAMA_HOST 配置、显卡显存占用、以及那个让我查了半天的 concurrent 参数。
不想用 Dify 全家桶的话,自己拼一个 RAG 需要哪些东西?本文给出最小可用的组合和完整链路。
LCEL 链跑不通、工具调用失效、token 数算不对……本地模型接 LangChain 的常见问题都在这。
不同量化等级的显存占用、推理速度、质量损失实测对比,以及转换脚本里那些容易写错的参数。