硅基元年
  • 首页
  • 课程
  • 文章
  • 关于
微信登录注册

文章· 标签:本地部署

5 篇

vLLM 生产部署笔记:从 PagedAttention 到 OpenAI 兼容接口

陈老师·2026/06/25·871 阅读

为什么吞吐比 HuggingFace 原生高那么多、KV cache 显存怎么算、以及上线前必须改的几个环境变量。

#本地部署#vLLM#推理优化

Ollama 部署 Qwen2.5 的那些坑,我踩了一遍

张老师·2026/01/02·194 阅读

从拉模型到跑起来的完整记录,包括 OLLAMA_HOST 配置、显卡显存占用、以及那个让我查了半天的 concurrent 参数。

#本地部署#Ollama#Qwen

本地 RAG 从零搭建,我用的这 5 个组件

唐老师·2025/03/07·513 阅读

不想用 Dify 全家桶的话,自己拼一个 RAG 需要哪些东西?本文给出最小可用的组合和完整链路。

#RAG#知识库#本地部署

LangChain 接本地 Ollama,我踩的 6 个坑

王老师·2024/12/10·445 阅读

LCEL 链跑不通、工具调用失效、token 数算不对……本地模型接 LangChain 的常见问题都在这。

#LangChain#本地部署#踩坑

llama.cpp 量化到 GGUF 全流程,从 fp16 到 Q4_K_M 一次说清

唐老师·2024/10/13·855 阅读

不同量化等级的显存占用、推理速度、质量损失实测对比,以及转换脚本里那些容易写错的参数。

#本地部署#量化#llama.cpp
定位中…
--:--:--
…

热门标签

RAG踩坑API实战Agent本地部署知识库部署向量检索AI绘画Embedding多智能体安全工具调用微调成本优化接入架构缓存评估语音运维提示词工程AMDASRAutoGenBM25CUDAChatGPTChromaComfyUICrewAIDeepSeekDockerFunction CallingGPUHuggingFaceLLMLangChainLangGraphLoRAMCPMilvusNeo4jOOMOllamaPlaywrightPrompt注入QdrantQwenROCmRedisRerankSSESaaSStable DiffusionTTSVLMWhisperllama.cppvLLM下载优化会话内容安全分块协议召回优化合规向量数据库回归测试多模态多租户审查幻觉排查推理推理优化数据脱敏日志显存检索优化流式输出浏览器自动化混合检索生产监控知识图谱经验统一网关自动化记忆设计语音识别运营重试量化长文档防御限流隐私AIGC机器学习PythonAI 绘画

AI前沿速递

暂无资讯,等待后台配置抓取…

硅基元年

系统化 AI 教程与前沿资讯平台,让每个人都能掌握人工智能。

快速链接

  • 首页
  • 课程
  • 文章
  • 关于
  • 隐私政策

联系我们

hello@aicourse.dev

© 2026 硅基元年 · 保留所有权利

京ICP备00000000号