LIYI (@LIYI1) 在 私有化大模型部署自测 GPU:RTX 4090 24GB; CPU:8 核以上 测试模型: Qwen/Qwen3-14B-AWQ 中发帖
使用 vLLM 私有化部署 Qwen3 大模型
本教程介绍如何在 GPU 云服务器上部署 Qwen3-14B-AWQ,并通过 OpenAI 兼容接口调用模型。
本方案适合个人学习、企业 AI 项目技术验证、RAG、Agent、工具调用及现有业务系统接入。
1. 部署目标
完成本教程后,将获得一个可以通过 HTTP 请求调用的大模型服务:
本地电脑 / 业务系统
│
│ OpenAI Compatible API
▼
http://127.0.0.1:8000/v1
│
▼
vLLM
│
▼
Qwen3-14B-AWQ
│
▼
RTX 3090 / RTX 4090
最终可以使用以下方式调用模型:
curl
Pytho...