LIYI (@LIYI1)私有化大模型部署自测 GPU:RTX 4090 24GB; CPU:8 核以上 测试模型: Qwen/Qwen3-14B-AWQ 中发帖

使用 vLLM 私有化部署 Qwen3 大模型

本教程介绍如何在 GPU 云服务器上部署 Qwen3-14B-AWQ,并通过 OpenAI 兼容接口调用模型。
本方案适合个人学习、企业 AI 项目技术验证、RAG、Agent、工具调用及现有业务系统接入。


1. 部署目标
完成本教程后,将获得一个可以通过 HTTP 请求调用的大模型服务:
本地电脑 / 业务系统

│ OpenAI Compatible API

http://127.0.0.1:8000/v1


vLLM


Qwen3-14B-AWQ


RTX 3090 / RTX 4090

最终可以使用以下方式调用模型:

curl
Pytho...