从零到一
本路径帮助你在约 1–2 周内从零搭建一个可用的模型推理服务,并完成与应用的对接。
阶段一:环境准备(1 天)
- 硬件:准备带 NVIDIA GPU 的机器(云主机或本地),8GB+ 显存
- 环境:安装 CUDA、Python 3.9+、pip
- 模型:从 Hugging Face 拉取一个 7B 模型(如 Qwen2-7B-Instruct),或使用量化版
- 验证:
nvidia-smi可见 GPU,python -c "import torch; print(torch.cuda.is_available())"为 True
阶段二:本地推理服务(2–3 天)
- 安装 vLLM:
pip install vllm - 启动服务:
vllm serve Qwen/Qwen2-7B-Instruct --host 0.0.0.0 --port 8000 - 测试:用 curl 或 Python OpenAI 客户端调用
/v1/chat/completions