AI 技术栈模型部署与推理服 务开发指南本页总览开发指南 生产部署架构 单机多卡 适用于 70B 等超大模型,使用 Tensor Parallelism: vllm serve Qwen/Qwen2-72B-Instruct --tensor-parallel-size 4 多实例 + 负载均衡 Nginx:upstream 配置多个推理服务后端 Kubernetes:Deployment 多副本 + Service ClusterIP/LoadBalancer