速查·推理服务对外暴露与网络配置 推理服务在容器里跑起来后,怎么让外部访问?本条给网络配置速查。 端口映射 把容器内 8000 端口映射到宿主机 8000。 只绑本地,外部不可访问(更安全)。 vLLM 默认监听 8000 端口,提供 OpenAI 兼容 API。映射后可用 测试。 网络模式 bridge(默认):容器有独立 IP,通过 docker0 网桥和宿主机通信。需要端口映射才能外部访问。 host:容器直接用宿主机网络,无端口映射,性能最好但无网络隔离。 。 自定义网络:多个容器组成一个网络,容器间用容器名互访。适合推理 + 网关 + 缓存多容器编排。 生产部署 生产环境一般不在容器层直接暴露,而是:容器跑在内网,前面挂 Nginx/网关做 TLS 终止、限流、鉴权。
推理服务在容器里跑起来后,怎么让外部访问?本条给网络配置速查。
docker run -p 8000:8000 把容器内 8000 端口映射到宿主机 8000。-p 127.0.0.1:8000:8000 只绑本地,外部不可访问(更安全)。
vLLM 默认监听 8000 端口,提供 OpenAI 兼容 API。映射后可用 curl http://localhost:8000/v1/models 测试。
--network host。生产环境一般不在容器层直接暴露,而是:容器跑在内网,前面挂 Nginx/网关做 TLS 终止、限流、鉴权。容器只负责跑模型,网络和接入交给专门的网关层(见百万 QPS 教程的接入层设计)。
AI 对话的流式响应(SSE/WebSocket)要确保中间链路(Nginx、负载均衡)不缓冲、超时够长,否则流式会被掐断(见百万 QPS 教程 2.1 节)。
详细见正文第四章 4.2「推理服务沙箱化与对外暴露」。