资源描述
LiteLLM Proxy 是一个生产就绪的轻量级 LLM API 网关,内置细粒度 RBAC 鉴权(支持用户/模型/Token 预算级控制)、实时审计日志、多租户成本追踪与 OpenTelemetry 可观测性集成,适用于企业级 AI 中台、SaaS 多租户服务及合规敏感场景。
详细内容
## LiteLLM Proxy with Fine-grained Auth
### 框架简介与定位
LiteLLM Proxy 是 LiteLLM 官方提供的高性能、可扩展的 LLM API 网关服务,专为构建安全、可观测、可计费的企业级 AI 接入层而设计。它作为反向代理部署在客户端与后端 LLM 提供商(如 OpenAI、Anthropic、Azure OpenAI、本地 vLLM/Ollama 等)之间,统一处理路由、鉴权、限流、日志与计量,无需修改上游应用代码。
### 核心特性
- **细粒度基于角色的访问控制(RBAC)**:支持按用户 ID、模型名称、API Key 组合进行权限策略配置,可精确限制调用模型、最大并发数、单次请求 Token 上限及月度 Token 预算。
- **全链路审计日志**:记录请求 ID、用户标识、模型、输入/输出 token 数、响应延迟、错误码及原始请求头,日志结构化输出至 stdout 或自定义 Webhook/Sink(如 Elasticsearch、Datadog)。
- **多维度成本追踪**:自动计算并聚合各用户/租户/模型的调用成本(基于厂商定价表),支持 CSV 导出与 Prometheus 指标暴露(`litellm_proxy_cost_total` 等)。
- **OpenTelemetry 原生集成**:默认启用 trace/span 上报(支持 Jaeger、Zipkin、OTLP),涵盖 LLM 调用链路、认证耗时、缓存命中等关键节点。
- **动态模型路由与负载均衡**:支持基于权重、延迟、健康状态的模型路由策略;可配置 fallback 模型与自动重试机制,提升服务 SLA。
### 适用场景
- 多租户 SaaS 平台:为不同客户提供隔离的 LLM 访问能力,并强制执行用量配额与计费规则。
- 企业内部 AI 中台:统一管控对第三方 LLM 的调用,满足数据合规(如 GDPR)、审计留痕与预算管控要求。
- 开发者平台 API 网关:对外提供标准化 `/chat/completions` 接口,同时实现密钥管理、速率限制与使用分析。
- 合规敏感环境:通过审计日志与细粒度权限,满足 SOC2、HIPAA 等安全审计需求。
### 快速入门步骤
1. **安装**:
```bash
pip install litellm
litellm --model gpt-3.5-turbo --port 4000 --database_url "sqlite:///proxy.db"
```
2. **启用细粒度鉴权**:创建 `config.yaml`,配置 `user_config` 与 `general_settings`,指定 `jwt_auth` 或 `api_key` 模式,并设置 `budgets` 字段约束 Token 使用上限。
3. **启动带鉴权的 Proxy**:
```bash
litellm --config config.yaml --port 4000
```
4. **测试调用(需携带有效 API Key)**:
```bash
curl -X POST "http://0.0.0.0:4000/chat/completions" \
-H "Authorization: Bearer sk-xxx" \
-H "Content-Type: application/json" \
-d '{"model": "gpt-3.5-turbo", "messages": [{"role": "user", "content": "Hello"}]}'
```
### 生态与社区说明
LiteLLM Proxy 是开源项目(Apache 2.0 许可),由 [LiteLLM](https://litellm.ai) 团队持续维护,GitHub 仓库含完整文档、Docker 镜像、Kubernetes Helm Chart 及 Terraform 模块。活跃社区提供 Slack 支持、Discord 讨论区与每周技术分享;企业用户可通过官方渠道获取 SLA 支持、定制化审计模块与私有化部署方案。