资源描述
LiteLLM 是一个开源的轻量级 LLM API 代理层,统一抽象 OpenAI、Anthropic、Google Gemini、Ollama、Mistral 等 100+ 模型提供商的接口,支持智能路由、自动故障转移、请求/响应日志、实时成本追踪与负载均衡,显著降低多模型集成复杂度,适用于 AI 应用后端开发、A/B 测试、模型灰度发布及企业级 LLM 网关构建。
详细内容
## LiteLLM:统一 LLM API 代理网关
### 工具定位与核心价值
LiteLLM 是一个生产就绪的 Python 轻量级代理层(兼容 OpenAI SDK 接口),旨在解决多 LLM 服务商接入碎片化问题。它不托管模型,而是作为「智能路由中间件」,将标准化的 OpenAI 格式请求动态转发至不同后端(如 Anthropic、Gemini、本地 Ollama 或自建 vLLM),同时提供可观测性与弹性能力,大幅缩短后端集成周期,提升模型调用稳定性与成本透明度。
### 主要功能列表
- ✅ **多提供商统一接口**:兼容 OpenAI、Anthropic、Cohere、Google Vertex AI、Azure OpenAI、Groq、Ollama、vLLM、Together AI、Fireworks 等 100+ 模型后端,所有请求均通过 `openai.ChatCompletion.create()` 风格调用。
- ✅ **智能路由与高可用**:支持基于延迟/成功率的自动 fallback、权重轮询(weighted routing)、区域就近调度(region-aware routing)及手动优先级策略。
- ✅ **全链路可观测性**:内置结构化日志(含输入/输出/token 数/耗时/费用)、Prometheus 指标暴露、Slack/Webhook 异常告警。
- ✅ **精细化成本管理**:自动计算并返回每请求 token 成本(基于官方定价表),支持自定义价格映射与成本汇总报表。
- ✅ **企业级扩展能力**:支持 API Key 动态管理、速率限制(Rate Limiting)、请求重试策略、JWT 认证集成、OpenTelemetry 追踪。
### 典型使用场景
- **快速原型验证**:在不修改业务代码前提下,一键切换底层模型(如从 GPT-4 切换至 Claude-3 或本地 Llama3)进行效果对比。
- **AI 服务网关**:作为公司统一 LLM 出口,集中管控模型访问权限、审计日志与预算消耗。
- **混合推理架构**:结合公有云高性能模型与私有部署低成本模型,按 SLA 自动降级或分流。
- **A/B 测试与灰度发布**:对同一用户请求并行发送至多个模型,对比响应质量后决策主用路径。
### 上手步骤与操作要点
1. **安装**:`pip install litellm`
2. **基础调用(无缝替代 OpenAI)**:
```python
import litellm
litellm.api_key = "sk-..." # 可选:若使用 OpenAI
response = litellm.completion(
model="gpt-3.5-turbo",
messages=[{"role": "user", "content": "Hello"}]
)
```
3. **多后端配置(环境变量或 YAML)**:
```bash
export OPENAI_API_KEY=xxx
export ANTHROPIC_API_KEY=yyy
export GOOGLE_VERTEX_AI_PROJECT=zzz
```
4. **启用高级特性**:
- 启动代理服务器:`litellm --port 4000 --config ./config.yaml`(支持 REST/Streaming)
- 配置 fallback:`model='gpt-4,claude-3-haiku,gpt-3.5-turbo'`
- 开启 cost tracking:`litellm.success_callback = ['cost_calculator']`
> ⚠️ 注意:LiteLLM 不提供模型训练或托管服务;所有模型调用均直连原始提供商或本地服务。详细配置与最佳实践请参考 [官方文档](https://docs.litellm.ai)。