推理平台经济学:Fireworks、Together、Baseten、Modal、Replicate、Anyscale 本节摘要:2026 年的推理市场早已不是「租 GPU 时间」那么简单,它裂成了三段——定制芯片(Groq、Cerebras、SambaNova)、GPU 平台(Baseten、Together、Fireworks、Modal)、API 优先卖场(Replicate、DeepInfra)。Fireworks 在 2026 年 5 月 1 日把 GPU 租用每芯片每小时涨了 1 美元,而它 40 亿美元估值、日处理 10 万亿+ token 的体量说明「量驱」模式依然成立;Baseten 在 2026 年 1 月以 50 亿美元估值完成 3 亿美元 E 轮。
本节摘要:2026 年的推理市场早已不是「租 GPU 时间」那么简单,它裂成了三段——定制芯片(Groq、Cerebras、SambaNova)、GPU 平台(Baseten、Together、Fireworks、Modal)、API 优先卖场(Replicate、DeepInfra)。Fireworks 在 2026 年 5 月 1 日把 GPU 租用每芯片每小时涨了 1 美元,而它 40 亿美元估值、日处理 10 万亿+ token 的体量说明「量驱」模式依然成立;Baseten 在 2026 年 1 月以 50 亿美元估值完成 3 亿美元 E 轮。竞争定位规则其实很简单:Fireworks 拼延迟、Together 拼目录广度、Baseten 拼企业级打磨、Modal 拼 Python 原生开发体验、Replicate 拼多模态覆盖、Anyscale 拼分布式 Python。本节给你一张能直接甩给创始人的选型矩阵,外加一个把六家异构计价模型折算到「每请求真实成本」的对比器。
对应原课程:Phase 17 · Lesson 02 ·
02-inference-platform-economics(原英文phases/17-infrastructure-and-production/02-inference-platform-economics/docs/en.md)。
阅读完本节,你应当能够:
你评估过托管大厂平台(第 01 节),决定要更窄、更快的供应商——Fireworks 拼延迟、Together 拼广度、Baseten 拼微调定制模型。可现在你面前有六个真实选项,而它们的定价页根本对不齐:Fireworks 显示「美元/百万 token」、Baseten 显示「美元/分钟」、Modal 显示「美元/秒」、Replicate 显示「美元/次预测」。不建模工作负载,你没法横向比。
更糟的是,每个定价页背后的商业模式不同。Fireworks 用自研引擎(FireAttention)跑共享 GPU,按 token 费率反映它的利用率曲线;Baseten 给你 Truss + 专属 GPU,按分钟反映独占性;Modal 是真正的 Python serverless——按秒计费、亚秒级冷启动。同样一个 LLM 响应,三种成本函数。
本节就把这六家逐一建模,告诉你每种场景谁赢。
定制芯片 —— Groq(LPU)、Cerebras(WSE)、SambaNova(RDU)。在同等模型上,解码通常比 GPU 集群快 5~10 倍。每 token 单价更高(Groq 在 2025 年末 Llama-70B 上约 0.99 美元/百万),但对延迟敏感场景无可匹敌——语音 Agent、实时翻译的生产首选。
GPU 平台 —— Baseten、Together、Fireworks、Modal、Anyscale。跑 NVIDIA(H100、H200,2026 年的 B200),偶尔用 AMD。它处于「裸 GPU 租用」(RunPod、Lambda)与「大厂托管服务」(Bedrock)之间的经济层。
API 优先卖场 —— Replicate、DeepInfra、OpenRouter、Fal。目录广,按次或按秒计费,强调「首次调用时间」最短。
Fireworks —— 延迟优先的 GPU 平台
Together —— 广度优先
Baseten —— 企业级打磨优先
Modal —— Python 原生优先
@modal.function(gpu="A100"),一条命令部署。Replicate —— 多模态广度
Anyscale —— Ray 原生
按 token 适合延迟不敏感、突发的工作负载——用多少付多少。按分钟适合利用率高且可预测的工作负载——一旦把 GPU 跑满,你就比按 token 划算。
经验法则:专属 GPU 持续利用率高于约 30% 时,按分钟(Baseten、Modal)开始赢过按 token(Fireworks、Together);低于这条线,按 token 因不付空闲而胜出。
每家在 vLLM 与 SGLang 之上的平台都声称有自研引擎:FireAttention、RayTurbo、Baseten 的推理栈。自研引擎的说法里掺了不少营销——诚实的表述是:vLLM + SGLang 占了生产开源推理约 80%,平台层的真正差异化是开发体验(DX)、归因能力与 SLA。
原课程 code/main.py 在合成工作负载上跨六家厂商对比计价模型,输出「美元/天」与「有效美元/百万 token」。下面给一个可复用的最简骨架——把不同计价模型折算到「每请求成本」,从而横向可比。
def cost_per_token(pricing_model, params, daily_requests, tokens_per_request): """把不同计价模型折算到『有效美元/百万 token』。 pricing_model: 'per_token' 按 token, params = {'rate_per_1m': 美元/百万 token} 'per_minute' 按分钟, params = {'rate_per_min': 美元/分钟, 'avg_req_seconds': 单请求墙钟秒} 'per_second' 按秒, params = {'rate_per_sec': 美元/秒, 'avg_req_seconds': 单请求墙钟秒} 'per_prediction' 按次, params = {'rate_per_call': 美元/次} 返回: (effective_dollars_per_1m_tokens, daily_cost) """ total_tokens = daily_requests * tokens_per_request if pricing_model == "per_token": daily_cost = total_tokens / 1_000_000 * params["rate_per_1m"] elif pricing_model in ("per_minute", "per_second"): unit = 60 if pricing_model == "per_minute" else 1 seconds = daily_requests * params["avg_req_seconds"] daily_cost = seconds / unit * params[f"rate_per_{'min' if unit==60 else 'sec'}"] elif pricing_model == "per_prediction": daily_cost = daily_requests * params["rate_per_call"] else: raise ValueError(pricing_model) effective_per_1m = daily_cost / (total_tokens / 1_000_000) if total_tokens else float("inf") return round(effective_per_1m, 4), round(daily_cost, 2) # 示例:10000 请求/天,每请求 800 token N, T = 10_000, 800 fireworks = cost_per_token("per_token", {"rate_per_1m": 0.90}, N, T) baseten = cost_per_token("per_minute", {"rate_per_min": 1.10, "avg_req_seconds": 2.5}, N, T) modal = cost_per_token("per_second", {"rate_per_sec": 0.018, "avg_req_seconds": 2.5}, N, T) print("Fireworks:", fireworks) print("Baseten: ", baseten) print("Modal: ", modal) # 有效 $/百万 token 最低的那个,就是当前工作负载的真实赢家
把 daily_requests 与 tokens_per_request 换成你的真实曲线,逐家对比。你会发现:真正决定胜负的不是厂商,而是你的利用率分布——同一家平台,在不同负载下可能是最贵也可能是最便宜。
💡 别被厂商的「每百万 token」标杆带节奏。先量自己的流量(请求 QPS × 平均 token),再折算「有效每 token」,否则你是在用别人的工作负载给自家买单。
| 厂商 | 细分 | 计价 | 主打 | 适合场景 |
|---|---|---|---|---|
| Fireworks | GPU 平台 | 按 token + 批处理层 | 延迟(FireAttention) | 延迟敏感、微调按基座费率 |
| Together | GPU 平台 | 按 token | 目录广度(200+ 模型) | 要多模型可选、推理+微调一体 |
| Baseten | GPU 平台 | 按分钟 + 专属 | 企业级打磨(Truss + 合规) | 金融/医疗、专属 GPU、SOC 2/HIPAA |
| Modal | GPU 平台 | 按秒 | Python 原生 DX | serverless 突发、Python-first 团队 |
| Replicate | API 卖场 | 按次预测 | 多模态广度 | 图像/视频/音频、快速集成 |
| Anyscale | GPU 平台 | 按 Ray 集群 | 分布式 Python(RayTurbo) | 推理是大计算图一个节点 |
配套定制芯片(本节不深讲,但选型时要知晓):Groq(LPU,语音/实时翻译)、Cerebras(WSE)、SambaNova(RDU)——5~10 倍解码速度,但每 token 单价更高。
本节产出 outputs/skill-inference-platform-picker.md(原课程目录)。给定工作负载画像、SLA、预算,它会:
把它和你第 01 节的「双供应商策略」拼起来,你就有一份能上架构评审会的完整推理采购方案。
跑通对比器:运行 code/main.py。对一个 70B 模型在单张 H100 上,Baseten(按分钟)在多高持续利用率上击败 Fireworks(按 token)?自己推导交叉点,再与 30% 经验法则对比。
多模态产品:你的产品要做图像生成 + 聊天 + 语音转文字。为每种模态选平台,并说出统一它们的网关模式(参考第 19 节 AI 网关)。
涨价影响:Fireworks 把你主用模型涨了 1 美元/小时。若 40% 流量切到批处理层(五折),建模混合成本影响,判断是否触发迁移评估。
受监管客户:某客户要 SOC 2 Type II + HIPAA + 专属 GPU。哪三家平台可行?在 FinOps 维度上谁赢?
量级对比:对比 Llama 3.1 70B 在 Fireworks serverless、Together 按需、Baseten 专属、Replicate API 上的每 1000 次预测成本。10 次/天时谁最便宜?10000 次/天呢?画出交叉点。
下一节,我们下沉到基础设施层——看 Kubernetes 上 GPU 自动伸缩怎么做:Karpenter、KAI 调度器、Gang Scheduling 如何应对「一批 GPU 要么全到要么全不来」的硬约束。