推理平台经济学:Fireworks、Together、Baseten、Modal、Replic...


文档摘要

推理平台经济学:Fireworks、Together、Baseten、Modal、Replicate、Anyscale 本节摘要:2026 年的推理市场早已不是「租 GPU 时间」那么简单,它裂成了三段——定制芯片(Groq、Cerebras、SambaNova)、GPU 平台(Baseten、Together、Fireworks、Modal)、API 优先卖场(Replicate、DeepInfra)。Fireworks 在 2026 年 5 月 1 日把 GPU 租用每芯片每小时涨了 1 美元,而它 40 亿美元估值、日处理 10 万亿+ token 的体量说明「量驱」模式依然成立;Baseten 在 2026 年 1 月以 50 亿美元估值完成 3 亿美元 E 轮。

推理平台经济学:Fireworks、Together、Baseten、Modal、Replicate、Anyscale

本节摘要:2026 年的推理市场早已不是「租 GPU 时间」那么简单,它裂成了三段——定制芯片(Groq、Cerebras、SambaNova)、GPU 平台(Baseten、Together、Fireworks、Modal)、API 优先卖场(Replicate、DeepInfra)。Fireworks 在 2026 年 5 月 1 日把 GPU 租用每芯片每小时涨了 1 美元,而它 40 亿美元估值、日处理 10 万亿+ token 的体量说明「量驱」模式依然成立;Baseten 在 2026 年 1 月以 50 亿美元估值完成 3 亿美元 E 轮。竞争定位规则其实很简单:Fireworks 拼延迟、Together 拼目录广度、Baseten 拼企业级打磨、Modal 拼 Python 原生开发体验、Replicate 拼多模态覆盖、Anyscale 拼分布式 Python。本节给你一张能直接甩给创始人的选型矩阵,外加一个把六家异构计价模型折算到「每请求真实成本」的对比器。

对应原课程:Phase 17 · Lesson 02 · 02-inference-platform-economics(原英文 phases/17-infrastructure-and-production/02-inference-platform-economics/docs/en.md)。

学习目标

阅读完本节,你应当能够:

  1. 说出三大市场细分(定制芯片、GPU 平台、API 优先)并把每家厂商映射到对应细分。
  2. 解释为什么「按 token」API 定价会向推理引擎成本曲线而非硬件成本收敛。
  3. 跨至少三家厂商计算有效每请求成本,并说明按分钟计费(Baseten、Modal)何时胜过按 token 计费。
  4. 针对给定工作负载(serverless 突发、稳态高吞吐、微调变体、多模态)选出对的默认平台。

一、问题与直觉

你评估过托管大厂平台(第 01 节),决定要更窄、更快的供应商——Fireworks 拼延迟、Together 拼广度、Baseten 拼微调定制模型。可现在你面前有六个真实选项,而它们的定价页根本对不齐:Fireworks 显示「美元/百万 token」、Baseten 显示「美元/分钟」、Modal 显示「美元/秒」、Replicate 显示「美元/次预测」。不建模工作负载,你没法横向比。

更糟的是,每个定价页背后的商业模式不同。Fireworks 用自研引擎(FireAttention)跑共享 GPU,按 token 费率反映它的利用率曲线;Baseten 给你 Truss + 专属 GPU,按分钟反映独占性;Modal 是真正的 Python serverless——按秒计费、亚秒级冷启动。同样一个 LLM 响应,三种成本函数。

本节就把这六家逐一建模,告诉你每种场景谁赢。

二、核心概念

三大细分

定制芯片 —— Groq(LPU)、Cerebras(WSE)、SambaNova(RDU)。在同等模型上,解码通常比 GPU 集群快 5~10 倍。每 token 单价更高(Groq 在 2025 年末 Llama-70B 上约 0.99 美元/百万),但对延迟敏感场景无可匹敌——语音 Agent、实时翻译的生产首选。

GPU 平台 —— Baseten、Together、Fireworks、Modal、Anyscale。跑 NVIDIA(H100、H200,2026 年的 B200),偶尔用 AMD。它处于「裸 GPU 租用」(RunPod、Lambda)与「大厂托管服务」(Bedrock)之间的经济层。

API 优先卖场 —— Replicate、DeepInfra、OpenRouter、Fal。目录广,按次或按秒计费,强调「首次调用时间」最短。

六家逐一看

Fireworks —— 延迟优先的 GPU 平台

  • 自研 FireAttention 引擎,宣称在同等配置下比 vLLM 低 4 倍延迟。
  • 批处理层(batch tier)约为 serverless 费率的一半,适合非交互工作负载。
  • 微调模型按基座模型费率计费——这对那些对你的 LoRA 收溢价的供应商是真差异化。
  • 2026 年中:自 5 月 1 日起按需 GPU 租用每芯片每小时涨 1 美元;量大可谈量价。
  • 财务信号:40 亿美元估值,日处理 10 万亿+ token。

Together —— 广度优先

  • 200+ 模型,开源新模型上游发布数日内上线。
  • 在同等 LLM 上比 Replicate 便宜 50%~70%——「AI Native Cloud」的定位就是量 + 目录。
  • 推理 + 微调 + 训练一套 API。

Baseten —— 企业级打磨优先

  • Truss 框架:把模型依赖、密钥、服务配置打包进一个清单。
  • GPU 范围从 T4 到 B200。按分钟计费,冷启动缓解做得不错。
  • SOC 2 Type II、HIPAA-ready。金融科技与医疗常见选择。
  • 50 亿美元估值,2026 年 1 月 E 轮 3 亿美元(CapitalG、IVP、NVIDIA 领投)。

Modal —— Python 原生优先

  • 纯 Python 的基础设施即代码。给函数加装饰器 @modal.function(gpu="A100"),一条命令部署。
  • 按秒计费。冷启动 2~4 秒(预热后),小模型 < 1 秒。
  • 2025 年 B 轮 8700 万美元,估值 11 亿美元。独立调研里开发体验得分最高。

Replicate —— 多模态广度

  • 按预测计费。图像、视频、音频模型的默认平台。
  • 集成生态丰富(Zapier、Vercel、CMS 插件)。
  • LLM 按 token 费率竞争力弱,但多模态多样性赢。

Anyscale —— Ray 原生

  • 基于 Ray;RayTurbo 是 Anyscale 的自研推理引擎(对标 vLLM)。
  • 适合推理只是更大计算图里一个节点的分布式 Python 工作负载。
  • 托管 Ray 集群,与 Ray AIR、Ray Serve 紧密集成。

按 token vs 按分钟 —— 谁何时赢

按 token 适合延迟不敏感、突发的工作负载——用多少付多少。按分钟适合利用率高且可预测的工作负载——一旦把 GPU 跑满,你就比按 token 划算。

经验法则:专属 GPU 持续利用率高于约 30% 时,按分钟(Baseten、Modal)开始赢过按 token(Fireworks、Together);低于这条线,按 token 因不付空闲而胜出。

自研引擎才是真护城河

每家在 vLLM 与 SGLang 之上的平台都声称有自研引擎:FireAttention、RayTurbo、Baseten 的推理栈。自研引擎的说法里掺了不少营销——诚实的表述是:vLLM + SGLang 占了生产开源推理约 80%,平台层的真正差异化是开发体验(DX)、归因能力与 SLA。

你该记住的数字

  • Fireworks GPU 租用:2026 年 5 月 1 日起每芯片每小时涨 1 美元。
  • Fireworks 宣称:同等配置下比 vLLM 低 4 倍延迟。
  • Together:LLM 上比 Replicate 便宜 50%~70%。
  • Baseten 估值:50 亿美元(2026 年 1 月 E 轮,3 亿美元)。
  • Modal 估值:11 亿美元(2025 年 B 轮)。
  • 按分钟在持续利用率 > 约 30% 时胜过按 token。

三、从零实现:每请求有效成本对比器

原课程 code/main.py 在合成工作负载上跨六家厂商对比计价模型,输出「美元/天」与「有效美元/百万 token」。下面给一个可复用的最简骨架——把不同计价模型折算到「每请求成本」,从而横向可比。

def cost_per_token(pricing_model, params, daily_requests, tokens_per_request): """把不同计价模型折算到『有效美元/百万 token』。 pricing_model: 'per_token' 按 token, params = {'rate_per_1m': 美元/百万 token} 'per_minute' 按分钟, params = {'rate_per_min': 美元/分钟, 'avg_req_seconds': 单请求墙钟秒} 'per_second' 按秒, params = {'rate_per_sec': 美元/秒, 'avg_req_seconds': 单请求墙钟秒} 'per_prediction' 按次, params = {'rate_per_call': 美元/次} 返回: (effective_dollars_per_1m_tokens, daily_cost) """ total_tokens = daily_requests * tokens_per_request if pricing_model == "per_token": daily_cost = total_tokens / 1_000_000 * params["rate_per_1m"] elif pricing_model in ("per_minute", "per_second"): unit = 60 if pricing_model == "per_minute" else 1 seconds = daily_requests * params["avg_req_seconds"] daily_cost = seconds / unit * params[f"rate_per_{'min' if unit==60 else 'sec'}"] elif pricing_model == "per_prediction": daily_cost = daily_requests * params["rate_per_call"] else: raise ValueError(pricing_model) effective_per_1m = daily_cost / (total_tokens / 1_000_000) if total_tokens else float("inf") return round(effective_per_1m, 4), round(daily_cost, 2) # 示例:10000 请求/天,每请求 800 token N, T = 10_000, 800 fireworks = cost_per_token("per_token", {"rate_per_1m": 0.90}, N, T) baseten = cost_per_token("per_minute", {"rate_per_min": 1.10, "avg_req_seconds": 2.5}, N, T) modal = cost_per_token("per_second", {"rate_per_sec": 0.018, "avg_req_seconds": 2.5}, N, T) print("Fireworks:", fireworks) print("Baseten: ", baseten) print("Modal: ", modal) # 有效 $/百万 token 最低的那个,就是当前工作负载的真实赢家

daily_requeststokens_per_request 换成你的真实曲线,逐家对比。你会发现:真正决定胜负的不是厂商,而是你的利用率分布——同一家平台,在不同负载下可能是最贵也可能是最便宜。

💡 别被厂商的「每百万 token」标杆带节奏。先量自己的流量(请求 QPS × 平均 token),再折算「有效每 token」,否则你是在用别人的工作负载给自家买单。

四、框架对比:六家横向矩阵

厂商 细分 计价 主打 适合场景
Fireworks GPU 平台 按 token + 批处理层 延迟(FireAttention) 延迟敏感、微调按基座费率
Together GPU 平台 按 token 目录广度(200+ 模型) 要多模型可选、推理+微调一体
Baseten GPU 平台 按分钟 + 专属 企业级打磨(Truss + 合规) 金融/医疗、专属 GPU、SOC 2/HIPAA
Modal GPU 平台 按秒 Python 原生 DX serverless 突发、Python-first 团队
Replicate API 卖场 按次预测 多模态广度 图像/视频/音频、快速集成
Anyscale GPU 平台 按 Ray 集群 分布式 Python(RayTurbo) 推理是大计算图一个节点

配套定制芯片(本节不深讲,但选型时要知晓):Groq(LPU,语音/实时翻译)、Cerebras(WSE)、SambaNova(RDU)——5~10 倍解码速度,但每 token 单价更高。

五、可复用产物

本节产出 outputs/skill-inference-platform-picker.md(原课程目录)。给定工作负载画像、SLA、预算,它会:

  1. 选出主推理平台(及理由:延迟/广度/合规/DX 哪一项最匹配)。
  2. 点名备选平台(用于故障转移或第二工作负载)。
  3. 给出计费模型判定(你的利用率 > 30% 走按分钟,否则按 token)。
  4. 标注隐藏成本(冷启动、最小承诺、微调溢价、批处理折扣)。

把它和你第 01 节的「双供应商策略」拼起来,你就有一份能上架构评审会的完整推理采购方案。

六、练习

  1. 跑通对比器:运行 code/main.py。对一个 70B 模型在单张 H100 上,Baseten(按分钟)在多高持续利用率上击败 Fireworks(按 token)?自己推导交叉点,再与 30% 经验法则对比。

  2. 多模态产品:你的产品要做图像生成 + 聊天 + 语音转文字。为每种模态选平台,并说出统一它们的网关模式(参考第 19 节 AI 网关)。

  3. 涨价影响:Fireworks 把你主用模型涨了 1 美元/小时。若 40% 流量切到批处理层(五折),建模混合成本影响,判断是否触发迁移评估。

  4. 受监管客户:某客户要 SOC 2 Type II + HIPAA + 专属 GPU。哪三家平台可行?在 FinOps 维度上谁赢?

  5. 量级对比:对比 Llama 3.1 70B 在 Fireworks serverless、Together 按需、Baseten 专属、Replicate API 上的每 1000 次预测成本。10 次/天时谁最便宜?10000 次/天呢?画出交叉点。

本节要点回顾

  1. 市场三段:定制芯片(快但贵)、GPU 平台(经济中间层)、API 卖场(目录广按次计费),先分段再选厂。
  2. 六家定位一句话:Fireworks 拼延迟、Together 拼广度、Baseten 拼企业打磨、Modal 拼 Python DX、Replicate 拼多模态、Anyscale 拼分布式 Python。
  3. 按 token 向引擎成本曲线收敛,而非硬件成本——这就是为什么同样 H100,六家费率能差 2~3 倍。
  4. 按分钟在 > 30% 持续利用率时胜过按 token:你的利用率分布才是真正的胜负手,不是厂商。
  5. 微调按基座费率是 Fireworks 真差异化:别人对你的 LoRA 收溢价,它不收。
  6. 自研引擎说法掺营销:vLLM + SGLang 占开源生产约 80%,平台差异化在 DX/归因/SLA。
  7. 隐藏成本决定真实账单:冷启动、最小承诺、批处理折扣、微调溢价——定价页只给你一半真相。

下一节,我们下沉到基础设施层——看 Kubernetes 上 GPU 自动伸缩怎么做:Karpenter、KAI 调度器、Gang Scheduling 如何应对「一批 GPU 要么全到要么全不来」的硬约束。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U