第6章 缓存与推理成本核算 章节摘要:本章跟着一条钱的主线走——把第5章量出的命中率、吞吐、延迟,逐项换算成可签字的成本数字。我们先建立推理成本的完整账本(从每百万 token 单价到总体拥有成本 TCO),再推导缓存的投资回报与盈亏平衡,然后把显存、写溢价、失效重建这些藏在水面下的隐性成本翻出来算账,最后落到一张管理层能对账的月度报表。读完这一章,技术负责人能独立搭建含缓存项的月度推理成本模型,并拿它去和第7章的四条降本路线对话。 一条主线 缓存这东西在工程师眼里是命中率,在财务眼里是账本。第5章我们把一套中台服务的命中率做到四成、吞吐拉到每分钟三万次、首字延迟压到四百毫秒,数据很漂亮。可这些数字进了预算会,CFO 只问一句:省了多少钱?本章要回答的就是这一句。
章节摘要:本章跟着一条钱的主线走——把第5章量出的命中率、吞吐、延迟,逐项换算成可签字的成本数字。我们先建立推理成本的完整账本(从每百万 token 单价到总体拥有成本 TCO),再推导缓存的投资回报与盈亏平衡,然后把显存、写溢价、失效重建这些藏在水面下的隐性成本翻出来算账,最后落到一张管理层能对账的月度报表。读完这一章,技术负责人能独立搭建含缓存项的月度推理成本模型,并拿它去和第7章的四条降本路线对话。
缓存这东西在工程师眼里是命中率,在财务眼里是账本。第5章我们把一套中台服务的命中率做到四成、吞吐拉到每分钟三万次、首字延迟压到四百毫秒,数据很漂亮。可这些数字进了预算会,CFO 只问一句:省了多少钱?本章要回答的就是这一句。
我们借一个贯穿全程的案例来讲:某中台团队月调用两亿次、月输出 token 约三十亿,上缓存之前按全价付费,上缓存之后命中四成。这条线从"每百万 token 多少钱"出发,走到"这次改造几个月回本",再走到"省下的钱里有多少被隐性成本吃掉了",最后收在"月末怎么把这盘账清晰地报给管理层"。每一个站点都对应一节,下一站是前一站的自然延伸。
本章真正的认知转折发生在 6.3:很多人以为缓存是纯省钱手段,算到隐性成本才发现,缓存不是免费的,它有持有成本和交易摩擦。把显存当租金、把写溢价当手续费、把失效重建当重置费,才能看清一笔缓存改造的真实净收益。最终落点是——只有把明账、回本账、隐性账三本账并成一张月度报表,技术投入才算真正进了财务的核算体系。
读完本章,你应当能够:
第7章要拿四条降本路线做横向对比(缓存、量化、蒸馏、路由),比的不再是"哪个技术酷",而是"每条路线在同样的成本框架里净省多少、多久回本、隐性账多大"。本章建立的有效单价、盈亏平衡、隐性成本三件套,就是第7章那张对比表的统一标尺。所以读第7章前,请确认自己已经能把一笔缓存投入完整换算成钱——那是进入对比的门票。