内容摘要
LLM可观测·token去哪了 灏 灏天文库 · AI基础设施与推理优化 第 7 期 AI基础设施与推理优化 · 第 7 期 一次请求花2块, token去哪了 ? LLM可观测 · tracing · token流 LLM应用的账是糊涂的:一次请求花2块钱,输入输出、检索、工具调用、重试各占多少? tracing把一次请求拆成span树 ,每个span记token数、延迟、成本、错误。看得见才能优化——哪步贵、哪步慢、哪步在浪费token,一目了然。 ⏱ 约 9 分钟 🎯 想搞清LLM成本和延迟的人 📦 源:llm-observability 教程 01 三个信号:trace、metric、log 可观测三件套在LLM时代升级:trace记一次请求的span树,metric记聚合指标(P50/P99延迟、token/s),log记原始事件。 传统应用trace记函数调用链,LLM应用trace要额外记 token流 :每个span标明输入token、输出token、模型名、成本。