第 2 章 · 04 Token 计数(token counting) 本节摘要:Token 计数(token counting)让你在真正发推理请求之前,精确预估一段文本(或一份文件)会消耗多少 Claude token——从而预估成本、判断是否超长、决定要不要切更大上下文模型。本节讲清它的核心要点:用 端点( )拿精确计数;千万不要用 OpenAI 的 ,它在 Claude 文本上普遍少算 1520%,代码与非英文内容偏差更大;计数是模型相关的,要传与推理时相同的模型 ID;端点无状态,跨版本对比靠分别计数再相减。读完本节,你能在发请求前算清成本,并理解不同模型 tokenizer 的差异。