1.1 大模型服务和传统 Web 服务到底差在哪 我第一次被拉去救火一个"大模型对话产品大促崩了"的现场,是在两年前。当时的架构师很委屈——他们按经典 Web 的高并发套路把网关、负载均衡、无状态服务都搭得很标准,压测时单接口能扛 80 万 QPS,以为稳了。结果大促开场十分钟,TTFT(首字延迟)从 800ms 飙到 12 秒,GPU 集群显存接连 OOM,整个对话服务事实上瘫痪。复盘时大家才发现:他们压测的那个 80 万 QPS,和真实大模型对话的 80 万 QPS,根本不是同一个东西。 这一节我不想讲什么"高并发架构总论",而是要把"高并发大模型服务"这个词彻底拆开——它到底指什么、和传统 Web 高并发差在哪、为什么照搬 Web 套路必崩。