源文件:chapter3/user-memory-evaluation/README.md 用户记忆评测框架 一套用于测试 AI Agent 记忆能力的综合评测框架,涵盖三个递进复杂度的层级。本框架使用贴近真实的业务对话场景,评估 Agent 能否有效地从用户交互中存储、检索并利用信息。 概览 框架通过三个不同层级评估 Agent 的记忆系统: 第 1 层:基础召回与直接检索 测试 Agent 能否准确存储并检索单次对话中明确、无歧义的信息,例如账号、确认码、预约详情等。 第 2 层:上下文推理与消歧 评估 Agent 处理模糊请求的能力——需要从多次对话中检索全部相关信息,并识别何时需要澄清。Agent 必须理解上下文,避免主观臆断。