检索与知识系统AI 产品与平台信任与治理

AI Memory 的 Benchmark 偏向 Recall,产品却更需要 Precision

我之前因为 ChatGPT 长期沿用一条过期的饮食偏好,关掉了 memory。它记对的时候,我只是少解释两句,几乎不会注意。它记错以后,却连续几周把同一条错误偏好带进新的回答。

这种体验和现有 memory benchmark 之间有一个明显的缺口。很多公开评测先给系统一批历史,再问它能不能找回并正确使用。真实产品还要做一个更早的决定,哪些信息应该进入长期状态。评测关心给定的历史有没有用起来,用户却会追问另一件事,这句话为什么会被保存。

漏掉一条有用信息,通常只让用户再说一次。存入一条错误、过期或无关的信息,它可能在之后的许多会话里反复出现。两类错误的后果并不对称。Memory 产品在写入时应该偏向 precision,宁可少存一些,也要优先减少误存。

PASB 的 27 个百分点说明了什么

最近发布的 PASB 研究测试了智能代理是否会把迎合用户的言论保存为长期状态,并在后续的不相关任务中继续沿用。研究人员从 100 个基础条目生成了 1,600 个测试任务,在 Hermes-Agent 和 OpenClaw 两个框架上运行了 12 个基座模型。实验代码也已公开。每个任务先通过五轮对话诱导智能代理形成某种迎合用户的观点,接着提出三个新问题,观察前面的判断是否仍会影响后续回答。

数据分成两组。一组的信息只留在原会话里,四项逐轮失败率的均值是 45.0%。另一组的信息由智能代理写入长期状态,均值是 71.9%,相差 27.0 个百分点。不过,这两组是根据智能代理自主决定是否写入而划分的,并非随机对照实验,因此这个差值只说明写入与后续失败相关,不能直接解释为因果效应。

这个结果的产品意义不只在于失败率上升。留在单次会话里的错误通常不会进入新的会话,一旦写入长期状态,同一个错误却可能反复出现。记对信息通常只省去几句解释,记错信息则要求用户在后续使用中不断检查和纠正。

公开 Benchmark 还没有测到完整的产品体验

现有 benchmark 已经不只测试简单问答。LongMemEval覆盖了信息提取、跨会话推理、时间推理、知识更新和拒绝回答,也分别分析了索引、检索与读取。MemoryArena进一步观察历史经验能否帮助智能代理完成后续行动。STATE-Bench还把任务结果、可靠性、成本、用户投入和知情同意放进了模拟环境。

这些评测正在接近产品,但起点仍然是一批已经准备好的历史或状态。它们可以判断系统能不能找到、更新和使用信息,却很少测试日常对话中的一句话是否应该成为长期记忆。产品最容易出错的写入决定,往往在 benchmark 开始以前就已经完成了。

我没有找到覆盖完整线上闭环的公开 memory benchmark。现有评测不会让真实用户连续使用几周,也看不到一条错误记忆让用户纠正了多少次、删除后是否重新出现、有没有越过项目边界,更无法观察它对长期留存和付费转化的影响。技术评测在回答系统记得好不好,产品还需要回答用户是否愿意让它记,以及记住以后到底减少了工作还是增加了麻烦。

用户更在意少记错,系统更容易多记

借用信息检索里的说法,漏掉一条以后可能有用的信息属于 false negative。减少这类遗漏,会提高 recall。把一条不该长期保存的信息写进去则属于 false positive。减少这类误存,会提高写入 precision。真实产品不应该给两类错误相同的权重,因为漏存通常只带来一次重复说明,误存却可能影响许多次后续使用。

自动保存会进一步放大这个差异。系统可以从一次对话里提取出大量可能有用的信息,用户真正愿意带到未来的通常只是其中很小一部分。比如,我出差时提到这周在柏林,这句话可以帮助安排眼下的行程,却不代表我已经搬家。系统如果把柏林自动保存为长期所在地,几周后仍可能按照柏林调整推荐。我们交给 AI 分析的网页和材料,也可能被误认成用户自己的长期观点。

一项研究收集了 80 名 ChatGPT 用户提供的 2,050 条 memory 记录。研究者发现,96% 的内容由系统主动创建,只有 4% 来自用户的明确要求。28% 的记录涉及个人隐私数据,52% 包含对用户心理状态的推断,84% 可以追溯到具体的对话上下文。这个小样本不能代表所有用户,96% 也不等同于出错概率,但它显示用户画像的内容主要由系统决定,用户只能在事后检查和修改。

Mem0 的一个部署个案更直接地展示了多存与存准之间的差别。一位用户在 32 天里积累了 10,134 条 memory,人工清理后只保留 224 条,其中不需要修改的只有 38 条。单一个案不能代表系统的平均水平,但它说明准确抽取一句话和判断这句话应该长期保存,是两个不同的任务。

同一条误存信息进入更大的作用范围以后,后果还会继续扩大。假设用户在一次对话里说自己不喜欢安全检查。它留在当前会话中,可能只影响这一轮的提醒。它进入跨会话 profile 后,可能影响多个项目。它如果再成为 reusable skill,智能代理执行部署或修改文件时也可能受到影响。句子没有变,能够影响的时间、任务范围和行动却变了。

同一句话从当前对话进入全局 profile,再进入 reusable skill 后,影响时间、作用范围和行动能力逐级扩大

候选记忆的低批准率也不该被自动保存掩盖。它可能来自确认界面的操作摩擦,也可能说明系统提取的信息没有足够的长期价值。产品团队需要把两种原因分开测。如果用户持续拒绝大多数候选,直接取消确认只会提高写入量,不能证明这些记忆真的有用。

Memory 产品应该怎样测

目前没有公开数据能够说明 AI memory 是否带来了产品层面的成功。ChatGPT、Claude 和 Gemini 都在扩大跨会话记忆能力,但三家公司都没有公布功能启用率、记忆实际参与的会话比例、D30 增量留存、付费转化率,以及用户纠正或删除记忆的频率。

OpenAI 在介绍 Dreaming 架构时给出了一组内部评测。事实回忆成功率从 41.5% 提升至 82.8%,偏好遵从度从 31.4% 提升至 71.3%,时间状态更新成功率从 9.4% 提升至 75.1%。这些数字说明系统更擅长找回和更新信息,无法说明用户是否愿意让系统自动保存。Claude 的 memory也从 2025 年面向 Team 和 Enterprise 推出,逐步扩展到 Pro、Max 和免费用户,同时加入项目隔离、可见摘要、编辑控制和临时对话。厂商持续投入这个功能,与用户是否接受自动写入,需要分别测量。

产品团队可以先比较无 memory 与人工提供正确、相关 memory 的理想状态,判断个性化在这个场景里最多能带来多少价值。如果两组结果接近,继续优化 memory 的意义就很有限。确认个性化确实有用以后,再比较自动写入、AI 提议后由用户确认、完全由用户主动保存三种模式,才能看出哪一种真正减少了用户工作。

这类实验首先要测写入 precision。候选批准率、用户主动保存频次、纠正与删除率,可以帮助判断系统保存的内容是否符合用户意图。过期信息复现、跨项目调用和错误行动,反映误存造成的后续影响。另一边还要测 memory 省去了多少重复说明,是否提高任务完成率,以及它对 D30 留存和付费转化的影响。只有把收益和误存造成的损失放在一起,产品团队才知道 memory 的净价值。

结语

偏向 precision 不等于放弃自动化。AI 仍然可以发现候选信息、整理表述、建议作用范围和有效期。用户只需要批准、修改或拒绝。长期状态在用户确认后才生效,后续检索和更新仍然可以自动完成。

AI 自动发现和整理候选记忆,用户批准后才进入长期状态;已批准记忆可以自动检索,高风险行动前仍需复核

显式保存也不能保证一条信息永远正确。GitHub Copilot 的 agent memory在保存代码库记忆时记录具体代码引用,使用前再回到当前分支读取最新内容。写入时由用户确认,使用时由系统检查信息是否仍然有效,两步解决的是不同问题。

可靠的 memory 应该少存、存准,并让用户知道每条长期状态从哪里来、如何修改和撤销。记住多少内容,反而是后面的事。

鸭哥每日手记

日更的深度AI新闻和分析