AI记忆赛道群雄并起:Mem0、Zep、Supermemory、ASMR谁能成为下一个“安卓“
AI记忆赛道群雄并起Mem0、Zep、Supermemory、ASMR谁能成为下一个安卓【免费下载链接】supermemoryMemory and context engine app that is extremely fast, scalable, and can be run fully locally. The Memory API for the AI era.项目地址: https://gitcode.com/GitHub_Trending/su/supermemory大模型什么都会唯独记不住。上下文窗口再长关掉会话一切归零向量数据库存再多分块也无法回答用户昨天为什么改主意了。当聊完就忘从段子变成产品痛点AI 记忆Memory就从一个辅助功能升级为独立赛道——过去一年里这条赛道密集出现了一批明星玩家论文刷爆 SOTA、号称抛弃向量数据库的 ASMR创始人 19 岁创业、获 Jeff Dean 等名人投资的 Mem0深耕会话记忆多年的 Zep以及在三项主流记忆基准测试上均排名第一的开源项目 Supermemory。这篇文章不做营销式盘点。我们将以 Supermemory 仓库的真实源码和文档为解剖样本回答三个更实际的问题赛道玩家各自押注了什么技术路线Supermemory 为什么把自己定位成模型与 Agent 之间的中间层以及这场竞争的本质——谁先定义长期记忆的事实格式谁就握住了下一代 Agent 生态的入口。一、赛道全景从存储聊天记录到记忆操作系统记忆赛道的爆发有一个清晰的技术分水岭早期玩家把记忆当作检索问题——对话文本向量化、塞进向量库、查询时做相似度匹配。Zep 是最典型的代表其数据模型围绕 Session 与 Message 展开本质上仍是带检索的聊天记录存储。随后 Mem0 把这一层做成了轻量 API开发者传入对话它用 LLM 抽取事实列表存进向量库检索时再提示词注入。它押中了两个趋势——Agent 化开发需要零门槛接入以及抽取事实比存原文更接近记忆的语义。这也是它能在 2024 年迅速成为 memory layer 明星、吸引顶级资本的原因。2025 年起赛道进入第二阶段技术路线开始分化。ASMR 的核心主张是用 Agent 完全替代向量数据库不再用 embedding 做最近邻检索而是让模型在检索时自主筛选、推理在长对话记忆任务上把准确率推到 99% 量级并刷爆多项 SOTA——它用结果证明了一个判断embedding 相似度根本承载不了时间先后、因果演变、立场翻转这类记忆语义。Supermemory 走的是另一条更重的路线自己训练抽取模型自研时态向量-图谱引擎把对话→事实→关系→画像整条管线做成一个封闭引擎再通过 API、MCP、SDK、插件把能力分发出去。仓库 README 给出的成绩单是在 LongMemEval、LoCoMo、ConvoMem 三大主流 AI 记忆基准上均排名第一95% Recall15 的同时实现 99.4% 的上下文压缩用户画像单次调用约 50ms。把四家放在一起看赛道其实只剩两条路线以 Mem0 为代表的向量库 提示词抽取轻封装和以 Supermemory 为代表的**专有抽取模型 时态知识图谱重引擎**。ASMR 则像是一份对前者的檄文也是对后者的背书——记忆不能靠相似度检索这一点行业正在达成共识。二、Supermemory 的生态位不做模型做记忆基础设施的中间层Supermemory 一个值得注意的选择是它不绑定任何模型。托管平台用自研模型做抽取自托管版本则完全交给用户指定——OpenAI、Anthropic、Gemini、Groq乃至 Ollama、vLLM 等本地端点都可以官方文档甚至给出了gpt-oss:20b离线运行的完整配置。这种引擎中立、模型可插拔的姿态是它作为中间层的第一块基石。2.1 MCP一个端点服务所有 AI 助手中间层策略最直接的落点是 MCPModel Context Protocol。仓库中apps/mcp实现了完整的 Supermemory MCP 服务器托管地址是一个标准 JSON 配置即可接入{ mcpServers: { supermemory: { url: https://mcp.supermemory.ai/mcp } } }按 MCP 服务器说明 的描述该实现基于 MCP SDK v2每次 HTTP 请求都做 OAuth 鉴权并暴露 8 个模型可见工具——search_memory、get_profile、list_documents、get_document、list_memories、list_spaces、who_am_i、add_memory——外加select-space、memory-graph、guided-save、upload-file四个可在对话内直接打开的交互式 App。这意味着 Claude Desktop、ChatGPT Web 乃至任何兼容 MCP 的客户端连上同一端点就共享了同一份记忆团队可以跨助手协作而上下文不散。2.2 插件矩阵给编程助手装上记忆比 MCP 更贴身的是围绕 IDE/CLI Agent 的插件矩阵。仓库文档列出的插件覆盖 Claude Code、Muse Code、Cursor、Codex、OpenCode、OpenClaw、Hermes 等主流编程助手。以 OpenCode 集成文档 为例插件的记忆机制包含四层会话启动时自动注入相关记忆用户画像、项目知识、语义匹配、remember/save this关键词触发即时存储、上下文用到 80% 时自动压缩并沉淀为记忆、private标签内的内容永不落盘。这条产品线直接对应社区里热度最高的使用场景——中文技术社区多篇上手教程都在解决AI 编程助手跨会话失忆的痛点而 Supermemory 把方案做成了装一个插件级别的体验。2.3 SDK 中间件侵入框架而非等待框架对应用开发者Supermemory 没有停留在教你怎么调 API而是直接寄生进主流推理框架。以 OpenAI SDK 中间件 为例with_supermemory()包装chat.completions.create请求发出前中间件从 Supermemory 拉取静态画像、动态上下文和与当前消息相关的记忆去重后注入 system/developer 消息响应返回的同时后台任务异步把这段对话存入记忆库主请求零额外延迟。Agent Framework 上下文提供器 走的是另一套协议实现BaseContextProvider的before_run/after_run钩子支持profile、query、full三种检索模式与框架内置的 Mem0 集成保持同一用法。而 Pipecat、LiveKit 的 Python SDK 则把记忆接到了语音 Agent 的帧处理流程上实现会话中拦截→检索→注入→存储的闭环。加上仓库中已实现的 LangChain、LangGraph、AI SDK、Mastra、CrewAI、VoltAgent、Convex 等集成Supermemory 实质上铺设了一张覆盖推理框架 Agent 框架 语音管线 编程助手的接入网——这正是一个中间层该有的姿态让记忆能力以每个生态的原生方式出现。2.4 一条管线同时输出 RAG 与记忆中间层策略的另一个支撑点是把记忆和RAG塞进同一个引擎。按 How it works 文档任何一份文档文本、PDF、图片 OCR、视频转写、URL、代码进入管线后会产出三样东西Document chunks用于 RAG 检索的原文分块、Memories抽取出的图谱事实、Profile随时可取的静态 动态画像。SDK 侧只是几个方法import { Supermemory } from supermemory; const supermemory new Supermemory({ apiKey: sm_... }); // 写入对话或文档自动进入抽取管线 await supermemory.add(user_123, { content: The user loves Paris., dreaming: instant, }); // 读取记忆 画像一次取回 const { profile } await supermemory.profile(user_123); const { results } await supermemory.search(user_123, { query: where does the user want to travel?, });这也是它区别于纯 RAG 产品和纯记忆产品的地方开发者的知识库和个人化状态不再需要两套系统、两个供应商。文档对比页给出的判断很直接——RAG 回答我知道什么记忆回答我记得关于你的什么。而这两者在 Supermemory 中共享同一命名空间、同一检索入口这正是它试图卡住的生态位做整个上下文栈的默认底座。2.5 从托管云到单二进制部署形态的全都要中间层要成为默认选项还必须回答数据主权问题。仓库的自托管方案给了一条极简路径curl -fsSL https://supermemory.ai/install | bash单二进制、零配置、内置本地 embedding默认Xenova/bge-base-en-v1.5768 维首次启动自动生成 API Key指向 Ollama/LM Studio 即可完全离线运行。SDK 切换只需改一个baseUrl所有 API 语义不变。托管平台则提供 SOC 2、GDPR、HIPAA BAA 等合规能力。云上一条 API、本地一个二进制让不同隐私诉求的团队都能把记忆层放在自己信任的边界内——这一点对争夺开发者心智至关重要。三、标准之争谁先定义长期记忆的事实格式如果说前两节讨论的是接入广度那这一节才是赛道胜负手记忆不是存下来就完了关键是存成什么结构。不同结构决定了检索能答对什么问题也决定了上层生态要不要围绕你的格式重写。3.1 事实格式的分野向量相似 vs 时态图谱Supermemory 的图谱模型在 Graph memory 文档 里被定义得很明确。事实之间只有三种关系Updates更新新事实替换旧事实Alex 在 Google 做工程师被Alex 刚入职 Stripe 做 PM覆盖检索命中当前事实历史保留可审计Extends扩展新事实补充细节而不推翻旧事实负责支付业务扩展Stripe PMDerives推导系统从多条记忆的模式中推断出从未被直接陈述的事实。Memory 1: Alex is a PM at Stripe Memory 2: Alex frequently discusses payment APIs and fraud detection → Derived: Alex likely works on Stripes core payments product配合三种记忆类型事实 Facts 持久、偏好 Preferences 随重复强化、事件 Episodes 随时间衰减以及时间衰减、矛盾覆盖、噪声过滤三套自动遗忘机制这套模型回答了一个向量库永远答不对的问题——用户上周说喜欢阿迪今天应该推荐什么文档用这个经典场景做了演示RAG 按相似度会召回我爱阿迪达斯这条过时事实而图谱会沿着鞋坏了→失望→换品牌的因果链把当前状态现在偏好 Puma捞出来。画像Profile是这套格式的直接产物每个命名空间自动维护一份static长期稳定事实职业、偏好dynamic近期动态正在做的项目、最近的学习的压缩摘要单次调用即取即用——它本质上就是记忆格式对上层 LLM 的最终呈现形态。可以毫不夸张地说谁的事实格式更接近真实的人类记忆状态机谁的 Agent 就更懂人。3.2 隔离即标准命名空间成为多租户原语记忆格式的另一个维度是隔离。Supermemory 把隔离做成了 URL 路径的一部分v3/v4 的containerTag升级为 v5 的/ns/{namespace}且每个命名空间对应独立的向量索引检索物理上不会跨边界泄漏。命名规则甚至允许org:acme:user:john这样的分层结构。对开发者而言这意味着每个用户一个命名空间 一把 scoped key就能实现严格的多租户——而 GDPR 式的数据删除也随之简化为删掉一个命名空间。隔离机制成为 SDK 的默认参数就会反过来约束上层应用的架构习惯这是标准之争里隐蔽但真实的一环。3.3 API 同构化迁移文档暴露的标准前夜这场标准之争最有趣的证据藏在仓库的迁移文档里。从 Mem0 迁移指南 给出了逐行 API 映射mem0.add(messages, user_id)对应client.add(user_alice, { content })client.search(query, user_id)对应client.search(user_alice, { query, searchMode: memories })从 Zep 迁移指南 则把session.create()、memory.add(session_id, ...)映射为命名空间参数。社区生态中甚至出现了 OpenMemory 这类第三方迁移工具声明可一键从 Mem0、Zep、Supermemory 平滑迁移。这个现象值得玩味当各家开始互相提供迁移通道时说明 API 表层已经在趋同——add、search、namespace正在成为行业通用动词。表层趋同意味着竞争上移到深层抽取模型的精度、图谱语义的完备度、时态推理的正确率、延迟与成本。Mem0 有先发与流量Zep 有会话场景的沉淀ASMR 有免向量库的范式冲击而 Supermemory 手里是三项基准第一的成绩单 完全开源的接入栈。3.4 安卓类比谁有资格成为记忆层的开放系统回到标题的问题。安卓赢下移动生态靠的不是最强硬件而是三样东西的组合开放的内核、免费的授权、庞大的分发生态——它定义了手机操作系统这个层让上面的厂商和下面的开发者都默认站在它的语义之上。记忆赛道的安卓同样需要三样东西一个标准的事实格式图谱语义、时态规则、画像结构一套跨生态的分发协议MCP、SDK 中间件、编程助手插件以及一个可自托管的开放引擎数据主权不再成为采用障碍。按这个框架审视四家ASMR 贡献了抛弃向量库的范式Mem0 跑通了轻量接入的体验Zep 守住了会话记忆的基本盘而 Supermemory 是目前唯一同时押注自研引擎 标准 API MCP 分发 插件矩阵 单二进制自托管的选手——它的生态位恰好就是安卓当年站过的那个位置做一个所有人都绕不开的中间层而不是某个应用、某个模型的一部分。这场竞赛远未到终局。基准可以刷SOTA 可以赶但决定胜负的最终变量是开发者是否愿意把记忆当作一个可信赖的默认基础设施来使用——换句话说谁能先让整个 Agent 生态围绕自己的事实格式生长谁就拿到了下一代智能体的安装底座。【免费下载链接】supermemoryMemory and context engine app that is extremely fast, scalable, and can be run fully locally. The Memory API for the AI era.项目地址: https://gitcode.com/GitHub_Trending/su/supermemory创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考