中文副标题「记忆之巅」的智能体长期记忆统一评测平台(AML):用一份固定评估契约横评学术记忆方法与商业化记忆产品,首期经核验榜单已于 2026 年 8 月中发布。

| 项目 | 内容 |
|---|---|
| HuggingFace 地址 | https://huggingface.co/spaces/agent-memory-leaderboard/leaderboard |
| 类型 | Space(静态站点) |
| 热度分 trendingScore | 67(截至 2026-08-26) |
| 许可证 | 未标注(评测契约代码另见 GitHub) |
| 榜单 | HuggingFace 热榜 L4 第49名 |
中文副标题「记忆之巅」的智能体长期记忆统一评测平台(AML):用一份固定评估契约横评学术记忆方法与商业化记忆产品,首期经核验榜单已于 2026 年 8 月中发布。
记忆系统已成为 agent 产品的新战场,但 Mem0 型 API、MemOS、各家 Agent 框架的记忆模块口径互不可比——「我的记忆层更好」长期无法证伪。AML 的设计恰好切中这一点:参赛系统只需实现 Memory Add 与 Search 两个接口,而答案生成(Answer)、评估(Eval)、数据集、评判模型、配置、复核与发布全部由平台方锁定,首次给出可复现的可比结论;再加上学术方法与商业产品分开发榜、每条 Verified 结果强制绑定固定来源/产品版本/镜像/commit/API 版本、发布前不接受占位系统,程序公正性远超自媒体跑分。
评测沿两轴展开:按任务分 Textual Memory 榜(覆盖长程召回、组合、时间、治理、个性化、执行、安全与隐私八维综合分)与 Coding Memory 榜(历史调试与开发经验的检索复用,指标 Task Solve %);按身份分学术组与产品组。GitHub 公开各基准的评估契约、共享运行时配置与文档供审计;刻意不公开题库、金标答案、私有标注、参与者轨迹与凭据以保护基准完整性。
git clone https://github.com/AML-memory/agent-memory-leaderboard
# 按 docs 中的 evaluation contract 实现 Add/Search 接口后提交报名
关注者可直接订阅官网榜单与 X 动态;欲参赛走 rules 页接入指南,同步备战 Agent Memory Challenge 2026。
相比 LongMemEval、MemBench 等单一论文基准覆盖了完整产品线;相比 LMArena 式人工偏好投票更程序化、可复核。
官网 agentmemoryleaderboard.ai、evaluation portal、docs/rules 参赛指南、GitHub AML-memory 组织、X @AgentMemoryL。