首页00月度趋势榜01新星榜02增速榜03HF热榜04总表05搜索06

agent-memory-leaderboard/leaderboard

中文副标题「记忆之巅」的智能体长期记忆统一评测平台(AML):用一份固定评估契约横评学术记忆方法与商业化记忆产品,首期经核验榜单已于 2026 年 8 月中发布。

类型
Space
热度分
67
下载量
0
Likes
766
许可证
未标注
在 HuggingFace 打开 回到总表

配图

信息卡

项目内容
HuggingFace 地址https://huggingface.co/spaces/agent-memory-leaderboard/leaderboard
类型Space(静态站点)
热度分 trendingScore67(截至 2026-08-26)
许可证未标注(评测契约代码另见 GitHub)
榜单HuggingFace 热榜 L4 第49名

一句话定位

中文副标题「记忆之巅」的智能体长期记忆统一评测平台(AML):用一份固定评估契约横评学术记忆方法与商业化记忆产品,首期经核验榜单已于 2026 年 8 月中发布。

为什么上热度榜(值得展开)

记忆系统已成为 agent 产品的新战场,但 Mem0 型 API、MemOS、各家 Agent 框架的记忆模块口径互不可比——「我的记忆层更好」长期无法证伪。AML 的设计恰好切中这一点:参赛系统只需实现 Memory AddSearch 两个接口,而答案生成(Answer)、评估(Eval)、数据集、评判模型、配置、复核与发布全部由平台方锁定,首次给出可复现的可比结论;再加上学术方法与商业产品分开发榜、每条 Verified 结果强制绑定固定来源/产品版本/镜像/commit/API 版本、发布前不接受占位系统,程序公正性远超自媒体跑分。

规格与技术亮点

评测沿两轴展开:按任务分 Textual Memory 榜(覆盖长程召回、组合、时间、治理、个性化、执行、安全与隐私八维综合分)与 Coding Memory 榜(历史调试与开发经验的检索复用,指标 Task Solve %);按身份分学术组与产品组。GitHub 公开各基准的评估契约、共享运行时配置与文档供审计;刻意不公开题库、金标答案、私有标注、参与者轨迹与凭据以保护基准完整性。

使用方式与代码示例

git clone https://github.com/AML-memory/agent-memory-leaderboard
# 按 docs 中的 evaluation contract 实现 Add/Search 接口后提交报名

部署建议

关注者可直接订阅官网榜单与 X 动态;欲参赛走 rules 页接入指南,同步备战 Agent Memory Challenge 2026。

典型应用场景

同类对比

相比 LongMemEval、MemBench 等单一论文基准覆盖了完整产品线;相比 LMArena 式人工偏好投票更程序化、可复核。

资源导航

官网 agentmemoryleaderboard.ai、evaluation portal、docs/rules 参赛指南、GitHub AML-memory 组织、X @AgentMemoryL。

← 上一篇mpasila/Krea-2-Turbo_I2I下一篇 →TenStrip/10Eros-Max