智能体长期记忆评测台

作者:注册老炮@MedXpert I SynomosAI学术研究v2

AI 说"我记得",你敢信吗?测一下就知道。长期记忆评测台 memory-bench——本地一键评测智能体/大模型长期记忆:12 类题型(时序/实体/否定/反事实/跨会话整合),EM/F1 标准评分,零配置开箱即跑;可接真实 LLM 严评(SiliconFlow/DeepSeek),密钥 env 注入不落盘;v2.4 起支持加载 LongMemEval/LoCoMo 等官方基准(数据按许可证自备,工具仅做格式转换与标准评分)。结果可复现、可对比、可入发布证据。自带安全稳定性 10 维实测全 5.0。适合 Agent 开发者、AI 产品经理、记忆方案选型。"记忆好不好,测了才知道。"

下载量
340
点赞
85
价格
免费
精选

技能文档

---
name: memory-bench
display_name: 智能体长期记忆评测台
title: 智能体长期记忆评测台
version: 1.0.6
category: 学术研究
platforms: ["web", "desktop"]
author: 注册老炮
license: MIT
description: AI 说"我记得",你敢信吗?测一下就知道。长期记忆评测台 memory-bench——本地一键评测智能体/大模型长期记忆:12 类题型(时序/实体/否定/反事实/跨会话整合),EM/F1 标准评分,零配置开箱即跑;可接真实 LLM 严评(SiliconFlow/DeepSeek),密钥 env 注入不落盘;v2.4 起支持加载 LongMemEval/LoCoMo 等官方基准(数据按许可证自备,工具仅做格式转换与标准评分)。结果可复现、可对比、可入发布证据。自带安全稳定性 10 维实测全 5.0。适合 Agent 开发者、AI 产品经理、记忆方案选型。"记忆好不好,测了才知道。" #AI评测 #长期记忆 #LLM #benchmark
description_en: Benchmark your AI agent's long-term memory in one command. memory-bench runs 12 question types (temporal, entity, negation, counterfactual, cross-session) with standard EM/F1 scoring, zero-config local execution, and a pluggable real-LLM backend (SiliconFlow / DeepSeek) with env-injected keys that never touch disk. Reproducible, honest, evidence-ready. Ships with a 10-dimension security & stability self-test scoring 5.0/5. Built for agent developers, AI product managers and memory-solution selection. "Is your AI memory real? Test it."
tags: [AI, 评测, 长期记忆, LLM, benchmark, 记忆评测, 评测台, agent]
---

# 智能体长期记忆评测台(memory-bench)

> **One-command long-term memory benchmark for AI agents & LLMs.** Local, zero-config, standard EM/F1 scoring, pluggable real-LLM backend, honest & reproducible.

AI 说"我记得",你敢信吗?**测一下就知道**。这是为「智能体 / 大模型的长期记忆能力」设计的本地评测台:12 类题型覆盖记忆的常见坑,标准 EM/F1 评分,一条命令出结果,可复现、可对比、可当发布证据。

## 何时用 · When to use

- **Agent 开发**:上线前给记忆模块打分,量化"记得住多少、会不会串、能不能跨会话整合"。
- **方案选型**:对比不同记忆方案(RAG / 记忆库 / 长上下文)在同一批题目上的表现。
- **模型严评**:接真实 LLM(SiliconFlow / DeepSeek 等)跑一轮,看大模型自己的记忆表现。
- **发布自检**:把评测结果作为"能力证据"附进发布材料(诚实标注口径)。

## 依赖与运行环境 · Requirements

- **零第三方依赖**:仅用 Python 标准库(`re` / `json` / `urllib` / `os` / `time`),无需 `pip install`。
- **Python 3.8+** 即可运行;Windows / macOS / Linux 跨平台。
- 真模型严评需自备 API 密钥(env 注入),不依赖任何厂商 SDK。

## 快速上手 · Quick start(零配置,3 步)

```bash
# 1. 跑内部确定性评测(不联网、可复现、默认后端)
python tools/memory_bench.py

# 2. 看安全稳定性实测(10 维,本地闭环)
python tools/security_test.py

# 3.(可选)接真实 LLM 严评——密钥只走环境变量,不打印、不落盘
MODEL_BACKEND=api REAL_API_KEY=你的密钥 REAL_API_BASE=https://api.siliconflow.cn/v1 REAL_MODEL=deepseek-ai/DeepSeek-V3 \
  python tools/memory_bench.py
```

## 架构与流程 · Architecture & Flow

评测台采用「输入 → 后端 → 评分 → 报告」四段式管道,数据流向清晰、可解释、可复现:

```
                         ┌──────────────────────────────┐
                         │       memory-bench 评测台     │
                         └──────────────────────────────┘
                                       │
        ┌──────────────────────────────┼──────────────────────────────┐
        ▼                              ▼                              ▼
 ┌──────────────┐              ┌──────────────┐               ┌──────────────┐
 │  题目输入     │              │   评分引擎     │               │   输出报告     │
 │ transcript   │─────────────▶│  EM / F1     │──────────────▶│ 通过率/宏均    │
 │ history      │              │  归一化比对    │               │ 诚实口径标注   │
 │ questions    │              └──────┬───────┘               └──────────────┘
 └──────────────┘                     │
                                      ▼
                            ┌─────────────────────┐
                            │   后端 Backend       │
                            ├─────────────────────┤
                            │ internal(默认)     │  确定性解析·本地·可复现
                            │ api(可选)          │  真 LLM·env 密钥·零落盘
                            └─────────────────────┘

 可选增强:自定义数据集(--dataset) / 官方基准(--official)
   raw JSON ──▶ official_adapter.py ──▶ dataset.json ──▶ 评分引擎
```

- **输入层**:`transcript`(多会话正文)+ `history`(跨会话历史)+ `questions`(含 id/type/q/gold)。
- **后端层**:`internal` 确定性解析(默认、可复现)或 `api` 接真模型(密钥仅 env)。
- **评分层**:标准 EM/F1 归一化比对,统一口径,可横向对比。
- **报告层**:通过率 / Macro-EM / Macro-F1 + 诚实标注(数据集性质、评分标准)。

## 12 道评测题 · 12 questions(覆盖 10+ 记忆能力维度)

内置「星轨智能手表发布会」多会话记忆场景(4 个会话 + 上月历史),每类题型测一类记忆能力:

| 题型 | 考查点 | 示例问题 |
|---|---|---|
| 时序 | 记住时间点 | 发布会定在周几的几点? |
| 实体 | 人物/属性绑定 | 设计负责人是谁,偏好什么配色? |
| 事件 | 事实因果 | 周四的评审会为什么取消? |
| 否定 | 记得"没做"的事 | 林涛最终明确没做哪件事? |
| 数值 | 数字变化追踪 | 媒体邀请从几家扩到几家? |
| 数值推理 | 多值运算 | 初始 50 万追加 20 万海外,最终锁多少? |
| 时序推理 | 日历推算 | 设计稿周三交付、审核 2 天,能否赶周五定稿? |
| 实体更新 | 追踪人事变动 | 演讲稿负责人从谁换成谁? |
| 指代 | 代词消解 | "他"在"他说太技术化"里指谁? |
| 反事实 | 假设撤销 | 若海外投放没追加 20 万,最终预算多少? |
| 跨会话整合 ×2 | 新旧信息融合 | 配色相对上月复盘做了什么调整? |

## 评分标准 · Scoring(标准 EM/F1,可比对)

- **EM(精确匹配)**:答案归一化后与标准答案完全一致 = 1,否则 0。
- **F1(字符级)**:预测与标准答案的字符重叠度(精确率 × 召回率调和平均),0~1。
- 判定:`EM=1 或 F1 ≥ 0.6` 记 PASS;汇总输出 `通过率 / Macro-EM / Macro-F1`。

## 完整用法与输出示例 · Usage & output

```bash
$ python tools/memory_bench.py
================================================================
长期记忆评测台 v2 · EM/F1 · backend=internal
================================================================
[PASS] Q1 <时序> EM=1 F1=1.00 (0.0ms)
[PASS] Q2 <实体> EM=1 F1=1.00 (0.0ms)
[PASS] Q3 <事件> EM=1 F1=1.00 (0.0ms)
[PASS] Q4 <否定> EM=1 F1=1.00 (0.0ms)
...
[PASS] Q12 <反事实> EM=1 F1=1.00 (0.1ms)
----------------------------------------------------------------
通过: 12/12 (100%) | Macro-EM=1.00 | Macro-F1=1.00
诚实标注: 非官方数据集(方法论复现);评分用标准 EM/F1;真模型接口预留未启用
================================================================
```

## 真模型接口(MODEL_BACKEND=api)

- 默认 `internal`:确定性解析后端(复现 Agent 抽取路径),不联网、完全可复现,作为对照基线。
- 设 `MODEL_BACKEND=api`:调用真实 LLM(OpenAI 兼容协议,SiliconFlow / DeepSeek 均可)。
- **密钥安全**:`REAL_API_KEY` 只从环境变量读取,代码不打印、不落盘;未配置密钥时优雅降级返回"未答出",不发起网络请求。
- **密钥别名**:除 `REAL_API_KEY` 外,也认 `SILICONFLOW_API_KEY` / `DEEPSEEK_API_KEY`(按你用的平台二选一即可),行为一致。

## 错误码速查 · Error codes(仅 api 后端 / 自定义数据集可能触发)

真模型调用或数据集加载出问题时,不再只给"调用失败"这种笼统提示,而是**结构化错误码 + 原因 + 排查动作**,便于快速定位:

| 错误码 | 含义 | 排查动作 |
|---|---|---|
| `ERR_NO_KEY` | 未配置模型密钥 | 设 `REAL_API_KEY` / `SILICONFLOW_API_KEY` / `DEEPSEEK_API_KEY`(仅内存) |
| `ERR_NETWORK` | 网络不可达 | 检查网络/代理;确认 API base 域名可达 |
| `ERR_TIMEOUT` | 请求超时(30s) | 模型响应慢:调大 timeout 或换更快模型;检查网络 |
| `ERR_RATE_LIMIT` | API 限流(HTTP 429) | 降低并发或稍后重试;检查密钥额度是否耗尽 |
| `ERR_AUTH` | 鉴权失败(401/403) | 确认密钥有效且未过期;核对 API base |
| `ERR_API_xxx` | API 返回非 200 | 查状态码含义;确认 `REAL_MODEL` 模型名有效 |
| `ERR_PARSE` | 响应解析失败 | 确认 base 指向 `/chat/completions` |
| `ERR_EMPTY` | 模型返回为空 | 调大 `max_tokens`;检查模型可用 |
| `ERR_DATASET` | 自定义数据集异常 | 确认 `--dataset` 路径/JSON 结构与 `tools/sample_dataset.json` 一致 |
| `ERR_UNKNOWN` | 未知错误 | 收集信息反馈维护者 |

> 内置 `internal` 后端不联网,永不触发上述网络类错误码。

## 自定义数据集 · Custom datasets(无需改代码,--dataset 开关)

想测自己的记忆场景?**不用碰源代码**,写一份 JSON 用 `--dataset` 指过去即可:

```bash
# 用自己的题库跑(格式见 tools/sample_dataset.json)
python tools/memory_bench.py --dataset tools/sample_dataset.json
```

JSON 结构(三字段,questions 为数组):

```json
{
  "transcript": "[会话1] 说话人:内容 ...",
  "history":   "[历史] 说话人:内容 ...",
  "questions": [
    {"id": "C1", "type": "实体", "q": "你的问题?", "gold": "标准答案"}
  ]
}
```

- `transcript` / `history`:多会话用 `[会话N·周X] 说话人:内容` 分段;`history` 测跨会话整合。
- `questions`:每条含 `id` / `type` / `q` / `gold`(缺省自动补 `Q1`、类型 `自定义`)。
- **选型提示**:内置 `internal` 基线解析器只精确匹配内置场景;跑自定义数据建议设 `MODEL_BACKEND=api` 接真模型,否则多为 FAIL(属预期)。样本 `tools/sample_dataset.json` 即为格式模板。

## 官方基准适配器 · Official adapters(--official,可选增强)

想用**权威长期记忆基准**跑同一套 EM/F1 评分、回应"非官方、只能作参考"的质疑?v2.4 起支持加载官方基准:

```bash
# 方式 A:直接加载(建议接真实 LLM 覆盖长上下文)
MODEL_BACKEND=api REAL_API_KEY=你的密钥 \
  python tools/memory_bench.py --official longmemeval --data /path/to/questions.json

# 方式 B:先离线转换再跑(可 inspect 中间结果)
python tools/official_adapter.py --preset longmemeval --input questions.json --output dataset.json
python tools/memory_bench.py --dataset dataset.json
```

- 支持预设:`longmemeval` / `locomo` / `generic`(字段映射见 `tools/official_formats.md`)。
- **数据按许可证自备**:本台**不捆绑、不分发**任何第三方数据集;基准文件请从其官方仓库按许可证获取。
- **诚实边界**:官方长上下文基准建议 `MODEL_BACKEND=api` 接真模型;`internal` 基线对长上下文覆盖有限、分数偏低属预期。评测结果仍为本台 EM/F1 标准化输出,权威认证请以官方仓库为准。
- 内置 12 题(方法论复现、零配置、可复现)与官方基准(可选、按许可证自备、接真模型)**并列不冲突**。

## 安全稳定性实测 · Security & stability(10 维,本地闭环)

随包自带 `security_test.py`,对评测台本身做 10 维安全稳定性实测(零真实凭据、可重跑),结果写入 `security_results.json`:

| 维度 | 实测 | 行业基线(参考) | 企业级(参考) |
|---|---|---|---|
| 评测可复现性 | 5.0 | 4.0 | 5.0 |
| 密钥零落盘 | 5.0 | 3.0 | 4.5 |
| 评分标准性 | 5.0 | 3.5 | 4.5 |
| 题型覆盖完整性 | 5.0 | 4.0 | 4.5 |
| 边界容错 | 5.0 | 3.5 | 4.0 |
| 数值推理 | 5.0 | 3.5 | 4.5 |
| 时序推理 | 5.0 | 3.5 | 4.5 |
| 否定与指代理解 | 5.0 | 3.5 | 4.5 |
| 跨会话整合 | 5.0 | 3.5 | 4.5 |
| 长上下文稳定性 | 5.0 | 4.0 | 4.5 |
| **综合** | **5.00 / 5** | — | — |

> 诚实声明:以上为本地闭环自测,非第三方权威机构认证;基线为行业常见水平估计,仅用于对比展示。

## 能力边界(诚实)

- **非官方数据集**:内置 12 题为方法论复现(自建场景),用于零配置、可复现的能力画像,不宣称与官方基准等值。
- **官方基准为可选增强**:`--official` 可加载 LongMemEval / LoCoMo 等权威基准,但数据须用户按许可证自行获取,本台仅做格式转换与 EM/F1 标准评分,不捆绑、不分发第三方数据;权威认证请以官方仓库为准。
- **internal 后端是解析器**:对内置场景精确匹配(可复现、可解释);对未覆盖的新题型需自行扩展 `internal_answer` 或改走真模型。
- **真模型严评会消耗 API 额度**:单轮 12 题,用量极小;密钥自备。
- 禁用绝对词:对外表述用"我们主张 / 提出",不宣称"最 / 全球首创 / 第一"。

## FAQ · 常见问题

**Q1:跑内部评测需要联网吗?**
不需要。`internal` 后端完全本地,不联网、不收集数据、不上传任何内容。

**Q2:真模型密钥安全吗?**
安全。`REAL_API_KEY` 只从环境变量读取,代码无任何打印/写盘;未配置时优雅降级,不发起网络请求。

**Q3:能测我自己的记忆场景吗?**
能,且不用改代码。写一份含 `transcript` / `history` / `questions` 的 JSON,用 `python tools/memory_bench.py --dataset 你的.json` 跑即可(格式见 `tools/sample_dataset.json`)。自定义数据建议配合 `MODEL_BACKEND=api` 接真模型。

**Q4:评测结果能用于发布材料吗?**
能,但请保留诚实口径:标注"非官方数据集(方法论复现)+ 标准 EM/F1"。

**Q5:internal 和 api 后端结果为什么不一样?**
internal 是确定性解析(对内置场景精确),api 是真实 LLM 自由生成(可能长句、可能过度弃权)。两者对比恰好能暴露"解析器假象 vs 模型真实表现"。

**Q6:12 题太少,怎么扩?**
`QUESTIONS` 是四元组列表,直接追加;多会话文本按 `[会话N]` 分段即可。

## 功能状态 · Status(已实现 / 路线图)

**已实现**:12 题型评测、EM/F1 标准评分、internal 确定性后端、真模型接口(env 注入密钥)、结构化错误码体系、自定义数据集(`--dataset` 开关,无需改代码)、**官方基准适配器**(`--official` longmemeval/locomo/generic,数据按许可证自备、工具仅做格式转换与评分)、安全稳定性 10 维实测、雷达图生成。

**路线图中(未实现,不夸大)**:多语言题库、Web UI 可视化。

## 文件导航 · File map

```
SKILL.md                # 本说明
README.md               # 技能介绍(SkillPie 自动同步为技能说明页)
panorama.png            # 技能全景图(PNG,1280×860)
CHANGELOG.md            # 版本变更索引(完整逐条变更)
LICENSE.md              # MIT 许可
ATTESTATION.md          # 权属证明(著作权/知识版权/免责/时间戳/指纹)
manifest.json           # 逐文件哈希 + 包指纹
安全审计报告.md          # 安全审计(结论 P2)
tools/memory_bench.py   # 核心评测台(12 题型 + EM/F1 + 真模型接口 + 错误码 + --dataset + --official 适配器)
tools/sample_dataset.json # 自定义数据集格式模板(--dataset 可直接套用)
tools/official_adapter.py # 官方基准离线转换器(→ dataset JSON;不下载/不捆绑数据)
tools/official_formats.md # 官方基准格式说明(longmemeval/locomo/generic 获取与字段映射)
tools/sample_official_longmemeval.json # 官方基准输入格式样例(合成,仅演示字段)
tools/security_test.py  # 安全稳定性实测(10 维 → security_results.json)
tools/gen_security_radar.py  # 雷达图生成(SVG,支持 --out 指定输出路径)
tools/security_results.json  # 实测结果(10 维 5.0)
```

## 版本变更索引 · Changelog

> 完整变更逐条见发布包内 `CHANGELOG.md`;此处仅列版本摘要,便于快速核对演进与回溯。

| 版本 | 日期 | 类型 | 关键变更 |
|---|---|---|---|
| **1.0.6** | 2026-08-26 | 体验增强 | 新增技能全景图 `panorama.png`;新增技能介绍 `README.md`(SkillPie 自动同步为说明页) |
| 1.0.5 | 2026-08-26 | 规范增强 | 章节中英双语化;新增架构与流程图(ASCII);新增版本变更索引(Changelog);TRAC-E 规范维度(C)补齐至 4.8 |
| 1.0.4 | 2026-08-26 | 功能 | 新增官方基准适配器(`--official` longmemeval/locomo/generic,数据按许可证自备);文档补 description_en / title / 错误码节 |
| 1.0.3 | 2026-08-26 | 功能 | 新增结构化错误码体系(9 类 + 排查动作);新增 `--dataset` 自定义数据集开关与样本 |
| 1.0.2 | 2026-08-26 | 合规 | 增加 SkillPie 发布目标审计;统一发布 12 项清单与权属证明五件套 |
| 1.0.1 | 2026-08-26 | 提分 | 正路提分复查:补零依赖说明、密钥别名、安全稳定性 10 维实测与雷达图 |
| 1.0.0 | 2026-08-26 | 首发 | 12 题型评测、EM/F1 标准评分、internal 确定性后端、真模型接口(env 注入密钥) |

## 版权与许可 · License

© 2026 注册老炮. 保留所有权利。

本作品(含软件代码与文档)的著作权归 注册老炮 所有,以 MIT License 授权使用(见 `LICENSE.md`)。

**知识版权声明**:本作品所汇集的方法论、题型设计、对比分析与合成内容("知识内容"),其编排与原创表达归 注册老炮 所有。未经书面许可,不得复制、转载、摘编、转售,或用于训练任何模型 / 商业系统。(软件代码依随附 LICENSE 的许可条款使用;本声明不限制 LICENSE 已授予的权利。)

**免责声明**:本作品按「现状」提供,不提供任何明示或暗示的担保,包括但不限于适销性、特定用途适用性及非侵权担保。使用风险由使用者自行承担,因使用本作品所致任何直接或间接损失,作者不承担责任。

使用说明

# 智能体长期记忆评测台(memory-bench)

**一句话**:一条命令,给你的 AI Agent / 大模型做一次「长期记忆能力」体检,12 题覆盖 10+ 记忆维度,输出标准 EM/F1 分数。

---

## 这是做什么的?

AI 说"我记得",你敢信吗?**测一下才知道**。

`memory-bench` 是一个**本地、零依赖、可复现**的长期记忆评测台。它用一套固定题集,把 AI 在「时序、实体、否定、反事实、跨会话整合」等关键记忆能力上的表现量化为 EM/F1 分数,帮你判断这个 AI 的"记性"到底靠不靠谱。

---

## 核心能力

| 能力 | 说明 |
|---|---|
| 12 类题型 | 时序 / 实体 / 事件 / 否定 / 数值 / 数值推理 / 时序推理 / 实体更新 / 指代 / 反事实 / 跨会话整合 ×2 |
| 标准评分 | 统一使用 EM(精确匹配)+ F1(字符重叠),结果可横向对比 |
| 双后端 | `internal` 确定性解析(默认、可复现);`api` 接真实 LLM(SiliconFlow / DeepSeek 等) |
| 密钥零落盘 | 真模型评测仅走环境变量注入,不打印、不写文件、不进提交包 |
| 自定义数据集 | `--dataset` 开关加载自己的 JSON 题集,不改代码 |
| 官方基准适配 | `--official` 支持 LongMemEval / LoCoMo(数据按许可证自备,工具只做格式转换与标准评分) |
| 安全稳定性自测 | 自带 10 维安全稳定性实测,本地闭环全 5.0/5 |

---

## 什么时候用

- **Agent 开发**:给记忆模块上线前打分,量化"记得住多少、会不会串、能不能跨会话整合"。
- **方案选型**:对比不同记忆方案(RAG / 记忆库 / 长上下文)在同一批题上的表现。
- **模型严评**:接真实 LLM 跑一次,看看模型自己的记忆短板在哪。
- **发布证据**:把评测结果作为能力证据附进发布材料(诚实标注口径)。

---

## 3 步上手

```bash
# 1. 跑内置评测(不联网、可复现)
python tools/memory_bench.py

# 2. 看安全稳定性实测
python tools/security_test.py

# 3.(可选)接真实 LLM 严评
MODEL_BACKEND=api REAL_API_KEY=你的密钥 REAL_API_BASE=https://api.siliconflow.cn/v1 \
  REAL_MODEL=deepseek-ai/DeepSeek-V3 python tools/memory_bench.py
```

---

## 技能全景

![技能全景图](panorama.png)

评测台采用「**输入 → 后端 → 评分 → 报告**」四段式管道:

1. **输入层**:`transcript`(多会话正文)+ `history`(跨会话历史)+ `questions`(含 gold 标准)。
2. **后端层**:`internal` 确定性解析(默认、可复现)或 `api` 接真模型(密钥仅 env)。
3. **评分层**:标准 EM/F1 归一化比对,统一口径,可横向对比。
4. **报告层**:通过率 / Macro-EM / Macro-F1 + 诚实标注。

可选增强旁路:`--dataset` / `--official` → `official_adapter.py` → `dataset.json` → 汇入评分引擎。

---

## 诚实口径

- 内置 12 题是**合成对话场景**,用于快速自检;不等于官方盲测难度。
- 100% 通过只代表在当前短上下文题集上表现完美,不代表超长跨会话真实负载无短板。
- 接真实 LLM 时分数有不可约方差,建议多次跑取平均、用同一套题横向对比。

---

## 文件导航

| 文件 | 作用 |
|---|---|
| `SKILL.md` | 主说明(含 frontmatter 元数据) |
| `README.md` | 本技能介绍 |
| `panorama.png` | 技能全景图 |
| `CHANGELOG.md` | 版本变更记录 |
| `LICENSE.md` | MIT 许可 |
| `tools/memory_bench.py` | 评测主程序 |
| `tools/security_test.py` | 安全稳定性自测 |
| `tools/official_adapter.py` | 官方基准格式转换器 |
| `tools/sample_dataset.json` | 自定义数据集模板 |
| `ATTESTATION.md` / `manifest.json` | 权属证明与文件指纹 |
| `安全审计报告.md` | 云鼎安全审计结果 |

---

## 版权与许可

© 2026 注册老炮 · MIT License · 本地闭环 · 零真实凭据

如何安装此技能?

访问技能市场,点击「安装」按钮,按提示将技能包放入 AI 编程助手的 skills 目录即可。

浏览技能市场

支持平台:Qoder · QoderWork · Claude · Codex 等 AI 编程助手

智能体长期记忆评测台 - 免费 | 技能派