本文迁移自 mindcarver/91ai · 原始位置
docs/evaluation/reproducibility-status.md· 由 @阿新聊ai 整理。
91ai 评测可复现性状态
本页说明 91ai 自建评测在当前仓库中的可复现程度。它衡量的是公开产物是否足以让第三方复跑,不评价作者是否实际运行过测试,也不替代报告中的 L1–L5 证据分级。
截至 2026-07-10,两套已发布评测均为 R1:narrative-only / artifacts-not-published。报告可以作为作者运行记录和选型线索阅读,但当前仓库没有足够产物让第三方独立复现其中分数或排名。
等级定义
| 等级 | 名称 | 验收标准 |
|---|---|---|
| R1 | Narrative only | 已公开方法、环境、结果或限制的文字记录,但关键运行产物未发布;不能仅从仓库复跑结果。 |
| R2 | Artifacts published | 已公开可执行 harness、输入/样本清单、配置模板、版本清单和原始结果;第三方可以审计分数来源,但尚未完成独立环境复跑。 |
| R3 | Independently rerun | 第三方在干净环境按公开命令完成代表性复跑,关键结果落在预先声明的容差内;复跑环境、提交版本、日志和差异均已记录。 |
| R4 | Continuously verified | R3 基础上建立定期或变更触发的自动复跑、结果留档和漂移告警;失败不会静默覆盖历史基线。 |
R 等级只描述仓库产物成熟度。例如,作者自己安装并运行得到的 L1 证据,在 harness 和原始结果未公开时,仍可能处于 R1。
当前状态总览
| 评测 | 当前等级 | 当前可用内容 | 当前不能验证的内容 |
|---|---|---|---|
| 四大开源知识库平台 RAG 横评 | R1 | 环境、数据集、指标、结果表、工程观察、局限 | 运行脚本、数据快照、平台/依赖完整版本清单、原始逐题结果和分数重算 |
| AI 记忆系统评测 | R1 | 方法论、环境记录、冒烟和缩减子集结果、项目详解、已知局限 | harness、适配器、输入子集、原始 context/answer/judge/score、证据台账和分数重算 |
四大开源知识库平台 RAG 横评
已公开
- 作者运行环境、共享模型、四类数据集和指标定义的文字说明。
- 四个平台的结果表、部署摩擦、解析行为和工程故障记录。
- FastGPT 使用 top-1、其他平台使用 top-5,以及样本量和代理数据集等限制说明。
当前缺失
- 报告所述
kb-benchmark/运行目录及其中脚本;该目录不在当前仓库。 - 数据构建产物、题目与 golden 文档快照,以及许可允许范围内的获取/校验说明。
- 四个平台、镜像、依赖、配置和评测代码的完整版本锁定清单。
- 逐题检索、生成、裁判结果及汇总分数的可重算原始文件。
- 第三方在干净环境中的复跑记录。
已知协议偏差
qwen2.5:14b同时参与答案生成和裁判;同族裁判偏差可能影响绝对分数,也可能影响相对排名,当前不能证明排名不受影响。- FastGPT 结果来自 top-1,其他三家来自 top-5,不是严格 apples-to-apples。
- 扫描件判断来自本次记录的版本、配置和 DocVQA 样本;不能外推为所有版本、解析插件或企业扫描文档的永久能力结论。
- 每个数据集仅使用 40–50 题,且 CUAD / DocVQA 是企业文档的代理数据集。
升级验收
升到 R2:
- 发布可执行的数据构建、灌库、检索、生成和评分脚本。
- 发布完整版本/镜像清单、脱敏配置模板和运行命令。
- 发布可合法分发的输入清单、校验值、逐题原始结果和汇总脚本。
- 为 top-1 / top-5 差异提供统一口径重跑,或将两类结果彻底分表,不再生成统一排名。
- 明确裁判 prompt、模型参数、失败重试和人工校准结果。
升到 R3:
- 由未参与原运行的人在干净环境完成代表性复跑。
- 记录仓库提交、平台/镜像版本、硬件、命令、日志和结果校验值。
- 预先声明允许容差,并逐项解释超出容差的结果。
AI 记忆系统评测
已公开
- 13 个候选的分类、方法论、作者环境和项目级分析。
- 3 会话 / 12 查询冒烟结果和 3–4 题 LongMemEval 缩减子集结果表。
- embedding、reader、judge、回答协议和吞吐限制等 caveat 的文字记录。
- 负分排查案例和部分工具未取得 hands-on 结果的说明。
当前缺失
- 报告规划的
runs/2026-07-03-memory-systems-eval/目录;该目录不在当前仓库。 - driver、finish、judge、各工具适配器及其依赖锁定文件。
- 冒烟输入、LongMemEval 实际子集、原始召回上下文、答案、裁判输出和分数。
- 完整工具版本、配置、随机性控制和证据台账。
- 第三方在干净环境中的复跑记录。
已知协议偏差
- 部分运行使用本地
qwen2.5:14b,部分抽取、reader 或 judge 使用gpt-5.4;不能概括为所有结果都来自同一后端。 - Supermemory、Memvid、Basic Memory 使用各自 embedding,未统一为
qwen3-embedding:4b。 - Letta 由 agent 直接作答,其他多数工具采用“检索 → 固定 reader”协议;Letta 的 12/12 不能与其他冒烟分数严格横比。
- LongMemEval 是每工具 3–4 题、约 9K token 的缩减子集,不是完整 500 题基准。
- “Supermemory 最高”只表示它在参加该缩减子集的 4 个工具中以 2/4 得到本次最高分,不代表它在 13 个项目或完整 LongMemEval 上排名第一。
升级验收
升到 R2:
- 发布 harness、全部实际使用的适配器、依赖锁定和脱敏配置模板。
- 发布冒烟输入、LongMemEval 子集生成规则及实际样本标识/校验值。
- 发布每个工具的 context、answer、judge、score 原始结果和可重算汇总脚本。
- 为每一行结果记录工具版本、LLM、embedding、reader、judge 和回答协议。
- 将不可比较协议分组展示;同一排名只包含满足同协议的参与者。
升到 R3:
- 由未参与原运行的人在干净环境复跑冒烟和至少一个缩减子集。
- 记录提交、依赖、后端、命令、日志、失败重试和结果校验值。
- 预先声明非确定性容差,并同时报告一致项、漂移项和无法复跑项。
阅读原则
- 具体分数视为特定时间、版本、配置、样本和协议下的快照,不作为产品永久属性。
- R1 报告适合形成 POC 假设,不足以单独支持采购、生产采用或“谁最好”的结论。
- 如果某项结论影响真实选型,应先用自己的数据和统一协议复跑;待产物升级到 R2/R3 后,再引用可审计结果。
评论
登录后可以参与评论和讨论。
💬
还没有评论
欢迎留下第一条评论,帮助这篇内容更快形成讨论。