跳到主要内容

内容阅读

工具链阿新聊ai

91ai 评测可复现性状态

本文迁移自 mindcarver/91ai · 原始位置 docs/evaluation/reproducibility status.md · 由 @阿新聊ai 整理。 91ai 评测可复现性状态 本页说明 91ai 自建评测在 当前仓库 中的可复现程度。它衡量的是公开产物是否足以让第三方复跑,不评价作者是否实际运...

本文迁移自 mindcarver/91ai · 原始位置 docs/evaluation/reproducibility-status.md · 由 @阿新聊ai 整理。

91ai 评测可复现性状态

本页说明 91ai 自建评测在当前仓库中的可复现程度。它衡量的是公开产物是否足以让第三方复跑,不评价作者是否实际运行过测试,也不替代报告中的 L1–L5 证据分级。

截至 2026-07-10,两套已发布评测均为 R1:narrative-only / artifacts-not-published。报告可以作为作者运行记录和选型线索阅读,但当前仓库没有足够产物让第三方独立复现其中分数或排名。

等级定义

等级 名称 验收标准
R1 Narrative only 已公开方法、环境、结果或限制的文字记录,但关键运行产物未发布;不能仅从仓库复跑结果。
R2 Artifacts published 已公开可执行 harness、输入/样本清单、配置模板、版本清单和原始结果;第三方可以审计分数来源,但尚未完成独立环境复跑。
R3 Independently rerun 第三方在干净环境按公开命令完成代表性复跑,关键结果落在预先声明的容差内;复跑环境、提交版本、日志和差异均已记录。
R4 Continuously verified R3 基础上建立定期或变更触发的自动复跑、结果留档和漂移告警;失败不会静默覆盖历史基线。

R 等级只描述仓库产物成熟度。例如,作者自己安装并运行得到的 L1 证据,在 harness 和原始结果未公开时,仍可能处于 R1。

当前状态总览

评测 当前等级 当前可用内容 当前不能验证的内容
四大开源知识库平台 RAG 横评 R1 环境、数据集、指标、结果表、工程观察、局限 运行脚本、数据快照、平台/依赖完整版本清单、原始逐题结果和分数重算
AI 记忆系统评测 R1 方法论、环境记录、冒烟和缩减子集结果、项目详解、已知局限 harness、适配器、输入子集、原始 context/answer/judge/score、证据台账和分数重算

四大开源知识库平台 RAG 横评

已公开

  • 作者运行环境、共享模型、四类数据集和指标定义的文字说明。
  • 四个平台的结果表、部署摩擦、解析行为和工程故障记录。
  • FastGPT 使用 top-1、其他平台使用 top-5,以及样本量和代理数据集等限制说明。

当前缺失

  • 报告所述 kb-benchmark/ 运行目录及其中脚本;该目录不在当前仓库。
  • 数据构建产物、题目与 golden 文档快照,以及许可允许范围内的获取/校验说明。
  • 四个平台、镜像、依赖、配置和评测代码的完整版本锁定清单。
  • 逐题检索、生成、裁判结果及汇总分数的可重算原始文件。
  • 第三方在干净环境中的复跑记录。

已知协议偏差

  • qwen2.5:14b 同时参与答案生成和裁判;同族裁判偏差可能影响绝对分数,也可能影响相对排名,当前不能证明排名不受影响。
  • FastGPT 结果来自 top-1,其他三家来自 top-5,不是严格 apples-to-apples。
  • 扫描件判断来自本次记录的版本、配置和 DocVQA 样本;不能外推为所有版本、解析插件或企业扫描文档的永久能力结论。
  • 每个数据集仅使用 40–50 题,且 CUAD / DocVQA 是企业文档的代理数据集。

升级验收

升到 R2:

  • 发布可执行的数据构建、灌库、检索、生成和评分脚本。
  • 发布完整版本/镜像清单、脱敏配置模板和运行命令。
  • 发布可合法分发的输入清单、校验值、逐题原始结果和汇总脚本。
  • 为 top-1 / top-5 差异提供统一口径重跑,或将两类结果彻底分表,不再生成统一排名。
  • 明确裁判 prompt、模型参数、失败重试和人工校准结果。

升到 R3:

  • 由未参与原运行的人在干净环境完成代表性复跑。
  • 记录仓库提交、平台/镜像版本、硬件、命令、日志和结果校验值。
  • 预先声明允许容差,并逐项解释超出容差的结果。

AI 记忆系统评测

已公开

  • 13 个候选的分类、方法论、作者环境和项目级分析。
  • 3 会话 / 12 查询冒烟结果和 3–4 题 LongMemEval 缩减子集结果表。
  • embedding、reader、judge、回答协议和吞吐限制等 caveat 的文字记录。
  • 负分排查案例和部分工具未取得 hands-on 结果的说明。

当前缺失

  • 报告规划的 runs/2026-07-03-memory-systems-eval/ 目录;该目录不在当前仓库。
  • driver、finish、judge、各工具适配器及其依赖锁定文件。
  • 冒烟输入、LongMemEval 实际子集、原始召回上下文、答案、裁判输出和分数。
  • 完整工具版本、配置、随机性控制和证据台账。
  • 第三方在干净环境中的复跑记录。

已知协议偏差

  • 部分运行使用本地 qwen2.5:14b,部分抽取、reader 或 judge 使用 gpt-5.4;不能概括为所有结果都来自同一后端。
  • Supermemory、Memvid、Basic Memory 使用各自 embedding,未统一为 qwen3-embedding:4b
  • Letta 由 agent 直接作答,其他多数工具采用“检索 → 固定 reader”协议;Letta 的 12/12 不能与其他冒烟分数严格横比。
  • LongMemEval 是每工具 3–4 题、约 9K token 的缩减子集,不是完整 500 题基准。
  • “Supermemory 最高”只表示它在参加该缩减子集的 4 个工具中以 2/4 得到本次最高分,不代表它在 13 个项目或完整 LongMemEval 上排名第一。

升级验收

升到 R2:

  • 发布 harness、全部实际使用的适配器、依赖锁定和脱敏配置模板。
  • 发布冒烟输入、LongMemEval 子集生成规则及实际样本标识/校验值。
  • 发布每个工具的 context、answer、judge、score 原始结果和可重算汇总脚本。
  • 为每一行结果记录工具版本、LLM、embedding、reader、judge 和回答协议。
  • 将不可比较协议分组展示;同一排名只包含满足同协议的参与者。

升到 R3:

  • 由未参与原运行的人在干净环境复跑冒烟和至少一个缩减子集。
  • 记录提交、依赖、后端、命令、日志、失败重试和结果校验值。
  • 预先声明非确定性容差,并同时报告一致项、漂移项和无法复跑项。

阅读原则

  • 具体分数视为特定时间、版本、配置、样本和协议下的快照,不作为产品永久属性。
  • R1 报告适合形成 POC 假设,不足以单独支持采购、生产采用或“谁最好”的结论。
  • 如果某项结论影响真实选型,应先用自己的数据和统一协议复跑;待产物升级到 R2/R3 后,再引用可审计结果。

评论

0
登录后可以参与评论和讨论。
💬

还没有评论

欢迎留下第一条评论,帮助这篇内容更快形成讨论。