AI / 大模型 / Agent 评测专题
TL;DR: AI 评测不能只看模型榜单。真正有用的评测要同时回答五个问题:模型会不会、系统稳不稳、工具调得准不准、结果能不能被证据支撑、上线后是否安全可控。这个专题把 AI、大模型、RAG、Agent、AI Coding 和安全红队评测…
专栏
本专题围绕「真正有用的 AI 评测」展开:不只看模型会不会,还要回答系统稳不稳、工具调得准不准、结果能不能被证据支撑、上线后是否安全可控。涵盖评测地图与方法论、可复现性状态、四大开源知识库平台 RAG 实测(MaxKB / RAGFlow / FastGPT / Dify)、AI 记忆系统开源项目深度评测,以及 Dify / FastGPT 的技术架构与实现原理拆解。每篇都标注 L1–L5 证据分级与可复现性等级,帮助读者判断该测什么、用什么框架、怎么把评测做成持续回归。
TL;DR: AI 评测不能只看模型榜单。真正有用的评测要同时回答五个问题:模型会不会、系统稳不稳、工具调得准不准、结果能不能被证据支撑、上线后是否安全可控。这个专题把 AI、大模型、RAG、Agent、AI Coding 和安全红队评测…
本页说明 91ai 自建评测在 当前仓库 中的可复现程度。它衡量的是公开产物是否足以让第三方复跑,不评价作者是否实际运行过测试,也不替代报告中的 L1–L5 证据分级。
TL;DR: 本文记录了作者报告的一手 RAG 平台实测。作者在同一台机器、同一个本地 Ollama(qwen2.5:14b + qwen3 embedding:4b)下,对四个开源知识库平台(MaxKB、RAGFlow、FastGPT、…
Dify 是四家里 功能最全、生态最大、也是 API 自动化最曲折 的一个。它的定位是"LLM 应用开发平台"——不只是知识库,还包括 Agent、工作流、模型管理、评测。本文拆解它的技术栈、插件市场架构、新一代 RAG pipeline…
FastGPT 是四家里 前端体验最好、模型层最复杂 的一个。它的定位是"对话式知识问答 + 工作流编排",中文生态成熟、检索质量高。但它的模型系统是三层叠加(aiproxy + mongo 注册表 + plugin daemon),PD…
MaxKB 是本次四平台横评里 部署最轻、API 自动化最顺 的一个。它定位是"开箱即用的企业内部知识库",单容器跑满所有依赖。本文拆解它的技术栈、架构、数据流和模型集成方式——所有结论均来自对其运行实例(容器进程、PostgreSQL…
RAGFlow 是四家里 架构最重、解析能力最强、也是踩坑最多 的一个。它的招牌是 DeepDoc (自研文档解析:OCR + 版式 + 表格),这让它在扫描/图像文档上独一档;但代价是镜像最大( 16GB)、容器最多、v0.26 还有模…
Mem0 是目前生态最大、采用最广的"可插拔 AI 记忆层"。它的核心定位是:在用户的聊天 LLM 和"长期记忆"之间,插一个独立的、用 LLM 做事实抽取的记忆服务。你把对话喂给它(add(messages)),它把对话蒸馏成原子事实存…
Graphiti 是 Zep 团队开源的"实时、bi temporal(双时序)知识图谱"引擎,专门给 AI agent 做记忆。和 Mem0 / LangMem 的事实抽取不同,Graphiti 不是把对话压成扁平的事实列表,而是把对话…
Cognee 是一个 pipeline 式的 GraphRAG 记忆引擎。它的定位是:把数据(支持 30+ 种格式:文本 / PDF / 图片 OCR / 代码 AST / 视频转写等)摄入成 dataset,然后用 cognify()…