跳到主要内容

专栏

AI 评测专题

AI 评测不能只看模型榜单——把模型、系统、工具、证据、安全放在一张地图里,做成持续回归。
工具链更新于
11 篇文章0 人订阅 创建

专栏简介

本专题围绕「真正有用的 AI 评测」展开:不只看模型会不会,还要回答系统稳不稳、工具调得准不准、结果能不能被证据支撑、上线后是否安全可控。涵盖评测地图与方法论、可复现性状态、四大开源知识库平台 RAG 实测(MaxKB / RAGFlow / FastGPT / Dify)、AI 记忆系统开源项目深度评测,以及 Dify / FastGPT 的技术架构与实现原理拆解。每篇都标注 L1–L5 证据分级与可复现性等级,帮助读者判断该测什么、用什么框架、怎么把评测做成持续回归。

文章目录

1

AI / 大模型 / Agent 评测专题

TL;DR: AI 评测不能只看模型榜单。真正有用的评测要同时回答五个问题:模型会不会、系统稳不稳、工具调得准不准、结果能不能被证据支撑、上线后是否安全可控。这个专题把 AI、大模型、RAG、Agent、AI Coding 和安全红队评测…

5

Dify 技术架构与实现原理

Dify 是四家里 功能最全、生态最大、也是 API 自动化最曲折 的一个。它的定位是"LLM 应用开发平台"——不只是知识库,还包括 Agent、工作流、模型管理、评测。本文拆解它的技术栈、插件市场架构、新一代 RAG pipeline…

7

MaxKB 技术架构与实现原理

MaxKB 是本次四平台横评里 部署最轻、API 自动化最顺 的一个。它定位是"开箱即用的企业内部知识库",单容器跑满所有依赖。本文拆解它的技术栈、架构、数据流和模型集成方式——所有结论均来自对其运行实例(容器进程、PostgreSQL…

工具链·评测
8

RAGFlow 技术架构与实现原理

RAGFlow 是四家里 架构最重、解析能力最强、也是踩坑最多 的一个。它的招牌是 DeepDoc (自研文档解析:OCR + 版式 + 表格),这让它在扫描/图像文档上独一档;但代价是镜像最大( 16GB)、容器最多、v0.26 还有模…

工具链·评测
9

Mem0:可插拔的事实抽取记忆层深度技术解析

Mem0 是目前生态最大、采用最广的"可插拔 AI 记忆层"。它的核心定位是:在用户的聊天 LLM 和"长期记忆"之间,插一个独立的、用 LLM 做事实抽取的记忆服务。你把对话喂给它(add(messages)),它把对话蒸馏成原子事实存…

工具链·评测