先问一句:你的 Agent 真的需要 LangGraph 吗
TL;DR: LangGraph 是面向长时运行、有状态 Agent 的编排引擎,不是 AI 应用的默认起点。选不选它,四个问题就够:任务要不要断点续跑、高风险动作要不要人审、要不要多角色编排、出问题要不要回放追责。四个都答否,几十行手写…
专栏
本专栏收录 mindcarver/91ai 仓库的 LangGraph 生产实战系列,共 20 篇。面向已经能调用 LLM API、写过简单 Agent,准备把系统推上生产的后端与 AI 应用开发者。 阅读顺序:01—05 建立选型、状态、持久化与记忆的基础;06—11 深入人审、子图、并行、多 Agent 和流式交互;12—17 覆盖错误处理、运维、测试、评测、安全和部署;18—20 完成版本迁移、框架比较和人审流水线实战。 原文仓库:https://github.com/mindcarver/91ai/tree/main/docs/agent/langgraph
TL;DR: LangGraph 是面向长时运行、有状态 Agent 的编排引擎,不是 AI 应用的默认起点。选不选它,四个问题就够:任务要不要断点续跑、高风险动作要不要人审、要不要多角色编排、出问题要不要回放追责。四个都答否,几十行手写…
TL;DR: LangGraph 的状态不是共享变量,而是一组「每个 key 带合并规则的通道」。节点永远只返回增量更新,合并方式由 reducer 决定。理解了这一点,superstep 执行、checkpoint 边界、并行合并乱序这…
TL;DR: checkpointer 在每个 superstep 边界给整张图的状态拍快照,按 thread id 归档。它给你四件事:断点续跑、时间旅行、分叉、以及人审(interrupt)的底层支撑。同时它有明确边界:只存图状态,不…
TL;DR: 「越聊越贵」的机制很朴素:checkpointer 让历史消息全部留存,而模型每次都看全量 messages,成本随轮数线性涨、响应随长度变慢。解法不是换更大数据库,是分清三套东西的边界:checkpointer 管短期状态…
TL;DR: LangGraph 有两套写法:StateGraph 画图,functional API 写普通函数。后者用 @entrypoint 标入口、@task 标步骤,靠「重放 + 跳过已完成 task」实现持久化。选型标准不是新…
TL;DR: interrupt() 五分钟能跑通 demo,生产化要跨过六个坑:别用 try/except 包它、恢复值按索引匹配、一个节点每轮只能 interrupt 一次、payload 必须可序列化、前置副作用要幂等、并行分支要按…
TL;DR: 子图(subgraph)有独立的 checkpoint namespace,父图默认看不到它的内部状态,这不是 bug 是设计。真正会出事的是三处透传:同名 key 的写入要走 reducer 合并、人审恢复值要能穿过父子两…
TL;DR: Send 是 LangGraph 的 map reduce 原语:条件边返回一列 Send(节点, 输入),运行时为每项起一个并行任务。用它的三个纪律:reducer 合并顺序不保证,去重排序放到后续节点;并行区里的人审要走…
TL;DR: LangGraph 的多 agent 有两种主流拓扑:supervisor(中心调度,子 agent 当工具用)和 swarm(对等移交,谁接手谁主导)。先说结论:多 agent 不是能力升级,是用延迟和成本换上下文隔离。需…
TL;DR: LangGraph 的 stream mode 有七种,前端打字机效果用的是 messages;「子图 token 推不出来」要开 subgraphs=True;进度条用 custom 模式自己推。前端侧用官方 SDK 的…
TL;DR: v1 之后 LangGraph 的分层是:底层引擎(StateGraph)→ LangChain 1.0 的 create agent(预置 agent 循环 + middleware 扩展)→ deepagents(虚拟文…
TL;DR: 错误处理的常见死法是两个极端:裸奔(一个异常整个图崩)或者一把抓(全部 try/except 吞掉)。正确起手式是先分类。LangGraph 的设计把错误分成四类,每类有不同的处理位置:瞬时错误给 RetryPolicy,模…
TL;DR: checkpointer 上线三个月后的三类典型事故:checkpoint 表膨胀拖垮数据库、子包 patch 升级夹带破坏性变更、state schema 演进后旧快照反序列化失败。这篇按事故复盘的格式把它们拆开,数据来自…
TL;DR: 循环图难调试的根源是模型错配:主流 tracing 工具假设执行是一棵 span 树,LangGraph 的执行是一个会回到同一节点的环,报错堆栈在节点边界断掉。对策分三层:排查用 debug 流和快照历史,日常测试用节点级…
TL;DR: Agent 应用「demo 阶段永远是对的,上线就开始崩」,原因是没人定义过「对」。评测要分三层:最终答案、执行轨迹、工具调用参数。LangGraph 独有的优势是 checkpoint 回放可以当回归工具用:从同一张快照出…
TL;DR: Agent 安全的起点是一个认知转变:模型输出的工具调用是不可信输入,prompt 写得再好也不改变这一点。工程上四道边界:工具按读写权限分级并按用户裁剪、高风险动作过 dry run 和人审、敏感凭证绝不进 state(c…
TL;DR: 先纠正名词:社区说的「LangGraph Platform」在官方语境里已经演进为 Agent Server(运行时)和 LangSmith Deployment(托管产品),选型文章里还在用旧名词的多半内容也旧了。四种部署…
TL;DR: 2025 年 10 月的 LangGraph 1.0 是分水岭:create react agent 废弃、预置类型大清洗、Python 3.9 出局,而中文互联网的主流教程和三个翻译站还停在 0.x。这篇给一条五步迁移路径…
TL;DR: Grid Dynamics 把一个 LangGraph 深度研究 agent 整体迁到了 Temporal,删掉数千行自建的重试和恢复代码。这个案例的答案不是「LangGraph 不行」,而是他们的系统真正需要的是 dura…
TL;DR: 这篇用一个完整项目把 LangGraph 的核心件拧在一起:一条「AI 起草 → 事实核查 → 人工审核 → 发布」的内容流水线,覆盖状态设计、人审、重试、幂等发布、降级出口。代码可以直接跑(把模型和发布函数换成你的实现),…