Asaakii
↖ 返回项目集

CASE STUDY 01 / GOVTECH × AGENT ENGINEERING

把县域资料,
变成有据可查
的决策初稿。

县域经济智能分析与协同决策平台
从零构建一个能分析、能协同、能交付的 AI 智能内核。

用确定性工作流组织复杂业务,用受控智能体理解资料,让每个数字、每条政策和每份送审稿都有来处。

四川库信数字科技有限公司2026.03 — 2026.06架构设计 / 智能内核开发
COUNTY INTELLIGENCE ENGINESYS. 510283
01 / INPUT统计数据 + 政策资料把杂乱材料变成可用证据
02 / CONTROLLED INTELLIGENCE工作流骨架 × 智能体Hermes Host + LangGraph Runtime
↗
9 条流程16 个角色6 层门禁
▤
03 / DELIVERY报告 · 行动矩阵 · 送审稿
MD
JSON
DOCX
代码控制边界 · 模型理解与表达ENGINEERING, WITH EVIDENCE.
9条业务链

从数据治理到县域规划

16个专家角色

按工位装配,按权限执行

6层质量门禁

数字、证据与表达边界

50+份试点产物

白皮书记录的隆昌交付

县域经济智能决策支撑平台总体工作流与底座支撑架构图放大查看 ↗
PLATFORM OVERVIEW

平台总体工作流与底座支撑

原页面的总体架构图。下方可继续探索各层职责与业务链。

01 / THE PROBLEM

真正要解决的,
是资料与决策之间的距离。

县域分析不缺材料。难的是把不同年份、不同口径、不同部门的材料,连成可以复核、可以行动的判断。

PROJECT CONTEXT183个县(市、区)

整体平台面向四川全省县域。白皮书记录总投资概算约 2,682 万元;这里展示的是其中的 AI 智能内核设计与隆昌试点。

183 县是建设覆盖范围;本页不据此声称全省已全部上线。
01

底数不清

约 20 项宏观指标的传统监测,难以刻画产业与要素结构;材料描述人工校核需 1–3 个月。

02

研判不准

经验难以支撑产业错位判断。立项材料提到 61.2% 县域主导产业集中于传统赛道。

03

协同不畅

15 项监管事项涉及 12 类数据、18 个省级部门;取数、补数和责任确认分散在不同系统。

04

政策不精

材料记录每年 200 余项政策,约 1/3 有跟踪;事前推演、执行监测与事后评估需要连接。

05

决策滞后

清洗、校核、研究、统稿反复接力,资料成为报告时,经济情况可能已经变化。

06

基层负担重

同一指标多头填报、重复报送、口径冲突,耗费业务人员的时间。

背景数字据项目白皮书中的立项材料描述,未附独立统计出处。查看原文口径 ↗

BUSINESS TRANSFORMATION

监测分析

人工填报 / 静态排名

↓多源归集 → 动态预警 → 态势研判
BUSINESS TRANSFORMATION

错位发展

经验判断 / 模板规划

↓比较优势 → 产业断点 → 一县一策
BUSINESS TRANSFORMATION

政策与项目

事后总结 / 分散落实

↓政策匹配 → 条件核验 → 协同行动
决策辅助的边界

法定统计口径由主管部门确认;正式排名、风险定性与因果结论需要对应程序;规划和政策建议保留专家评审、行政审签。

FROM ZERO TO ONE

我负责把研究流程,
变成可以运行的系统。

从状态建模、业务编排到数据知识底座,再到角色权限、质量审查和试点文件交付。模型调用只是链路中的一个环节。

  1. 01

    原型探索

    用 OpenClaw 验证角色与工具,发现长链路控制和状态管理的不足。

  2. 02

    架构迁移

    拆分 Hermes 宿主与 LangGraph 运行时,统一 MCP 工具协议。

  3. 03

    底座建设

    清洗年鉴与企业数据,解析政策材料,建立知识索引与证据契约。

  4. 04

    闭环交付

    固化 9 链、16 角色与 6 门禁,在隆昌验证从资料到 Word 送审稿。

02 / SYSTEM ARCHITECTURE

一套系统,
五层分工。

点击任意一层,查看它掌握的控制权,以及它向下一层交付什么。

点击分层,或跟随一次任务流转
ARCHITECTURE MAP↓ 任务下行 · 证据回传 ↑
流程与状态

LAYER 03 / 05

下一步走哪里,由图和状态决定。

强类型 State 维护任务进度、活跃证据、资源预算与重试计数。Node 返回增量,Reducer 合并证据;Edge 决定继续、补数、修订或挂起。检查点使长任务可以跨进程恢复。

CONTROL & RESPONSIBILITY确定性路由 · 节点调度 · 快照与恢复
深入这层的实现细节 ↗
确定性代码受控模型节点事实与知识
OUTER / 工作流掌握全局顺序
数据治理→运行监测→产业诊断→瓶颈归因
INNER / 节点内有限探索
组装上下文→模型决策→工具执行→观测与核验↺

最多 6 轮工具探索 · 单次工具 20s 上限 · 证据缺口显式输出

县域经济智能决策支持系统受控工作流总体架构放大查看 ↗
CONTROLLED WORKFLOW

受控工作流总体架构

原有架构图展示任务受理、业务路由、SQL / RAG 证据融合、质量门禁与多格式交付。

不是每个节点,都需要成为 Agent。

按任务的确定性与探索需求,选择最小够用的执行方式。

01 / DETERMINISTIC

纯代码节点

步骤与规则能完全穷举吗?

同比 / 环比、区位商 LQ、资产编目、权限拦截和只读 SQL。算式和规则清楚的部分交给代码。

同比 = (本期值 − 同期值) / 同期值
代码掌握全部控制权
02 / TRANSFORM

单步 LLM

只需完成一次提取或表达吗?

运行摘要、意图分类、预警解释、公文润色。固定输入输出,不引入工具探索循环。

已确认指标 → 结构化态势摘要
代码定流程,模型做一次转换
03 / EXPLORE

闭环 Agent

需要看完结果再决定查什么吗?

产业链断点追查、瓶颈假设交叉核验、复杂规划章节协同。有限工具、预算和步数内自适应探索。

查企业 → 发现缺环 → 补查供应商 → 核验
局部探索权 + Harness 熔断

03 / BUSINESS WORKFLOWS

九条业务链,
把问题变成可交付的产物。

从“哪些数据能用”,到“如何形成规划”。每条链都有明确的输入、工具、门禁与人工复核条件。

WORKFLOW 01data_governance

这个县的数据,哪些能用?

扫描覆盖度,校验一致性与完整性,将缺失字段变成带责任部门的补数任务。最终同时产出治理报告、资产目录和缺口台账;流转部门前人工确认。

01 / 06
校验参数

确认县域、年份和数据范围,先检查必填参数。

本地流程演示 · 不执行实际任务

输入契约

必填 county_code(6位区划码)、period(年份);选填 dataset_scope、metric_scope

参与角色

首席经济专家 (chief_economist)、数据治理专家 (data_steward)、报告主编 (report_editor)

授权工具

query_metricscheck_data_qualitysummary_structuredbuild_data_asset_inventory

交付产物

▤data_governance_report.md▤data_asset_inventory.json▤missing_metric_tasks.json
人工复核

(向省/市/县部门流转补数工单前必须人工核验确认)

查看完整链路与流程图 ↗
共同的执行契约参数校验 → 角色分派 → 确定性工具 → 受控分析 → 质量审查 → 产物注册

04 / DATA & KNOWLEDGE ENGINEERING

让模型有事实可依,
从整理原料开始。

数字与文本分开治理,再合成分析所需的证据。这也是从零构建中,最需要耐心的部分。

STRUCTURED DATA324,539条年鉴记录

1952—2024 年 · 925 地区 · 970 张标准表

ENTERPRISE REGISTRY22,119家重点企业

覆盖 21 个市州 · 登记 / 行业 / 经营范围

KNOWLEDGE CORPUS427份核心文档

12 个专题库 · 约 254 万字 · 隆昌库 136 份

PRECISION FIRST

“这个县的 GDP,取哪年的哪种口径?”

数值通过参数化查询与视图聚合获得。记录字段必须携带年份、来源、单位和统计口径,缺失时创建补数任务。

精确查询物理只读范围鉴权
SQL QUERY / 结构示意
SELECT metric_value, period, unit,
       statistical_scope, source_id
FROM authorized_metrics_view
WHERE county_code = :county_code
  AND period = :period;
510283 / 隆昌数值来源 ID口径
结构化字段示意;未执行真实数据库查询。
INGESTION / 从文件到可检索切片
扫描 PDFMinerU / OCR
Word · PPT · HTMLMarkItDown
政策网页Jina Reader
合并单元格 ExcelPandas / Openpyxl
→
清洗 · 标题 · 元数据索引与证据 ID

六个治理细节,决定检索能不能找到答案。

选择一个案例,查看原始问题、改造方式与适用口径。

KNOWLEDGE CASE 01

让一个段落只回答一个问题

BEFORE

无标题层级,按字符切块;平均 1,855 字,主题混在一起。

AFTER

将“一、”“(一)”恢复为 Markdown 标题,名词解释移到附录。

12 → 23段落数量
1,855 → 720平均字数
6 → 0>1,500 字段

2025 年工作报告的单文档治理样例,不是全部知识库平均值。

FROM LARGE CHUNKS TO FOCUSED SECTIONS
↓ 恢复章节结构
§ 1
§ 2
§ 3
§ 4
§ 5
§ 6
切片示意 · 非实际文档截图

CONTEXT ENGINEERING

模型这一刻看到什么,
比一句 Prompt 更重要。

把单次推理输入当作动态信息供给链。需要的事实、技能和轨迹按阶段装配,既保持注意力,也守住预算。

查看上下文装配规范 ↗
L1固定身份与安全基线稳定前缀+

专家身份与统计、权责、涉密边界固定在最顶部,不混入动态时间,以保持缓存前缀稳定。

L2运行时状态栏实时环境+

注入真实时间、county_code、step_used / max_steps、Token 水位。模型看见当前范围与预算,代码仍负责硬熔断。

L3渐进式技能挂载按需披露+

起步只给技能索引。确认需要后再加载行业 SOP 和 SKILL.md,避免 16 角色的所有规范挤占工作集。

L4状态与已确认事实当前子目标+

放入本阶段目标、已确认硬指标、完成里程碑和证据句柄;与假设保持明确标识。

L5近期轨迹与工具观测安全裁剪+

保留近期清洗观测,旧轨迹摘要折叠。工具声明与结果成对保留,尾部再强调当前交付任务。

当前任务

工作记忆

State / Todo / 活跃证据

历史执行

情景记忆

Checkpoint / reasoning_trace

领域事实

语义记忆

PostgreSQL / Dify

业务方法

程序记忆

DAG / Skills / 工具规则

事实依 SQL / RAG,方法参考 Memory。 Messages 是协议历史,Context 是推理工作集,State 是业务进度;它们各有生命周期。查看五层数据形态 ↗

05 / EXPERT ORCHESTRATION

十六种专业视角,
各自有工具,也各自有边界。

角色是按工位装配的领域规范。总调度分发任务,Worker 取得相关上下文与最小权限,回传结构化摘要。

宏观与治理

县域经济首席专家

chief_economist

整个智能内核的统筹研判中枢,负责统一业务链判断基调、把控证据边界与最终对外交付口径。

读取的上下文

用户原始问题、业务链匹配上下文、各专家中间分析草案、证据卡与专家规则。

回传的产物

任务归属业务链、可支持结论、不可支持结论、需人工确认事项、最终交付物摘要 (final_decision_brief)。

授权工具

query_metricssearch_evidencequery_expert_rules
判断边界

严禁 在未取得权威多源数据前断言“该县具备绝对比较优势”; 严禁 将政策出台与经济指标回升直接定性为因果关系; 严禁 规则版评分直接作为行政考核排名的结论。

Supervisor
全局目标与里程碑
⇄隔离 Worker
局部证据 + 有限工具
→结构化摘要
合并回 CountyEconomyState

角色间不做自由广播。权限、上下文容量、并行吞吐和独立审查需求决定是否使用多 Agent。查看隔离与调度设计 ↗

06 / RUNTIME ENGINEERING

真正的工程难题,
出现在任务开始之后。

数据缺失、模型超时、进程重启、审查驳回。运行时需要让任务继续、修订、挂起或停止,都有明确的路径。

ENGINEERING CONTRACT 01

输入、中间态与交付句柄分层

中间字段允许未生成;节点只读取状态并返回 Delta。大对象留在节点局部,State 保留摘要与句柄,避免检查点膨胀。

查看实现与约束 ↗
● ● ●Python / 简化示例
class CountyEconomyState(TypedDict):
    county_code: str        # 必填输入
    target_year: str
    workflow_id: str
    macro_metrics: Optional[dict]
    hypotheses: Optional[list]
    final_artifact: Optional[str]
    review_retry_count: int

如果跨部门补数要等 48 小时呢?

逐步操作,或播放一次挂起与恢复过程。演示在本地运行,48 小时等待被压缩为几个步骤。

RUNNING

分析发现指标缺项

不猜数。准备派发跨部门补数工单,并保留本次工具调用的唯一标识。

  • ✓缺项 → missing_metric_tasks
  • ✓保留 tool_call_id
  • ✓准备异步任务句柄
步骤 1 / 4 · 任务运行中
INFRA / 分布式底座

让运行现场留得下来

队列与 K8s Job 调度,PostgreSQL Checkpointer 持久化,OpenTelemetry / Langfuse 关联全链路,Docker / seccomp 隔离执行。

HARNESS / 宿主控制

让每次动作都有约束

Pydantic 参数校验、工具白名单、行政范围鉴权、幂等台账、上下文裁剪、Token 预算和步数硬上限。

LOOP / 协议推进

让调用与结果配对

模型返回 tool_calls,宿主执行并回传带相同 tool_call_id 的结果。错误转为可读观测,裁剪按调用与结果的原子对处理。

FOUR LEVELS OF TIMEOUT
≤ 3s连接握手
15–30s首 Token
≤ 5s片段间隔
300–1800s任务总时限

07 / QUALITY & TRUST

会生成,不等于能交付。
证据和门禁决定下一步。

先用程序检查可确定的事实与契约,再由独立 Critic 审查语义与体例,最后把失败原因沉淀为可回溯经验。

01数字门禁○

每个数值能否对应来源、年份与口径?

无据数字打回,不能用流畅表达掩盖数据缺口。
02证据门禁○

政策文号与原文段落是否真实可追溯?

校验 Dify 真实切片和政策元数据,避免模糊引文。
03逻辑门禁○

相关性是否被写成因果?是否越权承诺?

未满足识别条件的强因果表述降级为待核验假设。
04结构门禁○

章节、Schema 与公文格式是否齐备?

先查结构规则,再用独立 Critic 检查主观语义质量。
05敏感门禁○

是否含未脱敏的隐私或敏感经营信息?

发现敏感内容阻断流转,按数据分级约束模型路由。
06发布门禁○

是否需要专家或主管部门审签?

需要人审的任务进入待审队列,送审稿保留草案身份。
ILLUSTRATIVE INPUT / 教学示例
“隆昌某产业增长 18.6%,具备绝对比较优势。”

18.6% 是演示用数字,未绑定指标 ID。先补齐来源、年份和统计口径,不能直接进入后续论证。

处理结果

数字门禁打回

写入 missing_metric_tasks,生成补数与核验事项。

L1

硬数据

年鉴、局方报表、已确认指标

可用于测算,仍需核验口径
L2

软证据

政策、工作报告、会议纪要

用于背景、意图与政策依据
L3

待核验假设

瓶颈推测、未经验证线索

附核验方法与责任部门
L4

专家规则

分析范式、判定阈值

提供方法,不替代事实

EVALUATION / DESIGN TARGETS

验证真实产物,
也验证行动轨迹。

200+ 题 Golden Set 覆盖常规、长尾、脏数据和对抗用例。Prompt、工具或节点改动触发回归,每日巡检观察模型服务漂移。

查看四维评测与 CI/CD ↗
70%执行断言20%规则断言10%语义裁判

结果质量统计量误差目标 ≤ ±0.1%

轨迹效率有效动作比率目标 ≥ 90%

权限防护越权与沙箱拦截需验收

异常恢复扰动后自愈率目标 ≥ 85%

比例与阈值为白皮书的评测设计;未提供对应验收日志。

08 / LONGCHANG PILOT

在隆昌,
把整条交付链跑通。

试点县域:隆昌市 · 510283。以全域数智化转型发展规划为任务,将统计、产业、政策与调研材料连接到送审稿。

PILOT / 510283

从资料接收到 Word 送审稿

上千份接入资料与经治理后的 427 份核心知识文档,属于不同统计范围。白皮书记录五章规划草稿、重点工程清单、补数任务、政策矩阵与招商项目库等 50+ 份产物。

~30min

数据齐备后的材料初稿生成
据白皮书描述 · 不包含取数等待与行政审签

DELIVERY STAGE 01 / 12

受理业务目标

识别“全域数智化转型规划”任务,确认县域、周期和产物范围。

该阶段状态 / 产物task_spec / DoD
点击左侧阶段,沿着一份规划的证据链阅读。
DOCX
DELIVERABLE TYPE

规划送审稿

第一至第五章草稿与质检报告,进入专家审查流程。

JSON / EXCEL
DELIVERABLE TYPE

行动矩阵与项目清单

重点工程、政策行动、产业补链机会与要素协同任务。

MD / JSON
DELIVERABLE TYPE

数据与证据留痕

采集清单、部门补数清单、分析报告与 reasoning_trace。

09 / PROJECT IN PRACTICE

从架构图,
到实际运行的界面。

保留原页面全部 6 张项目图片:智能内核、运行时路由、专家编排、业务对话、知识库与数据治理流程。点击任意图片可放大阅读。

智能内核总体架构图
放大查看 ↗
01

智能内核总体架构图

LangGraph 9 条业务链运行时路由图
放大查看 ↗
02

LangGraph 9 条业务链运行时路由图

Dify Chatflow 20 个专家角色总览
放大查看 ↗
03

Dify Chatflow 20 个专家角色总览

原图标签为 20 个角色,本页按白皮书的 16 个角色契约展示,两种口径分别保留。

Agent 实际对话 · 隆昌高新企业分析
放大查看 ↗
04

Agent 实际对话 · 隆昌高新企业分析

隆昌知识库 · 136 份政府文档
放大查看 ↗
05

隆昌知识库 · 136 份政府文档

数据治理链 Chatflow 编排详情
放大查看 ↗
06

数据治理链 Chatflow 编排详情

10 / COMPLETE TECHNICAL COMPANION

看懂全貌之后,
还可以深入每个实现细节。

白皮书的 8 个章节在这里重新索引。每个主题先给阅读导引,再提供原文依据、流程图、表格、公式与代码。

下载架构白皮书 ↓
56 个技术主题
1.1

从人工填表开始的问题

183 个县的经济情况,需要统一的数据口径和跨部门协作。立项材料描述了底数、研判、协同、政策追踪、报告时效与基层填报六类问题;总概算属于整体平台建设范围。

+
原文依据 / 白皮书 § 1.1保留技术细节,便于核对

本项目根据四川省发展和改革委员会关于建设县域经济动态监测和研究分析平台的批示立项。项目总投资概算约 2682 万元,覆盖四川全省 183 个县(市、区)。此前,县域经济监测主要依靠人工填报,仅覆盖约 20 项宏观指标;本项目将其重构为多源数据自动归集、高频预警与动态研判的智能内核系统。

在“十五五”发展特色县域经济与四川省“四化同步、城乡融合、五区共兴”背景下,传统县域治理模式存在六个突出短板:

  1. 底数不清:全省县域季度核心指标约 3,500 个、年度约 8,000 个,传统方式偏重 GDP 和固定资产投资等单一总量,缺少产业结构、要素流动与动能转变的深层刻画,人工汇总校核周期长达 1~3 个月。
  2. 研判不准:全省 61.2% 的县域主导产业高度集中在食品饮料、低端装备制造等传统赛道,产业优势判断过去多凭经验定性,缺乏同质化竞争与错位发展的量化测算工具。
  3. 协同不畅:15 项核心监管事项需跨部门调取 12 类数据,涉及统计、发改、经信、税务、自然资源等 18 个省级部门,跨部门数据共享响应平均耗时超过 72 小时,三级联动全靠人工拉通。
  4. 政策不精:省级每年向 183 县下发 200 余项产业与民生扶持政策,仅约 1/3 实现跟踪,事前缺少沙盘推演、事中缺乏监测、事后缺乏净效应评估。
  5. 决策滞后:从数据清洗到送审分析报告产出耗时漫长,分析结论形成时往往已错过宏观调控的最佳窗口。
  6. 基层负担重:基层干部深陷“表格多头填报、指标反复报送、口径相互打架”的消耗战。
1.2

智能内核的任务与边界

围绕经济监测、产业错位规划和政策执行三类业务,把证据整理成可追溯初稿。法定统计、正式行政排名、风险定性和最终审签保留在主管部门与专家手中。

+
原文依据 / 白皮书 § 1.2保留技术细节,便于核对

项目不重复开发前端展示大屏,核心任务是构建嵌入三大现有政务业务系统的 AI 智能分析中枢(智能内核):

  • 三大业务流程重构:
    • 县域经济监测分析:从人工填报、静态排名升级为多源数据自动归集、指标动态预警与态势实时研判;
    • 主导产业错位发展规划:从经验判断升级为量化比较优势分析、产业链断点诊断与“一县一策”规划方案智能生成;
    • 政策精准执行与评估:从事后总结升级为政策事前推演、执行监测、因果评估与产业链靶向招商。
  • 系统核心边界与事实口径:
    • 不替代法定口径:严格不替代统计部门和行业主管部门的法定统计职责;
    • 不直接定性:不直接生成正式考核行政排名、正式风险定性或正式因果结论;
    • 不替代专家审批:所有规划草案与政策方案均标注置信度与证据出处,作为专家评审和行政审签的“可追溯决策辅助初稿”。

2.1.1

宿主管平台,状态机管业务

Hermes 管会话、工具、技能和权限;LangGraph 管 CountyEconomyState、9 条业务链、质量门禁与产物。FastAPI/MCP 将业务入口与 PostgreSQL、Dify、证据存储连接起来。

+
原文依据 / 白皮书 § 2.1.1保留技术细节,便于核对

智能内核采用了“平台宿主(Hermes)+ 领域状态机(LangGraph Runtime)”的双层解耦架构:

100%
双通道数据与知识底座领域 Agent 运行时 (LangGraph Runtime)Agent 平台宿主层 (Hermes)用户与业务交互层业务执行流水线领导驾驶舱 /业务系统前端FastAPI 统一网关 /任务接口Hermes CLI /自动化运维工具Tool Gateway /权限拦截技能与角色注册中心任务调度器与会话管理器MCP 协议枢纽(FastAPI/MCPServers)共享状态机:CountyEconomyState9 条业务链路由中心(Workflow Catalog)数据治理链运行监测链产业诊断链瓶颈归因链政策决策链一县一策规划链项目招商链模型分析链治理知识链分层质量审查门禁(6 层拦截)产物注册与版本中心(Artifact Registry)PostgreSQL硬指标 / 统计年鉴 /企业库Dify 12 专题知识库RAG 软知识 / 政策/ 会议纪要SQLite / ObsidianVault证据卡 / 知识地图
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
2.1.2

为什么从 OpenClaw 迁移

早期角色脚本和对话式探索难以维持长流程。迁移的重点是把路由、状态持久化、标准工具协议与多格式交付纳入工程控制,而非单纯更换模型。

+
原文依据 / 白皮书 § 2.1.2保留技术细节,便于核对

项目早期曾采用 OpenClaw 探索多智能体协作。但在长链路业务落地时遇到若干稳定性问题,随后迁移至 Hermes 宿主与 LangGraph 运行时架构:

对比维度早期 OpenClaw 阶段迁移后 Hermes + LangGraph 架构迁移原因与实际收益
架构形态偏对话网关,角色以独立脚本和 Prompt 离散存在工业级宿主 + LangGraph 状态机单一 Agent 难以承载企业级长流程业务
业务流程控制依赖 LLM 自发对话与 ReAct 循环,容易偏航跑飞代码硬编码固定 DAG 拓扑 + 条件分支政务分析要求 100% 流程确定性与可复现性
工具协议私有 Python 工具适配器,耦合紧标准化 MCP (Model Context Protocol) 服务工具模块解耦,支持跨系统独立部署和热插拔
状态持久化内存运行时变量,进程挂掉全部丢失结构化 State + 产物注册表 + 阶段断点持久化支持长时间后台异步计算任务与产物溯源
交付形态纯聊天窗 Markdown 输出Markdown 报告 + JSON 结构化矩阵 + Word 送审稿满足政务系统对结构化数据与公文交付的格式要求
2.1.3

把模型装进工作流

代码明确必做步骤、允许的动作和停止条件;模型承担资料理解、假设生成、政策匹配与表达。业务规则负责全局控制,智能体只取得节点内的有限探索权。

+
原文依据 / 白皮书 § 2.1.3保留技术细节,便于核对

在政务经济分析场景中,纯自主智能体(Autonomous Multi-Agent)和传统硬编码工作流各自存在致命缺陷:

  • 纯自主智能体的硬伤:大模型自由决策容易跳步、指标统计口径无法对齐、面对长链路容易产生注意力幻觉与越权推断;
  • 传统固定工作流的硬伤:无法解析口语化政务诉求、无法理解非结构化政策意图、无法从杂乱的调研文本中萃取归纳。

系统确立的核心架构原则:

让确定性代码决定“必须做什么、允许做什么、什么时候停止”,让大模型决定“如何理解资料、如何组织结论、如何高质量表达”。 主流程是强控制的 LangGraph 状态机;大模型只在资料归纳、瓶颈假设生成、政策匹配和报告撰写等特定节点以 Agent/Subagent 形态受控接入。

2.1.4

外层按规则走,内层按证据查

外层图控制前后依赖;内层 Harness 驱动 LLM → 工具 → 观测的反馈循环。单节点最多 6 轮,单次工具调用设 20 秒上限;失败会留下缺口和局部结论。

+
原文依据 / 白皮书 § 2.1.4保留技术细节,便于核对

根据现代软件工程对 Agent 的最小定义:

Agent=LLM+Context+Tools\text{Agent} = \text{LLM} + \text{Context} + \text{Tools}

外层由 Harness(宿主运行时) 驱动。传统的单向开环 LLM 应用仅是“输入 →\to 检索 →\to 生成”,中间一旦失败无法自我纠正。为了兼顾政务工作流的强确定性与智能体的自适应能力,本系统在架构上设计了“宏观工作流(Outer Workflow DAG)+ 微观自治闭环(Inner Tool Loop)”的双层嵌套机制:

100%
单节点微观闭环 (Inner Tool Loop in Harness)宏观工作流层 (Outer Workflow DAG)生成 tool_calls数据不全/需追查达到 max_turns (熔断)证据完备激活角色与目标传递状态 State记录未收敛原因数据治理节点运行监测节点产业诊断节点(Agent 节点)瓶颈归因节点1. 组装 Context(系统指令+任务目标)2. LLM 推理决策3. 执行物理工具(SQL/RAG)4. 获取 Observation回传5. 达到目标 or发生异常?更新消息轨迹 (对齐tool_call_id)触发熔断保护,输出局部结论与缺口6. 输出结构化结论Finding
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  1. 宏观层(Outer Workflow DAG):由 LangGraph 控制全局业务拓扑(如必须先完成运行监测与产业画像,才能进入瓶颈归因)。这一层由代码 100% 决定流转路径,模型无权越权跳转分支;
  2. 微观层(Inner Tool Loop in Harness):在具体的研判节点(如产业链断点分析)内部,模型在 Hermes/Runtime 提供的 Harness 循环中运行,不采用单次无反馈生成:
    • 模型发起结构化 tool_calls(如查询规上玻陶企业清单);
    • Harness 负责物理调用数据库,严格遵循协议对齐 tool_call_id,将结果作为 role: tool 消息压入上下文;
    • 模型根据物理观测发现某关键环节配套企业缺失,自主触发第二轮 tool_calls(进一步检索外地供应商数据库);
    • 硬性熔断控制:Harness 设定了严格的 max_turns = 6 硬性退出门禁与单次调用 20s 超时熔断,绝对禁止模型由于外部异常陷入无限调用死循环。
2.1.5

三问决定是否需要 Agent

能穷举规则就用代码;只做一次提取或改写就用单步 LLM;需要根据观测继续追查时才用闭环 Agent。同比、LQ 和权限判断不交给语言模型计算。

+
原文依据 / 白皮书 § 2.1.5保留技术细节,便于核对

开发复杂系统时,容易将所有模型调用和简单脚本泛化为 Agent。依据控制权归属(代码 vs 模型)与执行路径的确定性,系统将所有节点划分为三类:

100%
能穷举不能穷举否: 仅做单步转化/提取是: 需多步探索自适应Q1: 任务步骤与规则能否在开发期完全穷举?1. 纯代码确定性节点(DeterministicCode)控制权: 100% 代码零随机性 / 极低延迟/ 严格可复现Q2:节点是否需要根据中间观测自适应决定下一步动作?2. 单步 LLM数据处理节点(LLM asTransformativeFunction)控制权:代码固定入参,模型单步输出结构化抽取 /摘要润色 / 格式对齐3. 闭环探索 Agent节点(ConstrainedDynamic Agent)控制权:局部移交模型,代码负责沙箱熔断多轮 Tool 观测循环/ 假设反推 /自适应补查
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
节点类型系统内典型实现场景控制权归属为什么不采用其他模式?
1. 纯代码确定性节点宏观指标同比/环比计算、区位商(LQ)公式测算、数据资产编目、Tool Gateway 权限拦截、PostgreSQL 物理只读查询100% 代码控制属于严格数学统计与政务安全防线,容忍度为 0,严禁大模型参与介入产生幻觉或计算漂移。
2. 单步 LLM 处理器运行态势文字摘要提炼、预警成因公文润色、规划公文排版对齐、复杂自然语言指令意图分类代码固定 DAG,模型单步生成输入输出上下文明确,无需多步工具探索,单次 Prompt 即可完成高信噪比表达。强行 Agent 化只会徒增延迟与成本。
3. 闭环探索 Agent 节点产业链断链溯源(需根据企业画像动态追查上下游供应商)、瓶颈归因假设反推(需根据多源线索交叉核验)、一县一策规划章节编排协同局部移交模型自主决策,Harness 硬熔断搜索空间广阔,无法预先穷举所需资料;需要根据工具返回的真实物理观测动态决定下一步补查什么证据。

这种清晰的分类确保了“该硬的绝对硬(零波动),该活的在沙箱里受控探索(自适应)”。

2.2.1

七个模块如何形成一次交付

目标、状态、模型、工具、记忆、规划器和护栏各司其职。完成判据同时检查文件落盘、Schema、6 层门禁、证据引用和进程退出码,不以模型自述作为成功依据。

+
原文依据 / 白皮书 § 2.2.1保留技术细节,便于核对

脱离三方库的浅层封装,一个可维护的工业级 Agent 系统必须具备清晰的七大模块分工。本系统对这七大模块的工程落地映射如下:

100%
4. 工具管线 (Tools Pipeline)7. 护栏调度 (Guardrails Gateway)3. 推理中枢 (Model Routing)5. 分层记忆 (Memory)2. 状态机 (CountyEconomyState)1. 目标与DoD规范 (Goal & DoD)4. 工具管线 (Tools Pipeline)7. 护栏调度 (Guardrails Gateway)3. 推理中枢 (Model Routing)5. 分层记忆 (Memory)2. 状态机 (CountyEconomyState)1. 目标与DoD规范 (Goal & DoD)alt[命中安全策略 / 越权][鉴权通过]loop[微观受控循环 (Max 6 轮熔断)]初始化任务目标、客观 DoD 准则与预算配额1按目标检索相关政策知识与历史推演轨迹2返回高置信度事实与规约切片3提交组装上下文 (含 Todo 清单与活跃证据)4输出决策:结构化 tool_calls (带严格 Schema)5发起工具调用鉴权6拦截并抛出 PermissionDenied,记录审计7在物理沙箱中执行 (SQL/RAG/模型)8返回截断与降噪后的 Observation (对齐 tool_call_id)9更新待办状态、累加 Token 与耗时10提交产物草案进行 6 层质量审查11物理级 DoD 校验全部通过,正式交付12
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

核心模块落地映射一览:

  1. Goal & Specification(目标与客观完成判据 DoD):
    • 拒绝模型主观自夸:系统彻底打破“只要模型输出文字就当成任务完成”的缺陷,确立严格的客观物理级完成判据(DoD):
      • ① 所有必填结构化产物文件(.md / .json / .docx)物理落盘且 Schema 校验 100% 成功;
      • ② 穿透 6 层质量门禁,0 项 P0 违规拦截;
      • ③ reasoning_trace.json 证据链完整闭合,所有引用均有对应数据源 ID;
      • ④ 脚本进程退出码(Exit Code)严格为 0。只有同时满足上述 4 条客观指标,任务才被判定为 succeeded。
  2. State(强类型序列化状态机):
    • 显式维护 CountyEconomyState,将待办清单(todo_list)、活跃证据文件(active_evidence_refs)、资源用量(budget_tracker)显式独立维护,防止在长上下文中重复试错。
  3. Model(结构化输出契约与路由):
    • 严禁让模型自由输出非标准文本再用正则匹配,核心交互全量采用原生 Function Call / Pydantic 结构化数据协议;轻量意图分类路由至 7B 级小模型,深层推演调用顶尖模型。
  4. Tools(工具管线四道防护机制):
    • ① Schema 校验(Pydantic 强校验入参);② 环境隔离(PostgreSQL 物理只读账号与无权限子进程);③ 输出信噪比控制(SQL 强制截断,大结果返回引用句柄);④ 状态幂等与事务回滚。
  5. Memory(四层分层记忆体系):见 3.4 节详解。
  6. Planner(规划策略矩阵):
    • 宏观采用 Plan-and-Solve(业务链预先编排),微观采用 ReAct(探索节点边查边走),后置门禁采用 Critique / Reflection(自我反思与质检补丁)。
  7. Guardrails & Harness(硬性护栏与运行时管控):
    • 外部代码硬编码熔断、Tool Gateway 权限强校验与 Human-in-the-Loop 原生挂起。
2.2.2

工具调用的因果配对

模型只声明调用,宿主负责执行。每条 tool_calls 与 role: tool 的结果通过 tool_call_id 配对;裁剪时成对处理。参数错误回传供自纠,Schema 合法后仍需核验行政区划权限。

+
原文依据 / 白皮书 § 2.2.2保留技术细节,便于核对

在系统工程实现中,大模型不具备在服务器上主动执行代码的物理能力。所谓的工具调用,本质上是由 Harness 驱动的双轮次(Two-Turn)HTTP 协议循环推进:

100%
物理工具 (PostgreSQL / Dify)大语言模型 APIAgent Harness 宿主物理工具 (PostgreSQL / Dify)大语言模型 APIAgent Harness 宿主3. Pydantic 严格反序列化 & 权限校验4A. 不崩溃,将 ValidationError 作为 role: "tool" 回传alt[参数缺失或 Schema 校验失败][校验与鉴权通过]1. POST 请求 (Prompt + Tools JSON Schema)12. 返回挂起响应 (finish_reason="tool_calls", 带 call_id 与 arguments)24B. 驱动模型根据错误提示自动纠偏参数35. 执行物理查询与降噪截断46. 返回 Observation57. POST 回传原声明 + 严格配对的 tool_call_id 结果68. 返回最终分析结论 (finish_reason="stop")7
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

底层协议工程落地的三大准则:

  1. 因果绑定硬性配对(Causal Pairing Invariance):
    • 模型返回的每一个 tool_calls 项都包含全局唯一标识符(如 call_metric_091)。Harness 回传执行结果时,必须严格包装为 role: "tool" 且携带相同的 tool_call_id;
    • 原子性保全(杜绝孤儿调用):在上下文动态修剪(Context Pruning)或步骤回退时,系统必须以 (assistant.tool_calls, tool_results) 为最小不可分割原子对。严禁只修剪工具结果而保留调用声明,或保留声明而丢失结果,否则会直接引发 API 400 协议校验崩溃。
  2. 参数校验失败的自纠闭环(Schema Self-Correction):
    • 当模型返回的 arguments 缺失必填字段或格式不合规时,Harness 绝对禁止抛出未捕获异常导致任务崩溃。系统捕获 Pydantic ValidationError 后,将其标准化格式化为机器可读报错信息回传给模型(如 {"error": "缺失必填字段 'period',请提供 4 位年份"}),赋予模型在当前步骤原地自纠纠偏的能力。
  3. 零信任参数业务鉴权(Zero-Trust Parameter Guard):
    • 即使模型生成的入参通过了 JSON Schema 校验,Harness 依然视其为不可信输入。例如,必须强行比对 county_code 是否在当前登录用户的行政管辖授权范围内,严禁跨权限越权调数。
2.2.3

规划、检索、反思分开负责

Planning 决定步骤,RAG 补事实,Reflection 查质量。缺数生成补数任务;先跑确定性断言,再调用语义 Critic;规划总师将章节交给独立 Worker 并按反馈重排。

+
原文依据 / 白皮书 § 2.2.3保留技术细节,便于核对

在复杂智能体系统中,Planning(任务规划)、RAG(知识检索)与 Reflection(自省质检)常被误解为可以相互替代的概念。系统确立了严格的三元解耦边界,杜绝三大典型能力错配:

100%
核心能力三元解耦下发子任务按需感知/事实补全提交中间产物未通过: 附带精确补丁打回通过: 放行进入下一阶段1. Planning 规划流【解决拓扑与控制】决定做什么、按什么步骤推进2. RAG 知识检索流【解决事实与依据】按需注入缺失的客观公文与政策证据3. Reflection评估自省流【解决质量与边界】检验结论与输出是否真实合规用户业务目标Agent Harness调度中枢最终业务交付
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

三大工程避坑原则与选型决策:

  1. 事实缺失严禁依靠 Planning 脑补(知识盲区熔断):
    • 当遇到特定区县的核心指标或政策缺位时,系统严禁通过“让模型多想几步”来推导事实,必须直接触发 RAG 工具检索,若底层无数据则强制抛出 missing_metric_tasks 补数任务,从源头掐灭逻辑幻觉;
  2. 能用确定性代码断言绝不引入 LLM 反思(Reflection 三级火箭):
    • 优先采用 Python 代码编写的 L1 确定性硬断言(数字出处比对、文号白名单、敏感词正则);
    • 仅对长篇规划的主观公文体例和发改委规范,才下沉给 L2 专职 Critic 模型;
  3. 规划架构选型:一县一策的分层规划(Hierarchical Supervisor-Worker Planning):
    • 顶层由 county_planning_chief(Supervisor)确立战略定位与 5 大章节里程碑骨架;底层由章节撰写节点(Workers)在局部沙箱中完成具体分析,并通过门禁反馈触发动态 Replanning,兼顾全局一致性与局部灵活性。
2.2.4

多 Agent 什么时候有价值

只有上下文容量、权限隔离、并行吞吐或独立审查确有需求时才拆 Worker。Supervisor 持有全局状态,Worker 仅回传结构化摘要,不做横向广播。文中 80/20 为选型描述。

+
原文依据 / 白皮书 § 2.2.4保留技术细节,便于核对

在业界讨论中,多智能体(Multi-Agent System)常被包装成“虚拟公司/多角色聊天室”等拟人化噱头。在严肃政务工程中,无约束的角色自由对话只会导致 Token 指数级爆炸、延迟飙升至数分钟并极易死锁。 系统坚决剥离拟人化噱头,从分布式计算中的上下文隔离、权限边界、并发吞吐与状态确定性四个工程维度,明确单体与多 Agent 的分界:

100%
20% 极端场景:切换至受控 Supervisor-Worker 多 Agent80% 业务场景:坚守单 Agent + 确定性状态机遭遇四大物理极限时数据治理链 ·运行监测链 ·政策匹配链【强前后依赖 ·工具数 < 15 ·追求极致 SLA确定性与低延迟】1.上下文物理超限隔离(Context Isolation)(全域规划多章节生成,局部切片 50kTokens)2.权限与物理网络隔离(PrivilegeBoundaries)(只读宏观分析 vs部门补数工单写入)3.并发扇出与吞吐扩展(Parallel Fan-out /Map-Reduce)(三大主导产业并行画像,耗时从 15分钟降至 2 分钟)4. 非对称双盲质检(AdversarialValidation)(Critic独立沙箱,严禁接收生成者CoT,杜绝证实偏差)
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

工业级拓扑选型铁律:

  • 坚决采用主从分发型(Supervisor-Worker):由总调度节点掌握全局状态,向专业子智能体(Worker)派发子任务。Worker 之间互不可见、严禁横向私聊,执行完毕仅回传精炼的结构化摘要,主上下文体积始终维持在健康低水位;
  • 严禁使用网状点对点(P2P Mesh):在生产环境中彻底封杀多智能体广播与自由聊天拓扑,杜绝通信风暴与死锁震荡。
2.3.1

基础设施与四级超时

Loop 处理一步模型协议;Harness 处理上下文、工具与预算;Infra 处理队列、持久化、追踪、多租户和沙箱。连接、首 Token、流片段间隔、任务总时限分别设限,429/5xx 使用随机指数退避。

+
原文依据 / 白皮书 § 2.3.1保留技术细节,便于核对

将政务智能体从本地单机原型推向省级发改委 183 县生产环境,系统必须直接面对分布式环境下的硬核物理挑战:计算节点 Pod 遭遇 OOM 重启导致执行丢失、外部大模型 API 遭遇网络抖动或 429 限流、工具重复执行导致脏数据污染、以及模型生成代码越权逃逸等。为此,平台确立了明确的三层职责分工体系:

100%
3. Agent Loop 协议驱动内核 (单步推理驱动)2. Agent Harness 运行时宿主层 (Hermes 框架与状态机治理)1. Agent Infra 生产基础设施层 (分布式集群与高可用基座)分布式任务调度引擎(Celery / RedisQueue / K8s Job)状态持久化存储(PostgreSQLCheckpointer)分布式可观测平台(OpenTelemetry +Langfuse)多租户安全网关 /Token RateLimiter安全执行沙箱(Docker / seccomp/ 屏蔽私网元数据169.254.169.254)上下文装配与安全裁剪引擎 (Token预算硬拦截)工具注册网关与参数Schema 强校验(Pydantic /权限隔离)强类型状态机管理器(LangGraph节点状态流转)副作用工具幂等执行台账 (IdempotencyLedger)带抖动的指数退避重试器 (JitteredBackoff)大模型单步推理(ChatCompletion /Function Call)工具分派与结果结构化装配
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

各层边界与关注点遵循严格的职责正交原则:

  • Agent Loop(内核):仅负责单步模型调用与工具调用声明的分发解析,无外部存储依赖;
  • Agent Harness(宿主):管理局部内存轨迹、上下文裁剪、参数校验、异常重试与执行步数预算;
  • Agent Infra(底座):负责集群任务持久化、节点崩溃自愈、分布式链路追踪、沙箱资源隔离与多租户审计。

1. 外部大模型 API 四级超时控制矩阵

在长程政务规划生成中,简单的单一 HTTP 超时(如 timeout=60s)无法应对流式输出与深度思考。系统构建了四级递进超时防护矩阵:

100%
1. Connect Timeout(TCP/TLS 握手: ≤3s)2. TTFT Timeout(首 Token 到达: ≤15~30s)3. Inter-tokenTimeout(流式字符间隔断流:≤ 5s)4. Global TaskDeadline(单任务全局硬时限:300s~1800s)
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  • Connect Timeout(≤ 3s):限制底层 TCP 连接与 TLS 握手时间,防止网关连接池挂起或 DNS 解析死锁;
  • TTFT(Time-To-First-Token)Timeout(15s ~ 30s):请求发出到服务端输出第一个 SSE 数据包的时限。针对深度思考推理模型可放宽至 30s,防止请求无限排队拥堵;
  • Inter-token Timeout(≤ 5s):流式传输中,相邻两个 Chunk 之间的传输间断上限。若超过 5s 无任何新字符推送,判定为网络中间僵死,主动切断连接避免 Worker 线程永久挂起;
  • Global Task Deadline(300s ~ 1800s):单任务总硬性时限。常规宏观指标分析限时 300s,隆昌全域数智化规划宏观长任务限时 1800s,超时强行熔断并回滚,防止模型动作死循环空耗费用与资源。

2. 带随机抖动的指数退避策略(Jittered Backoff)

面对模型厂商偶发的 HTTP 429(Rate Limit)与 5xx 故障,系统坚决杜绝固定间隔重试,采用带随机抖动的指数退避算法: Tsleep=random(0, min⁡(Tmax⁡, Tbase×2attempt))T_{\text{sleep}} = \text{random}(0, , \min(T_{\max}, , T_{\text{base}} \times 2^{\text{attempt}})) 通过引入随机抖动,彻底打散 183 县并发任务高峰期的重试脉冲,避免数百个 Worker 在同一毫秒内重试引发次生雪崩。

2.3.2

用外部验证器判断结束

防止反复震荡、虚假完成、相同参数空转和错误级联。Verifier 输出具体失败项,驱动定向修订;连续 3 轮质检失败转人工。文中的约 62% / 91% 是未附样本的测试描述。

+
原文依据 / 白皮书 § 2.3.2保留技术细节,便于核对

在单次调用或简单链式调用中,关注点往往落在 Prompt 遣词造句与 Tool Schema 上。但在数智化转型规划生成与多源数据治理等长程多步 Agent 中,绝大多数严重的线上故障出在**循环控制流(Loop Control Flow)**层面。系统从工业级循环工程视角,建立了严格的自收敛控制律:

1. 政务场景下循环失控的四种典型病灶

100%
4. 误差放大 (Drift)3. 参数重复空转 (Stagnation)2. 假性收敛 (False Convergence)1. 乒乓震荡 (Oscillation)触发规则违反削减工业项目投资自我宣称完成缺乏反思机制修改产业增速目标能耗总量超标驳回产业增速不达标驳回模型生成规划草案文本宣称全部达标(实际底层缺少统计依据)SQL语法或表名错误原样再次重发相同SQL前期主观估算某产值后续全域园区基建均按此规划最终方案彻底背离物理现实
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

2. 第一铁律:外部验证器驱动退出(Verifier-driven Exit)

平台确立了绝对不可动摇的循环终止法则:严禁将“大模型的自主回答或自我宣称”作为任务终止的最终信任源。退出判定必须移交至外部确定性验证器(Deterministic Verifier)。

100%
Verifying启动节点执行组装上下文与事实证据生成工具调用 (SQL/RAG)回传物理观测结果模型输出章节草案并宣称完成1. Python 确定性断言 (统计指标出处/文号)通过失败 (有指标无出处)2. 发改委结构契约与数据平衡校验全部 100% 验收达标发现断言失败或平衡约束破坏外部验证器放行,标记状态机SUCCESS提取结构化失败诊断,推回循环强制模型自我纠偏触碰最大步数 (Max Turns=6) 或Token 预算阈值 (熔断)InProgressModelStepToolExecutionRunDeterministicAssertionsRunSchemaValidationRejectedRunSpecializedCriticPassedCompletedAborted
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  • 当模型输出“隆昌产业发展章节已撰写完毕,全部符合省发改委规范”时,Harness 坚决不认可其终止声明;
  • 状态机自动路由至外部 Verifier 节点,执行 Python 代码断言(比对年鉴数据精确出处、公文红头文号白名单、敏感词检测)与 Schema 校验;
  • 仅当验证器返回退出码为 0 时,才允许状态转移至 COMPLETED;若未通过,验证器输出的具体失败上下文(如 "AssertionError: 装备制造业产值增速与第三章统计底表不一致,差值为 4.2%")被包装为系统反馈直接注入下一轮循环,强迫模型精准重写。

3. 三轮平缓剪枝控制律(Pass@N Convergence Pruning)

在循环迭代中,模型自我纠偏能力服从收益递减规律:

  • Pass@1(一次通过率):约为 62%62%;
  • Pass@3(3 轮自愈通过率):上升至 91%91%;
  • 收敛截断铁律:经验测试表明,若连续 3 轮外部验证器均驳回,说明模型已陷入认知盲区或遭遇物理不可行约束(如资源禀赋客观无法同时满足两项省定指标),第 4 轮及以后的重试通过率趋近于 0。此时系统直接熔断早停,将现场上下文冻结并转为人工专家待办工单(Escalate to Human),杜绝无意义的 Token 燃烧。
2.3.3

可审查、可回滚的经验演进

不修改模型权重,而是沉淀反思经验、在只读沙箱测试新工具、离线优化提示词。经验按后续成败增减置信度;生成工具需至少 3 组测试;敏感或全省通用规则经人类终审。

+
原文依据 / 白皮书 § 2.3.3保留技术细节,便于核对

大模型的基座权重在部署后是完全冻结的。在四川省 183 县多变而复杂的实际政务落地中,各县统计表头口径微调、部门接口变动或长尾专有行业分析需求层出不穷。若每次业务调整都依赖工程师人工修改代码与 Prompt,系统的维护成本将随时间呈指数级上升;而触发模型权重微调(Fine-Tuning)又面临样本需求大、训练周期长、黑盒难以解释及易引发“灾难性遗忘”等致命痛点。 系统创新地确立了“冻结模型权重,通过运行时外化资产自进化(In-Context Self-Evolution)”的工程范式:

1. 运行时外化自进化 vs 权重微调

评估维度模型权重微调(Fine-Tuning / RLHF)运行时外化自进化(In-Context Evolution)
样本需求量需数千条专业对齐语料极少样本(1~3 次典型发改委专家驳回与修正案例即可沉淀)
生效周期天级或周级(数据清洗、集群训练、评测验收)分钟级(经验写入情节记忆或自举工具测试通过后即刻全局生效)
可解释性与回滚极低(隐式权重黑盒,无法精准排障)极高(生成的 Python 工具代码与反思文本完全人类可读,支持一键灰度与回滚)
模型基础能力易引发灾难性遗忘与通用泛化能力衰减零副作用(基座模型完全冻结,外挂知识与工具动态隔离)

2. 三大自进化工程机制落地

100%
机制 3: 提示词策略自优化 (Prompt Auto-tuning)机制 2: 动态工具自举合成 (Tool Synthesis)机制 1: 情节反思沉淀 (Experience Reflection)相似县域任务前置召回测试 100% 跑通任务遇阻或质检驳回Critic深度复盘分叉点沉淀至 Episodic经验库(生成布尔型负向规避准则)动态注入 Prompt规避旧坑跨表高频复合计算模式(如 CAGR +用电弹性系数 +偏离份额)自主编写复合Python 工具代码Docker 沙箱运行 3组单元测试自动生成 Schema接入工具网关批量历史任务质量审计Optimizer模型定向优化Prompt 表达跑通 200+ 题Golden Set准入合入
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  • 机制 1:情节反思沉淀(Reflexion Pattern): 当任务发生错误重试或被质量门禁驳回时,专职复盘 Worker 深度分析执行轨迹的分叉点,提炼针对该特定区县和指标的布尔型负向规避准则(例如:“在查询隆昌玻陶产业历史能耗时,必须剔除 2021 年退城入园企业的搬迁过渡能耗,否则会导致工业产值能耗比虚高 32%”),写入向量情节记忆库。后续同类任务前置召回并作为动态 Few-shot 注入上下文,防止“重复踩坑”;
  • 机制 2:动态工具自举合成(Tool Synthesis): 面对 183 县高频复杂的跨表统计计算(如同时测算主导产业 3 年复合增速、工业用电弹性系数及前 20 强企业税收集中度),Agent 不再每次耗费 8 轮琐碎 SQL 与多步推理拼装,而是自主生成一段参数化 Python 聚合工具代码(如 calc_industrial_cagr_and_elasticity.py)并附带 3 组单元测试用例。沙箱测试全绿后,自动生成 JSON Schema 并动态注册进工具网关,后续任务单步原子调用即可完成,推理 Token 与耗时下降 70%70%;
  • 机制 3:提示词策略离线自优化(Prompt Auto-Tuning): 基于 200+ 题 Golden Set 长期评测大盘的薄弱项,离线优化模型自动优化专家角色的系统指令,经基准测试无退化后生成 PR 供工程师核准。

3. 防中毒安全门禁(Anti-Poisoning Gate)

自进化最致命的隐患是“假性经验固化与恶意注入(Feedback Poisoning)”。系统设置了三重不可跨越的准入防线:

  1. 记忆置信度半衰期机制(Memory Half-Life): 每条沉淀的反思记忆赋予初始权重 W0=1.0W_0=1.0。后续任务引用该经验且通过质量门禁,置信度提升(W←W+0.2W \leftarrow W + 0.2);若引用后任务仍失败或被发改委专家驳回,扣减置信度(W←W−0.4W \leftarrow W - 0.4);一旦 W<0.3W < 0.3 则自动逐出记忆库,彻底淘汰失效经验;
  2. 测试驱动的沙箱隔离准入(Test-Driven Admission): 任何自动合成的工具代码,必须自带至少 3 组覆盖极端边界的单元测试,并在隔离的 Docker 临时容器中执行,要求退出码为 0 且无超时。工具仅限只读 SQL 与数据转换,严禁任何包含写副作用的代码自举;
  3. 人类终审(Human-in-the-Loop Sign-off): 涉及全省通用性规则更新或涉及敏感指标口径的经验,系统自动在管理后台生成待办工单,必须经省级发改委业务专家在线签署确认后方可合入全省主干知识库。
2.3.4

等待两天,也能接着跑

补数和审批不能占用同步连接。挂起时保存 State、消息、角色和门禁快照并释放 Worker;签名回调通过 HMAC、时效与 CAS 检验后,补回原 tool_call_id 并恢复执行。

+
原文依据 / 白皮书 § 2.3.4保留技术细节,便于核对

大语言模型的标准 Tool Calling 建立在同步 RPC 请求-响应的假设之上:模型声明工具调用,当前线程阻塞等待结果返回,随后驱动下一步推理。 然而,在真实政务运行场景中,工具物理耗时的分布呈现出极度不对称的跨度:

  • 查询 PostgreSQL 统计指标:10∼50ms10\sim 50\text{ms};
  • 183 县大规模偏离份额分析(SSA)与 50+ 份 Word 报表排版渲染:3∼153\sim 15 分钟;
  • 跨部门数据归集与补数填报(如经信局补录企业能耗):需 24 ~ 72 小时;
  • 省市发改委专家审批签字(Gate 6 人工终审):需数小时至数天。

若采用传统的同步长连接阻塞,网关必然在 60 秒内触发 HTTP 504 Gateway Timeout 报错崩溃;Worker 进程持续占满显存与文件描述符导致集群雪崩;且中间若遇 Pod 滚动升级,内存中未完成的规划现场将彻底灰飞烟灭。 为此,系统全面重构为基于事件驱动的异步会话挂起与恢复体系(Suspension & Resumption Architecture):

100%
大语言模型政务 OA / 外部补数系统PostgreSQL (State & Ledger)Agent Runtime (Hermes)大语言模型政务 OA / 外部补数系统PostgreSQL (State & Ledger)Agent Runtime (Hermes)【阶段 1: 非阻塞主动冻结】当前 Worker 进程优雅退出,100% 释放 CPU/内存... (漫长的跨部门线下核验填报,历时 48 小时) ...【阶段 2: 安全 Webhook 回调唤醒】发改委业务干部发起全域数智化规划编制任务1推进前置章节编制2发现核心指标缺项,调用 trigger_missing_metric_ticket3签发全局唯一 AsyncHandleToken (附带 HMAC 签名)4序列化 AgentState (置为 SUSPENDED 态,保存完整上下文)5向跨部门补数系统派发工单 (携带 AsyncHandleToken)6响应前端: "已生成工单并挂起,等待部门录入 (Token 已生成)"7POST /api/v1/webhook/task-callback (携带签名 Token 与录入数据)8强校验 HMAC-SHA256 签名与时间戳 (防伪造注入)9执行 CAS 乐观锁 (检查状态必须为 SUSPENDED,防重放)10读取并反序列化完整 AgentState (置为 RESUMED)11将补数结果装配为 tool_call_id 的观测输出 (role: tool)12无缝拉起第 N+1 步后续章节撰写与指标测算13继续推进直至最终规划成果交付14发改委业务干部
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

核心工程防御机制:

  1. 状态机全现场原子落盘:会话挂起时,系统完整持久化结构化业务变量、messages 轨迹、活跃专家角色配置及门禁上下文快照,支持任务跨节点与长周期后的精准恢复;
  2. HMAC-SHA256 签名与时效防护:签发的 AsyncHandleToken 包含任务 ID、节点标识与时效戳,外部回调到达时,网关严格执行秘钥验签与 72 小时过期判定,严禁任何伪造的“审批通过”或恶意注入;
  3. CAS 乐观锁防重复投递:利用数据库原子条件更新(UPDATE task_state SET status='RESUMED' WHERE token=? AND status='SUSPENDED'),面对外部网络超时导致的多次重试回调,仅首次处理成功,后续自动拦截忽略,实现绝对幂等。
2.4.1

从线性调用升级为图

State 是单一事实源,Node 只读状态并返回 Delta,Edge 承担路由。分支、重试和并发变成可见拓扑,支持逐步快照与回放,避免控制流藏在节点内部。

+
原文依据 / 白皮书 § 2.4.1保留技术细节,便于核对

在很多早期大模型应用开发中,开发者最直观的写法通常是将多个步骤以线性流水线的方式串联起来(即所谓的“链式调用”或 LCEL 链):

# 链式调用的脆弱原型
raw_data = step1_fetch_county_data(county_code)
diagnosis = step2_diagnose_bottlenecks(raw_data)
final_report = step3_generate_policy_outline(diagnosis)

这种模式在原型验证期简单直观,但在进入真实复杂的严肃县域经济治理场景后,线性链式调用遭遇了三项确定性的系统工程瓶颈:

  1. 条件分支导致代码结构膨胀:真实政务研判绝非单向流水线。若宏观指标出现异常预警,需动态分流至瓶颈诊断分支;若主导产业数据缺损,需分流至部门补数审批分支。链式调用必须借由多层嵌套的 if-else 实现,业务逻辑被大量的控制流胶水代码彻底淹没,每次新增产业规则都会引发全局回归缺陷;
  2. 无法原生表达循环、自省与自愈重试:当生成的一县一策方案在质量门禁中被驳回时,系统必须捕获未达标项并带着审查补丁返回前置节点重新修订。链式调用必须在外部包裹命令式 while True 循环,使重试逻辑散落为黑盒暗箱操作,破坏了链路追踪并极易发生死锁;
  3. 隐式状态传递导致数据契约与快照能力丧失:线性调用依赖局部变量在内存调用栈中层层传递。当流程延伸到第 10 步时,根本无法明确当前节点到底依赖前序哪些字段;且一旦由于网络抖动发生异常,局部变量随调用栈释放而彻底蒸发,系统无法实现断点续跑。

为此,系统从底层彻底摒弃线性链条,全面进化为基于有限状态机(Finite State Machine)与计算图(Computation Graph)的 LangGraph 架构,确立了控制权反转(Inversion of Control, IoC)的三大核心元语:

100%
LangGraph 图状态机解耦架构分数 < 80 (自纠反向边)连续超限门禁通过增量 Delta / 快照增量 Delta / 快照增量 Delta / 快照全局强类型状态容器(State)Single Source ofTruth不可变快照 +Reducer 增量合并数据采集与校验节点(Node A)纯函数: (state) ->delta只读输入,无局部副作用产业瓶颈诊断节点(Node B)纯函数: (state) ->delta独立沙箱执行专家质检门禁节点(Node C)纯函数: (state) ->delta输出结构化审查分数条件路由边(Conditional Edge)控制权反转核心外置声明式拓扑跳跃人工专家介入挂起规划编制流转
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

状态图三大核心工程基石:

  1. State(单一事实源状态容器): 以 Pydantic 强类型声明全局 CountyEconomyState,定义明确的数据契约与 Reducer 规则。所有节点只从该状态读取上下文切片,节点之间严禁直接通过内存对象隐式传参;
  2. Node(纯函数原子节点): 每一个节点都是独立的纯计算单元,函数签名统一约束为 (state: ReadOnlyState) -> dict。节点内部严禁原地修改(In-place Mutation)入参状态,仅计算并返回局部的增量差异(Delta),由 LangGraph 运行时 Reducer 安全合并,确保每个执行步具备确定性的快照生成与时间旅行(Time Travel)回溯能力;
  3. Edge / Conditional Edge(控制权反转的拓扑边): 节点自身不包含任何“下一个调用谁”的控制流逻辑。所有的条件跳转与重试回路被单独外置于条件边中(add_conditional_edges)。控制权从节点内部反转至图引擎,使整条业务链的执行拓扑在编译期即可一览无余,支持渲染为可视化拓扑并流式捕获单步快照;
  4. Topological Fan-out / Fan-in(拓扑层级的一等公民并发扇出与汇聚): 将 15 个统计指标库、重点项目库与规上企业库的并发查询,从单节点内部命令式 asyncio.gather 封装升维为图拓扑结构上的并发分支,赋予每个并行数据分支独立的超时熔断、独立重试与全链路可观测性。
2.4.2

状态生命周期与 Reducer

必填输入、中间 Optional 字段、最终交付句柄分层建模。列表按 evidence_id 去重追加,大 DataFrame 留在节点内;下游安全访问缺项并显式降级。

+
原文依据 / 白皮书 § 2.4.2保留技术细节,便于核对

在 LangGraph 状态图的生产演进中,针对长链路任务中数据混乱、状态覆盖和内存膨胀问题,团队确立了三项关键的状态工程规范:

1. 状态模型的三态生命周期分层(Three-Tier State Lifecycle)

严禁将所有字段扁平杂糅在单个字典中。CountyEconomyState 严格区分为三个正交生命周期阶段:

  1. 外部必选输入(Required Inputs):启动任务时由客户端传入的确定性元数据(county_code, target_year, workflow_id);
  2. 阶段加工中间态(Intermediate Optional):由各工位节点逐步计算出的特征、指标与诊断事实,必须显式声明为 Optional 并附带默认初始值(None);
  3. 最终交付产物(Deliverables):送审规划草案、政策矩阵、招商清单等最终文件句柄。
from typing import TypedDict, Optional, List, Annotated
import operator

class MultiTierCountyState(TypedDict):
    # --- 1. 外部必选输入 ---
    county_code: str
    target_year: str
    workflow_id: str

    # --- 2. 过程加工中间字段 (强制声明为 Optional) ---
    is_valid: bool
    error_message: Optional[str]
    macro_metrics_snapshot: Optional[dict]
    bottlenecks_identified: Optional[List[dict]]
    enterprise_supply_chain: Optional[dict]

    # --- 3. 最终交付产物与审计流 ---
    final_policy_matrix_excel: Optional[str]
    audit_trace: Annotated[List[str], operator.add]

2. 显式 Reducer 规约策略与业务去重合并(Deduplicated Reducer)

LangGraph 底层对状态的默认更新机制为浅层字典覆盖(Shallow Merge)。对于列表型容器(如历史消息 messages 或事实证据 evidence_list),若未配置 Reducer,后续节点返回同名键时将直接抹除前序节点积累的所有历史数据。 系统对所有列表容器强制施加 Annotated 规约修饰,并针对业务证据链开发了基于唯一业务主键(evidence_id)的自动去重 Reducer:

def deduplicate_evidence_reducer(current: List[dict], new_items: List[dict]) -> List[dict]:
    """工业级业务证据链去重追加 Reducer"""
    merged = {item["evidence_id"]: item for item in current}
    for item in new_items:
        merged[item["evidence_id"]] = item
    return list(merged.values())

class RobustCountyState(TypedDict):
    messages: Annotated[List[dict], operator.add]
    evidence_list: Annotated[List[dict], deduplicate_evidence_reducer]
    audit_trace: Annotated[List[str], operator.add]

彻底保障了多节点接力过程中,前序数据治理专员查出的核心指标与后续归因专家追加的调研证据得以无缝、无损增量累加。

3. 临时密集计算状态作用域隔离(Transient State Scoping)

在计量模型分析师(quant_model_analyst)运行偏离份额分析(SSA)或多元回归时,涉及上万行原始 DataFrame 与高维协方差矩阵。系统严格实施局部瞬态隔离:中间运算大对象仅在节点内部函数作用域存活,节点向外返回字典前强制经过 Pydantic Schema 白名单过滤,只允许轻量级结构化指标摘要(Summary Cards)回传合并至全局 State,杜绝 Checkpoint 快照网络拥塞与序列化阻塞。

4. 下游节点防御性安全访问守则(Defensive State Accessor)

下游专家节点严禁使用直接下标(如 state["enterprise_supply_chain"])强行取值,强制采用 state.get() 并配置缺数降级逻辑:

def downstream_policy_node(state: MultiTierCountyState) -> dict:
    bottlenecks = state.get("bottlenecks_identified")
    if not bottlenecks:
        return {"audit_trace": ["downstream_policy: 前序瓶颈分析缺项,启用普惠兜底政策框架"]}
    return {"final_policy_matrix_excel": generate_matrix(bottlenecks)}

从代码层面彻底消灭因前置接口超时或缺数引发的 KeyError 异常硬崩溃。


2.4.3

路由必须有可用的出口

Literal 枚举约束意图,path_map 明确目标节点。前置参数错误直接收口;审查通过继续、失败定向重试、累计 3 次转人工,防止无限回环。

+
原文依据 / 白皮书 § 2.4.3保留技术细节,便于核对

为实现复杂业务流转的极致可控与可审计,系统将动态条件分支(Conditional Edges)全面升级为工业级拓扑控制中枢:

1. 基于 Pydantic Literal 受控枚举的强类型结构化路由决策

严禁大模型以自然语言自由文本决定下一步走向。意图分流与阶段路由节点强制通过 with_structured_output 绑定受控字面量枚举,并在装配条件边时显式传入 path_map 映射字典:

from pydantic import BaseModel, Field
from typing import Literal

class StructuredRouteDecision(BaseModel):
    intent_branch: Literal["monitoring", "industry_diagnosis", "policy_decision", "out_of_scope"] = Field(
        ..., description="严格从预定义的四个业务分支枚举中选择最匹配的一项"
    )
    confidence: float = Field(..., ge=0.0, le=1.0)
    routing_reason: str

# 显式映射表,在 compile() 阶段触发严格静态校验
builder.add_conditional_edges(
    source="intent_router",
    path=evaluate_route_branch,
    path_map={
        "monitoring": "monitoring_report_chain",
        "industry_diagnosis": "industry_diagnosis_chain",
        "policy_decision": "policy_decision_chain",
        "out_of_scope": "graceful_exit_node"  # 显式兜底逃生通道
    }
)

彻底杜绝了模型偶发输出“我认为属于招商”等非标字符串导致的运行时 KeyError,并在编译期保障了拓扑中所有目标节点的 100% 存在性。

2. 节点单一职责与计算/拓扑解耦(严格控制权反转)

节点函数内严禁使用命令式 if-else 直接跨工序调用下游子业务,彻底拆解复合庞杂的“上帝节点”(God Node)。节点保持高内聚纯函数,专注于单一原子工序(如:纯 I/O 数据抓取 o o 纯 CPU 清洗 o o 计量算法计算 o o LLM 报告撰写 o o 事务持久化),所有条件分流上浮为拓扑图上的条件边声明。这赋予了系统灵活插拔节点、细粒度单独单测、以及出错原地局部重试的卓越工程弹性。

3. 前置校验快速失败即时短路熔断(Fail-Fast Circuit Breaker)

在顺序子流程中,前置输入校验节点(validate_input)之后配置条件边。一旦发现区划代码错误或核心年份缺失(is_valid == False),条件边立即短路直达错误收口节点,跳过中间所有重型分析与大模型调用。从原本让后续 5 个节点各自手写 if not is_valid: return {} 贯穿空转的“幽灵空跑(Phantom Passthrough Runs)”,升级为毫秒级快速失败响应。

4. 环形自纠回路的多阶逃生通道(Cyclic Loop Escape Hatch)

在质量门禁驳回并指回前序节点重新修订的环形自省回路(Cyclic Graph)中,路由函数严格与全局状态中的 review_retry_count 计数器强绑定,配置多阶逃生通道:

def route_with_escape_hatch(state: MultiTierCountyState) -> str:
    if state.get("review_passed", False):
        return "approved_continue"
    retries = state.get("review_retry_count", 0)
    if retries >= 3:
        # 重试达 3 次上限,触发一级逃生:挂起并升级发改委专家在线核准
        return "escalate_to_human"
    return "retry_revision"

builder.add_conditional_edges(
    "review_gate_node",
    route_with_escape_hatch,
    {
        "approved_continue": "next_stage_planning",
        "retry_revision": "generator_node",          # 受控环形反向边
        "escalate_to_human": "human_approval_node"   # 刚性逃生通道,杜绝死锁
    }
)

坚决阻断任何因模型理解死结引发的无限循环与 GraphRecursionError(递归超限)崩溃。


2.4.4

让长任务每一步都可见

app.stream / astream 将节点增量通过 SSE 或 WebSocket 推送。前端可看到正在做什么,运维可以关联工位耗时、输出字段和 Trace,减少误判卡死后的重复提交。

+
原文依据 / 白皮书 § 2.4.4保留技术细节,便于核对

在生产环境任务调度与 API 交付网关中,针对长长业务链运行,系统确立了全面的流式事件驱动架构(Streaming Event-Driven Execution):

  1. 彻底废除全量同步阻塞 invoke():在长达 30 分钟的 9 条业务链执行中,若仅使用 invoke() 同步等待最终 State,会导致业务系统前端长时间白屏,用户误判为卡死而频繁重复刷新,触发并发任务雪崩;
  2. 落地 app.stream() / astream() 逐工位流式事件广播:通过 Server-Sent Events (SSE) 或 WebSocket 向前端领导驾驶舱实时推送工位级状态事件,每一个 Node 完成计算即时广播增量 Delta 与进度百分比;
  3. 毫秒级单步审计(Audit Trace Streaming):运维监控系统流式监听每个工位的产出键名与执行耗时,结合 OpenTelemetry 实时生成细粒度分布式 Span,实现长程多步骤调度的全透明可观测性。

2.4.5

并发快,也要合得回来

无依赖的能耗、产业链、财税和专利评估并行展开。Semaphore=5 控并发,分支独立超时返回缺数标记,深度合并 Reducer 保留嵌套子键;有依赖的步骤仍串行。

+
原文依据 / 白皮书 § 2.4.5保留技术细节,便于核对

在主导产业错位发展规划与招商多维研判等重型业务链中,任务包含多个彼此无数据依赖的独立子工序(例如:同时评估产业能耗承载力、产业链缺环断点、财政税收贡献与规上企业技术专利)。 系统从传统的串行流水线全面升维至受控 Fan-out(扇出并发)与弹性 Fan-in(扇入汇聚)拓扑架构,将端到端延迟从累加模型 ttotal=∑i=1ntit_{\text{total}} = \sum_{i=1}^n t_i 压缩至木桶极限 ttotal≈max⁡(ti)t_{\text{total}} \approx \max(t_i)。

100%
Fan-out 并发扇出 (受控Semaphore=5)Fan-out 并发扇出 (受控Semaphore=5)Fan-out 并发扇出 (受控Semaphore=5)Fan-out 并发扇出 (受控Semaphore=5)Fan-in 弹性汇聚 (带超时降级)Fan-in 弹性汇聚 (带超时降级)Fan-in 弹性汇聚 (带超时降级)Fan-in 弹性汇聚 (带超时降级)准备与任务分派节点(prepare_dispatch)产业能耗承载评估(eval_energy)产业链缺环诊断(eval_supply_chain)财税效益测算(eval_fiscal)龙头企业专利画像(eval_patents)综合规划决策仲裁(aggregate_decision)后续章节编排流转
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

高并发生产级四大约束与工程落地:

  1. 信号量受控扇出(Semaphore-bounded Fan-out 防 429 限流雪崩): 在单次任务并发扇出 10~15 个大模型评估工位时,瞬时高频请求极易打满云端大模型服务商的 TPM(Tokens Per Minute)与 RPM 限制,触发 HTTP 429 报错风暴。系统在并发层注入全局 asyncio.Semaphore(5) 信号量网关,动态控制活动并发 Worker 上限,既享受并行加速,又坚决防止配额击穿;
  2. 弹性扇入与木桶短板治理(Elastic Fan-in & Straggler Mitigation): LangGraph 原生要求聚合节点等待所有上游完成。若某一外部数据源(如外部商业企业库)突发慢查询(耗时 40s),会导致其余仅耗时 1s 的节点全部被动停滞。系统为每个并发子分支设置独立硬超时(如 8s):超时未响应的工位自动返回预设的缺数降级切片({"status": "timeout_fallback"}),驱动聚合节点准时执行,消灭单点木桶短板;
  3. 嵌套字典深度合并规约器(Deep Merge Dict Reducer): 并发节点向全局状态提交复杂结构体时,传统的浅层字典更新会导致后完成节点覆盖先完成节点的子键。系统定制了递归深合并 Reducer:
    def deep_merge_dict_reducer(current: dict, delta: dict) -> dict:
        """支持并发节点安全合并复杂字典的多级键值"""
        result = current.copy()
        for k, v in delta.items():
            if k in result and isinstance(result[k], dict) and isinstance(v, dict):
                result[k] = deep_merge_dict_reducer(result[k], v)
            else:
                result[k] = v
        return result
    
    class ParallelCountyState(TypedDict):
        dimension_evaluations: Annotated[dict, deep_merge_dict_reducer]
        review_traces: Annotated[List[str], operator.add]
    从底层杜绝了并发写入时的键覆盖与状态覆盖事故;
  4. 运行时严格无隐式数据依赖(No Intra-Stage Cross Dependency): 同一扇出层级的并发节点在运行时彼此完全物理隔离。凡存在计算前后序依赖的步骤,强制通过拓扑边串行编排,杜绝并发竞争。


2.4.6

长研报分四个工位生成

提纲 → 章节扩写 → 指标交叉核验 → 公文润色。各工位有独立字段,结构先由代码检查,语义再由模型检查;重试注入具体 critique_feedback,进度通过流事件呈现。

+
原文依据 / 白皮书 § 2.4.6保留技术细节,便于核对

在县域决策支持场景中,生成《县域特色产业深度评估白皮书》(万字级)、《招商引资全景图谱》等重型政务交付物具有结构复杂、指标密集、因果链长与公文严谨等刚性特征。 早期若采用单次全量生成(One-shot Generation),大模型在超长上下文中面临严重的注意力稀释(Attention Decay)、后半段内容草率缩水甚至因 Max Output Tokens 溢出而被物理截断;且一旦前序指标存在偏差,整篇报告全盘报废,重跑耗费数万 Token 与上百秒时间。

系统基于 LangGraph StateGraph 全面落地 Prompt Chaining 工业级四阶分步流水线,将重型任务解耦为“提纲规划 →\rightarrow 章节扩写 →\rightarrow 指标交叉核验 →\rightarrow 行政公文润色”四个单一职责工位,并引入两段式确定性质检门禁与反思注入重试回路。

100%
结构缺项 / 规则拦截 (带反思注入)重试超限 (retries = 3)质检通过指标口径冲突 (带反思注入)核验通过任务触发与事实证据就绪1. 提纲规划工位(outline_planner)大纲两段式门禁(gate_outline)降级备选模板 /专家接管2. 章节分步扩写工位(section_expander)3. 指标交叉核验工位(data_cross_checker)事实性门禁(gate_factual)4. 行政公文润色工位(document_polisher)终稿持久化与下发(final_report)
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

Prompt Chaining 生产级四大核心设计与落地规范:

  1. 工位单一职责与显式状态切片隔离(Single Responsibility & State Field Isolation): 在全局状态 CountyReportState 中为每个工位开辟专属持久化字段,坚决避免跨步骤隐式字符串拼接或覆盖:
    from typing import TypedDict, Dict, List
    
    class CountyReportState(TypedDict):
        topic: str                       # 研报主题(如:成渝双城经济圈某县产业错位研判)
        outline: str                     # 第一步产出:结构化大纲与三级目录
        section_drafts: Dict[str, str]   # 第二步产出:按章节隔离的正文初稿
        cross_check_logs: List[str]      # 第三步产出:硬数据与政策事实交叉核验日志
        critique_feedback: str           # 质检驳回时的结构化反思修正建议
        outline_retries: int             # 提纲规划重试计数器
        final_report: str                # 第四步产出:终审定稿公文
  2. 两段式混合质检门禁(Two-Stage Hybrid Quality Gate): 彻底杜绝将所有质量判断盲目甩给大模型的反模式,实施分级阻断:
    • 第一阶(纯代码确定性 Fast-Fail):利用毫秒级 Python 正则与结构化规则,刚性断言小节数量(≥4\ge 4 个)、三级指标槽位覆盖率(工业增加值、能耗双控、规上企业专利等非空),失败时立即拦截,零 Token 消耗;
    • 第二阶(大模型语义对齐门禁):仅在第一阶规则通过后,调用轻量语义判别器核验论点与国家宏观产业政策导向的契合度。
  3. 反思反馈注入的定向自纠回路(Feedback-Injected Reflection Loop): 条件边驳回时不进行“盲目重试”。质检节点在 state["critique_feedback"] 中沉淀具体驳回诊断(如:“缺少工业用电量与规上工业增加值剪刀差分析”)。重试工位动态将该反馈组装至 Prompt,驱动针对性弥补缺陷,阻断同质化连续翻车。
  4. 状态增量事件流与长任务进度可观测(State-Driven Stream Observability): 万字研报生成通常耗时 40~90 秒。系统通过 app.stream() 捕获逐工位状态增量事件,通过 SSE 向前端看板实时广播当前工位进度(“正在规划大纲...”、“正在扩写第二章...”、“正在核验统计数据真实性...”),彻底杜绝前端超时与用户焦虑。

2.4.7

统一管理云端与内网模型

数据分级决定模型路由,未公开敏感数据留在内网。统一连接池和消息协议适配异构模型,Pydantic 接收结构化结果;节点重试耗尽写错误标记并进入备用路径。

+
原文依据 / 白皮书 § 2.4.7保留技术细节,便于核对

县域经济智能分析与协同决策平台在实际严肃政务落地中,面临双重严苛挑战:

  1. 宏观与开放分析诉求:宏观战略对齐、长文本综合研报撰写等重型任务,需要依赖前沿云端商业模型(如 DeepSeek-V3 / Qwen-Max / GPT-4o)的高阶推理与超长上下文能力;
  2. 政务合规与数据涉密底线:区县级未公开财税底表、涉密企业财务、重点项目投资明细及信访维稳信息,受到《数据安全法》与政务数据分类分级红线的严格约束,数据物理严禁出内网,必须强制路由至政务私有云内网部署的开源模型集群(如 vLLM 托管的 Qwen-2.5-72B / 14B、Ollama 离线推理实例)。

为解决异构模型差异、公私网环境切换与突发网络抖动问题,系统确立了异构模型统一纳管与运行时韧性架构。

100%
异构模型管理层 (Singleton Connection Pool)LangGraph 运行时节点与状态机重试恢复成功重试耗尽is_error == Trueis_error == False公开宏观研报 / 超长上下文未公开财税 / 企业敏感数据单例连接复用工位计算节点(Worker Node)异常捕获与就地指数退避 (1s, 2s, 4s)状态机错误标记沉淀(is_error, fallback)条件边弹性容错路由兜底规则生成 /本地离线模型切流正常后续工序流转数据涉密分级与模型网关 (ModelGateway)云端商业 API 连接池(DeepSeek / QwenMax / GPT-4o)Keep-Alive /max_retries=2 /timeout=30s政务内网私有推理集群 (vLLM / OllamaQwen-2.5)OpenAI 兼容协议 /ChatHuggingFace模板适配
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

异构模型纳管与运行时韧性四大工程规范:

  1. 长连接池生命周期管理与单例托管(Managed Singleton Connection Pool): 彻底禁止在节点函数内部动态执行 llm = ChatOpenAI(...)。服务启动时由工厂统一初始化全局 ModelClientPool 单例,预分配 HTTP 连接池并启用 TCP Keep-Alive。这消除了单次调用 80~150ms 的 TLS 握手开销,并在并发扇出(15+ 节点)时避免操作系统端口耗尽(防范 TIME_WAIT 堆积导致的 Cannot assign requested address);
  2. 异构模型统一协议抽象与 Tokenizer 模板自动适配(Unified Chat Protocol & Tokenizer Adapter): 上层业务节点纯粹依赖标准 ChatPromptTemplate 与 SystemMessage / HumanMessage 对象进行交互,严禁在业务代码中硬编码任何特殊 Token(如 [INST]、<|im_start|> 等)。底层通过 ChatHuggingFace 与兼容 OpenAI 标准的 /v1 端点(vLLM),由驱动层自动读取各开源模型(Qwen、Mistral、Llama-3)对应的分词器特殊标记映射规则,保障多模型无缝热插拔切换且永不发生格式错位;
  3. 强类型结构化输出驱动(Structured Output Binding): 全面采用 with_structured_output(PydanticModel) 替代传统的自然语言输出加脆弱正则匹配。对审查意见、风险评分、提取实体进行编译级模式约束,直接与 LangGraph TypedDict 无缝对齐;
  4. 节点级抖动退避重试与带标记的弹性降级分流(Node-level Backoff & Error State Routing): 节点内部封装基于 Jitter 的指数退避重试机制(1s→2s→4s1s \rightarrow 2s \rightarrow 4s),平滑吸收云端抖动与瞬时 429。重试全部耗尽后,节点捕获异常并将 {is_error: True, error_msg: "...", fallback_result: "..."} 写入状态机,禁止向上裸抛未捕获异常导致整张图崩溃。下游条件边检测到异常标志时,自动分流至备用离线规则节点或发出告警通知,保障工作流平稳执行。

3.1

数字与政策走不同通道

硬指标通过参数化 SQL 取得精确值、年份、来源和口径。政策与纪要经元数据过滤、混合检索和重排取回切片,两路在 Evidence Context 汇合后才进入分析。

+
原文依据 / 白皮书 § 3.1保留技术细节,便于核对

数据层坚持硬指标与软知识物理隔离原则:

  • 硬数据走关系型数据库(PostgreSQL):GDP、工业增加值、固投、企业税收等指标必须精确查询结构化数据,保留年份、来源与统计口径。严禁大模型从向量片段中“推测”数值;
  • 软知识走向量知识库(Dify RAG):政策文件、规划指导、调研访谈、会议纪要等非结构化文本,通过 RAG 提供背景支撑与政策溯源。
100%
统计指标 / 财税 / 企业数据政策法规 / 规划背景 / 调研事实业务分析指令意图与证据类型识别硬数据通道(PostgreSQL)软知识通道 (DifyRAG)参数化 SQL 查询 /视图聚合四维元数据过滤(Domain/Type/Period/Level)向量召回 +中文分块gte-rerank-v2重排序证据融合上下文(Evidence Context)受控分析与报告生成
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
3.2

先把数据底座清楚地建起来

年鉴库包含 1952—2024 年数据、925 地区、970 张标准表和 324,539 条记录;企业库覆盖 21 市州、22,119 家企业。覆盖矩阵用于发现缺口,原文 9,150 单元的指标维度未说明。

+
原文依据 / 白皮书 § 3.2保留技术细节,便于核对
  • 宏观统计年鉴库:清洗导入 1952—2024 年全省统计数据,覆盖 925 个地区、970 张标准表、324,539 条结构化记录;
  • 企业工商数据底座:清洗入库 21 个市州 22,119 家重点企业工商登记、行业分类与经营范围;
  • 全省 183 县数据覆盖度矩阵:建立 183 县 × 5 年指标覆盖矩阵(9,150 单元),精准识别各县数据缺口,自动派发《部门补数清单》。
3.3

427 份资料如何变成可检索知识

12 个专题库承载约 254 万字。多模态解析、标题重建、纪要清洗、5 域语义目录、四维过滤和上下文前缀先改善原料;GraphRAG 做多跳与宏观检索,Vector/BM25 经 RRF 和 rerank 选出证据。

+
原文依据 / 白皮书 § 3.3保留技术细节,便于核对

项目构建了 12 个专题知识库(收录 427 份核心文档,约 254 万字):

  • KB-510283(隆昌试点县专属资料库,136 份)
  • KB-POLICY-NATIONAL / KB-POLICY-PROVINCE(国家/省级政策法规)
  • KB-INDUSTRY(重点产业链规范与技术路线)
  • KB-MEETING(政企调研纪要与现场访谈)
  • KB-SCHEMA(数据库 206 张表结构定义与技术字典)等。

在建设过程中,团队实施了一系列高难度的知识工程治理:

1) 多模态解析流水线

针对政府部门提供的扫描件 PDF、复杂红头文件、合并单元格 Excel:

  • MinerU:负责复杂排版 PDF、图文混排及扫描件 OCR 识别;
  • MarkItDown:处理标准 Word、PPT 及 HTML 文件转 Markdown;
  • Jina Reader:抓取并抽取官方政策网页文本;
  • Pandas / Openpyxl:专门拆解复杂 Excel 合并单元格,补齐层级维度后再行入库。

2) 文档结构化重塑与分块优化(解决检索稀释)

  • 政府工作报告分块治理:原文档缺乏标准 Markdown Heading,Dify 原生层级分块退化为按字符粗暴截断,产生 ~2000 字超大文本块。团队编写预处理脚本,利用正则自动将中文层级标记(如“一、”“(一)”)转换为 ## / ### 标题,同时剥离尾部名词解释为独立附录。
    • 效果:2025 年报告从 12 段(均长 1,855 字)优化为 23 段(均长 720 字),>1,500 字超大段从 6 个降为 0,语义召回精准度大幅跃升。
  • 会议纪要噪音清洗与知识重建:原录音转写稿充斥口语词(“嗯、啊、哈哈”)、时间戳和琐碎短句,检索召回率几乎为 0。开发专用清洗脚本,剔除噪音、合并自然段并提取高频经济实体关键词,以层级模型重新入库,语义相似度从 0 提升至 0.67~0.75。

3) KB-SCHEMA 业务域表目录语义桥接(0 命中到 0.815 分)

面对 206 张数据库表结构文档,用户提问“隆昌 GDP 数据在哪个表”时,与纯技术 DDL 存在巨大的语义鸿沟。 团队构建了 5 个业务域语义索引文档(经济GDP人口、工业企业科技、农业财政投资、商贸金融民生、县域综合速查),建立从业务术语到物理数据表名的对齐映射,表结构检索命中得分从 0 提升至 0.815。

4) 四维元数据过滤与混合检索落地

为 427 份文档批量打上结构化元数据:

  • domain(宏观经济、工业经济、农业农村、财政金融等)
  • data_type(统计公报、政府工作报告、政策法规、调研纪要等)
  • data_period(年份标注)
  • level(国家级、省级、市州级、县级)

检索时在 Dify 侧执行“前置元数据硬过滤 + 向量检索 + gte-rerank-v2 重排序”,彻底解决跨年份、跨地域检索串扰问题。

5) Contextual Retrieval:上下文增强切片前缀工程(彻底攻克代词孤立)

传统切片直接将切分后的文本块转为向量,导致切片严重脱离父文档层级。在政务材料中,大量出现“我市”、“该主导产业”、“上述重点工程”等代词或省略主语,一旦被孤立切开,向量检索极易出现“张冠李戴”的致命串扰。 系统在离线解析流水线中引入 Contextual Retrieval:利用轻量模型为每个原子 Chunk 预先生成 50~100 字的全局层级与主题定位前缀(Context Prefix):

[文档上下文定位前缀]: 本段属于《隆昌市制造业高质量发展规划(2021-2025)》第三章第二节玻陶产业,论述重点耐火材料与日用陶瓷向特种工业陶瓷转型的技改支持政策
[原始正文内容]: 为鼓励上述骨干企业实施窑炉智能化改造,市财政按设备投资额的 15% 给予专项奖补,单个项目最高不超过 300 万元...

将前缀与原始正文拼接后再计算 Embedding 与构建 BM25 索引。即使原文只有“上述骨干企业”,向量空间也能精准捕捉其属于“隆昌市玻陶产业特种陶瓷企业”,检索召回率提升显著,且线上检索耗时零增加。

6) GraphRAG:产业链实体知识图谱与双路径分层检索(解决多跳断裂与宏观归纳失效)

面对复杂的产业链错位发展研判,传统向量检索暴露出两大根本性缺陷:

  • 多跳关系断裂(Multi-hop Disconnect):无法穿透“玻陶龙头企业 → 紧缺高纯石英砂原材料 → 跨县供货依赖(宜宾珙县) → 铁路货运场站吞吐瓶颈”等多跳依赖;
  • 宏观归纳失效(Global Blindness):面对“隆昌市主导产业发展的全局战略总定位与十五五转型主线是什么”等高层提问,自底向上的切片检索只能召回零星细节片段,“只见树木不见森林”。

系统构建了 GraphRAG 双路径知识拓扑检索中枢:

100%
2. 在线双路径分层检索 (Dual-Route Search)1. 离线图抽取与社群聚类宏观归纳 (战略定位/产业全局)微观穿透 (产业链断点/跨县依赖)427份政务规划与调研纪要LLM提取实体与关系三元组(县域-产业-龙头企业-核心产品-原料-政策文号)县域产业链拓扑知识图谱Leiden图社群聚类算法生成多层级宏观社群摘要 (CommunitySummaries)用户研判指令宏观总览 vs实体多跳?Global Search:并发扫描高层社群摘要(彻底避免扫描数千局部切片)Local Search:沿实体图边拓扑扩散1~2 度(整包拉取上下游依赖链路)
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  • Global Search(全局宏观路径):直接在 Leiden 算法聚类生成的预计算社群摘要上并发扫描,耗费极少 Token 即可输出高屋建瓴的全局战略归纳;
  • Local Search(局部拓扑扩散路径):从用户问题中识别核心产业/企业种子实体,沿知识图谱边向外扩散跳跃 1~2 度,整包提取包含关联实体、供求依赖及政策约束的拓扑子图,实现对产业链卡脖子断点的精准穿透。

7) RRF 倒数排名融合算法(Reciprocal Rank Fusion)

生产级检索绝不单独依赖密集向量(Dense Vector),系统构建了 Dense Vector 与 Sparse BM25(对公文文号、企业统一社会信用代码、统计指标代码精确匹配)双路并发召回,并落地 RRF 倒数排名融合算法: RRF Score(d)=∑m∈{Vector,BM25}160+rm(d)\text{RRF Score}(d) = \sum_{m \in {\text{Vector}, \text{BM25}}} \frac{1}{60 + r_m(d)} 其中平滑参数 k=60k=60。RRF 彻底抹平了余弦相似度(0∼10\sim 1)与 BM25 分值(无界)之间的量纲鸿沟,将双路召回的 Top-50 结果按相对名次归一化对齐,粗排筛选 Top-30 后送入 gte-rerank-v2 交叉编码器精排,最终锁定 Top-5 黄金证据注入 Agent 上下文。

3.4

四层记忆,四种生命周期

工作记忆维护当前目标;情景记忆留存任务轨迹;语义记忆保存指标与领域知识;程序记忆固化工作流、技能和工具。长期事实、操作规则和临时上下文各有存储位置。

+
原文依据 / 白皮书 § 3.4保留技术细节,便于核对

大模型本身没有任何跨任务长效状态。为了让系统在处理跨年度、跨部门的复杂研判任务时保持上下文一致与历史溯源,系统将所有异构存储介质映射为标准的四层分层记忆模型:

100%
4. 程序记忆 (Procedural Memory)3. 语义记忆 (Semantic Memory)2. 情景记忆 (Episodic Memory)1. 工作记忆 (Working Memory)按需调用与写入向量召回与 SQL 查询加载流程策略与权限运行时内存 State(CountyEconomyState)当前会话目标 · 待办Todo · 活跃证据 ID· 门禁拦截状态任务审计轨迹与证据链(reasoning_trace.json / PostgresCheckpoint)历史推导记录 ·工具执行入参与Observation 镜像领域知识与结构化事实底座(PostgreSQL宏观指标库 + Dify12 专题知识库)1952-2024年统计数据 ·国家/省政策法规 ·行业研报固化的业务编排规则与工具资产(LangGraph 9 条DAG 状态机 +Hermes SKILL规范)专家 Prompt 范式 ·工具定义 ·质检门禁规则库
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
记忆分层系统物理存储载体存活生命周期访问机制与协议在县域经济业务中的核心用途
工作记忆 (Working Memory)内存字典 / LangGraph 进程运行栈单次任务会话周期全局状态 CountyEconomyState 随步骤自动流转维护当前分析任务目标、步骤进展(todo_list)、当前活跃引用的证据句柄。
情景记忆 (Episodic Memory)PostgreSQL 状态表 / reasoning_trace.json长期持久化按 thread_id 或 task_id 精确检索历史回放记录单次报告推演的完整审计线索,支持断点恢复续跑与专家人工复审时的证据溯源。
语义记忆 (Semantic Memory)PostgreSQL (硬数据) + Dify 向量库 (软知识)永久保存与定时更新SQL 参数化查询 + 四维元数据混合向量检索承载 32.4 万年鉴指标、2.2 万企业库、427 份政策与调研文件,为所有决策提供坚实的事实底座。
程序记忆 (Procedural Memory)Python 代码仓库 / Hermes SKILL.md / MCP 配置代码版本化受控管理按业务链 workflow_id 自动加载对应 DAG 与角色固化 9 条业务链 SOP、16 个角色的审查规范、区位商公式和 6 层门禁校验逻辑。

通过这种严格的四层记忆映射,系统杜绝了“把所有东西都往 Prompt 里塞”的工程坏习惯,实现了工作上下文轻量化、长期事实结构化、业务 SOP 代码化的架构标准。

3.5

消息、上下文、状态、记忆、知识

Messages 是原始协议记录,Context 是单次推理工作集,State 是任务进度,Memory 是跨任务经验,RAG 是外部客观资料。业务事实依 SQL/RAG,操作方法参考 Memory。

+
原文依据 / 白皮书 § 3.5保留技术细节,便于核对

在政务复杂 Agent 系统中,“消息历史”、“工作上下文”、“业务状态”、“长期记忆”与“外部知识”极易被混为一谈。系统确立了清晰的五层数据形态解耦架构:

100%
3. 推理执行层 (Inference Tier)2. 上下文工作集编排引擎 (Context Engine)1. 持久化存储层 (Persistent Storage Tier)只读检索切片沉淀经验与偏好注入实时进度与待办注入原子组安全修剪单次 POST 瞬时计算tool_calls 声明步进更新追加原样消息Dify 向量库 /全文索引【RAG 外部知识】Postgres KV /经验图谱【Memory长期记忆】PostgreSQL 状态表/ Redis【State强类型状态机】Context 瞬时工作集(Prompt + State +Docs +TrimmedMsgs)Messages原始协议历史(role + content原始日志)大语言模型(Inference)Agent Harness 宿主
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
数据形态物理存储载体存活生命周期核心系统职责读写特性与访问机制
Messages (原始消息)关系型数据库 / 日志服务单次会话生命周期严格遵守大模型协议的原样交互历史(role + content + tool_calls)。高频只追加写入,不可随意物理切片断开。
Context (工作上下文)模型显存 / 推理内存单次推理(毫秒级)为当前步骤定向装配的 Token 瞬时计算集:系统指令 + 状态快照 + 检索切片 + 裁剪消息 + 工具清单。推理结束后立即销毁,不承载持久状态。
State (系统状态机)PostgreSQL / Redis / 磁盘任务全流程(小时至天)业务系统的一等公民:强类型结构体,显式记录任务阶段、完成步骤、待办清单、已验证事实与重试计数。步进强读写,支持 OOM 重启后断点 Resume。
Memory (长期记忆)向量数据库 / 经验图谱跨会话、跨任务永久存续沉淀智能体自身的执行经验、专家修正习惯、复盘反思心得(如某类指标的常见口径陷阱)。运行时动态提炼,任务终结后异步写入,新任务按相似度召回。
RAG (外部知识检索)Dify 知识库 / 外部文件外部业务数据生命周期为系统补充未曾在模型权重中包含的私有公文、政策法规、统计标准切片。高频只读,由数据中台和离线流水线维护,不随对话产生副作用。

RAG 与 Memory 的本质分界表:

  • 知识源属性:RAG 属于外部客观世界的公用静态资料(如《隆昌市国民经济和社会发展十四五规划纲要》);Memory 属于智能体在解决历史任务中自身沉淀的主观经验心得(如“处理隆昌统计局 Excel 时,规上工增数据在附表 3 需特殊解析”);
  • 执行副作用:RAG 召回失败只会导致信息缺失,不改变系统控制流程;Memory 若召回错误经验可能导致模型继承历史错误偏好。因此系统确立“业务事实以 RAG 和 SQL 为准,操作方法参考 Memory”的硬性铁律。
3.6

模型每一步究竟看到什么

依序组装固定身份、实时环境、按需技能、已确认状态和近期轨迹。固定前缀避免动态变量破坏缓存;旧观测摘要折叠,工具调用成对裁剪,并在尾部重新强调当前目标。

+
原文依据 / 白皮书 § 3.6保留技术细节,便于核对

在处理严肃政务长程任务时,静态 Prompt 能解决的问题非常局限。同一个大模型,若仅输入单句指令“请评估隆昌装备制造业发展瓶颈”,往往只会产出宽泛套话;而如果在单步推理前为其动态装配了当前区县行政区划、真实系统年份、已消耗的步数水表、细分行业诊断 SOP、已确认的硬指标底表及近 3 轮裁剪轨迹,模型能精准输出穿透统计数据的专业洞见。 系统将大模型的单次推理输入作为动态信息供给链,构建了工业级 Context Engineering 体系:

1. 概念升维:从 Prompt Engineering 到 Context Engineering

维度Prompt Engineering(静态提示词工程)Context Engineering(动态上下文工程)
关注范畴单次调用的自然语言文本(措辞、语气、Few-shot 样例)支撑整个决策生命周期的动态数据供给流水线
数据属性静态为主,通常在代码中硬编码或配置于模板中心高度动态,根据当前运行期状态、外部环境与权限实时计算装配
核心挑战词不达意、模型不听指令注意力稀释(Attention Dilution)、Prompt Cache 失效、信息信噪比失衡

2. 生产级上下文的五层黄金结构(Top-Down Assembly)

100%
动态上下文装配流 (Top-Down Assembly)Layer 1:核心身份与安全基线(Core Persona &Safety Anchors)【固定在最顶部,永远不被裁剪,保障KV Cache 命中】Layer 2:运行时环境状态栏(RuntimeEnvironmentMetadata)【真实时间戳、行政区划、步数水表step_used:4/6、Token 水位】Layer 3:渐进式技能文档(Progressive SkillsDisclosure)【按需动态水合挂载的细分行业 SOP与专属规程】Layer 4:结构化状态机与已确认事实 (ActiveState & Facts)【当前子目标、已确认硬指标底表、已完成里程碑】Layer 5:近期工作轨迹与观测数据 (WorkingTrace &Observations)【近 3轮清洗修剪后的工具调用结果,老Observation 折叠】
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  • Layer 1 绝对不可变(KV-Cache 极速命中): 将最核心的政务发改委专家身份、三大红线(不替代法定统计、不直接定性排名、涉密脱敏)牢牢锚定在 Layer 1 顶部,坚决禁止在此处注入任何动态时间或动态变量,保证大模型供应商的 Prompt Cache 命中率维持在 90%90% 以上,大幅降低 TTFT 延迟与 Token 账单;
  • Layer 2 运行时状态栏注入(Status Line): 大语言模型原生缺乏对现实物理时间的感知,也无法感知外部调度器的预算消耗。系统在 Layer 2 动态注入紧凑的 XML 环境元数据:
    <runtime_environment>
      <current_time>2026-10-09T01:15:00+08:00</current_time>
      <county_context code="510283" name="隆昌市" level="县级市" />
      <budget_meter step_used="4" max_steps="6" tokens_consumed="38500" max_tokens="80000" />
    </runtime_environment>
    当模型在输入中明确感知到 step_used: 5 / 6 时,会产生强烈的预算压迫感与目标收敛意识,主动放弃无序的工具探索,倾向于尽快聚合已有事实输出最终成果;
  • Layer 3 渐进式技能披露(Progressive Skills Disclosure): 严禁将 16 个专家角色涉及的全部行业规章和发改委公文规范全量塞入 System Prompt。初始状态下仅下发技能索引目录;只有当模型分析明确需要时,才触发二级工具动态水合加载详细的 SKILL.md(如玻陶产业诊断 SOP、重点工程策划标准),实现工作集的按需最小化与上下文信噪比最大化;
  • U 型注意力衰减治理与尾部再锚定(Tail Recency Anchoring): 针对 Transformer 模型的“中间迷失(Lost in the Middle)”效应,系统对中段超过 3 轮的历史工具 Observation 实施摘要折叠,并在发送给模型的 messages 最后一项重新追加简明扼要的当前任务强调指令(例如:【决策要求】:请依据上述已确认统计底表,输出结构化章节草案并退出),充分利用注意力的尾部近因效应锁定执行结果。

4 · 导言

业务链共享的执行规范

九条链共享 CountyEconomyState,依次完成输入校验、角色分派、工具调用、受控分析、质量审查与结构化交付。

+
原文依据 / 白皮书第 4 章导言保留技术细节,便于核对

系统将县域经济研判涉及的繁杂业务梳理并固化为 9 条标准业务链(Workflow)。所有业务链由 CountyEconomyState 共享状态驱动,遵循“输入参数校验 -> 角色分派 -> 确定性工具调用 -> LLM分析提炼 -> 质量门禁校验 -> 结构化产物落地”的标准范式。


4.1

数据治理:先确认能用哪些数据

扫描覆盖度,校验一致性与完整性,将缺失字段变成带责任部门的补数任务。最终同时产出治理报告、资产目录和缺口台账;流转部门前人工确认。

+
原文依据 / 白皮书 § 4.1保留技术细节,便于核对
  • 业务定位:全面摸排县域数据底数,核查 183 县在多源部门的数据归集度、口径一致性与缺失度,生成数据资产清单并派发补数任务。
  • 触发短语:数据治理、指标体系、基础普查、数据质量、缺数补数、数据资产
  • 输入参数:必填 county_code(6位区划码)、period(年份);选填 dataset_scope、metric_scope
  • 协同角色:首席经济专家 (chief_economist)、数据治理专家 (data_steward)、报告主编 (report_editor)
  • 依赖工具:query_metrics、check_data_quality、summary_structured、build_data_asset_inventory
  • 交付产物:
    • data_governance_report.md(县域数据质量诊断报告)
    • data_asset_inventory.json(县域数据资产目录)
    • missing_metric_tasks.json(部门补数工单与追溯清单)
  • 复核策略:required_before_department_circulation(向省/市/县部门流转补数工单前必须人工核验确认)
100%
是否通过未通过输入:county_code,period参数与权限校验调用 query_metrics扫描 183县覆盖度矩阵调用check_data_quality执行一致性/完整性校验发现指标缺失或异常?生成missing_metric_tasks 补数清单标记责任部门与缺失年份标记数据就绪状态ready调用build_data_asset_inventory编目资产字典data_steward汇总撰写数据治理诊断报告数据门禁审查输出:治理报告 +资产目录 +补数清单挂起人工复核 /needs_human_review
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.2

运行监测:从指标到复核线索

查询宏观指标并作同比、环比与横向对标,规则生成红黄绿信号,模型解释态势。每个数字核验 PostgreSQL 出处,低置信度或公开发布前复核。

+
原文依据 / 白皮书 § 4.2保留技术细节,便于核对
  • 业务定位:自动提取 GDP、固定资产投资、财税收支、工业增长等宏观总量,进行同比环比、位次排名与多维横向对标,触发红黄绿预警信号并生成监测报告。
  • 触发短语:运行态势、经济运行、监测报告、预警、横向对比
  • 输入参数:必填 county_code、period;选填 compare_group(对标区县组)、metric_scope
  • 协同角色:首席经济专家、数据治理专家、运行监测分析师 (monitoring_analyst)、预警分析师 (warning_analyst)、报告主编
  • 依赖工具:query_metrics、check_data_quality、summary_county、compare_counties、generate_warnings、generate_monitoring_report
  • 交付产物:
    • monitoring_report.md(综合运行监测报告)
    • warning_list.json(红黄绿分级预警台账)
    • data_quality_summary.json(指标质量摘要)
  • 复核策略:required_when_low_confidence_or_public_release(置信度偏低或对外正式发布前必须人工复核)
100%
未通过通过通过存在风险输入:county_code,period,compare_group从 PostgreSQL查询核心宏观经济指标调用summary_county汇总指标表现调用compare_counties横向对标周边区县调用generate_warnings根据统计偏离度触发红/黄/绿预警monitoring_analyst提炼运行态势摘要warning_analyst形成预警成因分析生成monitoring_report.md 草案数字门禁校验(所有数字是否源于PG 并标明口径?)打回修正指标数字引用敏感与发布门禁输出:运行监测报告+ 预警台账挂起待审
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.3

产业诊断:优势需要比较依据

聚合企业、行业和项目数据,用规模、成长、创新、带动、绿色五维和 LQ 描绘产业。检索规划及路线图后形成优势边界;薄弱证据降为线索,不将样本外推为全量结论。

+
原文依据 / 白皮书 § 4.3保留技术细节,便于核对
  • 业务定位:基于五维指标体系(规模、成长性、创新性、带动性、绿色化)对县域重点产业进行深度画像,测算产业区位商(LQ),量化主导产业与同质化竞争风险。
  • 触发短语:产业画像、比较优势、主导产业、产业诊断、同质化
  • 输入参数:必填 county_code、period;选填 industry_line(特定产业赛道)、compare_group
  • 协同角色:首席经济专家、产业战略分析师 (industry_strategist)、产业链分析师 (chain_analyst)、报告主编
  • 依赖工具:query_enterprises、query_industry_metrics、query_projects、query_expert_rules、search_evidence
  • 交付产物:
    • industry_diagnosis.md(主导产业精准诊断报告)
    • advantage_boundary.json(产业比较优势边界矩阵)
    • evidence_gaps.json(佐证数据缺口清单)
  • 复核策略:required_for_advantage_claims(凡做出“具备显著比较优势”的强判断必须由专家最终背书)
100%
证据薄弱证据充分输入:county_code,period,industry_line并发查询:1. 企业工商库(query_enterprises)2. 规上工业指标(query_industry_metrics)3. 重点产业项目(query_projects)测算五维指标与产业区位商 (LQ)识别特色集聚赛道vs 趋同赛道Dify检索:全省产业规划与该产业技术路线图industry_strategist产出比较优势边界chain_analyst标注关键龙头与断链环节生成industry_diagnosis.md 草稿因果与证据门禁校验(是否存在样本外推?优势证据是否充分?)降级为待核验线索,写入 evidence_gaps组装诊断报告与优势边界矩阵输出:产业诊断报告+ 优势边界 +证据缺口
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.4

瓶颈归因:让假设带着核验任务

把监测信号、产业短板与土地、能耗、财政、人才约束交叉分析。输出假设与线下验证任务,未经识别检验的相关性不能升级为确定因果。

+
原文依据 / 白皮书 § 4.4保留技术细节,便于核对
  • 业务定位:将上游的运行监测预警信号和产业短板进行交叉比对,结合土地、能耗、资金、人才等要素约束,提炼“待核验瓶颈假设”与实地调研任务。
  • 触发短语:瓶颈、归因、短板、制约、资源要素
  • 输入参数:必填 county_code、period;选填 focus_area(特定瓶颈领域)
  • 协同角色:首席经济专家、瓶颈诊断专家 (bottleneck_diagnostician)、要素资源分析师 (factor_resource_analyst)、报告主编
  • 依赖工具:query_metrics、query_projects、query_industry_metrics、query_factor_constraints、search_evidence、query_expert_rules
  • 交付产物:
    • bottleneck_report.md(县域发展瓶颈归因诊断报告)
    • hypotheses.json(结构化待核验瓶颈假设集合)
    • verification_tasks.json(线下实地核验任务清单)
  • 复核策略:required_for_causal_claims(严格禁止未经核验的因果性定性结论)
100%
违规因果词合规输入:county_code,period, focus_area加载前置产物:运行预警列表 +产业短板记录调用query_factor_constraints 查询:用地指标、环境承载、财政负债、人才缺口bottleneck_diagnostician构建因果推导树factor_resource_analyst输出要素制约矩阵生成 hypotheses(结构化瓶颈假设)生成verification_tasks(线下核查清单)强逻辑审查门禁(是否将相关性表述为确定性因果?)强行重写为:『显示存在...倾向,需核验』生成bottleneck_report.md输出:瓶颈归因报告+ 待核验假设 +验证任务
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.5

政策决策:从问题连到责任部门

复用监测、产业与瓶颈产物,检索真实政策及申报条件,建立问题 → 政策 → 举措 → 牵头部门矩阵。文号与承诺内容经过审查,正式流转前由法制和业务处室复核。

+
原文依据 / 白皮书 § 4.5保留技术细节,便于核对
  • 业务定位:基于前序运行预警与瓶颈分析成果,检索国家、省、市最新出台的产业扶持政策,梳理政策兑现堵点,生成精准匹配的《政策行动建议矩阵》。
  • 触发短语:政策需求、政策匹配、政策依据、政策矩阵、政策实施、动态优化
  • 输入参数:必填 county_code、period;选填 policy_scope、target_problem
  • 协同角色:首席经济专家、政策规划专家 (policy_planner)、报告主编
  • 依赖工具:load_monitoring_summary、load_industry_diagnosis、load_bottleneck_analysis、search_policy、build_policy_action_matrix
  • 交付产物:
    • policy_decision_report.md(政策梳理与落地建议报告)
    • policy_action_matrix.json(政策行动建议矩阵:含责任部门、政策文号与支持路径)
    • policy_needs.json(对上争取支持的政策需求诉求清单)
  • 复核策略:required_before_policy_circulation(政策矩阵正式呈送政府常务会或发文流转前必须经过法制与业务处室审核)
100%
虚假文号或夸大承诺真实合规输入:county_code,period,target_problem集成上游分析包:监测态势 +产业画像 +瓶颈短板调用 search_policy在 Dify 检索:国家/省级专项扶持政策与申报指南(含文号)policy_planner逐项匹配问题与政策抓手判定适用条件与对上争取空间调用build_policy_action_matrix 构造矩阵:问题 - 对应政策 -实施举措 -牵头部门政策真实性门禁(政策文号是否真实?是否越权承诺资金补贴?)拦截并要求重新检索确切政策条文生成policy_decision_report.md输出:政策建议报告+ 行动矩阵 +向上争取清单
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.6

一县一策:汇聚前序产物再编写

总师设定定位与章节,独立 Worker 使用各自任务包写作。结构、证据、边界和模板适配审查生成修订补丁,通过后导出 Word 送审稿;完整规划展开前先审框架。

+
原文依据 / 白皮书 § 4.6保留技术细节,便于核对
  • 业务定位:县域顶层设计主链。将监测数据、产业优势、瓶颈制约与政策矩阵汇聚为规划底包,通过规划专家 Subagent 协同编排生成完整的《一县一策综合赋能规划方案》及 Word 送审稿。
  • 触发短语:一县一策、赋能方案、规划框架、总体思路、实施方案
  • 输入参数:必填 county_code、period;选填 deliverable_type、planning_scope
  • 协同角色:首席经济专家、政策规划专家、县域规划总师 (county_planning_chief)、规划审查专家 (planning_quality_reviewer)
  • 依赖工具:load_monitoring_summary、load_industry_diagnosis、load_bottleneck_analysis、search_policy、dispatch_county_planner
  • 交付产物:
    • one_county_one_policy_outline.md(一县一策框架大纲)
    • planning_framework_v02.docx(一县一策完整公文 Word 送审稿)
    • planning_quality_review.json(规划质量审查与合规评估表)
  • 复核策略:required_before_full_plan_generation(方案框架必须经专家审签后方可展开撰写完整方案)
100%
否: 存在越权或无依据表述通过输入:county_code,period,planning_scope组装全量上游分析上下文包(宏观指标+优势赛道+瓶颈假设+政策矩阵)county_planning_chief设定规划总体定位与发展主线确立『一县一策』骨架大纲生成章节写作任务包(第一章发展基础 /第二章总体要求 /第三章重点任务...)调用dispatch_county_planner (规划Subagents并行协同撰写)汇总组装长篇规划初稿planning_quality_reviewer启动专项审查:1. 结构完整度 2.证据追溯 3.越权定性 4.样本机械照搬审查得分是否通过?生成章节修订补丁任务调用 Pandoc/Docx导出为标准公文格式输出:规划方案大纲+ Word 送审稿 +质检报告
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.7

招商:从缺环反推机会

由产业链断点匹配上下游企业,再核查园区、土地、能耗和环保承载力。形成机会清单、落地协同任务和项目报告;禁止未经审批的土地与税收承诺。

+
原文依据 / 白皮书 § 4.7保留技术细节,便于核对
  • 业务定位:从产业诊断中的产业链缺失环节(断链、卡脖子环节)逆向倒推,结合重点项目要素保障能力,筛选目标招商赛道,生成可落地的《精准招商方向与要素协同服务清单》。
  • 触发短语:招商、项目筛选、产业链短板、补链、落地服务
  • 输入参数:必填 county_code、period;选填 industry_line、project_stage
  • 协同角色:首席经济专家、产业链分析师、项目招商分析师 (project_investment_agent)、落地协同专员 (landing_service_agent)、报告主编
  • 依赖工具:query_chain_gaps、query_projects、query_enterprises、query_factor_constraints、search_evidence
  • 交付产物:
    • investment_opportunity_list.json(产业链靶向招商机会清单)
    • landing_service_list.json(招商项目落地协同与要素保障任务单)
    • project_report.md(县域重大项目投资分析报告)
  • 复核策略:required_for_project_prioritization(生成任何对外招商优先排序前必须通过发改/招商部门联合确认)
100%
违规承诺合规输入:county_code,period,industry_line调用query_chain_gaps梳理产业链断点与薄弱环节query_enterprises匹配省内外上下游链主与配套企业样本project_investment_agent制定延链补链招商方向landing_service_agent 联动query_factor_constraints核验土地/能耗/环保指标承载力生成落地协同任务清单(土地出让/环评审批/电价扶持)招商合规审查门禁(严禁承诺未经审批的土地/税收倾斜政策)剥离违规承诺,限定为『合规服务流程』输出:招商机会清单+ 落地服务工单 +投资分析报告
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.8

计量分析:先检验能不能算

路由 DID、PSM、面板、空间计量等模型族,检查样本、控制变量和平行趋势。条件不足设为 blocked / needs_data;条件满足才执行,并交付系数、区间与运行元数据。

+
原文依据 / 白皮书 § 4.8保留技术细节,便于核对
  • 业务定位:面向严谨的经济学量化分析需求。集成因果推断(DID/PSM)、面板分析、空间计量与预测预警模型,前置设置严格的“识别条件检验门禁”,防止伪科学因果结论。
  • 触发短语:模型分析、计量模型、统计分析、综合评价、聚类、预测
  • 输入参数:必填 county_code、period;选填 model_family_id、model_method、target_metric、feature_metrics、treatment_field、policy_time、spatial_data_path
  • 协同角色:首席经济专家、数据治理专家、量化模型分析师 (quant_model_analyst)、报告主编
  • 依赖工具:route_model_family、load_model_dataset、evaluate_model_readiness、execute_model_family
  • 交付产物:
    • model_analysis_report.md(计量模型分析与检验报告)
    • model_analysis_result.json(模型回归系数、置信区间与检验值)
    • model_execution_metadata.json(模型输入参数与环境运行记录)
  • 复核策略:required_when_blocked_or_needs_data(数据条件不满足时阻断执行并转入补数任务)
100%
条件不满足满足识别条件输入:county_code,period,model_family_id,treatment_field...调用route_model_family匹配模型族(如 DID因果推断 /综合评价 /空间滞后)调用load_model_dataset 提取面板数据调用evaluate_model_readiness检验前置假设:平行趋势检验?样本量足够?控制变量齐全?状态置为 blocked /needs_data输出《数据不足说明》与补数建议,终止运行调用execute_model_family 执行回归测算quant_model_analyst解释模型系数与统计显著性严格限定解释边界(仅说明净效应估算值)生成model_analysis_report.md输出:模型分析报告+ 回归系数 JSON
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

4.9

治理知识:解释现实中的协同堵点

在财权事权、考核激励、垂直管理与属地责任中解释经济现象,匹配治理机制后生成协同方案。涉及部门权责与体制改革的表述经人工核验。

+
原文依据 / 白皮书 § 4.9保留技术细节,便于核对
  • 业务定位:从基层真实体制运转、财政财权事权、跨部门利益协同与考核指挥棒的视角,深度解析一个县域经济现象“为何产生”、“如何破解”,提供接地气的体制机制建议。
  • 触发短语:县域运转、治理逻辑、真实逻辑、运转逻辑、县域经济与治理、部门协同、真实运转
  • 输入参数:必填 county_code、period;选填 focus_area、mechanism_scope
  • 协同角色:首席经济专家、治理机制分析师 (governance_knowledge_analyst)、政策规划专家、报告主编
  • 依赖工具:match_governance_mechanisms、synthesize_governance_knowledge、render_governance_knowledge_report
  • 交付产物:
    • governance_knowledge_report.md(县域经济与真实治理机制研判报告)
    • governance_knowledge_result.json(匹配的治理运转机制关系图谱与部门协作映射)
  • 复核策略:required_before_policy_or_governance_circulation(涉及部门权责与体制改革表述必须严格人工核验)
100%
不合规表述合规输入:county_code,period, focus_area加载待解析的县域难题(如财政吃紧、项目落地慢、部门推诿等)调用match_governance_mechanisms匹配治理机制:财权事权划分、考核激励、垂直管辖与属地责任调用synthesize_governance_knowledge解析跨部门博弈与堵点成因governance_knowledge_analyst输出现实可行的协同方案(如专班推进机制、飞地园区利益分享机制)行政权责审查门禁(是否符合当前法治与政府职能配置?)修正表述,恪守行政法权边界render_governance_knowledge_report输出:治理逻辑研判报告 +部门协作协同图谱
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

5 · 导言

专家规范的共同契约

每个角色都有 role_id、业务链范围、授权工具、产物格式与判断边界。四个专家组按领域组织,实际执行由状态机按需装配。

+
原文依据 / 白皮书第 5 章导言保留技术细节,便于核对

系统中的 16 个专家角色是在 LangGraph 状态机中按工位装配的领域专家规范(Role Specification),不采用分散独立的聊天智能体形态。每个角色定义了专属的 System Prompt 提示词边界、授权工具集(Allowed Tools)以及负向约束红线。

100%
BaseExpertRole+str role_id+str name+List<str> business_chains+List<str> default_tools+List<str> outputs+str confidence_policy+check_boundary()Macro_and_Governance+chief_economist+governance_knowledge_analyst+factor_resource_analystData_and_Monitoring+data_steward+monitoring_analyst+warning_analyst+quant_model_analystIndustry_and_Investment+industry_strategist+chain_analyst+bottleneck_diagnostician+project_investment_agent+landing_service_agentPlanning_and_Review+policy_planner+county_planning_chief+planning_quality_reviewer+report_editor
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

5.1

宏观与治理:统一判断基调

首席经济专家统筹证据与业务;治理分析师解释部门运作;要素分析师核查资源承载。各自取得有限工具与证据切片,强结论需要主管部门核验。

+
原文依据 / 白皮书 § 5.1保留技术细节,便于核对

1. 县域经济首席专家 (chief_economist)

  • 角色定位:整个智能内核的统筹研判中枢,负责统一业务链判断基调、把控证据边界与最终对外交付口径。
  • 协同业务链:全链条协同(数据治理、运行监测、产业诊断、瓶颈归因、政策决策、规划、招商)。
  • 授权工具集:query_metrics、search_evidence、query_expert_rules
  • 输入要求:用户原始问题、业务链匹配上下文、各专家中间分析草案、证据卡与专家规则。
  • 输出结构:任务归属业务链、可支持结论、不可支持结论、需人工确认事项、最终交付物摘要 (final_decision_brief)。
  • 判断边界与禁止表达:
    • 严禁 在未取得权威多源数据前断言“该县具备绝对比较优势”;
    • 严禁 将政策出台与经济指标回升直接定性为因果关系;
    • 严禁 规则版评分直接作为行政考核排名的结论。

2. 县域治理知识分析师 (governance_knowledge_analyst)

  • 角色定位:负责把县域经济指标、项目、企业、财政、政策放入真实基层治理与行政运转链条中解释,剖析机制成因与跨部门协同堵点。
  • 协同业务链:县域治理知识链、运行监测链、瓶颈归因链、政策决策链、项目招商链。
  • 授权工具集:match_governance_mechanisms、synthesize_governance_knowledge、render_governance_knowledge_report
  • 输入要求:指标与项目线索、部门职能台账、本地治理机制字典。
  • 输出结构:匹配的治理机制、财政/产业/项目/审批链条深度解释、部门协同任务单、证据需求。
  • 判断边界与禁止表达:
    • 严禁 将未经核实的基层线索直接当成行政问责事实;
    • 严禁 越权建议设立未经法律法规授权的机构或审批事项。

3. 要素资源约束分析师 (factor_resource_analyst)

  • 角色定位:专门分析土地、能耗、环境容量、财政资金、人才等硬要素承载力对经济发展的刚性制约。
  • 协同业务链:瓶颈归因链、项目招商链。
  • 授权工具集:query_projects、query_factor_constraints、search_evidence
  • 输入要求:项目要素需求清单、自然资源与生态环境指标、财政可支配财力。
  • 输出结构:要素约束清单、对应指标缺口、部门核验任务 (factor_constraint_summary)。
  • 判断边界与禁止表达:
    • 在未取得自然资源和发改部门正式核准前,不对单项用地或能耗指标作“完全受限、无法推进”的绝对死结论。

5.2

数据与监测:让数字有依据

数据治理、运行监测、阈值预警与计量分析四类角色分别把守入口、态势、线索和识别条件。缺数不能补造,预警不能当作已经发生的风险。

+
原文依据 / 白皮书 § 5.2保留技术细节,便于核对

4. 县域经济数据治理专员 (data_steward)

  • 角色定位:把守数据入口底座,核查指标来源、年份时效、统计口径与缺失度,确保只有合规数据流向下游分析。
  • 协同业务链:数据治理链、运行监测链、模型分析链。
  • 授权工具集:check_data_quality、query_metrics
  • 输入要求:待查县域、年份周期、指标范围、部门上报台账。
  • 输出结构:可用数据清单、数据缺口清单、口径风险提示、部门核验补数事项 (data_quality_summary)。
  • 判断边界与禁止表达:
    • 绝对禁止 补造、猜测任何缺失指标数据;
    • 口径不一致的指标必须强制标注“不可直接对比”。

5. 县域经济运行监测分析师 (monitoring_analyst)

  • 角色定位:基于硬指标数据库生成宏观运行态势摘要、横向同类县域对标与异动归因分析。
  • 协同业务链:运行监测链。
  • 授权工具集:query_metrics、compare_counties、summary_county
  • 输入要求:宏观指标集、历年同期基准、对标区县组。
  • 输出结构:运行态势摘要、核心指标升降表现、横向对比位次、需核验承压点。
  • 判断边界与禁止表达:
    • 只陈述指标客观表现,不替代统计部门进行官方数据核验定调;
    • 严禁从单个短期季度波动轻率推导出“经济全面下滑”等夸大性结论。

6. 县域经济预警分析师 (warning_analyst)

  • 角色定位:基于设定的阈值模型触发红黄绿预警,解释预警成因,明确线下核查方向。
  • 协同业务链:运行监测链。
  • 授权工具集:generate_warnings、query_expert_rules
  • 输入要求:预警规则表、异动指标集合、历史波动阈值。
  • 输出结构:预警事项清单、触发依据说明、建议复核方向 (warning_list)。
  • 判断边界与禁止表达:
    • 预警仅代表“提示复核与风险隐患”,严禁表述为“风险已经发生或失控”。

7. 统计与计量模型分析师 (quant_model_analyst)

  • 角色定位:负责计量模型与因果推断(DID/PSM/空间回归)的严谨算法选型、数据准备度检验与结果边界解释。
  • 协同业务链:模型分析链、运行监测链、瓶颈归因链。
  • 授权工具集:route_model_family、evaluate_model_readiness、execute_model_family
  • 输入要求:微观企业/项目面板数据、政策处理组对照组标签、空间拓扑权重。
  • 输出结构:模型族推荐、识别条件检验报告、回归测算结果、模型局限性说明。
  • 判断边界与禁止表达:
    • 平行趋势检验或样本量不满足时,绝对阻断执行,严禁输出未经检验的“因果净效应”结论。

5.3

产业与招商:从画像走向可行动清单

产业战略、产业链、瓶颈、招商和落地服务五类角色接力工作。分别交付优势边界、断点、假设、机会和服务任务,并守住样本、因果与承诺边界。

+
原文依据 / 白皮书 § 5.3保留技术细节,便于核对

8. 县域产业战略分析师 (industry_strategist)

  • 角色定位:运用区位商与五维指标体系绘制产业画像,研判主导优势、同质化赛道与错位发展方向。
  • 协同业务链:产业诊断链、一县一策与规划链。
  • 授权工具集:query_industry_metrics、search_evidence
  • 输入要求:产业增加值、企业集聚度、专利创新数、周边县域产业目录。
  • 输出结构:产业结构摘要、潜在比较优势边界、短板弱项说明 (advantage_boundary)。
  • 判断边界与禁止表达:
    • 企业样本调研数据不得直接代替全量产业规模;
    • 严禁在缺乏全省同口径横向比对前断言“全省领先”。

9. 产业链关系分析师 (chain_analyst)

  • 角色定位:深入重点产业上下游,识别断链点、卡脖子环节、本地配套率不足与延链补链机会。
  • 协同业务链:产业诊断链、项目招商链。
  • 授权工具集:query_chain_gaps、query_projects、query_enterprises
  • 输入要求:产业链图谱、本地规上配套企业名录、重点在建项目。
  • 输出结构:产业链断点清单、关键链主与配套画像、招商补链切入点 (chain_gap_summary)。
  • 判断边界与禁止表达:
    • 单个企业的产能不足不能直接推断全县全产业链存在重大系统性缺陷。

10. 县域瓶颈归因诊断师 (bottleneck_diagnostician)

  • 角色定位:连接监测预警与产业短板,将表象问题系统归因为“待核验瓶颈假设”。
  • 协同业务链:瓶颈归因链、一县一策与规划链。
  • 授权工具集:query_metrics、search_evidence、query_expert_rules
  • 输入要求:运行预警记录、产业诊断短板、要素瓶颈数据。
  • 输出结构:主要瓶颈假设、影响传导链条、实地核查任务清单 (hypotheses)。
  • 判断边界与禁止表达:
    • 绝对禁止 将表象相关性直接判定为因果定性,所有结论必须以“假设”和“核查线索”形式输出。

11. 项目招商机会分析师 (project_investment_agent)

  • 角色定位:结合产业链短板与要素禀赋,逆向推导靶向招商企业画像与重大产业项目机会。
  • 协同业务链:项目招商链。
  • 授权工具集:query_projects、query_chain_gaps、search_evidence
  • 输入要求:产业链短板清单、产业承载园区规划、外地龙头企业数据库。
  • 输出结构:招商机会方向库、目标企业画像、建议对接清单 (investment_opportunity_list)。
  • 判断边界与禁止表达:
    • 严禁擅自生成未经论证的招商项目优先级排序;严禁代替招商局进行正式可行性定论。

12. 项目落地服务协同专员 (landing_service_agent)

  • 角色定位:把招商意向转化为用地、环评、能耗、审批等政务要素保障工单,梳理跨部门协同职责。
  • 协同业务链:项目招商链。
  • 授权工具集:query_factor_constraints、query_projects、search_evidence
  • 输入要求:招商意向项目清单、要素保障标准、政府各部门权责清单。
  • 输出结构:落地服务工单、要素协调责任表、审批时限监控表 (landing_service_list)。
  • 判断边界与禁止表达:
    • 严禁向项目方做出未经政府审批的排他性要素兜底承诺。

5.4

规划与审查:写作和验收分工

政策策划、规划总师、专项质检和报告统稿四类角色负责政策映射、任务拆分、独立验收与公文输出。核查真实文号,避免模板照搬和将假设写成事实。

+
原文依据 / 白皮书 § 5.4保留技术细节,便于核对

13. 一县一策政策策划专家 (policy_planner)

  • 角色定位:将县域瓶颈与产业需求精准映射到国家与省市扶持政策,形成政策争取与落地的抓手矩阵。
  • 协同业务链:政策决策链、一县一策与规划链。
  • 授权工具集:search_policy、query_expert_rules
  • 输入要求:瓶颈假设、主导产业诉求、Dify 政策法律法规知识库。
  • 输出结构:政策支持清单、政策行动建议矩阵、向上争取支持诉求单 (policy_needs)。
  • 判断边界与禁止表达:
    • 绝对严禁 伪造、臆想政策文号或条款;严禁把研究建议表述为“上级已批复出台政策”。

14. 一县一策与规划首席专家 (county_planning_chief)

  • 角色定位:统揽上游所有分析产物,编排一县一策方案总体思路、发展目标、章节架构与重点工程体系。
  • 协同业务链:一县一策与规划链。
  • 授权工具集:dispatch_county_planner、search_policy、search_evidence
  • 输入要求:县域全景分析包(监测+产业+瓶颈+政策+项目)。
  • 输出结构:县域战略定位、一县一策实施框架大纲、章节写作工单 (planning_framework)。
  • 判断边界与禁止表达:
    • 严禁将其他县的规划模板机械照搬到目标县;严禁将待核验假设作为既成事实写入规划背景。

15. 规划质量与边界审查专家 (planning_quality_reviewer)

  • 角色定位:质量防线守门员,深度审查规划初稿是否存在数据无据、越权承诺、引文失真等合规缺陷。
  • 协同业务链:一县一策与规划链。
  • 授权工具集:query_expert_rules
  • 输入要求:规划草稿全文、上游分析证据链引用表、发改委公文规范标准。
  • 输出结构:质检打分项、问题拦截清单、章节修订补丁任务 (planning_quality_review)。
  • 判断边界与禁止表达:
    • 对任何未附带证据来源的强断言一律驳回;对模糊因果一律强制批注打回。

16. 报告统稿与表达边界审查员 (report_editor)

  • 角色定位:负责全流程报告的公文格式统稿、图表排版美化、标点语病审查与最终表达边界修润。
  • 协同业务链:全链条通用产物导出。
  • 授权工具集:query_expert_rules
  • 输入要求:各业务链 Markdown 草稿、JSON 清单、样式规范。
  • 输出结构:标准 Word 送审稿、规范排版 Markdown 报告、边界审查记录 (edited_report)。
  • 判断边界与禁止表达:
    • 统一行文口吻:对未完全验证的事项规范使用“数据显示”、“建议进一步核实”等严谨政务公文修辞。

5.5

角色提示之后,还有代码护栏

Prompt 提高合规概率;allowed_tools、行政区划权限、数字来源和文号检验在执行或落盘前拦截。词法规则只是防线之一,不能据此声称语义安全绝对保证。

+
原文依据 / 白皮书 § 5.5保留技术细节,便于核对

在 Agent 系统设计中,最常见的工程误区之一是“把安全、权限与停止条件写在 Prompt 里”。 Prompt 本质上是对大模型的概率引导,无法提供 100% 确定性保证。即使在 16 个专家的 System Prompt 中写明了“严禁断言绝对优势”、“严禁推导因果”、“严禁越权承诺”,大模型在处理复杂长文本时仍可能发生偶发性突破。

因此,系统在工程上实行了**“Prompt 引导 + Harness 代码硬拦截”的双重防线**:

100%
代码级确定性检测与修正1. System Prompt角色人格与业务指引(软约束)2.大模型生成候选输出3. Harness代码拦截器(DeterministicGuardrails)正则强因果检测器(因果句式强转为假设)数字溯源断言器(未绑定 PG ID直接抹除)政策文号查重校验(未命中白名单直接告警)越权承诺语法扫描(承诺性动词强降级)4.绝对受控的合规业务产物
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  1. 软约束(Prompt 层):让模型明确自身的专家视角与语境修辞,提高一次性生成合规内容的概率;
  2. 硬拦截(Code/Harness 层):大模型的输出在落盘或传给下游前,必须通过 Python 代码层硬编码的过滤器:
    • 因果断言器:检测句子中出现的“导致了、直接引起、证明了”等强因果词。若该句未绑定计量经济模型输出 ID,代码直接通过 AST 或正则重写为“提示存在关联,需实地核验”;
    • 文号白名单校验:抓取“〔202X〕X号”等政策文号,与 Dify 政策库真实元数据比对,若未命中直接抛出异常;
    • 调用权限硬隔离:角色允许调用的工具直接由代码配置的 allowed_tools 白名单强行绑定,模型即使在 Prompt 中被提示词注入或幻觉尝试发起未授权工具调用,Harness 直接在执行前抛出 PermissionDeniedError。
5.6

16 角色是按需激活的隔离工位

Supervisor 将目标、上下文和权限投影给 Worker,返回结果只保留结构化摘要。上下文隔离、并发、最小特权与独立审查才是角色拆分的工程价值。

+
原文依据 / 白皮书 § 5.6保留技术细节,便于核对

许多外行常将“16 个专家角色”误解为“在聊天室里开 16 个会话互相客套”。 本系统在工程架构上彻底破除这种拟人化噱头。在底层运行时中,这 16 个角色本质上是由总调度中枢(Supervisor)按需激活的上下文隔离沙箱与权限投影(Context-Isolated Worker Sandbox):

100%
隔离的 Worker 执行沙箱 (Context-Isolated Sandboxes)总调度层 (Supervisor / CountyEconomyState)派发任务包 1派发任务包 2派发任务包 3回传结构化摘要 (无原始日志污染)回传结构化摘要回传结构化 JSON规划总师 /运行总调度维护全局大纲里程碑· 控制总状态机产业战略专家沙箱(Worker 1)【只注入:玻陶/机械企业工商与区位商数据】独立处理 30kTokens - 产出500字产业画像与边界要素资源专家沙箱(Worker 2)【只注入:土地能耗环境承载力指标】独立处理 25kTokens - 产出300字要素约束清单招商补链专家沙箱(Worker 3)【只注入:省内外上下游企业名录与断点】独立处理 35kTokens - 产出靶向招商项目库JSON
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

为什么必须采用多角色沙箱物理隔离?四大工程收益:

  1. 彻底攻克 Lost in the Middle 上下文注意力溃散:
    • 如果用单个 Agent 同时处理隆昌全县产业、土地、财政、项目等 1000+ 份资料,Prompt Tokens 瞬间飙升至 120k 以上,大模型必将在海量文字中“迷失在中间”,导致指标张冠李戴;
    • 拆分独立 Worker 沙箱后,每个角色只吞吐与其专长相关的 20~30k 切片,在干净的高信噪比上下文中精细研判,最终仅向主状态回传提炼后的 500 字结论,主状态体积始终稳定维持在几千 Tokens 的健康区间!
  2. 并发扇出加速(Parallel Fan-out):
    • 多个领域的专家 Worker 通过 asyncio.gather 并发执行,将原本需串行运行 15 分钟的分析链压缩至最慢 Worker 的耗时(约 2 分钟);
  3. 数据权限最小特权原则(PoLP):
    • 例如只有 data_steward 拥有数据质量扫描工具,只有 quant_model_analyst 拥有计量模型执行工具,report_editor 没有任何数据库写权限,实现代码级的权限最小化暴露。

6 · 导言

程序断言、独立质检与经验闭环

后置检查将生成结果收口:先验证数字、文号与规则,再由独立 Critic 审查体例和语义;失败诊断写入任务轨迹及经验库。

+
原文依据 / 白皮书第 6 章导言保留技术细节,便于核对

在政务辅助决策场景中,安全可信高于一切。大模型若凭空捏造数据、虚假承诺招商政策或轻率得出因果归因结论,将引发严重行政风险。 在“工作流骨架嵌装智能体”的复合模式中,内层 Agent 节点的自适应探索必然伴随一定的模型输出随机性与幻觉风险。因此,外层工作流必须设立严密的“后置物理校验收口(Deterministic Gate Check)机制”。 系统构建了工业级的 Reflection 三级火箭质量防护体系:

100%
L3: 经验沉淀闭环 (Reflexion with Memory)L2: 专职评估模型 (Specialized Critic · 防盲从沙箱)L1: 确定性程序断言 (代码硬拦截 · 最优先)代码断言通过质检未通过: 沉淀归因并打回全部通过数字PG溯源校验 ·政策文号白名单 ·正则因果词消除 ·敏感词拦截【零延迟 · 零幻觉 ·100% 确定性】发改委公文规范质检·规划章节逻辑连贯性·政策适用度深层审查【独立沙箱 ·双盲评审 ·严禁附和妥协】质检拦截归因写入reasoning_trace与历史经验库【跨任务避坑 ·形成长效知识闭环】正式送审发布
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
6.1

六道门禁如何决定流转

依次检查数字、证据、逻辑、结构、敏感信息和发布准入。无据内容打回,弱因果降为假设,敏感内容阻断,需要人审的任务挂起待审。

+
原文依据 / 白皮书 § 6.1保留技术细节,便于核对

每个产物生成后必须依次穿透 6 道门禁拦截:

100%
No: 拦截并标注YesNo: 拦截并标注YesNo: 强行降级YesNo: 拦截并标注YesNo: 致命阻断Yes需人工全部通过大模型生成初始业务报告 / 规划初稿1. 数字门禁所有数字均有 PG来源、年份与口径?打回重修 /标记待核验2. 证据门禁政策引用能追溯到Dify 真实段落?3. 逻辑因果门禁严禁将相关性写成确定因果?严禁越权承诺?降级为『待核验瓶颈假设』4. 结构合规门禁必备章节、任务包要求格式齐全?5. 涉密脱敏门禁无未脱敏隐私或涉密标识?终止并告警6. 发布准入门禁需要专家或部门线下确认?挂起并推送到待审队列正式发布 (Word /JSON 归档)
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
  1. 数字门禁:对报告中所有涉及数值、百分比、金额的内容进行正则抓取,反向校验是否在输入指标字典中有据可循。无依据数字一律拦截;
  2. 证据门禁:政策条款必须附带真实文号与政策库切片 ID,杜绝“根据国家某政策支持……”等模糊引用;
  3. 逻辑门禁:扫描“因为……导致了……”等强因果表述,强行将未经过计量检验的推论降级为“待核验瓶颈假设”;
  4. 结构门禁:核查章节是否齐备,格式是否符合发改委公文送审规范;
  5. 敏感门禁:过滤企业敏感经营数据与未公开保密信息;
  6. 发布门禁:最终综合裁定是否允许流转到用户端。
6.2

每个结论需要说明证据是什么

硬数据、软证据、待核验假设和专家规则分别标识。假设必须带核验方法与责任部门,专家规则用于分析,不代替事实证据。

+
原文依据 / 白皮书 § 6.2保留技术细节,便于核对

系统在数据模型层确立了严密的证据等级体系:

  • Level 1 · 硬数据(Hard Metric):统计年鉴、局方报表、已确认指标(可作为定性与测算的硬核底座);
  • Level 2 · 软证据(Soft Evidence):官方政策文本、政府工作报告、正规会议纪要(作为政策背景与意图支撑);
  • Level 3 · 待核验假设(Unverified Hypothesis):瓶颈诊断、因果推测、未经验证的企业线索(强制标注为假设,必须列出核验方法与责任部门);
  • Level 4 · 专家规则(Expert Rule):内嵌的经济学分析范式与判定阈值。
6.3

评测看环境结果,也看动作轨迹

结果质量、路径效率、越权防护和异常恢复组成四维评测。执行断言、规则断言和模型裁判分层使用;200+ 题基准触发 PR 回归,每日巡检发现模型服务静默漂移。

+
原文依据 / 白皮书 § 6.3保留技术细节,便于核对

在业务演进过程中,工程师常面临严峻的工程困境:微调了某专家的 System Prompt,是否会导致其他 8 条业务链的存量能力退化?升级了基座模型或切换了厂商,原本稳定的工具调用参数解析是否发生隐蔽故障? 针对严肃政务决策,系统告别了“挑几个用例手工提问”的凭感觉试错,构建了可量化、可回归、纳入 CI/CD 的工业级自动化沙箱评测工程体系:

1. 为什么 Agent 评测不能套用传统单测或基础模型评测

  • 传统软件单测失效:传统单测基于确定性映射(f(x)=yf(x) = y),而大模型完成同一分析目标(如“评估隆昌玻陶产业断点”)可以选择多条截然不同的工具调用与推理路径;
  • 基础模型评测(MMLU / BLEU / ROUGE)失效:静态文本相似度匹配无法衡量 Agent 对外部物理环境(PostgreSQL 数据库、Dify 知识库、工单流转系统)发生读写交互时的因果执行力与真实状态改写;
  • 核心范式转变:Agent 评估必须将“真实环境物理状态验证(Environment State Assertion)”与“决策交互轨迹审计(Trajectory Audit)”深度结合。

2. 四维综合质量评估矩阵(Evaluation Framework)

100%
县域智能内核工业级四维评测矩阵1. 交付结果达成度(Outcome Quality)【数据库落盘状态 ·Pandas 统计量误差≤ ±0.1%】2. 交互轨迹效能(TrajectoryEfficiency)【决策步进开销 ·有效动作比率 ≥90% · Token转化率】3. 安全与越权防范(Safety Defense)【沙箱越狱拦截100% ·只读角色写库越权拦截 100%】4. 异常自愈能力(Resilience &Recovery)【工具 500 /检索超时扰动后的自愈修复率 ≥ 85%】
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读

3. 三大评测工程方法分层选型

系统按照确定性与执行成本,构建了三层递进评估金字塔:

  1. 执行断言(Execution-based Eval · 占比 70% · 黄金标准): 在隔离的 Docker 测试沙箱中运行真实任务。测试前置执行 setup_fixture() 恢复标准年鉴数据库镜像;测试后置执行 assertion_hook() 直接运行 Python/Pandas 代码断言底层表字段与落盘文件,以退出码 0 作为唯一硬判据;
  2. 规则断言(Deterministic Rule Guards · 占比 20%): 零大模型调用的高速代码拦截:JSON Schema 格式校验、敏感词正则匹配、涉密红线扫描与工具调用白名单校验;
  3. 模型裁判(LLM-as-a-Judge · 占比 10% · 仅用于主观语义): 仅用于评判发改委公文行文风格、政策解读逻辑通顺度等不可代码量化的主观维度。实施三项铁律:① 必须配置详尽的结构化评分细则(Rubric);② 强制要求裁判模型输出完整的 Chain-of-Thought(CoT)推理过程;③ 严禁给出无解释的裸分。

4. CI/CD 自动化回归门禁与模型供应商静默漂移监控

  • Merge Blocker(合入门禁阻断): 在代码仓库的 CI/CD 流水线中,任何涉及 System Prompt、工具声明或状态机节点的 PR,自动拉起包含 200+ 题标准业务用例(常规题、长尾题、脏数据鲁棒题、对抗注入题)的沙箱回归测试。若综合 Pass Rate 下滑或平均步数恶化超过 15%,直接阻断代码合入生产主干;
  • 防外部模型后台静默漂移(Provider Silent Drift Monitor): 针对公网闭源模型供应商(如 DeepSeek/Qwen 等),配置每日凌晨自动执行的端到端基准巡检,持续监控模型的 Intent Routing 准确率与 Tool Calling 格式合规率,一旦侦测到底层模型因未通知热更而导致能力漂移,立即向运维团队告警并自动切流至备用集群。

7.1

为什么从隆昌跑通全流程

隆昌市(510283)是端到端验证试点,材料包括历年统计公报、政府工作报告、专项材料与企业清单。它用于验证整条交付链,不能据此推定 183 县已经全面上线。

+
原文依据 / 白皮书 § 7.1保留技术细节,便于核对

隆昌市(县级市,行政区划代码 510283)作为项目全流程验证的一号试点。试点期间,系统接入并处理了隆昌市历年统计公报、政府工作报告、发改与经信专项材料、重点工业企业清单等上千份政务资料。

7.2

从业务指令到送审文件

解析任务并加载县域配置,拉取指标与政策,运行监测、画像和归因,拆分章节并审查,注册审计轨迹,最后以标准公文模板输出 DOCX 与 JSON。

+
原文依据 / 白皮书 § 7.2保留技术细节,便于核对
100%
公文导出渲染器质量门禁引擎规划与审核 SubagentsDify 知识库 (KB-510283)PostgreSQL 数据库智能内核调度中枢公文导出渲染器质量门禁引擎规划与审核 SubagentsDify 知识库 (KB-510283)PostgreSQL 数据库智能内核调度中枢发改委用户 / 业务分析师发起“隆昌市全域数智化转型发展规划”编制任务1意图解析并加载隆昌专属配置 (510283)2拉取近 5 年核心经济指标与产业矩阵3返回硬指标集合 (GDP, 工业增加值, 固投等)4检索隆昌最新政策指引、优势产业报告与调研纪要5返回高置信度软证据切片6运行【运行监测链】+【产业诊断链】,生成态势包7运行【瓶颈归因链】,提炼产业断点与待核验瓶颈假设8分发写作任务包 (任务要求/约束/参考上下文)9撰写第一章至第五章草稿及工程清单10提交规划草稿进入 6 层质量审查11执行数字核对、文号校验与因果边界脱敏12审查通过,生成 reasoning_trace.json13注入标准发改委公文模板,导出 DOCX 送审稿14交付《隆昌市规划送审稿(DOCX)》+《工程清单(JSON)》15发改委用户 / 业务分析师
以原始尺寸显示 · 拖动或滚动画布查看 · 大图可放大阅读
7.3

50+ 份成果与适用条件

文档记录了五章规划送审稿、工程清单、采集与补数清单、政策矩阵和招商项目库。约 30 分钟是数据齐备后的初稿生成描述,不包含资料归集与行政审签。

+
原文依据 / 白皮书 § 7.3保留技术细节,便于核对
  • 规划公文成果:
    • 《隆昌市全域数智化转型发展规划》第一章至第五章送审稿及对应质检报告;
    • 《隆昌市全域数智化重点工程清单(含投资规模与建设周期)》;
  • 业务清单与分析矩阵:
    • 《隆昌市指标扩展与数据采集清单》;
    • 《隆昌市部门补数清单(针对未覆盖关键指标的追溯清单)》;
    • 《隆昌市主导产业错位发展政策行动矩阵(JSON/Excel)》;
    • 《隆昌市重大产业延链补链招商项目库》。
  • 成效提升:
    • 传统模式下编制同类综合规划与专项报告需要调研组数周调研与反复修改,系统在数据齐备条件下,将全流程材料初稿生成周期缩短至约 30 分钟,且每一处论断均附带精准的数据表和文号索引。

8.1

复盘一:先守住业务确定性

将数字、政策和权责检查放进流程与代码。生成能力只有在可追溯的证据边界中,才能成为严肃场景可以使用的决策辅助。

+
原文依据 / 白皮书 § 8.1保留技术细节,便于核对

在政务分析与决策支持场景中,核心诉求在于数据的严肃可信:每项数据必须能对齐统计年鉴与部门报表、每句政策引用必须查到正式发文字号、每个归因推演必须恪守权责边界。工程的首要目标是构建强约束的工作流与代码级防护网,把大模型的生成严格限制在合规与事实边界之内。

8.2

复盘二:真正费力的是数据工程

970 张复杂报表、非标准标题、带噪音纪要和 206 张表的语义目录都需要前置治理。材料的结构和粒度会直接影响检索与交付质量。

+
原文依据 / 白皮书 § 8.2保留技术细节,便于核对

在项目实际落地中,决定交付质量的关键在于底层的数据清洗与知识治理工程:

  • 清洗 970 张统计年鉴复杂报表的合并单元格与非标表头;
  • 重构上百份长篇政策文件与工作报告的层级 Markdown Heading;
  • 清理提炼带口语噪音的调研座谈纪要;
  • 构建 5 个业务域语义索引映射 206 张底层物理数据库表。 底层数据表结构与知识片段治理清晰后,上层业务链的推演与输出准确度才能得到根本保障。
8.3

上线前必须验证的五件事

强杀后恢复、预算熔断、全链路追踪、沙箱权限、副作用幂等构成生产验收。原文列出的 100% 等指标为验收目标,不能当作已取得的上线测量结果。

+
原文依据 / 白皮书 § 8.3保留技术细节,便于核对

在将县域经济智能内核从隆昌试点推广至全省 183 县正式生产上线前,平台必须经过以下 5 维严苛的工业级就绪验收:

验收维度核心检验标准与破坏性测试目标 SLA 与指标要求
1. 状态持久化与断点续跑任务运行中随机触发 kill -9 强杀 Worker 进程或断开网络,重启后能否基于 PostgreSQL Checkpoint 在 5 秒内无缝拉起并继续执行?恢复成功率 100%,无上下文丢失
2. 死循环与成本硬熔断人工构造引发模型无限推导的反常指标提问,系统能否在触发 Token 预算上限(如 100k Tokens)、工具调用步数(如 6 轮)或全局超时(300s)后立即阻断并优雅告警?阻断率 100%,零费用失控与死锁
3. 全链路分布式追踪从用户发起规划到生成最终文档,每一次大模型调用的 Request ID、Token 消耗分布、各工具执行耗时是否全部注入 OpenTelemetry Trace 并能在 Langfuse/Jaeger 中可视化拓扑展现?追踪覆盖率 100%,排障定位耗时从小时级降至分钟级
4. 安全沙箱与权限隔离代码沙箱是否剥离宿主机 root 权限?是否彻底屏蔽了内网元数据接口(如 169.254.169.254)?SQL 网关是否强制参数化并物理封杀非白名单库表?零代码逃逸,零 SSRF 隐患,零 SQL 越权
5. 副作用工具强幂等性在派发补数工单与写数据库操作期间模拟网络断流并触发重试,系统是否通过确定性 Idempotency Key 强拦截重复写动作?零重复工单,零脏数据污染
8.4

持续观察循环是否真正收敛

监测 Pass@1、Pass@3、无效动作比率,并每周抽查成功任务的事实与引用。WAR<10%、Pass@3≥90% 属于目标;4.8% 基线在原文未附原始日志。

+
原文依据 / 白皮书 § 8.4保留技术细节,便于核对

为了杜绝 Agent 循环系统沦为“无限空转的 Token 黑洞”,系统在生产运维大盘中常态化追踪三项关键循环效能指标:

  1. Pass@1 与 Pass@3 收敛率大盘:
    • 目标:常规监测与分析链 Pass@1 ≥75%\ge 75%,复杂规划链 Pass@1 ≥60%\ge 60%;
    • 经外部 Verifier 驱动 1~3 轮自动自愈后,Pass@3 必须达到 ≥90%\ge 90%;若 Pass@3 未收敛,严格执行三轮早停剪枝,转交专家介入;
  2. 无效动作比率(Wasted Action Ratio)严格红线:
    • 定义:WAR=被熔断动作数+参数报错动作数+零增益重复动作数总工具调用数\text{WAR} = \frac{\text{被熔断动作数} + \text{参数报错动作数} + \text{零增益重复动作数}}{\text{总工具调用数}};
    • 生产红线:必须严格压低至 10%10% 以下(当前基线实测为 4.8%4.8%);
  3. 退出真实性抽检审计(Exit Truthfulness Sampling Audit):
    • 每周抽取 5%5% 线上状态机标记为 SUCCESS 的归档任务,由离线审计脚本自动核验:① 生成的规划指标与 PostgreSQL 最新事实库是否绝对一致;② 报告中的文件引证是否在 Dify 知识库具备可溯源原句;
    • 彻底防范大模型自作主张、虚构产物的假性收敛(False Convergence)。

附录:核心成果与可演示资产核对表

  • 架构拓扑:LangGraph 9 条业务链状态机图谱(graph.py + workflow_catalog.py)
  • 数据底座:PostgreSQL 32 万+ 年鉴指标库、2.2 万+ 企业库、183 县覆盖度矩阵
  • 知识工程:Dify 12 大专题知识库(427 份文档,254 万字)、四维元数据体系
  • 试点成果:隆昌市全域数智化转型规划各章送审稿、重点工程清单、补数清单(50+ 份完整产物)
  • 工程防线:6 层质量审查门禁、Finding-Evidence 契约规范、reasoning_trace 审计留痕
  • 生产级韧性架构(31 项工业级高可用与工程加固方案):
    • 协议与边界防护:Instructor 强类型结构化路由、Tool Gateway 统一权限与区划拦截、零信任参数行政隔离、全局模型连接池单例托管与 TCP Keep-Alive;
    • 状态机与流式引擎:LangGraph 控制权反转拓扑、三态生命周期建模、去重 Reducer、PostgresSaver 断点续跑持久化、app.stream 逐工位流式事件驱动;
    • 规划控制流与容灾:Harness 动作指纹检测器(LoopBreaker)、客观物理产物验收(DoD)、防错误级联硬护栏、Critic 反思注入自愈回路、两段式混合质检门禁(Fast-Fail + Semantic Gate)、多阶逃生通道;
    • 高并发与长周期任务:信号量受控并发扇出(Semaphore-bounded Fan-out 防 429)、带超时兜底的弹性扇入(Elastic Fan-in)、嵌套字典深度合并规约器、长任务挂起与 HMAC 签名 Webhook 唤醒;
    • 评测与质量门禁:200+ 题 Golden Benchmark、基于物理环境状态断言的 CI/CD 回归流水线、每日模型静默漂移监控、6 层质检审查门禁与 Finding-Evidence 证据契约。
资料与展示口径

本页依据项目架构白皮书与原项目记录重构。交互为架构教学演示;流程参数、评测目标和文档记录的样例成绩均按各自口径展示。源文中约 62% / 91% 通过率、4.8% 无效动作基线、70% 工具效率提升及 >90% 缓存命中等描述,未附测试样本或原始日志,保留在技术手册供核对。

183 县 × 5 年对应 915 个“县—年”组合;9,150 单元的额外指标维度未在原文说明。角色口径统一为 16,试点交付阶段按白皮书统一为 12。

ENGINEERING REFLECTION

最费力的部分,
往往发生在模型推理之前。

清洗复杂报表,恢复文档层级,整理有噪音的纪要,让业务语言找到正确的数据表。底座越清楚,上层分析才越有依据。

返回项目集 ↗回到顶部 ↑
INTERACTIVE CANVAS

架构图

100%
拖动画布查看细节 · 按 Esc 关闭
打开原图 ↗