Asaakii
四川能投云电科技有限公司 · 2023.06 — 2026.02

智慧电厂 AI 知识助理

在银河麒麟工业内网部署量化后的 70B 级 DeepSeek-R1 蒸馏模型,接入 500+ 份设备资料建成本地 RAG 知识库;回答必须引用原始文档、章节和页码,便于运维人员回到原文核对。

Pipeline
RAG Pipeline · 从提问到溯源回答
01 / 06 当前阶段
用户提问 Web / 移动端
70B级
蒸馏模型
500+
文档数量
40GB级
量化模型体积
秒级
检索速度
Project Outcomes
  • 在银河麒麟离线环境部署 DeepSeek-R1 70B 级蒸馏模型,通过 GGUF Q4_K_M 量化把模型压到约 40GB 级,跑通内网本地推理
  • 整理接入 500+ 份设备手册、规程与制度,按章节、条目与表格差异化分块,检索响应达到秒级
  • 执行“查无依据直接拒答,回答必须带出处”原则,输出附原始文档、章节和页码,方便现场快速复核
  • 用 FastAPI 封装本地推理和 RAG 接口,支持 SSE 流式输出,对接 Web 与移动端
  • 针对设备参数、操作规程和故障排查编写工业测试用例,围绕准确率、召回率、引用准确度与拒答率持续回归验证
Project Background

电厂运维查参数、排故障主要翻纸质手册和上百页的设备 PDF,不仅慢,新人查阅也费劲。由于生产网运行在银河麒麟系统上,且完全断网,无法调用任何公有云 AI。这个项目要在离线内网环境下跑通大模型本地部署与 RAG 检索,把设备手册、运维规程和安全制度做成本地知识库,让运维人员提问时能快速拿到带章节和页码依据的答案。

Core Challenges
! 知识难找

设备参数、规程和安全制度分散在几百页 PDF、Word 和表格里,全靠翻目录和老师傅经验,查一条依据很耗时间。

! 内网隔离

系统跑在银河麒麟内网,完全断网且资料不能出域,不能调用云端模型或在线解析服务,模型、依赖和知识库必须全量离线运行。

! 资源受限

70B 原始模型对现场硬件要求太高,必须在回答质量、模型体积、显存占用与推理速度之间反复权衡。

! 文档结构杂

手册按章节写,规程按条目列,参数表靠行列对应;按固定字数切块容易把故障代码、步骤和安全警示切碎,破坏语义。

! 答错代价大

工业参数和操作步骤一旦胡编或漏掉安全前提,会直接误导现场操作。资料里没有的宁可拒答,也不能自由发挥。

! 效果难量化

模型能顺畅说话不代表可用。必须拆开测:文档召回准不准、回答是否忠于原文、引用页码对不对、没依据时能不能老实拒答。

Solution & Positioning

这是部署在电厂工业内网的受约束知识查询系统,核心目标是帮运维快速定位依据。系统先从授权知识库检索证据,再让本地模型基于召回内容整理回答,并附上文档名、章节与页码。系统只做资料检索与辅助参考,不替代现场操作规程、设备铭牌和专业人员确认;一旦检索资料不足或超出范围,明确告知未找到,不做无根据推测。

离线内网 · 端到端实施路径

从环境约束摸底、模型量化部署到资料治理、受约束问答与测试回归的工程链路

点击步骤聚焦 01 / 06
Runtime Case

给水泵参数查询 · 可溯源问答链路

以一个具体查询展示从自然语言提问到定位原文、附带出处的完整处理过程

01 / 06
对象
#2 机组给水泵
问题
额定流量 / 扬程 / 功率
资料
技术规格书 + 参数汇总表
边界
现场铭牌优先
问题解析 query parser

提取设备对象、机组编号与参数需求,把口语转成规范的查询表达。

Stage Output

生成“#2 机组 / 给水泵 / 额定参数”上下文


Data Foundation
工业知识文档
500+ 份

涵盖设备手册、运维规程和安全制度等内部资料

分块策略
3 种

按手册章节、规程条目、表格行列差异化切块

溯源层级
3 级

回答标注文档名、章节、具体页码

问答模版
3 类

参数查询、操作步骤、故障排查分别套用对应格式

评测维度
4 项

测试回答准确率、检索召回率、引用准确率与拒答表现

RAG 工程与质量把控

把文档切块、来源追踪与安全边界做在检索链路前段,而不是寄希望于模型在最后一步自行保持克制。

01

按语义单元分块

依手册章节、规程条目和表格行列切分,避免固定字数切块拆散操作步骤和安全警示。

02

全程透传来源信息

从文档入库切块开始,将文档名、章节、页码绑定在元数据中,回答时直接带出对应出处。

03

无依据宁可拒答

检索不到足够材料时直接告知未查到;涉及设备参数时注明以现场铭牌和规程为准,不硬猜。

04

定位问题发生层级

把回答错误拆解到解析、分块、召回、Prompt 或模型层面,定位后修补并加进回归题库。

Optimization Evidence
500+ 份 知识文档

设备手册、运维规程和安全制度离线入库

3 种 分块策略

章节、条目与表格结构分别处理

秒级 语义检索

BGE-M3 + Chroma 支撑本地证据召回

4 项 质量检查

准确性、召回、引用与拒答形成回归闭环

Auditable Deliverables
01

回答层

ANSWER · TEMPLATE

按参数、操作步骤或故障排查分类组织,结构清晰,减少歧义。

02

证据层

SOURCE · SECTION · PAGE

结论后紧跟文档名、章节和页码,方便运维翻阅纸质或原件核对。

03

评测层

EVAL · REFUSAL · REGRESSION

用固定测试集验证召回率、忠实度、引用率和拒答表现,保障迭代稳定。


My Role

负责大模型私有化部署与 RAG 落地:在银河麒麟断网内网完成 70B 级 DeepSeek-R1 蒸馏模型量化部署;针对手册、规程和表格设计差异化分块,搭建 BGE-M3 + Chroma 检索链路;开发 FastAPI 推理与问答接口;编写限制模型胡编、强制输出页码的 Prompt 规则与格式模板;构建工业测试集,针对准确率、召回率、引用准确度与拒答表现做回归评测。

Tech Stack
DeepSeek-R1 llama.cpp GGUF Q4 量化 BGE-M3 Chroma FastAPI Python 银河麒麟
RAG Q&A Example
Question

#2 机组给水泵的额定流量是多少?

Retrieved Documents
  • 《DG-280/140 型给水泵技术规格书》第 3.2 节
  • 《2号机组辅机参数汇总表》Sheet-给水系统
Answer

#2 机组给水泵额定流量为 280 t/h,额定扬程 140 m,配套电机功率 1600 kW。该参数来自设备出厂技术规格书,具体安装参数请以现场铭牌为准。

Sources
  • 📄 DG-280/140 型给水泵技术规格书 — 第 3.2 节 · 第 12 页
  • 📄 2号机组辅机参数汇总表 — Sheet"给水系统" · B3 单元格

Key Highlights

内网离线量化部署

在完全断网的银河麒麟内网中部署大模型,平衡硬件开销与回答表现

  • 在银河麒麟离线工业内网部署 DeepSeek-R1 70B 蒸馏模型,全流程脱离外网
  • 用 llama.cpp 结合 GGUF Q4_K_M 量化,把模型压到 40GB 左右,适配内网服务器显存
  • 通过 FastAPI 封装接口,提供 SSE 流式输出,支持 Web 和手机端调用
llama.cpp GGUF Q4_K_M 银河麒麟 FastAPI

文档感知切块与检索

针对结构各异的设备资料做差异化分块,避免打散业务上下文

  • 500+ 份资料分类处理:设备手册按章节拆,规程按条款拆,参数表按行列拆
  • 采用 BGE-M3 向量化并写入 Chroma,本地语义检索达到秒级响应
  • 候选片段重排后送入模型上下文,强制带出原始文档名称与页码
BGE-M3 Chroma Embedding 语义检索

严格约束 Prompt 与模板

从输入端约束模型只依据资料回答,统一输出格式

  • Prompt 明确限定范围:未检索到的内容直接回复未查到,不让模型自行推想
  • 每条结论必须附带文档名和页码,方便现场翻看原书核验
  • 设计参数查询、操作规程、排障建议三套输出模版,规范展示格式
Prompt Engineering System Prompt 格式模板

基于工业用例的分层评测

用真实问题集评测各环节表现,针对故障根因定向优化

  • 整理工业测试题库,涵盖参数核查、规程定位与故障建议等常见问题
  • 追踪四项指标:回答准确率、引用标注率、幻觉率、检索召回率
  • 出现错漏时对齐排查是分块、召回、Prompt 还是模型理解问题,修复后纳入回归集
Evals 幻觉率 召回率 评测体系
Core Differentiators
01

纯内网离线运行

模型、Embedding、向量库和 API 服务全部部署在工业内网,数据不出网,满足生产安全与合规要求。

02

精确到章节与页码

回答必须附带文档名、章节和页码;运维人员能随时回翻原始依据,系统重在缩短查阅时间,而非替代人工确认。

03

按文档形态做针对性分块

针对手册、条文和参数表采用不同的分块规则,尽量避免拆断操作步骤、丢失表头或搞混设备型号。

04

结合硬件做量化选型

选用 70B 蒸馏模型搭配 Q4_K_M 量化,在现有内网硬件条件下兼顾参数理解力与响应速度。

05

查不到就明确拒答

检索资料不足时直接说明无依据;涉及设备安全参数提示以铭牌和规程为准,不靠语言流畅掩盖资料缺漏。

Reflection & Takeaways

做工业 RAG 最大的体会是:可信比流畅重要得多。模型语言再通顺,如果数字不可查、出处不可验,现场就没人敢用。整条链路里最耗精力的其实是前段:文档切块切得好不好直接决定了能不能召回关键步骤,出处信息从入库切块起就得一路透传到最后输出。回头来看,如果在项目初期就先把各类典型查询题库建好,再去对比不同量化档位和分块参数,选型过程会更有依据,也能少走弯路。

Future Outlook
01 量化参数横向对比

用统一的参数查询和规程定位题库,系统测试不同量化档位的准确率、首字延迟和显存占用,形成量化依据。

02 引入多维度过滤

在向量召回前增加设备型号、文档版本和专业领域等标签过滤,并尝试接入重排序进一步提升出处命中率。

03 按岗位划分查询权限

根据运维岗位和设备责任区设置检索过滤条件,控制敏感规程和资料的查阅范围。

04 完善文档更新与运维观测

补齐新文档增量入库、索引版本管理以及检索未命中日志统计,便于长期排查与维护。

← 县域经济智能分析与协同决策平台 Agent 内核 智慧电厂一体化平台 · 系统集成 →