四川能投云电科技有限公司 · 2023.06 — 2026.02
智慧电厂 AI 知识助理
在工业内网完成 DeepSeek-R1 系列 70B 级蒸馏模型私有化部署,构建 RAG 知识库支撑秒级检索召回与可溯源问答链路。
Pipeline
RAG Pipeline · 从提问到溯源回答
用户提问
意图识别
RAG 检索
LLM 推理
来源标注
回答输出
用户提问
Web / 移动端
意图识别
Prompt 分流
RAG 检索
BGE-M3 + Chroma
LLM 推理
DeepSeek-R1 70B
来源标注
文档 + 页码溯源
回答输出
结构化格式
70B
模型参数
500+
文档数量
<40GB
显存占用
秒级
检索速度
Project Outcomes
- 在银河麒麟离线环境完成 DeepSeek-R1 70B 级蒸馏模型私有化部署,采用 GGUF Q4_K_M 量化将显存占用控制在 40GB 以内
- 处理 500+ 份设备手册、运维规程、安全制度等文档,构建结构化知识库,检索响应达到秒级
- 所有回答强制标注原始文档来源与页码,实现可溯源问答,幻觉率有效控制
- 通过 FastAPI 封装推理 API,支撑多终端接入(Web 端 + 移动端),新员工上手查询效率显著提升
Project Background
电厂运维人员在日常巡检、故障排查和制度查询中长期依赖纸质手册和个人经验——一个具体的设备参数或操作规程往往需要翻阅数百页 PDF 才能定位,新员工上手周期长、知识传承断层严重。与此同时,电厂处于工业内网(银河麒麟操作系统 + 完全离线环境),无法使用任何公有云 AI 服务。本项目在这一严苛约束下完成大模型私有化部署与 RAG 知识库建设,为运维人员提供"问即得、答有源"的 AI 知识助理,将设备手册、运维规程、安全制度等沉淀为可检索、可溯源的数字知识资产。
My Role
独立负责 LLM 私有化部署全流程:调研量化方案并在离线环境完成 DeepSeek-R1 70B 模型部署;设计文档分块策略与 RAG 检索链路(BGE-M3 + Chroma);开发 FastAPI 推理服务与问答接口;构建 Prompt Engineering 策略(系统边界约束、来源强制引用、格式模板);搭建工业场景评测用例进行效果验证与持续优化。
Tech Stack
DeepSeek-R1 llama.cpp GGUF Q4 量化 BGE-M3 Chroma FastAPI Python 银河麒麟
RAG Q&A Example
Question
#2 机组给水泵的额定流量是多少?
Retrieved Documents
- 《DG-280/140 型给水泵技术规格书》第 3.2 节
- 《2号机组辅机参数汇总表》Sheet-给水系统
Answer
#2 机组给水泵额定流量为 280 t/h,额定扬程 140 m,配套电机功率 1600 kW。该参数来自设备出厂技术规格书,具体安装参数请以现场铭牌为准。
Sources
- 📄 DG-280/140 型给水泵技术规格书 — 第 3.2 节 · 第 12 页
- 📄 2号机组辅机参数汇总表 — Sheet"给水系统" · B3 单元格
Key Highlights
LLM 离线私有化部署
- 在银河麒麟 + 完全离线的工业内网环境中完成 DeepSeek-R1 系列 70B 级蒸馏模型部署,无法依赖任何公有云服务
- 采用 llama.cpp 推理引擎 + GGUF Q4_K_M 量化方案,在单卡环境下将显存占用降至 40GB 以内,推理速度满足交互需求
- 通过 FastAPI 封装标准化推理 API,支持流式输出(SSE),对接前端 Web 与移动端多终端访问
llama.cpp GGUF Q4_K_M 银河麒麟 FastAPI
RAG 知识库与检索链路
- 对 500+ 份设备手册、运维规程、安全制度文档进行结构化分块,按文档类型设计差异化分块策略(手册按章节、规程按条目、表格按行列)
- 使用 BGE-M3 多语言 Embedding 模型生成向量,写入 Chroma 向量库,支撑秒级语义检索与 Top-K 召回
- 检索结果经相关性排序后注入 LLM 上下文,回答强制标注原始文档名称与页码,确保可溯源
BGE-M3 Chroma Embedding 语义检索
Prompt Engineering 策略
- 设计系统提示词边界约束:限定回答范围为知识库内容,超出范围明确告知"未找到相关资料"
- 强制来源引用机制:每条回答必须附带原始文档名称和定位信息,杜绝无根据回答
- 回答格式模板化:针对不同问题类型(参数查询、操作步骤、故障排查)设计结构化输出模板
Prompt Engineering System Prompt 格式模板
效果评测与持续优化
- 构建工业场景测试用例集,覆盖设备参数查询、操作规程检索、故障排查建议等典型场景
- 设计评测指标:回答准确率、来源标注率、幻觉率、检索召回率,建立量化评估基线
- 根据评测结果迭代优化分块策略、检索参数和 Prompt 模板,幻觉率持续下降
Evals 幻觉率 召回率 评测体系