RAG 向量库

01.多源数据清洗与预处理

将非结构化的文档转为干净标准纯文本,包括 ocr 识别,噪声剔除(广告/页眉页角)及元数据(Metadata)提取
Unstructured->``Layout(布局) Analysis->``Markdown 转换

提取标题 时间 分类等作为元数据,为后续“条件过滤查询”打基础

02.智能分片(chunking)

解决长文本超过 Embedding 模型窗口限制及语义碎片化问题,不能语义断裂所以不固定长度
一般是递归切分 Recursive Split 语义段落切分 滑窗重叠(上下文缓冲)
采用 small-to-big 架构,存储小块用于检索,检索出来的父块(大)用于 LLM 生成上下文

  • Recursive Split:分层递归切割,优先在自然分隔点拆分文本
  • 语义段落切分:遵循语义边界分块,保障片段逻辑完整
  • 滑窗重叠:切片预留重叠缓冲区,防止上下文断裂丢失信息

03. 高维向量化 (Embedding)

将文本转化为计算机可理解的数学向量。选择合适的 Embedding 模型决定了语义空间的相关性。

双塔模型``BGE-M3 / m3e``Batch Processing

💡🚀 性能优化: 针对特定行业语料进行微调 (Fine-tuning),并使用批处理接口显著提升入库吞吐量。

  • 双塔模型:主流 Embedding 网络架构,分别编码【查询文本】和【知识库文档文本】,适合向量检索场景;
  • BGE-M3/m3e:当下中文场景最常用的开源 Embedding 模型,支持稠密向量、稀疏向量、多向量混合检索;对不同场景要微调
  • Batch Processing(批处理):不要单条文本依次调用模型,批量送入 Embedding 模型推理,大幅提升文档向量化入库速度。

04. 向量存储与索引构建

将向量及对应的原始文本、元数据存入专用向量数据库,构建高效查询索引。

HNSW 索引``IVF_PQ``向量数据库

⚙️ 工程挑战: 大规模数据下选择 HNSW 索引权衡检索速度与精度,并实现多租户数据隔离。

  • 向量数据库:支持基于语义相似度检索,不局限于精确关键词匹配。
  • HNSW:主流索引策略,平衡速度与高召回精度,中小企业知识库首选。
  • IVF_PQ:向量压缩方案,适合亿级超大向量规模,以小幅精度损耗换取更低硬件开销。

05. 检索增强与验证 (Optimization)

入库后的最后一步是闭环验证。通过混合检索和重排序提升最终召回质量。

Hybrid Search``Rerank 重排序``HyDE 虚拟文档

🎯 效果突围: 引入 Reranker 模型对 Top-50 结果进行精排,彻底解决 “语义相近但事实错误” 的痛点。

  • *Hybrid Search:关键词 + 向量检索融合,兼顾精准词与语义匹配
  • *Rerank 重排序:粗筛后精细打分,过滤看似相近实则无关的文档
  • *HyDE 虚拟文档:ai 生成模拟答案辅助检索,提升短问句召回质量

数据决定模型表现的下限,工程能力-> 这一整套决定上限

🔨 精细化预处理 垃圾入,垃圾出。数据质量是 RAG 系统的天花板。
🔗 上下文保持 利用父子块和重叠机制,守住知识的语义完整性。
📈 工程化闭环 通过混合检索与重排序,实现工业级的召回精度。