skip to content
技术学习

RAG 落地实战:Chunk 切分、语义检索与重排(Rerank)的权衡取舍

告别盲目接入向量数据库:从文档切片粒度、关键词与向量混合检索到 Cross-Encoder 重排实战权衡。

在 AI 产品落地中,很多团队把 RAG(检索增强生成)简单理解为“把文档切一切丢进向量数据库,问问题时 Top-K 召回塞进 Prompt”。

但在真实的业务场景中,这种天真的做法通常会在一个月内暴露出三大致命缺陷:

  1. 语义切碎导致上下文断裂:一个包含严密逻辑或多级嵌套表格的知识点,被生硬切成 500 Token 的碎片后,模型只拿到了结论,丢失了适用前提;
  2. 纯向量检索的专有名词盲区:用户搜索产品型号、错误码或特定人名时,向量相似度常常被常见词带偏,而传统的 BM25 关键词匹配反而更准;
  3. Top-K 排序靠前但不相关(Noise):召回了 5 个片段,其中第 1 个是废话,第 4 个才是关键答案,模型产生注意力稀释(Lost in the Middle)。

AI PM 在技术方案评审时需要把握的三个关键决策点:

  1. 切片策略(Chunking Strategy)按业务文档结构定制

    • 扁平纯文本:采用带 10%~15% Overlap 的滑动窗口;
    • 规则与手册:采用父子文档切片(Parent-Child Chunking),小块切片用于精准检索定位,召回时带出父级完整上下文;
    • 表格与结构化数据:转换为 Markdown 表格或提前提炼为 Key-Value 问答对。
  2. 检索阶段必做“混合检索(Hybrid Search)” 采用 BM25(稀疏检索)+ Embedding(稠密向量检索) 双路召回,通过 RRF(Reciprocal Rank Fusion)加权融合,兼顾专有名词精确匹配与泛语义理解。

  3. 召回后引入重排(Cross-Encoder Rerank) 初筛召回 Top-20,经过专门的 Rerank 模型(如 BGE-Reranker 或 Cohere Rerank)重算深度相关性得分,只截取 Top-3~5 喂给 LLM。这一步通常能使问答准确率提升 15%~25%,且大幅节省 Prompt Token。

PM 视角总结: RAG 的本质不是高大上的算法炫技,而是一场极其严谨的数据清洗与检索链路调优。AI PM 必须深入召回命中率与截断分数的细节,才能做出真正可信的知识库产品。