跳到主要内容

PageIndex:基于推理的 RAG 新架构

PageIndex 是 VectifyAI 推出的一种新型文档检索架构,并非传统向量 RAG 的替代品,而是一种基于推理(Reasoning-based)的 RAG 进化方案

它通过消除向量数据库(Vector DB)和传统的切片(Chunking)过程,专门解决传统 RAG 在处理复杂、长文本时的痛点。

与传统 RAG 的核心差异

传统 RAG 依赖"向量相似度"搜索,而 PageIndex 模仿的是人类查阅文档的方式:

维度传统向量 RAGPageIndex
检索方式向量余弦相似度LLM 推理逐级定位
文档处理切片(Chunking)保留原始结构,构建树状索引
索引形式向量数据库层级目录树(摘要 + 标题)
跨章节关联强,可在树状结构中跳转
速度快(毫秒级)慢(多次 LLM 调用,可能十几秒)
成本高(每次检索消耗 Token)

工作原理

PageIndex 的检索流程分两个核心阶段:

阶段一:构建树状索引

它不会将文档切碎,而是利用 LLM 分析文档结构,生成一个层级分明的"智能目录树"。每一层包含摘要和标题,而不是原始全文。

阶段二:推理检索

当用户提问时,LLM 查看这棵"树",先在顶层判断"这个问题应该在哪个章节?",然后逐级深入,直到定位到具体段落。

解决了哪些传统 RAG 的痛点

  • 切片破坏语境:传统 RAG 如果把一段话切成两半,AI 就读不懂了。PageIndex 保留了文档的自然结构。
  • 语义距离不等于正确答案:有时候相似的语义并不代表是正确的答案。PageIndex 通过逻辑推理来找答案,而不是靠计算数学距离。
  • 跨章节关联:比如"财报中 A 节的收入对比 B 节的成本",传统 RAG 很难同时精准抓取。PageIndex 可以像人一样在树状结构中跳转。

局限性

虽然 PageIndex 在金融文档(如 FinanceBench 测试)中表现远超传统 RAG,但也有明显的权衡:

  • 延迟高:检索过程涉及多次 LLM 推理调用,速度远慢于向量数据库检索
  • 成本高:每次检索都在消耗 Token,不适合高并发、低延迟的场景(如客服机器人)
  • 规模限制:目前更适合针对单篇或少量长文档深度挖掘,不适合百万量级文档库的大海捞针

适用场景

以下场景推荐尝试 PageIndex:

  • 需要处理超长 PDF(如 200 页的标书、年报)
  • 对准确率要求极高,不能容忍 RAG 常见的"张冠李戴"
  • 想要集成到 AI Agent 中(PageIndex 提供了 MCP Server 支持,适合与 Claude Code 配合使用)

以下场景建议继续使用传统向量 RAG:

  • 需要快速检索海量 Wiki 页面或知识库
  • 并发量大、对响应时延有要求
  • 成本敏感型项目

:::tip 选择建议 两者并不互斥。可以用传统 RAG 做粗筛,再用 PageIndex 对高价值文档做精准深挖。 :::

相关链接