这期评测 PageIndex:一套面向长文档的 reasoning-based RAG。PageIndex 在 2026 年 8 月 28 日登上 Product Hunt 24 小时趋势榜首,条目显示 312 票。这个上线线索值得跟进,因为 PageIndex SDK 最近把完整的本地工作流也放进了同一个客户端。
PageIndex 会先把 PDF 整理成带标题、页码范围、摘要和嵌套章节的层级树,再让 LLM 沿着树判断哪些章节真正相关。传统向量 RAG 依赖固定分块、embedding 和向量库,短新闻、邮件检索与通用探索往往更直接;PageIndex 更贴近财报、法规、合同、技术手册这类需要看完整结构、保留页级依据的文档。
最稳的首测方法,是拿一份公开、无敏感信息的文字型 PDF 跑完四步:先执行
pip install -U pageindex;再准备自己的模型 key;然后用 PageIndexClient 指定 index_model、chat_model 和本地 storage_path,调用 submit_document() 建树;最后调用 client.chat() 提问,并在 system message 里要求返回文档名和页码,再回看原 PDF。先验收树是否保留章节关系、答案能否落到页码、重复提问是否复用同一份索引,再考虑接入真实资料。成本和数据路径要分开看。Local 免 PageIndex 软件费,索引存于本机,但仍会调用读者自己的 LLM 并产生模型费用;官方本地基准给出的索引成本约为每页 0.001 美元,属于厂商测试口径。Cloud Free Trial 提供 200 credits、最多 200 个活跃页面;Standard 为每月 30 美元,含 1,000 个每月到期 credits、最多 10,000 个活跃页面。Cloud 路径会负责解析、OCR、图像理解和托管存储,文件会交给 PageIndex Cloud 处理;托管 Chat API 还会按输入与输出 token 消耗 credits。
PageIndex 官方页面自述 FinanceBench 达到 98.7% 准确率;本期没有独立复现这个结果,所以读者应把它视为厂商 benchmark 线索。选择时,文字型 PDF 与私有开发先试 Local;扫描件、图像密集文档和大规模集合再看 Cloud;短文本、通用探索或已有向量基础设施的任务,可以继续比较传统向量 RAG。先用同一份公开 PDF 对比树形检索、引用页码、出站路径和实际模型账单,选择会更稳。
来源:


Comments
Sign in to comment.