PageIndex 把文档检索变成了找目录,账单却没消失

PageIndex 把文档检索变成了找目录,账单却没消失

PageIndex 用树状目录和模型推理寻找长文档答案,但云端 credits、模型费用与数据出口仍要由使用者自己算清。

作者丨沐秋
长合同、财报和技术手册最烦人的地方,不是字多。
真正麻烦的是,答案往往藏在一个章节的脚注里,还要顺手跳到另一张表才能核对。
传统向量检索像把整本书撕成纸条,再挑几张“看起来相似”的递过来。
PageIndex 想换一套动作:先把文档整理成目录树,再让模型沿着树往下找。
8 月 28 日,PageIndex 出现在 Product Hunt 过去 24 小时趋势榜,产品主打长专业文档的可验证问答。1
AI 科技评论注意到,它卖的核心不是“又一个聊天框”。
它卖的是一条能回到原文的路。

01|它先读目录

PageIndex 把每份文档做成层级树,节点对应章节、段落或页面,再让大模型判断下一步该看哪一层。23
用户问“递延资产总额是多少”,模型可以先看财务摘要,再顺着“见附录 G”的线索跳到统计表。
这条路径比按关键词捞几段相似文本更接近人读报告的方式,但每一步都要花模型的推理额度。
PageIndex 当前给了两条路。
本地模式把索引、存储和问答流程放在自己的机器上,用户自备 OpenAI、Anthropic 或其他兼容模型的 key;云端模式则把解析、OCR、图片理解、树索引和存储交给 PageIndex Cloud。24
PageIndex 官方工作流图:文档先生成树状索引,再由模型沿树检索
PageIndex 官方开发文档展示的流程:先生成树索引,再由大模型在树上推理检索。2
所以它的优势落在“找对章节并留下出处”,代价落在“模型要替你多走几步”。
开源仓库在 8 月 27 日还有一次提交,最近的 SDK 也加入了本地模式和 PageIndex Flash。5
这个更新让它从一个 RAG 思路,变成了能装进 Python 项目的工具。

02|免费只是第一层

PageIndex Cloud 先给 200 个免费 credits,最多激活 200 个页面,带基础 API 和 MCP 访问。6
Standard 是每月 30 美元,包含 1000 个每月到期的 credits 和最多 1 万个激活页面。
Pro 是每月 50 美元,包含 2000 个 credits 和最多 5 万个激活页面。
Max 是每月 100 美元,包含 6000 个 credits 和最多 50 万个激活页面。6
索引每页消耗 1 credit。
云端问答按输入和输出 token 消耗 credits,额外充值是每个 credit 0.01 美元,充值 credits 不过期。6
还有一笔容易被漏算的账:PageIndex 把模型选择留给用户,本地和云端的问答都可以接自己的模型,模型供应商的推理费用另算。4
一份 1000 页的资料,首次云端索引就先吃掉约 1000 个 credits。
如果团队还要反复追问,Cloud 套餐、充值 credits 和模型 API 会叠在一起。
“免费试用”降低了打开网页的门槛,却没有把长文档处理变成零成本。
本地模式的现金成本更轻,但部署、模型 key、PDF 解析质量和权限管理都落回使用者。
这更像买了一台能自己加油的车,而不是叫来一辆包油的出租车。

03|文档换了出口

PageIndex 的“本地”需要拆开看。
本地模式可以把索引和存储放在自己的机器上;云端模式则明确把文档索引和存储放进 PageIndex Cloud,并提供 OCR、图片理解和托管存储。45
问答模型依旧可以由用户选择,但文档走哪条处理链,取决于你采用哪种索引模式。
官方隐私政策写着,个人数据存储在美国和英国,使用第三方时可能转移到其他国家。
政策还写明,经过匿名化的数据可以无限期用于改进业务,也可能出售给其他企业;该政策最后更新于 2024 年 5 月 17 日。7
服务条款又给了另一层口径:客户保有 Customer Data 的权利,但授予 Vectify AI 在协议期间使用这些数据提供服务的许可,供应商还可以用 Customer Data 改进软件和开发更新。8
条款把服务限定为商业用途,试用期按“原样”提供,试用相关责任上限写成 100 英镑;一般协议的累计责任上限则是过去 12 个月已付费用与 1000 英镑两者取高。8
产品页面强调“答案可追溯”,法务页面提醒你的数据处理与责任边界仍要自己追溯。
对于公开财报,云端模式很方便。
对于未公开合同、客户名单和内部投研材料,真正要问的不是“它有没有向量数据库”。
真正要问的是:原文件去了哪里,索引留在哪里,问答模型拿到了哪些内容,删除后能否确认清理。

04|先拿假文件试

截至本期检索,独立用户验证不足。
Product Hunt 的榜单数据能证明 PageIndex 在 8 月 28 日获得了曝光,官方仓库和文档能证明它怎么工作;这些材料还撑不起对长期稳定性、中文财报效果和大团队权限管理的判断。15
想试的人,可以按四步走。
  1. 先用公开材料。 选一份上市公司年报或公开技术手册,先测试它能否从章节跳到附录,并检查每条引用的页码。
  2. 再做同题对照。 用同一份 PDF 同时跑现有向量 RAG 和 PageIndex,记录答对率、引用位置、延迟与模型费用。
  3. 然后测出口。 把一份脱敏合同放进本地模式和 Cloud 模式各跑一次,分别确认索引文件、原文存储、问答请求和删除路径。
  4. 最后才接业务。 给团队建立文档白名单、模型 key 权限和用量预算,再决定是否把真实资料交给云端处理。
PageIndex 像给一摞报告装上了目录和书签。
它让“答案在哪里”变得更容易核对,却没有替你支付模型费,也没有替你承担数据出城后的判断。
这本目录值得试读,机密文件值得慢一点翻页。

References

  1. 1
  2. 2
    PageIndex Developer Docs

    docs.pageindex.ai

  3. 3
  4. 4
    PageIndex Getting Started

    docs.pageindex.ai

  5. 5
  6. 6
    PageIndex Subscription

    docs.pageindex.ai

  7. 7
  8. 8

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

  • Sign in to comment.
More from this channel