
AI PM 面试精华:企业知识库助手的权限、新鲜度与引用怎么答
本期用企业 AI 知识库助手做主案例,拆解知识接入、权限继承、索引延迟、引用与无答案兜底,让你把「给公司做一个 AI 知识库」答成可上线的软件产品方案。
今日题目:设计一个企业 AI 知识库助手
面试官可能会这样问:「公司有很多散落在文档、聊天和项目系统里的资料,请你设计一个 AI 知识库助手,让员工可以直接提问。」
这道题容易答成「接入文档、做向量检索、调用大模型」。但企业软件真正难的是三件事:员工能不能只看到自己有权访问的内容,答案是不是足够新,回答里的每个关键判断能不能回到原文。今天用这三个问题做主线,再补上无答案兜底和评估指标,整理一套能在面试中复述的回答。
先给结论:先做可信问答,再做自动执行
第一版不应该承诺「替公司记住所有知识」,而应把范围收窄为:
- 面向内部员工的知识问答和资料定位;
- 只使用当前用户有权限访问的内容;
- 每个关键结论带来源、更新时间和原文入口;
- 证据不足、权限不明或索引过期时明确降级,不强行生成答案。
这样定义,产品的核心闭环就很清楚:身份识别 → 权限过滤 → 检索证据 → 生成回答 → 引用核验 → 反馈纠错。第一阶段先证明「员工能更快找到可信资料」,而不是追求让 AI 替员工做审批、发通知或修改知识库。
考点一:你会怎样定义用户任务和知识边界?
面试官在看什么
面试官不是只想听「支持自然语言问答」,而是要看你能不能区分不同类型的问题,以及能不能把产品的承诺限制在可验证的范围内。
参考回答骨架
我会先把问题分成三类:
- 定位型:例如「报销规则在哪里」「上个季度的发布复盘是哪一份」。这类问题优先返回文档、段落和负责人,目标是缩短查找时间。
- 解释型:例如「为什么这个版本取消了某个功能」。这类问题可以综合多份资料,但需要列出证据,并区分原文结论和模型归纳。
- 行动型:例如「帮我提交报销」「通知项目群」。第一版只提供操作建议或跳转入口,不直接执行有外部影响的动作,除非用户明确确认且系统能记录审计。
知识范围也要分层。政策、流程和产品规格可以作为相对稳定的知识;聊天记录、草稿和临时讨论则要标记状态和时间,不能因为「检索到了」就和正式制度放在同一层级。回答中可以展示「正式制度」「项目文档」「讨论记录」等来源类型,帮助用户判断可信度。
一句可复述的话
我不会把所有可检索内容都当成同等权威。先按任务类型定义输出,再按来源类型、状态和更新时间控制答案承诺;涉及外部动作的需求先停在建议和确认,不让知识问答直接变成自动执行。
考点二:权限应该放在哪里,而不是交给模型自己判断?
关键判断
权限是检索链路的前置条件,不是生成答案后的补丁。模型即使「知道」某份文件存在,也不代表它可以看到文件内容,更不代表它可以在回答中透露文件存在。
微软对 Microsoft 365 Copilot 的公开说明提到,Copilot 会遵循组织的身份模型和权限,并继承敏感度标签、保留策略和交互审计能力。1 Slack 的企业搜索说明也明确写到,搜索结果、AI 答案和 Slackbot 回复只包含搜索者有权限访问的源内容。2
参考回答骨架
我会把权限设计成四层:
- 连接层:接入文档、网盘、聊天和项目系统时,记录来源系统、文档 ID、所有者、用户或群组权限,以及权限更新时间。
- 检索层:用户提问时先确认身份,再用权限过滤候选内容。过滤应发生在召回和排序之前,不能先把无权内容交给模型,再靠提示词要求它「不要泄露」。
- 生成层:模型只接收已经通过权限校验的片段;引用链接再次检查访问权,避免出现用户看得到答案、却打不开来源的断链体验。
- 变更层:权限撤销、群组变化和文档删除都要触发索引更新;在同步完成前,宁可临时收紧结果,也不要继续沿用不确定的访问状态。
产品上还要区分「没有找到」「没有权限」「正在同步」三种情况。对无权限内容不能返回标题、摘要或「你没有权限查看这份文件」这种可能暴露其存在的提示;可以统一提示「当前可访问资料中没有足够证据」,并给出申请访问或联系负责人的入口。
追问:为什么不能只在回答后做脱敏?
因为越权内容可能已经进入检索日志、上下文窗口、缓存或引用生成过程。回答后脱敏只能处理最后一屏文字,不能撤回已经发生的数据暴露。产品经理要把权限校验画在数据流的前面,并把越权命中率设为硬门槛,而不是普通满意度指标。
考点三:如何处理知识「已经变了,但索引还没变」?
先把新鲜度当成产品能力
知识库的风险不只来自幻觉,也来自「引用了一份曾经正确、现在已经过期的文档」。例如审批额度、值班规则、接口地址和客户政策都可能在短时间内变化。
Notion AI Connectors 的帮助文档说明,连接的第三方内容会受现有权限控制,并指出新内容可能需要最长 3 小时才被索引、出现在搜索结果中。3 这说明「接入了数据」和「用户现在就能问到最新内容」是两个不同承诺,面试中要主动说出同步延迟。
参考回答骨架
我会为每类数据定义不同的新鲜度策略,而不是给整个知识库设一个模糊的「实时」标签:
- 强时效资料:如排班、价格、事故状态,优先接事件通知或短周期同步;回答展示最后同步时间,超过阈值就降级为「可能已过期」,并优先引导用户打开源系统。
- 稳定制度:如员工手册、流程规范,采用版本号、生效日期和失效日期;新旧版本同时命中时,优先有效版本,并在冲突时显式提示。
- 讨论和草稿:保留作者、时间和文档状态,默认作为背景材料,不直接覆盖正式政策。
索引状态要对用户可见,至少包括「已同步时间」「来源更新时间」「来源类型」和「是否存在冲突」。如果连接器延迟不可避免,产品就不能把回答包装成实时事实,而应在答案顶部显示「资料同步可能有延迟」。
一句可复述的话
我会把新鲜度拆成来源更新时间、索引更新时间和答案生成时间三个时间点。只有三者都可见,用户才知道答案到底新不新;超过业务阈值时,系统要减少断言、优先给原文,而不是继续生成一个听起来完整的答案。
考点四:引用怎样从「有链接」变成可核验的证据?
引用不是装饰。Slack 的 AI 功能指南写明,AI 答案会给出指向来源消息或文件的引用,用户可以预览或点击查看原始内容。4 这类设计给产品一个明确方向:用户应该能从答案回到证据,而不是只能相信模型的总结。
参考回答骨架
我会要求每个答案都完成三步:
- 证据绑定:把关键句拆成若干主张,每个主张绑定具体文档、段落或消息,而不是只在答案末尾放一个泛链接。
- 证据展示:显示来源标题、来源类型、更新时间和可访问的原文位置。用户点击后应能看到足够上下文,而不是跳到一个很长的首页。
- 证据不足时收缩回答:如果只有一份过期材料,或多份资料互相矛盾,就明确列出冲突来源,减少结论强度;没有可靠证据时返回「当前资料不足」,并给出继续查找的路径。
我还会把「引用支持率」和「引用可用率」分开:前者看关键主张是否都有证据,后者看用户是否能打开引用、引用片段是否真的支持该主张。只统计「答案带了几个链接」会鼓励系统堆链接,不能证明答案可信。
评估指标:别只看点赞率
可以按四组指标搭建第一版评测:
| 维度 | 关键指标 | 面试时要补充的风险 |
|---|---|---|
| 任务价值 | 找到目标资料的成功率、完成任务耗时、有效点击率 | 搜索更快但打开了错误文档,不能算成功 |
| 内容质量 | 有证据回答率、引用支持率、无答案准确率、过期答案率 | 用户说「有帮助」不等于事实正确 |
| 权限安全 | 越权召回率、越权生成率、撤权后的残留命中 | 权限问题应设为硬门槛,不能用平均满意度抵消 |
| 系统体验 | P95 响应时间、索引延迟、失败率、反馈修正闭环率 | 低延迟不能以牺牲权限过滤和证据质量为代价 |
离线评测集要覆盖真实的权限和时间变化:同一问题让不同角色提问,加入已经撤权的文件、刚更新但未完成索引的文档、相互冲突的制度,以及应该拒答的越权问题。线上则抽样检查引用是否支持答案、用户是否打开来源、错误反馈是否在后续索引或提示中被修正。
追问快答:三个容易被问住的细节
问:如果用户说「我知道那份文档存在,直接告诉我内容」怎么办?
答:不改变权限判断。可以提供申请访问、联系文档所有者或查看公开替代资料的路径,但不确认受限文档的标题、摘要和内容。
问:如果两份制度文件冲突怎么办?
答:不替组织拍板。先按生效日期、来源类型和责任人排序;如果仍无法判定,展示冲突并建议找制度所有者确认,同时记录为知识治理问题。
问:为什么不一开始就让 AI 自动更新知识库?
答:因为写入会改变其他人的事实来源。第一阶段先做带引用的建议和待办,把发布、覆盖旧版本和删除操作保留给有权限的人确认;等审核链路、回滚和审计稳定后,再讨论自动写入。
最后一道练习题
你负责的企业知识库助手上线后,员工反馈「答案看起来合理,但经常引用旧文档」。请在两分钟内说明:你会先查哪三个环节,如何区分检索问题和生成问题,以及你会用什么指标判断修复有效?
一个合格的回答至少要覆盖:来源更新时间、索引更新时间、权限过滤后的候选集、引用是否真正支持结论,以及过期答案率的变化。如果只回答「换一个更强的模型」,这道题还没有答到产品问题上。
Related content
- Sign in to comment.
