AI PM 面试精华:AI 合同审查助手的证据、风控与复核怎么答

AI PM 面试精华:AI 合同审查助手的证据、风控与复核怎么答

本期用 AI 合同审查助手做主案例,拆解条款抽取、证据定位、风险分级、人工复核、权限审计和风险加权指标,帮你把「AI 审合同」答成可控的企业软件方案。

先给结论:AI 不负责下法律结论

面试题可以这样设定:一家 200 人的 SaaS 公司想做合同审查助手。采购同事上传供应商合同后,希望系统在几分钟内指出自动续约、赔偿、责任上限、数据使用和终止条款的风险,并告诉他下一步该找谁确认。
低分回答通常是「上传合同,AI 总结重点,再标记高风险」。问题在于,它没有说明什么可以自动做,什么必须交给人,也没有回答风险判断凭什么成立。
更稳的回答是:第一版只做「条款抽取 + 公司标准条款对比 + 证据定位」,不直接给出「可以签」或「不能签」的法律结论。每一条风险都要附上原文位置、对照的规则、模型置信度和建议动作;低置信度或高影响条款进入法务复核。
这条边界也有现实产品依据。Microsoft Copilot Cowork 的合同分析示例覆盖关键商业条款、风险条款、义务与截止日期、非标准条款,并要求用结构化结果呈现风险等级和摘要。1

1. 把任务拆成三层,先回答「AI 到底做什么」

层级例子产品动作是否自动通过
事实抽取合同期限、付款金额、续约通知期从原文提取字段并标出位置低风险字段可自动展示
规则对比公司的责任上限是 100 万,供应商合同写成无限责任对照版本化的合同 playbook,标记偏离生成建议,交给指定复核人
决策与执行是否接受条款、是否发起谈判、是否批准付款提供建议、分派任务、记录处理结果不替代法务或授权审批人
面试官追问「为什么不让 AI 直接判断能不能签」时,可以这样答:合同审查里的事实识别和规则匹配适合自动化,但「风险是否可接受」还取决于交易金额、供应商类型、业务场景和公司的授权规则。产品应该把判断拆成机器能证明的部分和人必须承担的部分,避免一个看似明确的结论掩盖了上下文缺失。
面试时可直接复述:
我会先把助手定位成审查副驾驶,而不是自动签约人。它负责找出条款、对照 playbook、说明偏离在哪里;法务或采购负责人负责确认风险是否可接受,并决定是否发起修改。

2. 风险卡片必须能回到原文

「高风险」三个字没有证据时,几乎不能用于审批。一个可复核的风险卡片至少要包含:
  • 条款原文和页码、段落或坐标;
  • 对应的公司规则与规则版本;
  • 偏离内容,例如「责任上限缺失」或「续约通知期短于标准」;
  • 风险等级和置信度;
  • 建议动作,例如「法务确认」「补充供应商材料」或「进入谈判」。
Azure Content Understanding 的文档分析能力支持为字段提供 0 到 1 的置信度,也支持返回原文页码、空间坐标和字符片段,用于追溯和人工复核;高置信度结果可以自动处理,低置信度结果可以转人工。2
这里有一个容易答错的点:置信度是路由信号,不等于法律风险概率。模型可能很确定地读错扫描件,也可能准确提取了条款,却不理解该条款对这笔交易的影响。官方文档也提醒,标注样本不能自动修正 OCR 把字母 l 识别成数字 1 这类错误。2
因此,评测时要把「提取正确」「定位正确」「风险判断正确」分开。没有原文支撑的风险卡片,应该显示为「待确认」,而不是用更强的语气补齐答案。

3. 权限设计要覆盖审核前后

合同不是普通知识库资料。产品方案至少要回答四个问题:谁能上传,谁能看到,谁能批准,以及批准后系统能做什么。
一个可落地的流程是:合同进入对应业务或法务空间后,系统只读取当前用户有权访问的文件;抽取结果继承合同权限;高风险条款分派给指定复核人;复核人需要留下通过、拒绝或要求修改的结果和理由;所有变更保留审计记录。对外发送、修改合同状态、触发付款等动作,都要在明确确认后执行。
Microsoft 365 的合同管理方案采用安全 Teams 频道组织利益相关者,成员可以查看、审核、批准或拒绝合同,Power Automate 负责更新 approved 或 rejected 状态并通知相关成员。3 这类案例适合在面试里用来说明:人工复核不是一个孤立按钮,而是权限、通知、状态和审计组成的工作流。
如果面试官继续问「能否自动批准低风险合同」,可以回答:可以做分级自动化,但要先定义不可自动放行的条款清单,例如无限责任、知识产权赔偿、数据跨境和自动续约。自动化的前提是规则版本可追踪、证据可回看、阈值能调整,并且保留抽检和撤回机制。

4. 指标不要只报一个准确率

离线评测

  • 条款召回率:标准合同中的关键条款有没有被找到;
  • 高风险条款漏报率:对无限责任、数据使用、知识产权等条款单独加权;
  • 字段与证据准确率:金额、期限、主体和原文定位是否一致;
  • 风险分级一致率:模型和法务复核人的判断差异有多大;
  • 低置信度路由准确率:真正需要人工的结果有没有被送到人工环节。

上线指标

  • 合同从上传到首次完成复核的时间;
  • 复核人打开证据后直接接受建议的比例;
  • 高影响条款的严重漏报率;
  • 人工改写、退回和二次复核比例;
  • 复核完成率,以及从风险发现到谈判任务创建的转化率。
Crosschq 的 AI PM 面试题把「如何定义 AI 产品成功指标」「如何处理模型有概率出错」列为独立考察点。4 你可以借此把回答从「模型准确率 90%」推进到「高风险漏报是否下降、法务是否少花时间、建议是否真的完成了工作流」。

3 个快速追问

没有公司标准 playbook,怎么办?

先提供事实抽取、条款对比和原文问答,但不伪装成通用法律意见。让法务先配置少量高价值规则,标明适用合同类型、风险等级、例外条件和规则版本,再逐步扩展覆盖面。没有规则时,系统可以说「合同里出现了无限责任」,但不该直接说「这一定不能接受」。

模型对 90% 合同都有效,却漏掉少数赔偿条款?

按风险加权重做评测,不能被平均准确率掩盖。对高影响条款设置硬门槛,漏报就进入人工抽检或整份合同升级;同时检查扫描质量、条款位置、合同语言和模板来源,确定问题出在抽取、检索还是风险分类。

长合同超过上下文窗口怎么办?

先按页码和章节切分,再用条款类型召回相关片段,保留章节层级、页码和前后文。最终答案只引用已定位的片段;无法确认上下文时,展示缺口并请求人工补充,不把相邻片段拼成看似完整的法律结论。

练习题

你要为一家跨境 SaaS 公司设计合同审查助手,目标是把采购合同初审时间缩短一半。请在 3 分钟内回答:
  1. 第一版服务哪类合同,为什么?
  2. 哪些条款自动抽取,哪些条款必须人工复核?
  3. 风险卡片需要展示哪些证据?
  4. 如何设计权限、批准和审计流程?
  5. 上线前后分别看哪些指标?
参考回答可以按这个顺序组织:先限定合同类型和用户,再拆「抽取、对比、决策」三层,接着讲原文证据和风险分级,最后补上权限、人工接管与风险加权指标。这样回答,面试官能听见你如何把模型能力翻译成一条可控的业务流程。

Related content

  • Sign in to comment.
More from this channel