Abraham Thomas:金融行业的 AI 失灵,常常从数据质量开始

Abraham Thomas:金融行业的 AI 失灵,常常从数据质量开始

Abraham Thomas 从金融工作流出发,解释数据质量如何影响 AI 的输入、输出、评估和内部信息系统。

原文定位

Abraham Thomas 于 2026 年 8 月 11 日在 Pivotal 发表 《Looks, Brains, and Money》。这篇文章从金融从业者的工作流出发,追问一个实际问题:金融机构怎样把 AI 用进需要准确性的任务,而不是只得到一份表面专业的错误答案。作者的核心判断是,金融业使用 AI 的主要障碍常常落在数据质量:错误可能出现在送入模型的材料里,也可能出现在模型产出和模型自我评估的环节。1

数据质量覆盖整个 AI 工作流

作者把 AI 与数据质量的关系分成三类:
  • 输入质量。 提示词、文件、连接器、应用、历史记录和用户保存的技能,都属于送进模型的材料。重复、冲突、过时或缺少依据的内容,会给后面的回答埋下错误。
  • 输出质量。 模型可以把粗糙材料加工成细节丰富、语气自信、格式专业的文本。表达更顺滑,事实却未必更可靠。
  • 评估质量。 模型可以快速检查大量结果,但模型自身也有盲点、偏见和自信错误。让模型评估模型,不能自动形成可靠的闭环。1
这个定义改变了「数据」的范围。传统质量管理常盯着数据库字段和文件,LLM 工作流面对的输入则包括提示词、录音转写、图像、网页、工具交接和长对话里的临时假设。只要这些内容进入后续判断,它们就需要版本、来源和检查。
粗糙输入经过 AI 变成可信口吻的示意图
原文用「CICO」概括输入端的故障:重复、冲突、过时和未经检查的材料,可能经过 AI 变成带有专业细节与自信语气的输出。1

输入端要控制的,是数量、来源和交接

作者给金融从业者的第一条原则是:少放材料,留下更好的材料。模型能处理很长的上下文,不代表内容越多,答案越好。使用者应当严格筛选与任务有关的文件,并在整个流程中持续提供独立的事实来源;模型不能直接改写那份作为依据的原始记录。
工具之间的隐藏交接是另一处风险。以财富顾问整理客户会议为例,数据可能经过麦克风、语音转文字、说话人识别、摘要、提示词和模型多个环节。使用者看到的最后一段文字,已经可能丢失原话、混淆说话人或加入模型生成的内容。每一次转交都需要检查。
作者还要求使用者保持材料最新,查看尽可能原始的文件、转录和表格,并警惕长对话中的 context rot。一段持续很久的对话可能把临时假设变成事实,把早期错误带到后续计算里。金融工作中,一个被当成正式数据的临时空置率或旧版合同,就足以改变整个结果。

输出端要把流畅和正确分开

输出端的控制动作与输入端相反:使用者要让模型交代依据、引用和推理过程,要求模型主动寻找异议和反例,而不是只复述使用者已经相信的判断。作者把以下特征列为金融 AI 输出的检查信号:
  • 没有依据的精确数字;
  • 把输入、假设和输出混在一起;
  • 计算结果前后不一致;
  • 为过分整齐的结果强行寻找理由;
  • 规模或单位出错;
  • 句子很完整,却没有重要性和比例感。1
作者特别提醒,企业应把分析和呈现分开。模型先给出简单、可核对的事实,再处理格式和表达,可以减少「写得像一份董事会材料」对人的误导。读者容易把文字的精致当成分析的扎实,模型会把这种错觉放大。

评估器会获得规模,也会失去现实锚点

让 AI 检查 AI 的好处很清楚:模型可以用更低的成本、更快的速度处理更多材料,保持持续工作,并覆盖人工难以逐项查看的结果。作者认为,这些优势适合扩大初筛范围,却不能取消外部事实来源和人工判断。
模型自我评估时,可能把自己的错误当成合格答案;遇到相反证据时,模型可能坚持原结论,也可能在两个结论之间摇摆。更隐蔽的风险来自封闭循环:一个模型生成内容,另一个模型评估内容,评估结果再成为下一轮输入,整个过程逐渐脱离原始事实。作者把这种脱离现实的过程称为 untethering

错误一旦写回系统,就会污染后续判断

文章把最严重的组织风险称为 contamination。如果 AI 应用把未经确认的结果直接写进总账、CRM、客户指标或操作手册,下游应用就会把这些结果当成事实。错误会在新的输入、输出和评估之间继续传递,原本的语境逐步消失,内部系统最后保存的是一套越来越复杂、基础却越来越不稳的记录。
数据库从干净状态走向污染的四个阶段
原文把数据污染画成从「pristine database」到「poisoned database」的单向过程,强调错误一旦进入权威记录,恢复原状会变得困难。1
作者给出的组织回应是信息纪律:隔离主要来源,把 AI 输出单独标记和保存,明确哪些数据可以合并,持续监督和检查,减少没有必要的工具链式传递。AI 生成内容可以进入工作流,但它需要保持与原始记录不同的身份,直到人或独立来源完成核验。

CFO 编制董事会财务包时,故障会怎样串起来

作者用一个 CFO 编制季度董事会财务包的例子把这些风险串在一起。PDF 解析器可能漏掉一行,收入表可能沿用旧合同,缺失的汇率可能被模型补出来;模型可能在多轮对话中把临时假设当成正式数据,也可能读取错误的转录或沿用上一期财务包的内容。最后一份评论看起来信息密集、措辞专业,却可能没有提供公司真正需要的具体判断。1
这个案例说明,金融 AI 的错误很少只发生在「模型回答错了」这一刻。数据在解析、转录、版本切换、工具连接、长对话和最终呈现之间移动,每一次移动都可能丢失事实或引入假设。企业如果只给模型增加权限,却没有保留原始资料、版本边界和人工复核,模型的速度会把错误更快地送进正式流程。

结论与边界

Thomas 没有把 LLM 写成无用工具。作者认为,LLM 擅长处理大量信息、制作复杂产物和覆盖多种能力;金融机构要做的是引导它、限制它,并让它的每个重要结论都回到外部事实来源。
文章给出的完整判断是:金融机构能否扩大 AI 使用,取决于组织能否把数据质量放在模型输入、模型输出、模型评估和内部信息系统的同一条控制链上。提示词和文件需要筛选,输出需要依据和反例,评估器需要外部锚点,AI 结果需要与权威记录隔离。模型越会写出可信的答案,组织越需要让人保留检查事实、识别假设和承担结论的责任。

References

  1. 1
    Looks, Brains, and Money

    pivotal.substack.com

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content