1/9

Paul Appleby:AI 工厂做大了,为什么还找不到故障根因?

Eye on AI 对谈 Virtana CEO Paul Appleby:拆解 AI 工厂的全栈可观测性、根因定位、GPU 利用率、Token 成本与治理。

Eye on AI 对谈 Virtana 总裁兼 CEO Paul Appleby:当 AI 基础设施从试验走向关键服务,真正难的不是再买多少 GPU,而是能否看见整套系统、解释故障、控制成本,并把治理跟上投资速度。1
本期基于官方完整 MP3 的全量 ASR 整理。正文前半部分按节目顺序提炼要点;文末另设「逐句全文翻译」,只保留中文译文,并保留主持人 Craig 与嘉宾 Paul 的说话人标签。

先看图

这组 9 张卡片依次回答:Paul Appleby 是谁、AI 工厂为什么不是 GPU 仓库、根因为什么难找、可观测性如何跨层工作、Token 价格与总成本为何背离,以及为什么技术风险正在进入董事会视野。

一句话判断

AI 基础设施的瓶颈,正在从「能不能把模型跑起来」转向「能不能把整套系统稳定、可解释、可计价地跑起来」。
Appleby 的核心判断不是反对继续投资 AI,而是提醒企业:基础设施、控制和治理不能以不同速度向前跑。否则,AI 工厂越大,故障越难定位,GPU 越可能闲置,Agent 越可能把总消耗推高。

嘉宾背景

Paul Appleby 是 Virtana 总裁兼 CEO,负责一家专注于混合云与全栈基础设施可观测性的公司。Virtana 官方领导团队页称,他的工作重点包括 AI 工厂、IT 基础设施、云平台和企业应用中的高增长业务;加入 Virtana 前,他曾在 Elastic、SAP、Salesforce、BMC 等公司担任领导职务。2
Virtana 在 2024 年宣布任命 Appleby 为 CEO,并称他曾在 Elastic、Kinetica、BMC Software、Salesforce 和 Travelex 担任 CEO 或其他领导职务。3

按节目顺序整理的完整要点

1. 可观测性首先是业务韧性,不只是技术监控

Appleby 先把 Virtana 的任务定义得很清楚:银行、电信、医疗、零售、航空等行业都越来越依赖技术;对许多企业而言,技术和基础设施已经是最严重的灾难性失败风险之一。
因此,可观测性要回答的不是「某个组件有没有亮红灯」,而是:支撑业务和客户的关键服务是否保持性能与可用性?问题出现时,系统能否快速识别风险、找到原因并采取修复行动?
Virtana 并不是生成式 AI 热潮之后才开始使用 AI。Appleby 说,公司已经持续十多年建设 AI 与机器学习能力,用实时流入的事件数据做映射和关联,再识别风险与威胁;最近新增的是 Agent 能力,用于自动化一部分 IT 运维。

2. AI 工厂不是一堆 GPU,而是一套异构系统

在 Appleby 的描述里,一项关键业务服务往往由数据、应用、网络、计算和存储组成,可能横跨公有云、传统基础设施和本地部署环境。现代企业的真实状态是异构、混合,而且会动态变化。
AI 工厂同样如此。它不仅包含 GPU,还包括数据管道、AI 工作负载、编排层、计算、网络、存储,以及承载这些层的基础设施。Retail、航空和医疗的例子说明,真正需要保障的也不只是面向客户的应用:供应链、后台系统、机组排班、航班调度、电子健康记录和远程诊断都可能成为关键依赖。
Virtana 官方对 Appleby 另一场公开谈话的概括也采用了同一逻辑:现代数字服务跨越应用、基础设施、云平台和 AI 工作负载,需要从完整系统而不是孤立组件理解性能问题。4

3. 投资跑得比治理快

「AI Factory Reality Check」研究关注的不是 AI 有没有价值,而是企业在大规模投资 AI 数据中心时,治理和控制是否同步到位。
Appleby 认为,企业和政府采用 AI 后,很多 AI 基础设施会部署在本地,以承载大规模业务场景。但现实是,AI 数据中心和所谓 AI 工厂的投资增长很快,优化韧性与效率所需的治理、控制和可观测性却没有以同样速度跟上。
他的建议是把传统基础设施里已有的治理和控制复制到 AI 数据中心,而不是因为进入新技术周期,就把原有的生产纪律暂时放在一边。研究的作用,是在投资热潮里按下一个检查点:机会很大,但治理也必须一起上线。

4. 六成企业知道工作负载失败,却找不到跨层根因

研究中的核心数字是:六成企业无法在 AI 工作负载失败时,自动识别跨 AI 基础设施域的根因。1
原因在于系统复杂度。一个 AI 工作负载可能从数据管道一路经过 AI 编排、计算、网络和存储。它变慢或失败时,真正的问题可能发生在任何一层。Appleby 特别强调:大量故障没有被识别出的根因;没有因果关系,就很难可靠地进入修复阶段。
这会带来三层损失:
  • 关键服务无法承受较高的 AI 工作负载失败率;
  • GPU 可能因为工作负载被限流而处于闲置状态,企业投入了昂贵算力,却没有得到相称回报;
  • AI 数据中心的能耗和环境影响会因为低效运行而被进一步放大。
很多企业目前的做法,是从技术栈各层拿到一些遥测,再由 IT 专业人员手工拼接。发生服务中断时,原本在 NOC 里的人员,加上临时拉进电话会议的专家,一起寻找「到底哪里出了问题、应该怎样修」。这仍是许多企业的现实,而不是可持续的生产机制。

5. 全系统视图是 Agent 自动化的前提

Appleby 的顺序很重要:先捕捉完整遥测,再做动态映射和实时关联,之后才有条件使用 Agent 加速因果定位和自动修复。
Virtana 的平台据 Appleby 介绍,已经深入连接传统基础设施和 AI 基础设施的各层,在亚秒级时间窗口捕捉约 20,000 个不同指标,并在接近实时的状态下对这些指标做关联和映射。1
流程可以拆成四步:
  1. 从整套技术栈捕捉指标、事件和遥测;
  2. 通过动态映射把不同层的信号放回同一系统关系中;
  3. 用模型识别模式,推断因果并给出修复建议;
  4. 根据企业政策,自动执行修复,或把带有支持证据的建议交给人工操作员。
他反复强调,只有局部可见性时,所谓自动化也只能自动化某一段;没有系统级视图,就很难得到真正的自治结果。

6. 它不是网络安全产品,但丰富遥测可以增强安全能力

Appleby 明确表示,Virtana 不把自己定位为网络安全解决方案,主要关注基础设施。但当平台能够摄取、分析、关联大量事件并识别异常时,客户可以把这些数据用于增强已有的安全能力。
对于重复出现的异常,系统可以更快识别模式并定位因果;对于新异常,大量历史数据也能帮助系统更快学习模式、提出修复建议。是否自动修复,取决于企业所处的 AI 与自动化阶段,以及企业愿意采用的政策。
他还分享了一个观察:在一些大型技术供应商和客户的 AI 实验室里,Virtana 发现了客户自己都没有完全理解的异常和使用模式。可观测性的价值不只是事后报警,也可能帮助企业重新认识自己的系统。

7. 这件事由谁负责?答案正在向 C-level 移动

这不是又一个报警面板。底层使用者可能是 IT 运维人员,特别是负责可靠性的 Site Reliability Engineer;但推动购买和治理的人,往往是负责 IT 运营、基础设施韧性与效率的高级管理者。
Appleby 讲了一个不点名的客户故事:一位负责 IT 运营的高级副总裁,早年向 CEO 和高管团队汇报基础设施韧性,最初是一年一次,后来变成季度一次,再变成每月一次;如今已经是每周一次。
在他看来,这说明 IT 基础设施韧性和效率已经从运维部门的局部工作,变成 C-level、几乎是董事会层面的问题。业务管理层要求企业快速投资 AI、成为 AI-first 公司;IT 运营负责人则必须提醒大家,投资速度也在提高风险暴露,需要同步建立治理和控制。

8. Token 单价下降,Agent 消耗却在上升

Craig Smith 问到:当 AI 从试点走向生产,CEO 和 CIO 是否应该用不同方式看 GPU 支出?Token 价格下降看似利好,但更便宜的 Token 也可能让企业部署更多 Agent,最后因为调用量和工作流规模扩大而让总成本上升。
Appleby 的回答是:Token 成本还会继续下降,但 Token 消耗正在急剧上升。企业不能只看每个 Token 的价格,还要看哪些工作应该交给 AI、这些工作是否真正提高客户体验和 ROI,以及基础设施是否被高效使用。
他举出的正向场景包括加速药物发现、让新药更有针对性、改善医学影像分析、识别欺诈和金融犯罪交易。问题不在于缺少 AI 用例,而在于企业是否把 AI 用到能产生有意义影响的地方。
未来 AI 的评价标准会更少围绕单纯的模型性能,更多围绕运营效率、成本和业务影响。这个影响可以体现在成本,也可以体现在收入、客户体验和留存;但它必须足以对应企业投入的规模。

9. ROI 需要基础设施指标与业务指标合起来看

大型 IT 组织同时被要求支持更复杂的服务、维护更高韧性、并降低运营成本。Appleby 认为,任何参与企业韧性的技术,都必须帮助客户更高效地使用基础设施。
Virtana 可以提供本地物理基础设施和云基础设施的成本分析与运行指标,但不会替客户定义银行、保险等行业的业务指标。企业需要把基础设施成本和效率数据,与自身的收入、客户和业务指标结合起来,才能判断 ROI、回本周期和是否值得继续扩大规模。

10. AI 投资热潮会压过治理,但平衡会回来

Appleby 把治理被推迟的原因称作 AI 投资周期中的淘金热:企业担心错过机会,于是先投资、先上线,原本成熟的治理原则被挤到后面。
他强调,研究不是为了唱衰 AI。研究真正指出的是:业务高管和 IT 操作人员之间存在认知差距,AI 工作负载的失败率不容忽视,治理和控制必须追上投资。随着企业看到真实数据并面对运行结果,这个平衡会重新建立。

11. 观测层必须覆盖异构、混合的现实

Appleby 认为,AI 数据中心通常会为每一层选择看起来最合适的供应商,最终形成由多个厂商共同组成的异构环境。Virtana 与 AWS、Dell、Nutanix、NVIDIA 等建立更深集成,目的不是把某一家供应商变成唯一入口,而是捕捉完整遥测,并把不同组件串起来。
部署位置也不会只有一个答案。大多数大型企业都会进入混合世界:部分工作负载和数据留在本地,部分进入云端,并根据价格、速度、数据保护和隐私要求动态移动。可观测性平台也必须同时存在于本地和云端,甚至嵌入服务提供商的平台,而不是假定客户会把一切都搬到云上。

12. 最后一个问题:会不会把数据中心建过头?

Craig Smith 追问,随着推理向边缘移动、功耗下降、模型变便宜,企业是否可能把数据中心建得过多?
Appleby 的回答是:边缘推理、城市级自动化、自动驾驶、大规模制造和物理 AI 确实会需要更多边缘计算,但这更可能是新增的需求,而不是简单替代集中式 AI 基础设施。他预计,企业和政府建设自己的 AI 数据中心与 AI 工厂仍会继续,同时边缘 AI 也会并行发展。
他最后提到,长期被承诺的自动驾驶、分布式发电、家庭智能能源和大规模物理自动化,都可能在边缘 AI 的帮助下逐步落地;但这已经是另一场更长的讨论。

逐句全文翻译

以下为基于本期完整原始音频 ASR 的中文逐句译文。为保持阅读连续性,将相邻字幕合并为完整句段;不保留英文原文,不压缩主要对话内容。ASR 对个别专有名词存在识别误差,已依据本期官方单集页和 Virtana 官方资料统一为 Virtana、Paul Appleby 等正确写法。

00:00–05:24|开场、嘉宾背景与公司定位

Craig:六成企业在 AI 工作负载失败时,无法自动识别跨 AI 基础设施不同领域的根因。为什么在 AI 工厂里,找到根因会比传统企业 IT 难得多?你刚才说,我们正在进入一个阶段:评价 AI 的标准会更少看模型性能,更多看运营效率,也就是成本和业务影响。
Craig:这不一定只是成本问题。AI 投资周期里的淘金热,正在压过企业原本的一些良好治理原则。不过,我们会看到平衡重新回来。先请你向听众介绍一下自己。
Paul:谢谢你,Craig。我是 Paul Appleby,Virtana 的 CEO。我们这家公司存在的一个重要目的,是帮助企业保护自己的技术和基础设施。银行、电信、医疗、零售、航空等很多行业都高度依赖技术。事实上,许多首席风险官会说,现在企业最大的灾难性失败风险之一,就是技术和基础设施本身。
Paul:Virtana 所处的领域,就是保护这些基础设施。我们做的是可观测性,核心是业务韧性和运营效率:怎样确保对企业和客户至关重要的服务一直保持良好性能并且可用?在 AI 加速采用的时代,这件事就更重要了。
Craig:你加入 Virtana 多久了?在加入之前是什么背景?
Paul:我加入这里已经几年了。我接手的是一家很棒的企业。它过去叫 Virtual Instruments,曾由微软前董事长 John Thompson 管理,公司已经存在了一段时间,也有很深的核心技术积累。
Paul:两年前,我带着董事会交给我的任务加入公司:真正投入到服务全面数字化,以及 AI 技术大规模扩张的世界里。我的职业生涯一直在科技行业,有时在创业公司,因为我喜欢企业从扩张到规模化的过程;有时在大型公司,经历转型和增长。我曾在 Salesforce 工作多年,最近也在 Elastic 担任总裁。所以,我长期专注于企业软件、企业技术,以及企业的增长和规模化。
Craig:我们录音前聊到,Virtana 是一个面向大规模技术运营的可观测性平台,不一定只面向 AI。它在生成式 AI 爆发前就存在,对吗?
Paul:有几件重要的事。Craig,这一类软件已经存在很久了。只要技术在支撑关键业务服务,企业就需要监控基础设施,确保它保持可用和高性能。
Paul:但如果想一想,可观测性的真正目的是什么?它是实时识别威胁和风险,识别这些风险的原因,然后修复它们。因此,我们已经建设深度的 AI 和机器学习能力超过十年。AI 对我们不是新东西,它本来就是我们存在的核心原因之一:实时接收事件数据,做必要的映射和关联,识别风险与威胁。
Paul:最近,我们加大了对 Agent 能力的投入,用它来自动化很多 IT 运维工作。同时,我们也认识到,随着企业扩大 AI 的应用,市场正在真正把 AI 工业化,大量 AI 数据中心投资被称作 AI 工厂。于是,我们需要为 AI 工厂建立端到端的可观测性。
Paul:我们做的事情,本质上是把可观测性的长期积累带进 AI 时代,帮助企业扩大 AI 投资。

05:24–10:05|为什么必须看整套系统

Craig:在谈研究之前,你说这是一层位于技术栈之上、甚至位于编排层之上的能力。对吗?
Paul:如果你想一想任何关键业务服务,比如交易平台,或者零售银行的网上银行,它背后都是一个非常复杂的系统。我们现在大多在线上银行,很多时候直接用手机完成。
Paul:支撑我们与银行互动的,是由数据、应用、网络、计算和存储基础设施组成的复杂系统。有些在云端,有些在传统基础设施里,有些部署在本地。可观测性应该观察整个系统,因为它通常是异构的,也通常是混合的,这就是今天大多数企业的现实。
Paul:动态地观察和管理整个系统,就是我们的软件所处的位置。随着系统规模扩大,可观测性越来越关键。系统扩张,有时是为了应对更多客户,有时是因为业务本身增长并变得更复杂。
Paul:我们看的不只是面向客户或公众的应用。任何技术栈中含有 AI 的系统,都需要被看见。
Paul:以大型零售商为例,重要系统不只是网站和销售点环境,还包括完整的分销和供应链基础设施,以及后台职能。航空公司也是一样:乘客能感受到行李处理、售票和登机,但背后还有机组排班、航班调度以及其他系统。远程和混合办公也让企业需要支撑庞大的远程与混合劳动力。
Paul:医疗行业同样如此。消费者可以使用数字医疗、远程诊断和远程问诊;医疗人员也在使用这些系统访问电子健康记录,与其他医生协作。我们服务的,就是大型医疗机构、大型航空公司和大型银行背后的整套基础设施。

10:05–16:23|研究、根因与人工拼接

Craig:你的研究叫「AI 工厂现实检查」,对吗?你们发现,这些系统的增长速度比企业运营、维护和管理它们的能力更快?
Paul:我觉得这是很准确的说法。大家都同意,AI 基础设施和 AI 数据中心的投资出现了疯狂增长。除了我们熟悉的 AI 平台之外,随着大型企业和政府采用 AI,很多基础设施会部署在本地,支撑企业的大型 AI 用例。
Paul:研究发现,企业正投入 AI 数据中心和所谓 AI 工厂,但用于优化这些数据中心韧性与效率的治理和控制没有跟上。治理投资没有以基础设施投资的同样速度增长,这会提高风险。
Paul:我们想说的是:AI 在许多行业都有巨大机会,但请确认治理和控制已经内置于系统中。传统基础设施的生产纪律,也要复制到 AI 数据中心。
Craig:研究最重要的发现之一,是六成企业在 AI 工作负载失败时,无法自动识别跨 AI 基础设施域的根因。为什么 AI 工厂里的根因比传统企业 IT 更难发现?
Paul:无论在哪种环境里,根因都很难找到;但在 AI 工厂或大规模 AI 数据中心里,系统复杂度让问题更难。它从数据管道一路延伸到 AI 工作负载和编排,再到计算、网络、存储等基础设施层。
Paul:当 AI 工作负载变慢或失败时,挑战是判断问题究竟发生在哪里。非常值得注意的是,大量故障没有被识别出根因。如果不知道因果关系,就很难进入修复阶段,这会造成很高比例的 AI 工作负载失败。
Paul:如果企业要在关键服务中大规模运行 AI,就不能接受很高的失败率。第二个问题是,GPU 提供了非常强大的计算能力,但如果工作负载被限流、GPU 处于闲置状态,企业就无法从巨大投资中得到回报。企业需要最大化利用率和吞吐量,才能得到好的 ROI。
Paul:第三个问题是 AI 数据中心巨大的能源消耗和环境影响。如果它们运行得更高效,就能显著降低能源需求、基础设施足迹和环境影响。所以,我们要从多个层面看这套系统。
Paul:遗憾的是,很多企业现在只有来自技术栈各层的一小段遥测,然后试图把它们手工拼接起来,弄清楚发生了什么、怎样管理环境。这不是答案。
Craig:没有 Virtana 这样的平台,企业怎么办?这个问题并不新,只是随着规模扩大,风险更高。难道大家只能屏住呼吸,希望一切没事?
Paul:他们当然不只是屏住呼吸。不同部分确实会有数据。但最后,负责运行数据中心的 IT 专业人员只能试着把这些数据拼接在一起。
Paul:所以发生服务失败或中断时,过去可能是一群人在 NOC 里处理;现在则是 NOC 的人,再加上一群通过电话会议接入的人,一起试图弄清楚问题到底是什么、怎样修复。他们手工拼接所有数据。
Paul:这就是今天许多企业的现实。他们有四五个、甚至六个不同的数据源,需要想办法织在一起。对于 AI 世界里的关键服务,前进方向很清楚:必须看见完整系统。

16:23–24:48|全栈遥测、Agent 与异常

Paul:企业必须捕捉丰富的遥测,并实时做动态映射和关联,才能真正治理这些系统。有了完整系统视图,才可以使用 Agent 加快因果定位,并自动化修复。
Craig:Virtana 的平台是怎样工作的?你们有多个模型互相交叉验证吗?服务器上有传感器持续监控吗?所有数据会被融合和分析吗?能不能讲讲整体架构?
Paul:简短回答是:是、是、是。但让我多解释一点。要实现我们所说的真正自治运维,必须从整套技术栈捕捉遥测。多年来,我们为传统基础设施的每一层建立了深度集成,现在也进入 AI 基础设施的每一层。
Paul:我们在亚秒级时间窗口捕捉两万个不同指标,并在接近实时的状态下对这些指标做关联和映射。通过捕捉指标、做关联和映射,再使用模型识别模式,我们就能识别因果。能够推荐修复方式,也是 Virtana 的核心能力。
Paul:我在可观测性行业的其他组织工作过,得到的一个认识是:如果没有系统范围的可见性,就不能真正使用 Agent 来实现自治结果。你可以自动化技术栈的一部分,但不是整套系统。实时、动态的映射和关联是必要条件。
Paul:这很难。要把如此大量的指标流式摄取,再分析、关联、理解并动态给出建议,是 Virtana 能力的核心。这也是它为什么能在 AI 时代帮助治理所谓 AI 工厂。
Craig:这是否也会增强网络攻击监控?你们使用模型分析异常。大多数异常是反复出现、系统已经见过的,还是会发现没人见过的新问题?如果是新问题,系统能自主处理吗?
Paul:关于网络安全,我们不把自己定位成网络安全解决方案,主要关注基础设施。但如果能摄取、分析和关联所有事件,识别异常,这个强大的引擎当然可以用于安全场景。
Paul:有些客户看到数据很丰富,就说可以用这些异常检测能力增强现有的安全工作。所以这确实发生了,但不是我们今天业务的核心。
Paul:由于我们掌握了大量丰富数据,而且许多事件会遵循相似模式,我们可以快速识别模式并找到因果。更有意思的是,即使发现了新的异常,我们也能很快学习这些模式,开始建议修复。
Paul:依据企业的政策,我们可以自动完成修复,也可以把修复建议和支持建议的证据一起交给人工操作员。最终取决于企业处于 AI 与自动化旅程的哪个阶段,以及它愿意采用什么政策。
Paul:在一些大型技术供应商和大型客户的 AI 实验室里,我们发现了客户自己都没有理解的异常和使用模式。这正是前面所说能力的结果。

24:48–32:33|负责人、董事会与 Token 成本

Craig:我还有很多问题。到底由谁负责?这不是又一个报警仪表盘,因为很多修复是自动进行的,但有时仍然需要人介入。这个人属于 IT 部门吗?另外,你们的报告显示高管和一线实践者之间存在脱节。这说明 AI 基础设施的决策,或者像购买 Virtana 这样的决定,是怎样做出来的?
Paul:你很擅长一次提出多层问题。我先讲一个故事。出于显而易见的原因,我不能说出公司名字,但我最近拜访了一家美国大型企业,见到了负责这件事的人:负责 IT 运营的高级副总裁。
Paul:这位高管在公司工作了几十年。他说,自己刚加入公司、担任那个职位时,会向 CEO 和高管团队汇报如何建立 IT 的韧性和可靠性,一年汇报一次。后来变成季度一次,再后来变成每月一次。现在,他们每周汇报一次,为 CEO 和领导团队说明 IT 基础设施和所支撑服务的韧性、可靠性与运营效率。
Paul:这说明,负责 IT 基础设施韧性和效率的人,已经成为 C-level、几乎是董事会层面的问题。我们会向这个角色销售;在这个角色之下,还有 IT 操作人员,尤其是 Site Reliability Engineer,他们负责确保基础设施可靠。
Paul:业务与 IT 操作人员之间的脱节,来自两种相反压力。今天每个董事会都在问:你的 AI 战略是什么?你怎样拥抱 AI、保持相关性并参与竞争?这种压力推动企业快速投资 AI,成为 AI-first 公司。
Paul:但 IT 运营的副总裁和高级副总裁会说:我们需要治理和控制,才能保护企业韧性。这就是脱节:一边是要求快速投资的业务压力,另一边是 IT 负责人提醒大家风险正在上升。
Craig:Token 价格正在下降。随着 AI 从试点走向生产,CEO 和 CIO 应该怎样不同地看待 GPU 支出?Token 更便宜之后,大家会部署更多 Agent,于是总成本可能暴涨,对吗?
Paul:Token 的成本会继续下降,这是肯定的。但 Token 消耗正在急剧上升。我们还需要问,工作在哪里完成最有效率,以及哪些业务问题值得用这类基础设施来解决。
Paul:有些用例非常有价值,比如加速药物发现,缩短新药上市时间,让药物更有针对性并提高疗效;更好地分析医学影像;更好地识别欺诈、犯罪和金融交易风险。AI 有很多强大的用例。
Paul:企业现在应该问,在哪里部署 AI,才能真正影响客户、客户体验并提高 ROI。很多企业正在不加思考地冲进投资,却没有充分理解 ROI 的后果。当前投入的资金是数千亿美元,而投资曲线与收入曲线何时交叉,按照我看到的数据,不会很快发生。
Craig:也就是说,我们正在进入一个阶段,评价 AI 的标准会更少看模型性能,而更多看运营效率,也就是成本?
Paul:还要看业务影响。它可能是成本,也可能是收入、客户体验或留存。但必须有可衡量的影响,与投入规模相称。AI 有很多不可替代的用例,但企业要聪明地决定怎样、在哪里部署 AI,围绕投资建立正确的治理和控制,并继续有思考地扩大规模。

32:33–40:24|ROI 指标、混合部署与平台位置

Craig:Virtana 会帮助追踪 ROI 指标吗?报告似乎说,接近三分之一的企业需要清晰的 ROI 指标,才能有信心继续扩大 AI。哪些指标最重要?Virtana 怎样处理?
Paul:大型 IT 组织处在很难的位置。他们不仅要支持越来越复杂的服务,也要面对越来越复杂的基础设施,并保持极高韧性,同时还要高效运行。我还没有遇到过一个 CIO 没有成本和运营成本压力的。
Paul:如果你要参与企业韧性,就必须帮助客户高效使用基础设施。对本地物理基础设施和云基础设施进行成本理解、管理和控制,是我们解决方案的核心部分。
Paul:我们不提供业务指标,因为我们不是银行,也不经营保险公司。但我们可以提供成本分析和基础设施指标,再把它们与业务指标结合,判断 ROI、回本和其他结果。
Craig:研究还发现,复杂度在增加,但许多治理工作被推迟了。为什么?这会怎样影响企业?
Paul:我认为,AI 投资周期里的淘金热压过了企业原本的一些良好治理原则。但平衡会回来。我们发布这项研究,是为了显示业务高管和 IT 操作人员之间存在差距,也为了说明 AI 工作负载有很高的失败率。
Paul:我们不是在唱衰 AI。我们说的是:既然要做这些投资,就必须让治理追上来。我相信当人们看到数据、面对现实,尤其是认识到 AI 的治理和控制既符合公共利益,也符合商业利益时,这会很快发生。
Craig:你们已经把 AI 工厂可观测性扩展到 Dell AI Factory、AWS Bedrock 和 Nutanix。这说明可观测性应该位于哪里?本地、模型层,还是别的地方?
Paul:现在部署的 AI 数据中心,通常会在每一层选择它认为最好的方案,于是形成由不同供应商提供组件的异构环境。我们与 AWS、Dell、Nutanix 以及许多其他公司加深合作,也深度集成 NVIDIA 的技术栈和 GPU,核心都是捕捉最丰富的遥测。
Paul:至于本地还是云端,我认为会是混合世界。地球上几乎每一家大型公司都是混合的现实。某些工作负载和数据会继续留在本地,某些会进入云端。它们可能根据价格套利、达到结果的速度、数据保护和隐私要求动态移动。
Paul:我们的责任,是帮助客户管理这个复杂的混合世界,把复杂性从客户那里拿走。因此我们既建设本地基础设施能力,也与超大规模云厂商和新型云厂商合作,在客户需要的地方提供支持。
Craig:所以,平台是部署在企业内部,还是数据流经的每个地方都部署一个实例?
Paul:我们努力让技术可以部署在任何地方。本地有实例,云端也有实例。对于提供基础设施服务的供应商,比如日立,我们的平台还会嵌入对方的平台中。
Paul:Virtana 会出现在不同地方,取决于客户怎样消费服务。理念不是只待在云里,因为客户并不只在云里。客户会使用公有云、服务提供商、托管服务提供商,也会管理自己的本地基础设施。我们要覆盖所有这些环境。
Craig:这是一项 SaaS 服务,不是一次性购买,对吗?
Paul:订阅软件的好处是,你必须持续赢得与客户合作的权利。我一直鼓励团队保持这个理念。对我们来说,几乎每一位客户的使用量都在逐年增长。他们之所以增长,不是因为其他原因,而是因为他们在扩大基础设施规模,也在扩大对我们的使用,而我们解决的是重要问题。

40:24–44:32|边缘 AI、数据中心与收尾

Craig:我想问一个稍微离题的问题。随着部署 AI 的经济性变化,很多人把推理推向边缘,也在努力让 AI 更省电、更便宜。你觉得我们会不会把数据中心建得太多?这似乎意味着,用更少的基础设施也能做更多事情。
Paul:这是个大问题。你给我一分钟回答它吗?
Paul:我认为你说的那些事情都是真的。我们过去谈物联网,现在可能不再总说这个词,但城市级自动化、大规模采用自动驾驶、大规模制造,以及 AI 在制造流程中的作用,都意味着很多计算必须发生在边缘。
Paul:但我认为这会是新增,而不是简单替代。AI 基础设施的物理建设仍然非常关键,尤其是企业和政府采用 AI 之后。它们会建设越来越多自己的 AI 数据中心和 AI 工厂。只要听听 Michael Dell 讲 Dell 的 AI 工厂采用正在爆炸式增长,就能知道企业确实在这么做。
Paul:所以两件事会并行发生。也许最终我们会看到大规模自动驾驶,真正分布式的能源生产,家庭里的智能技术和能源利用,以及长期以来被承诺的其他事情。边缘 AI 可能帮助这些愿景落地,但那会是更长的谈话。
Craig:还有什么我没有问到、但你希望听众听到的?
Paul:没有了,Craig。我们已经谈到了所有事情。这是一次很棒的对话。聊一聊外面的世界很有意思:一方面拆穿一些关于 AI 的神话,另一方面也提高大家对风险的意识。我觉得这是一次非常棒的谈话。
Craig:是的。

读者可以带走的三件事

  1. 先看全栈,再谈自治。 没有跨层遥测、动态映射和实时关联,Agent 只能自动化局部动作,不能可靠地承担整套系统的修复。
  2. 先算总消耗,再看单价。 Token 价格下降会推动更多调用;真正要管理的是工作流、调用量、利用率、失败重试和业务回报的组合。
  3. 把治理当成生产能力。 AI 工厂建设、成本控制、基础设施韧性和董事会风险讨论,已经是同一件事的不同切面。

関連コンテンツ

コメント

ログインするとコメントできます。