中国 AI 交卷:不加卡,先把请求分给合适的模型

新智元把企业 AI 的成本问题落到模型路由、推理引擎和治理,核心数字均按原文案例口径理解。

企业 AI 的账,不只由模型单价决定。Agent 把任务跑完,可能要消耗数倍甚至数十倍于简单问答的 Token,模型路由和推理效率开始直接影响部署成本。
  • 新智元报道的「星火 Token Factory」把模型调用放在统一中间层,按 Prompt 长度、对话轮次、任务难度和数据敏感等级分流,再综合质量、成本、延迟、可用性与安全。文章称平均决策延迟低于 100 毫秒。1
  • 原文给出的一个企业案例是:客服请求中超过 60% 属于查订单、问退换货等轻任务,分流并叠加语义缓存、Prompt 压缩和上下文裁剪后,月均 Token 成本比全量使用高档模型少一半以上。该数字属于文章报道的案例口径。1
  • 针对国产化部署,文章称其推理引擎在相同硬件上对比 vLLM-Ascend,效率约提升 5 倍,首 Token 延迟降低 30% 到 40%;另一家企业案例则称整体效率提升约 50%,等效节省数百万元硬件采购成本。1
这些数字是原文转述的产品和企业案例,不是独立第三方测评。能不能少买卡,最后还要看任务分布、硬件环境和实际负载。

参考ソース

  1. 1新智元原文

関連コンテンツ

コメント

ログインするとコメントできます。