服务器 频道

从“算力焦虑”到“算力理性”:Akamai解答AI推理时代的ROI之问

  过去两年,全球AI产业的关键词是“抢GPU”。从Meta、微软到xAI,动辄十万卡级别的集群建设不断刷新着人们对算力规模的想象。

  然而,当巨额资本开支逐渐沉淀为资产负债表上的折旧压力,市场风向开始转变:企业不再只关心能不能买到卡,而是开始追问这些卡到底能带来多少回报。ROI与TCO,正在取代单纯的算力规模,成为CIO和CFO们共同关心的话题。

  在这一背景下,笔者有幸采访到了Akamai云计算首席技术官Jay Jenkins,围绕AI算力的分配逻辑、推理场景的隐性成本、分布式架构的合规价值以及多智能体时代的基础设施挑战,进行了深入探讨。

Akamai云计算首席技术官Jay Jenkins

  训练与推理的算力分配:不是“一刀切”,而是“分阶段”

  Jay Jenkins表示,训练与推理对计算能力的需求存在本质差异,因此不能采用“一刀切”的配置策略。训练和预训练阶段的需求集中且高度自发,适合集中式GPU集群;而推理和训练后阶段则具有全天候连续性、分布式架构和低延迟等特点,应优先考虑边缘/分布式部署,而非简单复制训练期间的集中式架构。

  这一判断的实践意义在于,它打破了训练用什么、推理就用什么的惯性思维。Akamai在GoVeda案例中的经验颇具说服力:在业务初期,CPU足以满足推理需求;随着规模扩大,迁移到GPU后,性能提升了30%,成本反而降低了20%。这说明,推理场景的算力选择并非越贵越好,而是需要根据业务阶段和应用场景进行动态匹配。

  更进一步,Jay Jenkins提醒企业注意输入密集型应用与生成密集型应用之间的差异。前者如汇总密集型合约,后者如交互式代码或文本生成,二者所需的内存和计算能力截然不同。这种细分视角,恰恰是当前许多企业在AI部署中容易忽略的盲区,他们往往把推理当作一个同质化的负载,却忽视了不同推理任务对硬件资源的结构性需求差异。

  从这个意义上说,Akamai的分阶段分配原则不仅是一种技术建议,更是一种成本治理思路。它要求企业在AI生命周期的不同阶段,重新审视算力配置的合理性,而不是被GPU全能论牵着走。

  推理的隐性成本:GPU之外,还有三座大山

  许多公司认为推理仅仅是购买GPU的问题。但Jay Jenkins在采访中明确指出,除了GPU硬件之外,推理场景中还存在大量隐性成本,这些成本往往在企业预算中被严重低估。

  首先是基础设施运营成本。数据在用户和中央服务器机房之间传输时产生的网络带宽成本,以及由于缺乏智能调度而造成的GPU资源闲置浪费,构成了推理成本的水面之下部分。

  Jay Jenkins强调,强大的编排和服务软件对于将原始芯片转化为可靠的吞吐量至关重要。换句话说,买卡只是开始,如何让卡忙起来才是真正的挑战。

  其次是延迟造成的业务损失。Jay Jenkins披露的一组数据令人警醒:50%的AI部署在高峰负载下无法满足小于250毫秒的响应时间要求,直接影响客户满意度、服务成本和每位访客的收入。冷启动时间也会增加延迟,而这些性能瓶颈在多代理环境中会显著加剧,从而放大收入损失。这意味着一味追求GPU峰值性能而忽视端到端延迟优化的做法,可能在实际业务中付出高昂代价。

  第三是合规和安全治理成本。跨境数据传输引发的监管合规成本、对API安全、模型保护和身份访问管理的持续投资,以及由影子人工智能引起的未经授权的工具使用、数据泄露和后续治理成本,都是企业在推理部署中必须面对的现实问题。

  Jay Jenkins还特别提到,流量是人工智能领域最大的隐性成本之一。由于AI管道本质上依赖于持续不断的数据传输,传输费用会迅速累积,而多代理工作流会在每次数据交接中加剧这种数据传输。

  这三座隐性成本大山的存在,解释了为什么约75%至95%的AI/计算能力投资未能转化为可衡量的财务回报,而真正实现规模化正投资回报率的公司比例仅为16%至25%左右。

  Akamai的应对思路,是通过分布式架构、灵活的计算能力选择、推理优化技术以及与NVIDIA AI Grid的深度集成,系统性地压缩这些隐性成本。

  例如,结合语义缓存、推测解码和基于意图的模型路由等技术,可将优质的Blackwell GPU周期专门用于非缓存的复杂推理任务;通过将模型路由和推测性解码与Akamai的边缘编排相结合,消除冷启动性能损失,并在整个部署范围内保持较高的GPU利用率。

  自建还是采用第三方:TCO/ROI评估的关键维度

  对于企业而言,一个绕不开的决策是:到底应该自建GPU基础设施,还是采用第三方分布式推理云?Jay Jenkins给出的建议是分阶段的、务实的。

  如果企业处于早期阶段且流量不稳定,应优先考虑第三方分布式推理云服务。循序渐进地发展是完全可以的,但随着技术和企业人工智能素养的提升,务必制定退出策略。如果项目已达到一定规模,且有明确的长期负载预测,可以考虑采用自建基础设施与云计算相结合的混合方案,并利用开源模型进行定制,以降低长期代币成本。同时,务必考虑硬件折旧和过时问题。

  这一建议的背后,是一种对AI基础设施投资节奏的清醒认知。AI技术迭代速度极快,今天的高端GPU可能在两三年后就被新一代产品取代。如果企业在早期阶段就大规模自建,不仅面临沉重的资本开支压力,还可能承担硬件过时的风险。而第三方分布式推理云的价值,恰恰在于它能够以更灵活的方式匹配企业不同阶段的算力需求,降低试错成本。

  Jay Jenkins列出的关键评估指标包括性能、成本/折旧、能源需求、可扩展性、合规性和生命周期管理。这些指标构成了一个多维度的TCO/ROI评估框架,远比单纯的每GPU小时成本更为全面。它提醒企业,AI推理的经济性不是一个孤立的硬件采购问题,而是一个涉及网络、能源、合规和运维的系统工程。

  多智能体时代与分布式合规:新挑战与新解法

  Jay Jenkins对多智能体系统的分析尤为深刻。他指出,单个AI请求的延迟40至100毫秒是可以接受的,但多智能体系统可能会生成数百个请求,累积延迟可能会从40毫秒增加到4秒甚至40秒。代理间通信的复杂性不仅涉及模型推理,还涉及代理之间以及代理与API之间的实时协作,需要本地代理通信和部署在协调器附近以加速集成。

  此外,代理全天候运行,对基础设施的持续高强度处理能力提出了极高要求。更值得警惕的是风险放大效应:当代理自主地跨工具和数据库调用API时,一个被篡改的提示符或有缺陷的输出就如同全能钥匙,传统的边界防火墙无法检测到这种内部通信,遏制风险需要工作负载级别的微隔离和边缘端的实时API检测。

  这些挑战意味着,多智能体时代的AI基础设施不能只是更大的集群,而必须是更聪明的网络。分布式推理架构的价值,在这里得到了充分体现:它能够将推理工作负载分散到边缘,减少集中式数据中心的压力,同时通过本地化部署降低代理间通信的延迟。

  在数据合规方面,Akamai的解法同样体现了分布式思维。本地推理/加密可以在边缘执行,防止跨境数据传输;算法路由与合规性参数相结合,将位置是否允许实例启动作为核心调度参数,而非仅仅依赖延迟指标;

  区域化基础设施覆盖方面,Akamai已在130个国家和700多个城市部署了节点,能够满足不同国家的数据本地化需求;持续合规产品支持方面,Guardicore Segmentation产品面向金融行业客户,结合NVIDIA BlueField技术,可帮助银行等受严格监管的行业持续满足合规要求。

  笔者观察:算力理性的本质是匹配

  笔者看来,Akamai对AI计算的核心主张可以概括为一个词:匹配。训练与推理需要匹配不同的架构,应用场景需要匹配不同的计算能力,企业阶段需要匹配不同的部署模式,合规要求需要匹配不同的区域策略。这种匹配思维,与当前市场上流行的规模至上叙事形成了鲜明对比。

  从“算力焦虑”到“算力理性”,企业开始意识到,AI的竞争力不仅取决于拥有多少GPU,更取决于能否以合理的成本将算力转化为可衡量的业务价值。

  Akamai的分布式云架构、推理优化技术和全球合规能力,为这一转型提供了一种值得关注的路径。而“避免一刀切”“考虑隐性成本”“制定退出策略”等建议,也提醒着每一位AI决策者:在算力投资的热潮中,保持理性与克制,或许比盲目扩张更为重要。

  毕竟,AI的终极目标不是堆砌最多的GPU,而是让每一份算力都产生应有的回报。

0
相关文章