亚马逊的AI复兴:AWS与Anthropic的多吉瓦Trainium扩张
Anthropic多吉瓦集群、Trainium产能爬坡、每内存带宽最佳TCO、系统级路线图、Bedrock与内部模型
两年半前,我们曾预警AWS即将面临的“云危机”。如今,证据已经堆积如山。AWS是亚马逊帝国的皇冠明珠,贡献了集团约60%的利润,并在利润丰厚的云计算市场占据主导地位。但它难以将这一优势转化为新的GPU/XPU云时代。
微软Azure目前在季度新增云收入上领先市场,而谷歌云与AWS之间的差距已显著缩小,尤其是谷歌在TPU上的大动作——我们已报道了一个多月。市场已经注意到这一点。年初至今,亚马逊是四大科技与AI巨头中明显的落后者,投资者因其在AI领域失去动力而对其估值下调最多。
今天,SemiAnalysis再次提出一个非共识观点。当市场过度渲染云危机主题时,我们呼吁AWS的AI复兴。一个月前,我们向核心研究订阅用户阐述了这一论点,预测到2025年底,其同比增长将加速至20%以上。
亚马逊的救世主有一个名字:Anthropic。这家初创公司在2025年的生成式AI市场中表现明显优于同行,年初至今收入增长了五倍,年化收入达到50亿美元。
为了保持这一轨迹,Anthropic正大力押注扩展定律。虽然Dario的初创公司比OpenAI、xAI和Meta Superintelligence获得的头条新闻更少,但它在投资上并不吝啬。AWS为其主要客户建设的数据中心容量已超过1吉瓦,正处于最后建设阶段。AWS正在以史上最快的速度建设数据中心。而且未来还有更多。
为了理解和预测按云提供商划分的AI实验室的GPU/XPU电力容量,我们依赖专有的数据中心行业模型,该模型由实时卫星图像驱动。该模型受到所有超大规模云提供商、AI实验室和全球最大投资者的信赖,为OpenAI、Anthropic、xAI、Meta Superintelligence、Google DeepMind等提供按季度、按建筑的数据中心预测。如需更多信息,请联系我们。
Trainium vs GPU
虽然亚马逊的AI数据中心在规模和速度上令人印象深刻,但单个建筑的设计并不出众。该蓝图针对空气冷却进行了超优化,与5年前的传统AWS云数据中心完全相同。
这些设施的独特之处在于其内部:它们将容纳世界上最大的非英伟达AI芯片集群,在最大的园区中拥有近100万个Trainium2。要了解Trainium2系统的一切,请阅读我们2024年12月的技术深度分析。
Trainium2在许多方面落后于英伟达的系统,但它对多吉瓦的AWS/Anthropic交易至关重要。其每TCO的内存带宽优势完美契合了Anthropic激进的强化学习路线图。Dario Amodei的初创公司深度参与了设计过程,其对Trainium路线图的影响只会越来越大。
简而言之:Trainium2正朝着Anthropic定制芯片计划的方向发展。这将使Anthropic与Google DeepMind一起,成为近期内唯一受益于紧密软硬件协同设计的AI实验室。
本报告将深入探讨亚马逊AI复兴的各个方面:Anthropic合作、数据中心和Trainium。在报告末尾,我们提供了一份
对 Anthropic、AWS Bedrock 和内部模型的长期展望,并解释为什么一切并非一片光明。
首先,回顾一下为什么 AWS 至今表现不如竞争对手的 AI 云。
AWS GenAI 表现不佳
要理解亚马逊在 GenAI 时代表现不佳的原因,我们可以分析 GPU/XPU 云市场成功的驱动因素。最简单地说,我们看到 GPU/XPU 容量的两个主要客户群体:
批发裸机用户:大型客户,如 OpenAI、Anthropic、字节跳动和其他超大规模企业。
托管 SLURM/Kubernetes:较小的客户,如初创公司、研究机构和企业试点项目。
云危机与 ClusterMAX 表现不佳
在第二类中,我们的 ClusterMax AI 云评级是比较相对优势和劣势的最佳方式。铂金级和金牌级 AI 云比其他云获得了更多关注,并拥有高于平均水平的定价能力。因此,CoreWeave、Oracle、Nebius、Crusoe 和 Azure 等公司在多租户 GPU 集群(需要高性能和高级软件层)市场中表现优于同行。
正如两年前预测的那样,亚马逊表现不佳的关键在于使用了自定义网络结构 EFA。AWS 在前端网络上凭借 ENA 取得的成功尚未转化为后端上的 EFA。EFA 在性能上仍落后于其他网络选项:NVIDIA 的 InfiniBand 和 Spectrum-X,以及 Cisco、Arista 和 Juniper 的 RoCEv2 选项。原始性能并非唯一指标,EFA 的用户体验也不如 InfiniBand 和 RoCEv2。话虽如此,亚马逊最新的 EFAv4 在实际消息大小下的性能正在改善,尽管仍落后于竞争对手。
亚马逊的自定义网络还因 NVIDIA 系统的定制要求而延长了上市时间。其他方面,如高级被动和主动自动每周定期健康检查策略,也不如金牌和铂金级云那么可靠。
我们即将推出的 ClusterMAXv2 评级将根据我们的专有测试对所有主要云提供商进行更新。敬请期待!
寻找锚定客户
对 AWS 的 XPU 业务增长更重要的是获得锚定客户的能力——他们是 GenAI 需求第一波浪潮中的市场创造者。规模、上市时间、深度合作和定价是赢得这些客户的关键,比高级软件层更为重要。
没有哪家公司比微软更能说明这一点。Azure 在 AI 方面优于同行的表现完全归功于其与 OpenAI 的合作关系。截至 2025 年第二季度(2025 年 6 月),OpenAI 超过 100 亿美元的云支出全部由 Azure 记账。
亚马逊很早就意识到需要锚定客户,并于 2023 年 9 月向 Anthropic 投资 12.5 亿美元,可追加至 40 亿美元。2024 年 3 月,合作扩大,Anthropic 承诺使用 Tranium 和 Inferentia 芯片。2024 年 11 月,亚马逊再向 Anthropic 投资 40 亿美元,后者将 AWS 指定为其主要的 LLM 训练合作伙伴。
Anthropic 表现出色,AWS 表现不佳?
亚马逊的押注是正确的。Anthropic 在 2025 年的 GenAI 市场中明显表现出色,年化收入从 10 亿美元飙升至 50 亿美元。在这种情况下,AWS 的表现不佳让投资者感到沮丧,这是可以理解的,但他们误解了 Anthropic 在训练和推理上的支出构成。
有两个明确的原因可以解释为什么亚马逊尚未真正从其与 Anthropic 的关系中受益:
截至 2025 年第二季度,Anthropic 的云
支出不到 OpenAI 的 1/2。
Anthropic 的支出中有很大一部分流向了 Google Cloud——Anthropic 的首批主要投资者之一(2022 年底 3 亿美元融资轮)以及 2023 年和 2024 年的首选云合作伙伴,之后才与 AWS 扩大合作。
Anthropic 与 AWS 的多吉瓦级 AI 训练基础设施
具体来说,我们认为 Anthropic 激增的推理需求大部分由 Google Cloud 满足。拥有全球最佳的推理系统(TPU)是一项关键竞争优势。
AWS 的基础设施建设旨在为其关键客户承担部分需求,同时也会专注于训练。尽管 Anthropic 不像 OpenAI、xAI 和 Meta 等同行那样频繁登上头条,但它全力投入 AGI 竞赛,并且不打算在训练支出上有所保留。Anthropic 的领导层坚信 Scaling for RL。
他们的信念最早将在今年实现。我们在下方展示了三个处于最后建设阶段的 AWS 园区,其 IT 容量超过 1.3GW,专门用于满足 Anthropic 的训练需求。建设速度非常惊人。
虽然这些数据中心从空中看已经建成,但我们认为它们尚未产生任何可观的收入。Trainium 在组装阶段遇到了一些良率问题——这对新系统来说相当常见。我们认为,到 2025 年底,这三个大型 AWS 园区将为 AWS 的营收做出显著贡献,并将增长率提升至 20% 的同比门槛以上。
Anthropic 并未止步于此。其约 130 亿美元的融资轮(估值 1830 亿美元)将提供资金,与 AWS、Google 及其他公司签署更多协议。AWS 也没有停滞不前——他们已经在为即将到来的吉瓦级数据中心破土动工,以抓住这一增长。
如前所述,这些数据中心将主要配备 AWS 的自研芯片 Trainium。鉴于其规模之大,我们无法低估 Anthropic 这一赌注的冒险程度。他们不仅承诺投入数百亿美元,而且是在一款尚未充分验证的芯片上!
让我们通过分析 Trainium 的 TCO 和路线图来理解他们的赌注。
Trainium2 TCO 分析——Anthropic 的大赌注如何可能获得回报
Trainium2 的供应链信号目前极为强劲。我们行业领先的 AI 加速器模型追踪了封装出货量和系统/机架出货量,自年初以来两者均大幅增长。该模型提供了 Trainium2 和 Trainium3 产品系列中 10 多个 SKU 的季度出货量预测,并指出了哪些供应商将从特定 SKU 中不成比例地受益。联系我们获取更多信息。
请注意,这是芯片生产,机架生产存在滞后,但我们也在追踪。
与 Nvidia 和 Google 的 TPU 竞争当然绝非易事。虽然 Google 正在推出其第七代 TPU Ironwood,但 Trainium2 只是亚马逊的第三代 AI 加速器。
芯片规格:Trainium2 在所有方面均处于劣势,但……
仅从芯片规格来看,Trainium 明显落后于 Nvidia:
Nvidia 的 GB200 在 FP16 FLOPs 上具有 3.85 倍优势,达到 2500 TFLOP/s/芯片,而 Trainium2 为 667 TFLOP/s/芯片。请注意,规格表上的数字相比实际可实现的 FLOPs 有所夸大。
在内存带宽方面,差距缩小至 2.75 倍,为 8000GB/s/GPU 对比 2900GB/s/Trn2。
评估扩展网络带宽是另一个关键项目。我们多次解释了扩展网络对于推理模型推理的重要性。我们对强化学习的深入分析强调了
RL与推理工作负载的相似性,使得内存带宽成为扩展后训练的关键因素。
Nvidia的GB200 NVL72在全局规模下拥有总计576TB/s的内存带宽。
相比Trainium2(Teton2-PD-Ultra-3L SKU)的186 TB/s,这是3.1倍的优势——但需注意,不同SKU间存在差异。
虽然Trainium看似明显落后,但一旦考虑总拥有成本(TCO),情况就不同了。
Trainium在每TCO内存带宽上的优势
在下表中,我们将TCO纳入比较。虽然Nvidia在每有效训练PFLOP的TCO上具有显著优势,但Trainium2在每百万Token的TCO和每TB/s内存带宽的TCO上极具竞争力。
而且我们认为Nvidia即将推出的VR200 NVL144不会改变相对于AWS Trainium3的格局。需要明确的是,TCO还有许多其他变动因素。AWS还有其他系统级架构部署,更适合某些用例。未来,Nvidia的Kyber机架将拥有世界上最先进的扩展网络架构。
要全面了解50多个Nvidia SKU的TCO,并与所有AMD、Trainium和TPU SKU进行详细TCO比较,请查看我们的AI云TCO模型。最大的超大规模云服务商、Neocloud及其财务赞助商依赖我们的模型来把握投资时机。
Anthropic押注硬件-软件协同设计
Trainium2在每TCO内存带宽上的优势是理解Anthropic选择的关键。虽然Nvidia的芯片和系统在大多数方面更优,但Trainium2完美契合Anthropic的路线图。他们是扩展后训练技术(如强化学习)最激进的AI实验室。其路线图更受内存带宽限制而非FLOPs限制。我们最近的HBM报告深入解释了哪些AI工作负载倾向于内存受限。
Anthropic的规模扩张将使其不仅成为Trainium2唯一的大型外部最终用户,而且其需求将远超亚马逊内部需求(如Bedrock、Alexa等)。他们现在深度参与所有Trainium设计决策,实际上是将亚马逊的Annapurna Labs作为定制芯片合作伙伴!这使得Anthropic成为除Google DeepMind外唯一受益于紧密硬件-软件协同设计的AI实验室。
Trainium路线图:在系统上加倍投入
亚马逊正在为其核心客户推出新的系统级架构。目前,AWS部署的两个系统是Teton PD和Teton PD Ultra。明年,新的Teton PDS和Teton Max将开始大规模出货。我们的AI加速器模型提供了精确的出货量和按SKU的季度细分。
关键区别在于引入了名为NeuronLinkv3的全对全扩展网络。因此,Trainium的架构正在向Nvidia的NVL72 NVLink收敛。
四个NeuronLinkv3交换托盘将放置在机架中间,上下各均匀分布16个计算托盘。某些供应链供应商将获得不成比例的收益,正如两个月前在Core Research(我们受全球最大对冲基金信赖的机构研究服务)中强调的那样。该供应商自我们发文以来已上涨73%。我们认为PDS的引入是Trainium追赶Nvidia道路上的中间步骤。我们也相信Anthropic深度参与了这一新系统级架构的推出。
Anthropic在设计决策中的参与度提高,对未来出货量是个好兆头。但他们也没有放弃TPU和Nvidia GPU。我们的Accele
rator 模型按精确 SKU 细分预测了亚马逊和谷歌云的芯片采购情况,而我们的数据中心模型则用于了解哪些数据中心和云合作伙伴支持 Anthropic 的扩展。Anthropic 在 2026 年的 TPU 扩展规模巨大,并且正如我们一个多月来所报道的,他们的交易具有独特之处。
现在,让我们从更长远的角度来评估 AWS 的未来可能是什么样子。在付费墙之后,我们将讨论以下内容:
亚马逊关键客户 Anthropic 的前景。
亚马逊在 Anthropic 之外的 GenAI 业务:Bedrock 和内部 LLM 的努力。
2026 年和 2027 年 Trainium 的扩展、潜在的新外部客户,以及它可能如何影响亚马逊未来几年的财务状况。
