
亚马逊千亿美元押注自研芯片:AWS 芯片实验室首次曝光
就在亚马逊 CEO Andy Jassy 宣布与 OpenAI 达成 500 亿美元投资协议后不久,亚马逊邀请笔者参观了位于这场交易核心地位的芯片研发实验室——费用基本由亚马逊自行承担。
行业观察者正在密切关注亚马逊自研 Trainium 芯片的进展,因为它有望降低 AI 推理成本,并可能动摇英伟达在这一领域近乎垄断的地位。
带着好奇,笔者接受了邀请。
合作背景:OpenAI 交易的核心
当天的导览人员包括实验室总监 Kristopher King、工程总监 Mark Carroll,以及负责此次访问的公关负责人 Doron Aronson。
[[SFIMG0]] AWS 早在 AI 实验室发展初期就已成为 Anthropic 的主要云平台——这段合作关系的分量,足以让 Anthropic 在后续引入微软作为云合作伙伴之后,仍然维系与亚马逊的绑定。如今再加上亚马逊与 OpenAI 不断深化的合作,关系网愈发复杂。
根据协议,AWS 成为 OpenAI 新款 AI Agent 构建工具 Frontier 的独家提供商。如果 AI Agent 如硅谷所预期的那样成为下一个大趋势,Frontier 有望成为 OpenAI 业务的重要组成部分。不过,这项独家协议的最终落地情况仍有待观察。《金融时报》本周报道称,微软方面认为 OpenAI 与亚马逊的这份协议,可能违反了微软自身与 OpenAI 签订的协议——即微软有权访问 OpenAI 所有模型和技术的条款。
庞大的算力承诺
是什么让 AWS 对 OpenAI 如此有吸引力?作为协议的一部分,亚马逊承诺向 OpenAI 提供 2 吉瓦(2 gigawatts) 的 Trainium 计算资源。这是一个极为庞大的承诺——要知道,Anthropic 和亚马逊自有 Bedrock 服务对 Trainium 芯片的需求,已经超过了亚马逊自身的产能。
目前,亚马逊已部署了 140 万颗 各代 Trainium 芯片,其中 Anthropic 的 Claude 模型运行在超过 100 万颗 Trainium2 芯片之上。
值得注意的是,Trainium 最初主要面向更快、更低成本的模型训练(这是几年前行业的首要优先级),但如今也已针对推理场景进行了优化和投入使用。推理——即实际运行 AI 模型生成响应的过程——目前是整个行业最大的性能瓶颈。
典型案例:Trainium2 承担了亚马逊 Bedrock 服务的大部分推理流量。Bedrock 为亚马逊众多企业客户提供 AI 应用构建支持,并允许这些应用调用多个模型。
"Bedrock 的客户群正在以我们尽可能快的速度扩张," King 表示。他补充道:"Bedrock 将来有一天可能与 EC2 一样庞大。" [[SFIMG1]]
Trainium vs. 英伟达:亚马逊的破局策略
除提供英伟达那些交付延迟、难以获取的 GPU 替代方案外,亚马逊还表示,其搭载新型 Trn3 UltraServers 的芯片在同等性能下,运行成本比传统云服务器低 50%。
除了去年 12 月发布的 Trainium3,AWS 芯片团队还同步打造了全新的 Neuron 交换机。Carroll 表示,这套组合带来了颠覆性改变。
"这为我们带来了一项重大突破," Carroll 说道。交换机使得 Trainium3 芯片能够在网状配置中相互通信,从而降低延迟。"这就是 Trainium3 打破各种记录的原因," 尤其是在"每瓦价格"指标上表现突出。
当每日处理数万亿个 token 时,这类改进的效益是叠加的。
事实上,亚马逊芯片团队曾在 2024 年获得苹果的高度评价。在那次罕见的公开亮相中,苹果 AI 总监公开介绍了苹果如何使用该团队的另一款芯片——Graviton,一款低功耗、基于 ARM 的服务器 CPU,也是这个团队打造的首款突破性芯片。苹果同时盛赞了专为推理设计的 Inferentia 芯片,并对当时还属于新品的 Trainium 给予了认可。
这些芯片代表着亚马逊的经典打法:看清市场需要什么,然后自建替代方案,以价格优势参与竞争。
但芯片领域历来存在一个障碍:切换成本。为英伟达芯片编写的应用程序,必须经过重新架构才能在其他芯片上运行——这一过程耗时耗力,令开发者望而却步。
不过 AWS 芯片团队自豪地表示,Trainium 如今已支持 PyTorch——一个流行的开源 AI 模型构建框架,其中许多模型托管在开发者共享开源模型的 Hugging Face 平台上。
Carroll 告诉笔者,迁移到 Trainium 只需要"基本上一行代码的改动,然后重新编译,就能在 Trainium 上运行。"换句话说,亚马逊正在尽可能地蚕食英伟达的市场主导地位。
本月,AWS 还宣布与 Cerebras Systems 达成合作,在运行 Trainium 的服务器上集成 Cerebras 的推理芯片,亚马逊承诺这将带来超强性能、低延迟的 AI 推理表现。
Nitro 与服务器设计:不止于芯片
亚马逊的野心不止于芯片本身。这支团队还自主设计承载芯片的服务器硬件。除网络组件外,他们打造了 Nitro——一套软硬件结合方案,提供虚拟化技术(让同一服务器上运行多个独立软件实例)、前沿液冷技术,以及用于固定设备形态的滑轨(sled)。
所有这些努力,都是为了掌控成本与性能。
十年磨一剑:芯片实验室起源
这支定制芯片设计团队诞生于 2015 年初——亚马逊以约 3.5 亿美元收购以色列芯片设计公司 Annapurna Labs。也就是说,该团队为 AWS 设计芯片已超过 10 年。部门仍保留 Annapurna 的根基与名称,办公室四处可见其 logo。
实验室位于奥斯汀高端"The Domain"商圈,一栋玻璃幕蔷的现代化建筑内。该区域商铺餐厅林立,步行可达,被称为"奥斯汀的硅谷"。
办公室是典型的科技企业风格:格子间、工位休息区和会议室。但大楼高层深处另有一间真正的实验室,可俯瞰城市全景。
实验室约有两个大型会议室大小,架子上堆满设备,风扇运转声不绝于耳。乍看像是高中实训车间与高端实验室好莱坞片场的混合体——只是工程师们穿着牛仔裤,而非白色实验服。
[[SFIMG3]] [[SFIMG4]] 需要说明的是,这里并非芯片制造工厂,因此无需穿白色防护服。Trainium3 是先进的 3 纳米芯片,由业界公认的 3 纳米制造领导者 台积电(TSMC) 生产,部分芯片则来自 Marvell。
但这正是"bring-up"——芯片启用的魔法发生的地方。
24 小时"芯片启用"攻坚战
"芯片启用就像第一次拿到芯片时的大型通宵派对,整个人都被锁在这里。" King 解释道。经过 18 个月的工作,芯片首次通电激活,验证其是否按设计运行。团队甚至拍摄了 Trainium3 启用的部分过程并发布到 YouTube。
剧透:过程中从不缺少问题。
Trainium3 原型芯片最初采用风冷设计(与前代版本相同),而现版已改为液冷——能效更优,但工程难度极高。
启用过程中,芯片与风冷散热器的连接尺寸出现偏差,导致芯片无法激活。团队没有慌乱,"立刻找了个研磨机开始打磨金属件"。为了不让噪音破坏启用派对的氛围,他们悄悄转移到会议室完成了打磨。
通宵达旦、解决问题——"这就是芯片启用的常态。" King 说。
实验室还设有焊接工位,硬件工程师兼焊接高手 Isaac Guevara 演示了通过显微镜焊接微型集成电路元件。这项工作难度极高,以至于团队负责人 Carroll 当场坦言自己做不到,引发在场工程师们的哄笑。
[[SFIMG5]] 实验室同样配备了定制与商用工具,用于测试和分析芯片问题。下图是信号工程师 Arvind Srinivasan 演示如何检测芯片上每个微小元件: [[SFIMG6]]
滑轨:实验室的明星展品
实验室中最引人注目的是一整排展示区,陈列着团队设计的每一代滑轨(sled)。
[[SFIMG7]] 滑轨是用于容纳 Trainium AI 芯片、Graviton CPU 芯片及配套板卡组件的托盘。将多个滑轨与同样自研的网络组件堆叠装入机架,就构成了支撑 Anthropic Claude 成功的核心系统。
以下是去年 12 月 AWS re:Invent 大会上展示的滑轨: [[SFIMG8]]
来自 Anthropic 和 OpenAI 的验证
参观中,笔者本以为工程师们会大谈与 OpenAI 的合作,但他们并没有。
这可能与前文提到的潜在法律风险有关。但就笔者的观察,这些一线工程师(目前正在设计下一代 Trainium4)尚未有太多机会与 OpenAI 实际合作,他们眼下的日常工作主要围绕 Anthropic 和亚马逊的需求展开。
目前,Trainium2 芯片最大部署量集中在 Project Rainier——全球最大 AI 计算集群之一,已于 2025 年底上线,拥有 50 万颗芯片,供 Anthropic 使用。
不过,办公室的一块壁挂显示器上展示了 OpenAI 将使用 Trainium 的引言。骄傲仍在,只是更为内敛。
专用数据中心:严格安保下的测试场
除这间实验室外,团队还拥有自己的私有数据中心,用于质量测试。数据中心距此不远,专用于测试而非跑客户业务,因此选址在共置设施而非 AWS 自有数据中心内。
安保极为严格:进入大楼和亚马逊区域都有严格规程。
数据中心冷却系统噪音极大,必须佩戴耳塞,空气弥漫着金属受热的刺鼻气味。对普通人来说,这里并非久留之地。
[[SFIMG9]] 数据中心内排排服务器装满了滑轨,集成亚马逊最新自研芯片:Graviton CPU、液冷 Trainium3、亚马逊 Nitro,全部正常运转。液体采用闭环系统循环使用,有助于降低环境影响。
下图是当前 Trn3 UltraServer 的样子:多层滑轨上下堆叠,中间是 Neuron 交换机。硬件开发工程师 David Martinez-Darrow 正在进行滑轨维护: [[SFIMG10]] 尽管外界对这团队的关注一直很高,但近期的审视程度明显进一步加剧。
Andy Jassy 曾在多条推文中为 Trainium 站台,称其已是 AWS 旗下"数十亿美元业务",是他最期待的 AWS 技术之一。在宣布与 OpenAI 合作时,他也不忘为这款自研芯片摇旗呐喊。
研发压力与冲刺文化
芯片团队承受着不小压力。每次"bring-up"(点亮)阶段,工程师们通常要连续三到四周、每天 24 小时轮班作业,处理各种问题,确保芯片能够量产并部署到数据中心。
"我们必须尽快证明这东西真的能用。" Carroll 说道,"目前进展相当顺利。" [[SFIMG11]]


评论