【XM最新官网】六位AWS工程师如何重构Bedrock,向微软发起挑战
戴夫・布朗在 AWS re:Invent 2025 大会介绍 “地幔计划(Project Mantle)作者:凯瑟琳・珀洛夫、凯文・麦克劳克林
2025 年初,亚马逊云内部气氛紧张。用于运行 AI 大模型的新服务 Bedrock 漏洞频发。知情人士透露,客户反复收到报错信息,有时需要等待数周才能拿到所需算力。
两名直接了解内情的人士称,在各类问题集中爆发之际,资深工程负责人安东尼・利戈里牵头团队,制定 Bedrock 重构方案 —— 也就是地幔计划(Project Mantle),旨在解决限流与报错问题,让这项服务具备扩容能力,服务更多用户。利戈里联合另外五位资深工程师,借助 AWS 自研 AI 编程工具 Kiro 打造 Mantle。
Mantle 于去年 12 月正式上线。数月之后,AWS 在 Bedrock 的模型矩阵中加入 OpenAI 模型(平台原本已接入 Anthropic 的 Claude 等模型),业务随即快速升温。
咨询公司 Caylent 首席技术官兰德尔・亨特表示,现在已经有一部分客户将云预算从微软 Azure 转移到 AWS。虽然 AWS 在云市场份额和营收规模上大于 Azure,但此前微软云是唯一可以提供 OpenAI 模型的平台,这让它领先其他云厂商。
他称:“客户现在可以在 Bedrock 获得稳定可靠的性能,而在 Azure,性能表现难以预估。” 亨特说,他服务的金融客户在 AWS 上的开销自 5 月以来增长了四倍。在他看来,AWS 这项 AI 服务性能优于微软等竞品。
亚马逊 7 月披露,2026 上半年 Bedrock 新增客户数量已经超过该服务上线头两年总和;第二季度客户在 Bedrock 上的花费,超过此前所有季度的总和。亚马逊没有单独披露 Bedrock 营收,但财报显示 AWS 二季度增速提升 9 个百分点至 37%;微软 Azure 增速 42%,环比提升 2 个百分点。
微软在声明中表示:“随着 AI 应用普及,工作负载从模型开发转向大规模推理与智能体应用,微软持续迭代 AI 技术栈,满足客户不断变化的需求与持续增长的 AI 算力需求。”
Bedrock 早期的困境说明:即便 AWS 是全球市场份额最高的云厂商,AI 巨大的算力需求也给它带来重重难题。
AWS 发言人在声明中表示:“为跟上 Bedrock 激增的需求,我们从头重写推理引擎,兼顾性能与安全。这套方案已经获得客户广泛认可。Bedrock 是 AWS 史上增长最快、规模达数十亿美元的业务,已有数十万客户使用。”
技术难题
2022 年底 ChatGPT 发布拉开 AI 竞赛序幕,时隔近一年,AWS 在 2023 年秋季推出 Bedrock。亚马逊此前已经拥有 SageMaker 等 AI 工具,但在 AI 浪潮初期起步不顺,给微软创造机会。一名项目参与者称,AWS 工程师每周工作 60 小时,打造这项服务,让客户能够把云应用接入大语言模型。
AWS 推出这项新服务,部分原因是客户无法在原有系统上运行头部 AI 模型。和普通软件不同,大模型使用的是 AI 企业严格保密的专有权重,模型厂商不允许客户直接访问权重。
但仓促开发上线的 Bedrock,在后续两名项目参与者看来,产品有种 “拼凑感”。一位内部人士和另一名项目成员表示,原有架构无法充分利用 AI 芯片算力,导致客户频繁报错,限制 Bedrock 大规模扩容。
AWS 发言人回应:“我们持续迭代服务,力求尽善尽美。但在我们这种体量下,偶尔会出现难以预见的问题,我们会识别、同步客户并尽快解决。”
与此同时,客户算力配额问题越来越突出。每个用户拥有基础算力额度,一旦用量上升就会被限流,需要等待 AWS 释放更多算力。一名前员工称,部分客户等待时长最长可达三周。
一名产品团队成员透露,2025 全年不断有客户投诉,亚马逊限制他们调用 Anthropic 模型。AWS 管理层一度担心 AI 代码初创公司 Lovable 会因为 Bedrock 调用 Claude 困难而迁出平台。
一名看到这份内部文档的人士称,2025 年初,AWS 销售团队传阅一份内部报告,指出 Bedrock 的技术缺陷正在阻碍获客。同期 The Information 报道,高层将 Bedrock 算力危机称作一场 “灾难”。
亨特表示,客户实测发现:2024 年,Bedrock 上运行 Anthropic 模型的吞吐(token / 秒)最高比直接对接 Anthropic 慢 63%。企业直连模型厂商,是通过 API 调用,模型本身依然托管在云服务器;Anthropic 除 AWS 外,还在谷歌云提供模型直连 API。
Bedrock 的问题甚至引发亚马逊其他业务线高管不满。两名听过相关谈话的人士称,时任亚马逊电商高级副总裁戴夫・特雷德韦尔在 2025 年初向 AWS 管理层表示,Bedrock 持续报错、算力紧张,让他想直接改用 OpenAI 原生模型(OpenAI 原生模型主要托管在微软 Azure)。一名接近亚马逊的人士对特雷德韦尔这番说法提出异议,特雷德韦尔现已转岗至 AWS。
Mantle 的解决方案
随后,利戈里提出打造 Bedrock 新版本的构想。在去年 12 月 AWS 年度 re:Invent 客户大会上,时任云服务器业务负责人戴夫・布朗推出 Mantle—— 支撑 Bedrock 运行的全新技术层。他介绍,Mantle 的目标是让 Bedrock 可以持续扩容,满足未来预期需求。
布朗在大会主旨演讲中说:“随着模型迭代、使用量上涨,我们意识到推理需要一套全新架构。”(布朗近期离开 AWS,加入 Meta)
布朗同时指出初代 Bedrock 架构缺陷:它沿用传统 Web 服务的设计思路搭建。
但驱动应用的大模型运行过程,也就是推理,远比传统云业务复杂。传统云业务主要是客户存储、调取数据分析;推理需要随时调度足够服务器承接波动巨大的负载。2025 年,客户开始用 AI 处理更复杂任务,这一矛盾愈发明显。
布朗在 re:Invent 上称:“推理的运行逻辑,和我们过去二十年持续优化的传统计算模式完全不同。”
Mantle 专门适配复杂 AI 任务尖峰负载:算力瞬间冲高,随后迅速回落。早期 AI 任务相对简单,旧架构尚可支撑,新的 AI 智能体长任务,则需要全新的算力分配机制,AWS 发言人如此说明。
为解决大规模场景下的算力尖峰问题,Mantle 新增功能:客户可对 Bedrock 内不同任务设置优先级,AWS 可以把更多算力分配给客户的高优先级任务。Mantle 还做了负载隔离,发言人打比方:就像演唱会场馆设置多个独立入口,单个客户的高负载只会占用自身配额,不会挤压其他客户资源。
AWS 还强化 Mantle 与已有服务 Journal 的兼容性。Journal 可以保存 AI 智能体的任务进度,长任务中途中断后无需从头重新运行,以此适配越来越多的长时 AI 任务。
参与 Mantle 研发的 AWS 前副总裁乔・马格拉莫罗夫,在今年 1 月 AWS 播客节目中表示:“通过 Mantle,我们认识到推理本质上不完全是 Web 服务,更像一套调度系统。”(马格拉莫罗夫上月跟随布朗一同加入 Meta)
API 原生兼容
Mantle 实现对 OpenAI、Anthropic 原生 API 直接兼容。初代 Bedrock 要求客户编写定制代码,才能调用这些 AI 实验室的模型接口。
2026 年初 Mantle 全面落地。一名前员工说,客户申请扩容的等待时间,从 2025 年初的三周,在当年年底缩短至两天。亚马逊 CEO 安迪・贾西在 2026 致股东信中,将 Mantle 称为 “大获成功的 Bedrock 服务的技术基石”。
亚马逊称,2025 年后期,Bedrock 主要跑在自研 AI 训练芯片 Trainium 之上。在英伟达芯片持续供给受限的背景下,这为 AWS 新增算力来源。
当然,客户使用该服务偶尔仍会遇到延迟。一家借助 Mantle 在 Bedrock 调用 Claude 的企业经理表示,过去数月曾间歇性遭遇服务中断,最长一次持续约 11 小时。
AI 咨询公司 Loka 机器学习负责人博扬・亚基莫夫斯基称,已有六家客户转至 Bedrock 上运行 OpenAI 模型,不再直连 OpenAI 或者使用 Azure。
亚基莫夫斯基说:“迁移有不少好处,推理速度更快、整体吞吐量更高;成本不变,其他参数也完全一致。”
