选云平台这种事,最怕的就是在网上翻一堆对比表格,最后发现每家的结论都是「看情况」。

这篇尽量从技术能力的实际差异出发,把 AWS 和 Google Cloud 在核心服务、AI 产品线和定价结构上的区别说清楚,不回避谁在哪方面更强。


市场格局:体量不同,路径不同

2026 年初的市场数据比较有意思:全球云基础设施市场达到 419 亿美元规模,三巨头合计占了大约 68%。AWS 以大约 30-32% 的份额保持第一,GCP 大约 11-13%。从增速上看,GCP 的百分比增长更快,但 AWS 的绝对体量优势仍然很大。

但真正决定选型的不是市场份额,是两家在 AI 这个变量上的策略差异。


技术能力:广度 vs 深度

AWS 的策略是铺广度。

2006 年就开始做云服务,到现在有超过 200 项服务,Gartner 连续多年在云基础设施和平台服务魔力象限里把 AWS 排在第一位。这个广度的意义在于:你需要的某种能力,大概率已经是一个现成的托管服务,不用自己拼凑。

EC2 提供了 500 多种实例类型,Graviton 自研芯片在 ARM 架构上比 x86 实例便宜不少。S3 是对象存储的事实标准,SageMaker 的端到端 ML 平台也覆盖了从数据标注到模型监控的全流程。

GCP 的策略是堆深度。

Google 做了 Kubernetes 和 TensorFlow,这两样东西在开发者社区里的影响力不小。GKE 被普遍认为是管理能力最强的托管 Kubernetes,BigQuery 的 Serverless 数据仓库在性价比上很难找到对手。

Gartner 的 Magic Quadrant 报告里提到,GCP 的强项在于开发者「心智份额」——和开源社区的关联带来了比较强的技术影响力,而且在缩小和 Azure 的差距方面有明显进展。

简单说:AWS 是「你想要的这里都有」,GCP 是「在特定领域比谁都强」。


AI 服务:两条不同的路线

这是两家差异最大的地方,也是选择时最需要考虑的维度。

AWS Bedrock:模型超市 + 分销模式

Amazon Bedrock 的本质是一个基础模型调用平台,客户通过统一的 AWS 账单和安全框架,调用 Claude、Nova、Llama 等模型。

2026 年一季度的数据显示,Bedrock 贡献了 AWS AI 收入的 37%,年化运行规模约 55 亿美元。仅占 AWS 总收入的 4%,却贡献了 30% 的新增毛利额。

原因在于 Bedrock 的交易结构:AWS 不只是卖算力,而是在分销 Anthropic 的 Claude token 时同时收两份钱——基础设施费用和分销分成。Bedrock 在 2026 年一季度实现了大约 55% 的 EBIT 利润率。

另外,AWS 自研的 Trainium 芯片已经支撑了超过 50% 的 Bedrock token 使用量。这意味着底层成本还在往下压。

Bedrock 对开发者的实际意义: 一个 API 可以调用多家模型,不用为了换模型重新搭一套基础设施。如果团队正在快速迭代 AI 产品,这种灵活性比较重要。

Google Cloud Vertex AI:Gemini + TPU 路线

GCP 的 AI 策略更偏「自给自足」。Vertex AI 是端到端的 ML 平台,Gemini 系列模型是 GCP 自己的模型。Google 的优势在于 TPU(张量处理单元)——这是 AWS 没有的硬件加速器,在训练特定规模模型时的性价比确实能赢 GPU。

一个 IEEE 论文里的研究对比了在不同云平台部署 ML 模型的效率和成本。结论是:Google 的 BigQuery ML 对熟悉 SQL 的用户学习门槛低,适合大规模数据分析任务;但成本方面,AWS SageMaker 的并行训练可能导致费用更难预测。

一个值得关注的风险点

如果 AI 产品的流量增长比较快,容量问题值得考虑。2026 年出现过 GCP 在推出新的消费者功能时,算力需求暴增导致 API 客户被限流的情况——付费客户的服务响应变慢,因为他们用的容量被挪给了 Google 自家的产品。

AWS 的容量规模通常不容易遇到这种问题,对流量敏感的应用来说,这是比模型功能更实际的考量因素。


价格优势:到底谁更便宜?

这个问题得分开看。

按需实例的标价:GCP 通常比 AWS 便宜 5-10%,而且有自动的持续使用折扣(不用签长期合同就能享受)。

长期承诺折扣:两家的折扣比例差不多(1-3 年承诺换 30-60% 的节省),但 AWS 的 Savings Plans 在跨实例族应用方面更灵活。

TPU 的性价比:在特定的 AI 训练负载上,GCP 的 TPU 确实能跑出比同等 GPU 更低的总成本。

容易被忽略的部分:出站流量费用。AWS 的出站流量在几家里是偏贵的,如果业务需要大量数据从云上往外传,这个部分的费用可能显著影响总成本。

综合来看:没有「哪家一定更便宜」的结论,取决于负载类型、网络流量模式、以及对承诺折扣的使用方式。


应该选哪家?

选 AWS,如果你:

  • 需要一个覆盖最广的服务目录,避免将来「这个功能只有别家有」的麻烦

  • 运行的是生产级 AI 产品,对可靠容量的优先级比较高

  • 需要同时接入多个模型(Bedrock 的多模型能力比较方便)

  • 团队已经有 AWS 的操作经验或认证

选 GCP,如果你:

  • 主要负载围绕大数据分析(BigQuery)或 Kubernetes(GKE)

  • 准备用 TPU 跑模型训练,且对 TPU 的性价比有明确需求

  • 团队更看重开发者体验和「干净的 API 设计」

  • 业务对流量出站费用敏感,需要更低的数据传输成本

另外,一个在 2026 年已经比较普遍的策略是多云——大约 75% 的企业现在会同时用两家以上云厂商。不一定非要二选一,可以根据不同工作负载的特点分别放。


总结

AWS 和 GCP 的竞争,本质上是两种不同路线的竞争:AWS 靠广度和规模,GCP 靠深度和垂直整合。AWS 的优势在于「什么都有」和「规模大到不会挤兑你的流量」,GCP 的优势在于「特定领域做得更好」和「谷歌的全栈技术底蕴」。搞清楚自己的优先项,选型就没那么难了。