谷歌做出了一个AMD?为什么TPU是谷歌AI战略最大的杀器!?

6 小时

播放量 1.1k

video_lock

谷歌,这是一家产品线分布相当广泛的公司。从最初的互联网产品,搜索、YouTube、邮箱、地图这些产品,再到现在的大模型、芯片、数据中心、互联等等。可以说,谷歌就是美股所有科技公司里,产品线最多最长的公司了。而在这么多的产品力,要说有哪一个产品特别不一样的,那我想,必然要看它的芯片TPU。

no-comment

开通服务即可查看评论~

文字稿

谷歌,这是一家产品线分布相当广泛的公司。从最初的互联网产品,搜索、YouTube、邮箱、地图这些产品,再到现在的大模型、芯片、数据中心、互联等等。可以说,谷歌就是美股所有科技公司里,产品线最多最长的公司了。而在这么多的产品力,要说有哪一个产品特别不一样的,那我想,必然要看它的芯片TPU。
TPU是AI数据中心最重要的基础。有了自己的TPU,就可以降低对英伟达的依赖,同时建立AI的竞争优势。近几个月,谷歌TPU甚至还开始对外销售,而且这个量还不小,俨然要做出一个小英伟达的架势。显然,TPU已经是谷歌AI战略中极为重要的一部分。那既然如此,咱们就来做一个专题研究。我来给大家好好聊聊谷歌TPU,看看它的优势在哪,对于谷歌未来的走势,又意味着什么?


TPU的优劣势

咱们不妨先对TPU做一个简单的科普。
在规划一颗计算芯片的时候,最常考虑的,是在固定的晶圆面积(比如12寸晶圆)上能够放下多少不同类型的单元。包括控制单元、存储单元、和计算单元。它们分别代表这颗芯片有多少的任务规划能力、数据存放能力和数据计算能力。
而从CPU到GPU再到TPU,背后的推动力就是算力的使用场景越来越细分、越来越定制化。CPU是"头脑发达"型,什么问题都能应付,但要是只让它算加减乘除,那就是杀鸡用牛刀,因为它留给计算单元的空间是最少的。TPU是另一个极端,是一个专业的"计算小能手",它的计算单元多,片上存储面积大,所以数据跑的距离短,运算响应快。因此特别适合重复干同样的活。但代价是,它严重依赖编译器来安排任务,而且只擅长干一类活。GPU呢,就介于这两者之间。
简单说,如果要处理的任务不确定性很高,那还是得用CPU;如果计算量很大、处理方式又高度确定,那直接用TPU最划算,它的价值主要体现在成本上;而如果计算量很大、但数据可能要用好几种不同的方式来处理,那GPU就是最佳选择。

那怎么地,谷歌的TPU突然火起来了呢?这是因为,进入26年以来,AI推理的需求在飙升。对于用户来说,他们关心的是怎么用最少的token,来产生最大的经济价值;而对于卖token的云厂商来说,关心的则是怎么用最小的芯片成本,生产出更多的token。而这就时候,成本优势就愈发得到市场的重视。而前面说过,成本就是TPU最大的优势,再加上谷歌本身有着十多年的开发经验,量产时间最长,性能也最早获得外界认可。所以,TPU的价值就得到体现了。
那谷歌当初为什么会去研发TPU呢?故事得回到2013年。那时候互联网的算力需求爆发,算力的使用场景也越来越细分。传统的通用算力芯片,已经很难满足一些特定场景的需求了。
当时谷歌内部有很多线上推荐系统,对算力的需求相当高。但它们的推理用的全都是CPU。而CPU的问题前面我也说了,它做的是并行计算,能耗高、速度慢。且那时候也没法用GPU,因为当年的GPU还没有加入矩阵计算单元。于是谷歌就想,为什么我们不自己开发一款只做矩阵计算的芯片呢?就这样,公司自建研发团队,到2015年,谷歌第一款高计算吞吐量的TPU就诞生了。此后每两年左右迭代一次,最近几年加快到了每年一代,到26年,已经是第八代TPU了。

这里有一个很重要的设计思路。TPU从设计之初就是为数据中心而生的,它要干的活,是让几千张卡协同起来去完成一个任务。所以它把芯片里的控制单元压缩得极小,计算任务的安排完全交给一套叫XLA的软件来做,目的就是确保所有的计算单元尽可能处于满负荷工作状态。也因此,它的全寿命成本TCO(total cost of ownership),就能做到最低。
这还带来一个很有意思的结果。如果客户对TPU的软硬件特性了解得很深,不怕折腾再去搞搞软件的话,那它能直接从谷歌那里买芯片,去最大化利用TPU的性价比优势;但如果没有能力自己搞软件的话,那客户也可以直接租用谷歌云来获得算力。相对来说,卖云服务的附加值,要比单纯卖芯片高得多得多。当然这两种服务现在谷歌都有在做。
不过, TPU这种专用性的设计,也决定了它的缺点。TPU之所以又快又便宜,是因为它把芯片上宝贵的面积,几乎全都留给了计算单元。任务排版则全部交给XLA这套软件提前安排好。这就意味着,一旦AI模型在迭代过程中出现了架构或者算法上的巨大变化,TPU就需要重新做排版,等到在硬件或者软件层面,面向新一代算法做完特定优化。
而GPU就没有这个问题,由于它的通用性和灵活性,任何新的架构和算法出现后,都可以立即开始工作。
这就像一条专门为某款车型打造的自动化生产线。只要车型不变,它的效率和成本,通用车间根本没法比。可一旦车型换代,这条生产线就得停下来大改。反倒是隔壁那个什么都能干的通用车间,虽然平时效率低一点,但由于它够灵活,所以即便来了新车型,也能很快就上产线了。
不过,谷歌也在针对TPU这些缺点做出调整。它新一代的TPU V8,直接推出了训练用的8T和推理用的8i两个方向的产品,分别针对训练和推理端的需求。训练端更强调峰值算力和大数据量吞吐,推理端则更重视片上高速缓存和低延迟。同时,新一代芯片的集群互联带宽也更大了,模型可以调用一个统一的超大规模内存池来计算,从而降低总成本。这确实一定程度上缓解了不够灵活的问题,但和GPU比终究还是差不少。

到这里咱们简单总结一下。TPU在计算性能上的优势,主要来自芯片设计上对特定场景的强化,它特别适合大规模的、高通量数据的并行处理。这恰恰就是目前AI推理所对应的场景,也是TPU现在受热捧的主要原因。
随着TPU的不断成熟,越来越多的外部客户对此感兴趣。现在,TPU的最大买家就是Anthropic。去年10月,Anthropic宣布采购100万颗谷歌TPU,大约相当于1吉瓦的算力,26年开始交付。26年4月,Anthropic再次与谷歌、博通签署TPU算力采购协议,传闻是3.5到5吉瓦,27年开始交付。
除了Anthropic以外,谷歌还和Meta、OpenAI有一定的合作。不过现在只有Anthropic是唯一被确认的客户。


TPU的市场份额和业绩贡献

那TPU未来到底能带给谷歌多大的业绩贡献和市场份额呢?恰好,最近有两家机构,大摩和Wolfe Research,都专门讨论谷歌TPU的最新变化,咱们不妨看一看。
先看大摩8月24日的这份报告。从我们多年跟踪的经验来看,大摩对芯片公司的分析里往往会有一些行业内幕,尤其是他们还有专门的亚洲团队去跟踪供应链的走势,所以他们的观点还是很值得参考的。
大摩的观点是,根据最新的订单新闻,谷歌TPU对外销售的单价,将从此前的每吉瓦200亿上调到每吉瓦 270亿。这个价格,仅仅比英伟达的Vera Rubin低了18%。同时,TPU的毛利率假设也从20%提到了30%。
收入上,大摩预计,27年谷歌光靠卖TPU就能卖出840亿,28年更是到1080亿。这是什么概念?市场预计AMD在28年数据中心的收入就是1040亿,相当于凭空做出了一个AMD。
而要是考虑到谷歌云的附加值上,就更夸张了。大摩对于27年28年谷歌云的收入预期,分别给到2360亿和3430亿。要知道,现在谷歌广告的一年总收入就是3400亿。也就是说,两三年后,谷歌云和广告的收入就能做到五五开了。当然了,利润率上,云和TPU肯定比不上搜索,但这个收入也是相当夸张的。


Wolfe在8月27日的报告更乐观一点。它们表示,随着第三方基于谷歌TPU计算平台的投资增加,26到28年,谷歌TPU的销售收入分别达到230亿、1058亿和1746亿美元。比大摩的估计高出70%。

他们说的这个"第三方投资",指的是谷歌和博通、Apollo、Blackstone等一起做的算力扩张计划。Apollo、Blackstone这些基金给钱和基建,谷歌和博通提供硬件、服务和软件。这样做,谷歌就可以把部分基础设施的投入给外部资本来承担。对于谷歌来说,不仅算力卖出去回款更快,对于缓解谷歌当前的现金流压力,是有帮助的。

而考虑到这些新投资形式带来的TPU收入增加,Wolfe给谷歌云的收入预期,在明后两年在2338亿和3277亿美元。
按照这两家机构的数据来看,27年和28年谷歌云的收入,都比市场平均值高出30%左右。相信这俩机构的预期,在未来会和市场预期慢慢趋同磨合。但要注意的是,由于TPU芯片出售的毛利率较低,所以传导到最后,两家机构对谷歌总体每股盈利的预测,只比市场预期高了5%而已。因此最后到股价上的影响,可能也没有想象中那么大。



但不管怎么样,通过这些分析我们知道:第一,TPU未来的销售,包括和云附加之后的销售将会相当强劲。第二,第一次看到有华尔街机构专门对谷歌TPU业务做了量化测算,说明市场开始对TPU业务进行单独定价了。


管理层的矛盾!

好处是看得很清楚,但这背后还有一个咱们投资者不得不思考的问题。那就是算力分配。
对于谷歌来说,现在的算力资源本来就非常有限。好不容易找台积电要到产能,做出了这些TPU,结果现在要卖出去一大部分,那你内部怎么办呢?别忘了,谷歌自己还有一个Gemini,所以谷歌自己本身也是相当缺算力的。现在,你卖出去这么多算力就罢了,还要把它卖给Anthropic这样的竞争对手,这不是战略上矛盾了吗?难道说,谷歌真的把卖芯片看得比Gemini更重要?管理层这到底在想什么呢?
针对这个问题,我们团队几位分析师做了激烈的辩论。最后呢,老实说辩论完之后也还没有肯定的答案,但一些想法还是有的。所以这里,我就对我们团队的几个核心思考和大家汇报一下。
首先,我们认为,对外销售芯片这个战略,某种程度上是为了对TPU的团队进行鞭策。此前,TPU都是给公司内部使用,但内部客户往往比较“礼貌“,再不满意也不会说不用你的芯片。这在长期必然会削弱了产品长期的竞争力。而一旦转到对外客户,情况就不一样了,为了抢占市场份额,获得客户的订单,产品力必须跟上,这就可以倒逼着团队去加快速度迭代。外部客户经常又会给出一些不一样的反馈,这对于产品迭代来说非常有帮助。另外,外部客户的订单也能给谷歌云的“性价比”优点提供背书。因此,从产品发展策略上看,对外销售还是很合理的。
其次,是产业链上的背书。站在台积电的角度想一想,它的产能本身是有限的,那在给客户分配产能的时候,会优先给那些需求高,保证能卖得出去的芯片。不然的话,台积电到时候为你扩产,结果扩着扩着你的芯片没人买,要砍订单,那台积电不就吃大亏了吗。
而谷歌估计是想到了这一点。要是有多个终端客户给这颗芯片背书,尤其是有Anthropic这样的客户,那TPU销量低于预期的可能性就会非常小,台积电的生产安排会更平稳,也就能够多给你分配一些产能。而现在,产能恰恰又是谷歌眼下最缺的东西。
最后,从公司内部财务的考量来看,这么做也能合理化它的资本开支,为更长时间的投入做准备。之前我们说过,谷歌是所有大科技里面花钱最猛,而且是最没有办法降低资本开支的公司。对于微软和亚马逊,资本开支如果少了,大不了就是云的收入少一点。但谷歌不行,它如果不投钱,不光云的收入受到影响,而且自己的AI模型也会受到影响。所以谷歌是三大云中最不能不参与军备竞赛的公司。
但问题是,如果你只花钱不收钱,时间长了股东也受不了,管理层压力也很大,就跟现在的Meta一样。那怎么办呢?那就不妨先卖点TPU,卖点云,来回笼一下现金流压力吧。这样长期也可以保证整个资本开支更持续一点,最终也更有可能打赢这场算力战。
所以我们认为,正是因为管理层相对TPU团队进行鞭策、在产业链上寻找背书、以及内部财务的考量,一举三得,它们才做出了,在自身算力就紧缺的背景下对外销售TPU的这个看似矛盾的决定。
当然,上面说的都是有利的一面,咱们也得把另一面说清楚。不可否认的是,谷歌之前对AI发展的速度,以及台积电产能紧缺的程度,都是预期不足的。
不管是英伟达、AMD、还是其他芯片公司,它们都是早早就找台积电去book未来两三年的算力。但谷歌呢,直到去年下半年才开始认识到产能的重要性,seriously地去找台积电要产能。但当时,台积电未来一年多的产能几乎都订满了,这便是为什么今年的TPU一直上不了量。不仅如此,管理层还在去年10月份和Anthropic签约,更是导致了的TPU,还要分一部分给Anthropic。照理说,在产能不太够的情况下,应该谨慎对外签约才对,可见当时管理层的预期明显不足。最后结果就是,目前谷歌内部的算力资源不够用了,模型的表现也不如预期。
这里,相信既有公司采购策略的问题,也有内部管理上的问题。
当然了,现在咱们是事后诸葛亮。站在当时的情景下,管理层做这个决策也可以理解。毕竟对外销售TPU的长期价值还是相当明确,还是一举三得。现在虽然算力不够,但好在,随着明年和后年TPU产能瓶颈的缓解,算力的问题还是能够缓解的。而且明年TPU还会上V9的新版本了,到时候效果估计会更好。因此,我们对于公司明后两年Gemini的表现,还是比较有信心的,只不过短期算力短缺的问题,应该还是要持续一阵了。


我们的观点

到这里,关于TPU的客观分析就说到这。最后,我们再来聊聊,在做完这次分析过后,我们对于谷歌TPU业务,以及对谷歌这家公司的一些新的看法。
从业绩上看,TPU对于谷歌还是很有帮助的。按照目前TPU的在手订单来看,明后两年 TPU对外销售会分别占到公司总收入的15%和19%,贡献当年收入增量的68%和39%。还是很可观的。因此,TPU在短期内就会是它的重要的增长引擎。不过,考虑到它本身的盈利贡献并没有那么高,而且这本质上就是谷歌云的一部分,所以对于股价的影响,肯定是没有收入增量贡献那么明显的。也就是说,我们未来可能会看到很多来自TPU的好消息,或许也能看到收入就此有一些增长,但股价的反应不一定会很好。
那是不是TPU其实也没有那么重要了呢?当然不是,只不过它传导到股价的链路不一样。
我们之前分析谷歌时说过,当前影响谷歌股价最核心的因素,没别的,就是Gemini大模型的进展。包括谷歌云、Gemini Enterprise等B端产品。都和Gemini的竞争力直接相关。如果Gemini的智能水平掉队了,那谷歌不光在B端进展会遭遇困境,更麻烦的是,还可能拖累到自己本身原有的互联网业务,包括搜索广告等。
而对于谷歌来说,未来算力的增量来源,主要就是靠它自己的TPU。因此,只有它自己的TPU做得更好,找台积电要到更多的产能,那么才更有可能把Gemini给做好。
往后看,也只有TPU做好之后,Gemini的成本优势才能进一步被体现。之前我们也说过,成本将会是谷歌未来在AI时代最核心的优势。长期来看,AI大模型作为生产力工具,性价比相当重要。现在,成本已经是AI在B端应用最大的痛点之一了 。因此谁的性价比更高,能力又不差太多的话,自然就能获得更大的市场份额。而从最近几个月谷歌不断更新Gemini Flash版本,追求极致性价比的战略来看,这应该就是谷歌正在努力的方向。
那怎么样才能实现单位任务下的Token成本最优呢?说到底,就是自己全都做,垂直一体化。而这里最大的杀器,就是谷歌的TPU自研芯片,也是谷歌区别于OA最核心的能力。谷歌也因此可以用更便宜的价格,通过「量大管饱」的竞争策略,抢占更多市场份额,最终帮助谷歌这场马拉松竞赛中取得一定的战略优势。
因此这么分析下来,TPU的进展还是相当重要的。我也认为,未来在看谷歌这家公司的时候,对于TPU的进展,应该要放在和Gemini的模型进展一样重要的位置上。而且,我们也对此感到乐观。相信过不了太久,等V9上来,产能也开始上来过后,TPU的威力会再一次被市场认可。而到那时候,Gemini的模型能力问题理应也能跟上,从而打消市场当下的担忧了。
因此整体来看,美投团队对于谷歌,依然维持之前的观点不变,继续给出“非常积极”的观点倾向,保持看好。
好,到这里,关于谷歌TPU的分析就先讲完了。最近这段时间,我们确实做了很多关于谷歌的分析,原因也很简单,我们团队目前整体对谷歌的观点比较积极。所以接下来,我们也会继续把谷歌其他业务一点点拆开来分析,进一步完善我们对这家公司的整体判断。
所以如果你对谷歌感兴趣,或者本身就在持有、准备持有谷歌,也记得点击我们的跟踪按钮。这样后续无论是新的分析视频,还是公司出现重要异动的时候,你都不会错过我们的更新啦。
深度跟踪-为你持续追踪GOOG基本面变化

深度跟踪-GOOG

Alphabet Inc

$335.38

0.07 (+0.02%)

昨收

$335.31

最低价

$330.39

PE Ratio

22.57

今开

$331.99

最高价

$336.47

52周范围

$233.38-$404.47

财报跟踪

1 视频

业务调研

5 视频

更新于2026.09.08

事件解析

2 视频

股价监控

6

估值

1

问答

306

交易

5

热门

MAG7

AI应用

search