AI 这条产业链不是一排并列的公司,是一栋九层的楼。

你每个月付出去的那笔钱,进的是最顶上那间房。那间房压在云厂的楼板上,楼板压在英伟达的地基上,地基是台积电浇的,浇地基那台机器全世界只有一家能造,而整栋楼能不能通电,电网说了算。

楼层之间不是可替换关系,是承重关系。

先记住四个数字:

· 7250 亿美元 —— 微软亚马逊谷歌、Meta 四家 2026 年买 AI 基建的预算,接近瑞士全年 GDP

· 92% —— 英伟达最新季度营收来自数据中心(816 亿里的 752 亿)

· 2/3 —— 推理(模型训练完之后每一次干活)已占 AI 总算力,2023 年还只有 1/3

· 100% —— 荷兰 ASML 一家占了全球极紫外光刻机的市场,不是 90%,是全部

这四个数字里藏着这一轮最反直觉的一件事:花钱最猛的那一层不是最赚钱的那一层,而全世界唯一那个百分之百,长在一家荷兰公司身上。

下面我从住户一路拆到地基,一共九层。方法只有一个:跟着钱走。不需要任何前置知识,每个名词第一次出现的时候我都会解释。

━━━━━━━━━━━━━━━

▍整栋楼:钱从上往下流,力从下往上撑

先说一句会得罪很多人的话:把 AI 产业链画成一排并列的公司,是这轮讨论里最大的误导。

它们不是并列的,是摞起来的。九层楼里,每一层都在向紧挨着的下一层下单,再把加工过的东西卖给紧挨着的上一层。

所以真正要看的不是那九个方框,而是方框之间那道逐层收窄的界面。每两层之间都发生一次交易:钱往下买走一样东西,货往上交回另一样东西。九个方框只回答「这一层是谁」,八道界面才回答「他们凭什么连在一起」。

顺着中间这条线从上往下读一遍:你的月费,最后有一部分变成了 ASML 的一台光刻机和机房的一度电。

住户可以换一家 AI,房间可以换一朵云;但从地基往下,界面上只剩一个卖家。抽掉任何一层,上面全塌。

━━━━━━━━━━━━━━━

▍这九层各自到底在做什么

L9 住户 —— 你、企业客户

在做什么:付 20 美元月费,或按用量付 API 账单

绕不绕得开:绕得开,不满意就换一家

L8 房间 —— 模型公司(OpenAI、Anthropic、xAI)

在做什么:先花巨资训练出一个模型,再把它开放出来按字数收费

绕不绕得开:绕得开,几家互相可换

赚钱的样子:经营利润率 −122%,每赚 1 块亏 1.2 块

L7 楼板与水电 —— 云厂(微软亚马逊谷歌、Meta)

在做什么:掏钱买芯片、盖数据中心,再把算力按小时租给模型公司

绕不绕得开:基本绕得开,但要先垫掉几千亿

赚钱的样子:赚钱,但要先垫巨资,2026 年合计花 7250 亿

L6 布线与安装 —— 硬件供应链(服务器组装、光模块、电路板、铜缆)

在做什么:把芯片装进服务器机箱,再用光模块和铜缆把几万台机器连成一台

绕不绕得开:组装谁都能做;但光模块有技术壁垒

赚钱的样子:组装净利率 1.5%,光模块 28–38%

L5 地基 —— 芯片设计(英伟达、博通、AMD

在做什么:设计 GPU,买 HBM 装上、交台积电生产,再把整套机架卖给硬件供应链和云厂

绕不绕得开:绕不开,CUDA 生态积累了二十年

赚钱的样子:毛利率 75%,卖 4 万的卡成本 1 万

L4 钢筋 —— 高速内存 HBM(SK 海力士、三星、美光)

在做什么:把内存竖着叠成塔,用超宽通道把模型参数源源不断喂给 GPU

绕不绕得开:绕不开,和 GPU 焊死在同一块基板上

赚钱的样子:营业利润率 72%,产能全部售罄

L3 施工队 —— 芯片代工与封装(台积电)

在做什么:把设计图变成真实的硅片,再把 GPU 和内存塔封装到一起

绕不绕得开:绕不开,先进制程全球九成在一家手里

赚钱的样子:毛利率 66%,先进制程市占 90%+

L2 造打桩机的 —— 光刻机(ASML,荷兰)

在做什么:造出全世界唯一能在硅片上刻出纳米级线路的机器,卖给台积电这类代工厂

绕不绕得开:完全绕不开,全球独此一家

赚钱的样子:全球市占 100%,一年只造 48–60 台

L1 这块地 —— 电力(电网、变压器、燃气轮机)

在做什么:发电、变压、把数据中心接进电网,并把 GPU 的热带走

绕不绕得开:完全绕不开,有钱也得排队五年

赚钱的样子:排队接电 2600GW,中位要等近 5 年

整篇文章就是按这张表往下拆的。越往下走,你会发现选择越少、利润越厚、越没有人能绕开。

━━━━━━━━━━━━━━━

▍一个流行的说法,和它错在哪

你大概听过这句话:淘金热里最赚钱的不是淘金的,是卖铲子的。照这个说法,英伟达就是那个卖铲子的人。

这话听着有道理,可它解释不了眼前这件事。

铲子谁都能做。淘金热里第一个卖铲子的能赚点,等大家都来卖,边际利润很快就被吃光。历史上绝大多数行业里,卖工具都是门槛低、利润薄的苦生意。

问题出在这个比喻本身。铲子是平铺的,一把不好使就换一把,谁也不欠谁。而这九层是摞起来的,下面一层塌了,上面全完。

钱可以改道,你不满意就换一家模型公司、换一朵云;力不行,承重方向上没有替代品。

越往下层,玩家越少,利润率越高,越没人能绕开。

━━━━━━━━━━━━━━━

▍楼里这些人:一张牌桌的坐次

楼是结构,人是另一回事。

这一行里,短期赚多少钱是次要的,关键是你得留在中心那张牌桌上。这条动机解释了后面所有看着不合理的交易:

· 送出百分之十的股本去换一张采购承诺

· 承诺兜底买走客户卖不掉的算力

· 花两百亿只为把一支团队挖过来

它们都不是生意上的算术,是座位上的算术。

━━━━━━━━━━━━━━━

▍先搞懂机器在干什么:智能只有四个零件

上一节把九层摆开了。但在往下拆每一层之前,得先回答一个更基础的问题:这栋楼从上到下都在伺候同一台机器,那台机器到底在干什么?

这栋楼里所有公司、所有钱、所有唬人的技术名词,最后都会落回四个零件里的某一个。以后你遇到任何新词,先问一句:它属于哪一个。

这四个零件不是并列的,是串成一条线的。训练在链条外面,它是一次性的工程,一结束参数就冻结。所谓「知识截止日期」就是这么来的,也是它不会因为跟你多聊几句就变聪明的原因。真正每天重复几万亿次的,是后面那个循环。

零件一 · 训练:一段有始有终的工程

先灌进数万亿字,每次遮住一个字让它猜,这一步占了九成以上的花费。然后是监督微调,人类写几万到几十万条好问答范例,教它好好说话。最后是强化学习,答完当场打分,学会分寸感。

钱花的是资本开支,砸完就完了。

零件二 · 参数:它到底记住了多少

7B、70B、671B 说的就是数字有多少个。参数量乘以每个占几字节,就是至少需要多少显存。常用精度下 671B 等于 1.34 TB,得十七张 H100 才装得下。

显存不够不是慢一点,是根本跑不起来。

零件三 · HBM:把记忆调出来的那条管子

模型每吐一个字,都要把全部参数从显存里完整读一遍。GPU 是功率巨大的水泵,HBM 是接在泵上的管子。泵再猛,水也只能按管子粗细流。

这句话你先记着,后面整条产业链最赚钱的两层都是从它长出来的。

零件四 · GPU:一次历史性的巧合

CPU 像几个博士,一次只能深想一道题;GPU 像几万个小学生,只会乘加但能同时开工。神经网络恰好就是几万个小学生的活。

一颗本来为打游戏渲染画面而生的芯片,就这样成了智能的载体,这件事没有人事先规划过。

四件缺一件,智能就散架。学过但记不住等于没学,记住了调不出来等于失忆,都调出来了反应不过来,那叫呆。

━━━━━━━━━━━━━━━

▍你打一个字,钱是怎么一层层流下去的

四个零件讲的是机器怎么工作。这一节讲它们怎么变成钱:你按下回车之后,这笔钱依次经过谁的口袋。

一次普通的对话,会依次惊动六拨人。铲子可以换一把,收费站不能绕。

有一件事很多人算错了:成本不是按你问了几次算的,是按它吐了多少字算的。那个逐字生成的循环才是烧钱的地方。

还有排队这一步也值得留意,排队不是浪费,是省钱的关键。参数反正要搬一遍,一次搬运顺便服务几万人。所以高峰期变慢不是服务器不行,是批次排得更满了。

━━━━━━━━━━━━━━━

▍训练是上学,推理是上班

「推理」这个词听起来像深度思考,其实朴素得很:模型训练完之后,每一次干活都叫推理。这个区别决定了钱的形状。

训练像制药厂。钱是资本开支,一笔巨款砸下去按几年折旧,砸错了是沉没成本,但花完就完了。模型天天在改,所以要灵活,用通用 GPU。研发成功之后,多卖一盒的成本几乎为零。

推理像航空公司。钱是营业成本,跟着用量走,只要还有人在用它就永远不会消失。模型已经定型、要跑几万亿次,那就该上专用芯片。而且规模再大,也换不来边际成本的改善。

2026 年的现实是,整个行业正在从制药厂变成航空公司。推理占算力的比例,2023 年约三分之一,2025 年约一半,2026 年已经到三分之二。

很多人拿铁路来类比这轮投资,说铁轨投完就能收一百年租金。最致命的错误就在这里:AI 这条铁路,每跑一趟车都在真金白银地烧钱。

━━━━━━━━━━━━━━━

▍谁投了谁,谁又把钱花回给谁

钱流的前三站是住户、模型公司、云厂。可这三方之间的关系,比「谁付钱给谁」复杂得多:他们互相持股,也互相买货。

判断的方法很简单:凡是两家之间出现一去一回两笔钱的地方,就是一笔循环交易 —— 我投你的钱,你拿这笔钱回头买我的货。

看谁的线最多,就知道谁是枢纽:

· 英伟达一家连着三组闭环 —— CoreWeave、OpenAI、xAI

· OpenAI 一家被三家连着 —— 微软、英伟达、AMD

它们的收入和估值互为因果,很难单独判断哪一家是真的。

博通是个例外,它只有单向、没有回头 —— 因为它不投人,只收钱。谷歌、Meta、OpenAI 三家的「自研芯片」,都得请它来设计。

市值口径说清楚。上市公司取 companiesmarketcap.com 2026 年 8 月 9 日快照:

· 英伟达 5.42 万亿

· 谷歌 4.32 万亿

· 微软 3.71 万亿

· 博通 2.04 万亿

· Meta 1.51 万亿

· AMD 7890 亿

· CoreWeave 471 亿美元

未上市的取最近一轮融资估值:Anthropic 9650 亿是 2026 年 5 月 H 轮,OpenAI 8520 亿是 2026 年 3 月,xAI 2500 亿是 2026 年 2 月被 SpaceX 全股票收购时的作价。

两个词先解释一下。TPU 是谷歌自己设计的 AI 专用芯片,只干矩阵乘法,砍掉了 GPU 里所有通用电路。SPV 指为单笔交易专门注册的空壳公司,它借的债不计入母公司报表。

这一堆闭环里,最硬的一条证据不是任何千亿投资的传闻,而是微软自己的财报口径。

合同储备指已经签约但还没确认为收入的金额,它同比涨了 99%,可剔除 OpenAI 之后只增长 26%。一家市值三万亿的公司,接近四分之三的订单增长来自一个自己持股 27%、每年巨亏的客户。

只引 99% 不引 26%,那就叫选择性引用。

━━━━━━━━━━━━━━━

▍必须纠正的两个流行说法

第一个:英伟达投一千亿给 OpenAI、OpenAI 转头买英伟达的卡。

这件事没有发生过。2025 年 9 月官宣用的词是 intends to invest up to 100 billion,意图投资最多一千亿,是意向不是合同。英伟达 2026 财年年报白纸黑字写着协议仍未签署、无法保证完成。到了 2026 年 2 月,黄仁勋公开改口,说这一千亿「从来就不是一个承诺」。最终落地的是 300 亿纯股权,而且不再挂钩任何 GW 里程碑。

第二个:Oracle 那份三千亿美元合同。

Oracle 从来没有确认过它。源头是媒体独家报道,Oracle 唯一披露的是 RPO 总额 6380 亿,「OpenAI 约占一半」是分析师倒推出来的。

顺便把监管口径也说准。SEC 至今零问询、零立案、零执法。真实的动作发生在国会:2026 年 6 月,参议员提出《AI 泡沫透明度法案》,要求披露金融机构对 AI 的债权敞口。有人已经在准备事后追责的工具了。

━━━━━━━━━━━━━━━

▍「自研芯片」大多是个幻觉

亚马逊有 Trainium,Meta 有 MTIA,微软有 Maia,OpenAI 也在做自己的芯片。听起来大家都在摆脱英伟达。可这些自研芯片,核心物理设计大多不是他们自己做的。

博通加 Marvell 合计控制约 95% 的定制 AI 芯片市场。所谓云厂摆脱英伟达,实际是从依赖一家公司,变成依赖另一家公司。

博通 2026 年二季度 AI 半导体营收 108 亿,同比涨 143%,当季 AI 订单超过 300 亿,接单量是出货量的近三倍。五个前沿定制硅项目里,它一家占了三个。

英伟达收「用 GPU」的税,博通收「逃离 GPU」的税。

你想跑?先给博通交过路费。

━━━━━━━━━━━━━━━

▍护城河的四层,以及那道缝

护城河指的是别人抄不走、也绕不过去的结构性优势。英伟达的护城河不是那颗芯片本身,而是叠在芯片外面的四层。

第一层 · CUDA

2006 年做到今天,二十年的复利,400 万开发者、4 万家组织。底下是 cuDNN、cuBLAS、TensorRT、NCCL 等几千个手工调优的算子库。对手能做出能跑的替代品,做不出同样快的。

第二层 · 框架的默认路径

PyTorch 和 JAX 这两个最常用的框架,默认后端就是 CUDA。AMD 的 ROCm 已经拿到官方支持,但最新的性能红利总是先到 CUDA,你永远慢半拍。

第三层 · 迁移成本

AMD 的 HIP 能转译 CUDA 语法,但转不掉性能,转完还得重调一遍。业内的形容很准:换 CUDA 就像住在房子里重建房子。

第四层 · NVLink 和整机架

这一层从 2024 年之后最狠。你能从别家买到芯片,但买不到把 72 张卡当成一张卡用的那套互联。这是它从卖芯片变成卖系统的底气:单卡三到五万美元,一架 GB300 NVL72 是 370 到 400 万。

那道缝在哪

缝在推理这一侧。推理场景下 CUDA 的锁定力明显弱于训练,vLLM、SGLang、Triton 这些新框架正在把底层算子抽象掉,你调的是高层接口,底下是不是 CUDA 你不需要关心。这是所有挑战者能切进来的唯一入口。

英伟达的回应发生在 2025 年 12 月,一笔约两百亿美元的交易。它不收购股权、不买客户合同、不买产品线,只拿技术授权,外加把对方的创始人和核心团队全部挖走。对方是 Groq,做推理专用芯片的明星创业公司。

这件事告诉你护城河不只是 CUDA,还包括一张能随时买断任何挑战者的资产负债表。

━━━━━━━━━━━━━━━

▍光模块:这条链上最不像赢家的赢家

刚才那层地基之上、云厂之下,还夹着一层几乎没人讨论的东西:把几万张卡连成一台机器的那些零件。

同一层里,有人净利率 1.5%,有人 38%。一家营收 1647 亿只赚 24 亿,另一家营收 382 亿赚 108 亿。一个是组装工,一个收技术租。

为什么会差这么远?因为集群从万卡扩到十万卡,算力是线性增长的,互联需求却是超线性膨胀的。楼里的主干管线因此有了定价权。

为什么它是中国公司在这条链上最不可替代的位置:

第一,它是有技术壁垒的主干管线,不是可有可无的辅料。互联需求按 N² 膨胀,英伟达新增的 800G 光模块订单里,中际旭创加新易盛合计拿走 60%。

第二,客户是全球,不看国内脸色。它们的客户是英伟达、谷歌、Meta、微软。所以国内 AI 算力中心闲置七成,丝毫不影响它们的报表,这一点很多人搞混了。

第三,它不受对华管制影响,甚至受益。管制卡的是 GPU 进中国,而光模块、印制电路板、铜缆这些是中国卖出去。美国越是加速自建 AI 数据中心,这些零件出口越旺。

━━━━━━━━━━━━━━━

▍内存墙:这几年卡死大家的是搬运,不是算力

再往下一层是钢筋,也就是高速内存。但要看懂它凭什么这么贵,得先回到前面那个结论:整条链最慢的一环是搬运,不是计算。

大家都以为 AI 拼的是算力。真实的剪刀差很难看:算力每两年涨三倍,内存带宽只涨 1.6 倍。泵越造越猛,管子跟不上。

大模型的活儿天生就是搬得多、算得少,每个参数搬过来只做一次乘法就扔了。这不是工程师没优化好,是这件事的固有形状。

一个 1.34 TB 的模型想每秒吐 30 个字,就得每秒从显存里搬出 40 TB 数据。HBM 凭什么卖那么贵,答案就在这个数字里。

给 AI 加算力,不会让它答得更快。把内存管道加粗,才会。

如果你只盯着算力涨了多少倍去判断一家公司值多少钱,你会系统性地看错方向。

━━━━━━━━━━━━━━━

▍存储:这轮周期最猛的印钞机,也是砸到你钱包上的那一锤

内存墙解释了为什么非要 HBM 不可。接下来是这件事的两个后果:做内存的公司成了这一轮最猛的印钞机,而你的内存条涨了四倍。

你电脑里的普通内存像一排平房,靠一条窄马路进出。HBM 是把内存盖成高楼,楼里打一堆直通电梯,再修一条 1024 车道的超宽马路,直接连到 GPU 隔壁。关键不是让车跑得更快,是把马路修宽了一百倍。

一颗 HBM3E 的带宽约等于一条 DDR5 通道的十八到二十倍。

工程上有多变态?整个内存塔必须塞进 775 微米的高度限制内,所以 SK 海力士要把每一片 DRAM 晶圆磨到 30 微米薄,比头发丝还薄好几倍,才能叠进十六层。

三巨头的成绩单

三星那句话是 2026 年一个少有人注意的反转:HBM 被长期合同锁死了价格,而普通 DRAM 是现货,可以任性涨。于是他们做了一道很简单的算术题,而这道题的答案,会砸到你身上。

涨了多少

微软的原话是:我们现在为内存支付的价格,是去年底的 2.5 倍,并且预计到 2027 年底还要再翻一倍。

还有一个让人绷不住的冷知识:Xbox Series S 那台廉价机现在的售价,等于 2020 年 Series X 旗舰机的发售价。

2026 年,AI 数据中心可能消耗全球 70% 的存储产出,而 2022 年这个数字只有两三成。

所以当你发现内存条涨价、显卡买不起、Xbox 突然贵了三百块,你不是遇到了通货膨胀,你是在和 OpenAI 抢产能。

━━━━━━━━━━━━━━━

▍芯片是谁造的:英伟达自己也得求人

英伟达设计芯片,SK 海力士造内存塔,但这两样东西最后都要在同一个地方变成实物。再往下一层,是施工队。

这里有个很多人不知道的事实:英伟达一颗芯片也不生产。业内管这种公司叫无晶圆厂,只画图,不开厂。真正把图纸变成硅片的,是台积电。

所有人都在盯 2nm、3nm 这些制程数字。但 2026 年真正决定谁能拿到 GPU 的,不是几纳米,是台积电嘉义那座封装厂盖得多快。

HBM 不是插在 GPU 旁边的配件,它和 GPU 坐在同一块硅地基上,物理上就浇在一起,想换供应商比换代工厂还难。这也是 SK 海力士能拿到 72% 营业利润率、比英伟达毛利率还狠的结构性原因。

扩产为什么扩不快

· 混合键合设备一台约三百万美元,交货期七到九个月

· 新洁净室从破土到量产要十八到二十四个月

· 三年扩了十倍,还是不够

· 英伟达一家就要吃掉全球约 60% 的 CoWoS 产能,2025 年 12 月起产线已经完全订满

━━━━━━━━━━━━━━━

▍台积电:从不承认涨价,但毛利率不会说谎

市场上流传的 2026 年 3nm 以下报价涨三到一成,全是供应链传闻,台积电从不认。但有一个数字不会说谎:

· 2024 年毛利率 56.1%

· 2025 年 59.9%

· 2026 年一季度 66.2%

一家代工厂,重资产、拼产能的苦生意,把毛利率做到 66%,只有一个解释。用毛利率曲线讲涨价,比引用任何传闻都硬。

同期它的晶圆代工全球市占 72.3%,三星 6.5%,中芯 5.1%;7nm 以下先进制程超过九成。高性能计算已占其营收 61%,手机只剩 26%。

台积电已经从手机代工厂变成了 AI 代工厂。

━━━━━━━━━━━━━━━

▍再往下一层:ASML

极紫外光刻机的全球市占率是 100%,不是 90%,是全部。

· 下一代 High-NA 单台价格三亿五千万欧元,约等于三架空客 A320

· 全球年出货量四十八到六十台

· 一台机器十万个零件、五千家供应商、重一百八十吨

它的光源是用高功率激光每秒轰击五万个锡液滴,产生 13.5 纳米的极紫外光;镜片由蔡司独家供应,粗糙度小于 0.1 纳米 —— 把这面镜子放大到德国那么大,表面最高的山不超过一毫米。

ASML 加蔡司加 Cymer 花了二十多年、超过九十亿美元才把这条链搓出来。

一个耐人寻味的细节:最贵的机器,最大的客户不买。

台积电明确表示 2029 年前不会用 High-NA 量产,理由很朴素:一台三亿五千万欧元,不划算。它宁可继续用老一代光刻机做多重曝光硬扛。

━━━━━━━━━━━━━━━

▍这块地通不通电

芯片造出来了,机架也装好了。最后一个问题最土:这栋楼通不通电。

2026 年,AI 最卡脖子的已经不是芯片了,是电。而且卡住它的东西一点都不性感:变压器、开关柜、并网排队号。

先感受一下量级:

· 一座 100MW 的数据中心,一年耗电约等于十万户家庭

· 一座 1GW 的数据中心,相当于一座中型城市,八十万到一百万户

· 而现在的大厂开口就是几个 GW

· 美国电网的并网排队积压量是 2600GW,中位项目从申请到通电接近五年,排队项目的退出率高达八成

为什么现在必须液冷:这不是省电,是能不能开机

英伟达最新的 GB300 机柜,一个柜子里塞 72 颗 GPU,功率 120kW 起、峰值 150kW 以上,单颗 GPU 满载 1400 瓦。而用风扇散热的经济上限大约在 30 到 50kW。

物理上,风扇根本带不走 120kW 的热。所以液冷不是为了省电的可选项,是这台机器能不能开机的问题。

电从哪来?排队去

想接电网,中位要等近五年,谷歌报告部分新数据中心的输电接入延迟可达十二年。

想自己发电?燃气轮机大厂 GE Vernova 的产能已经实质售罄到 2030 年,今天下单最早 2028 年底交付。

核电呢?微软签下了三哩岛核电站重启,835MW,预计 2027 年并网 —— 那座因为 1979 年事故而写进教科书的核电站,因为一家软件公司要跑模型,被重新点亮。谷歌的小型模块化反应堆首台 2030 年上线,亚马逊计划 2039 年前上线 5GW。

看出问题了吗:核电是 2030 年以后的解药,救不了 2026 到 2028 年的燃眉之急。

连变压器都没了。有分析认为,30% 到 50% 的规划中数据中心,可能因为这些无聊的铁疙瘩而延期或取消。

最性感的技术叙事,撞上了最不性感的物理现实。

━━━━━━━━━━━━━━━

▍AI 在和你抢电吗?这个问题必须说准

局部看,它确实在推高电价。覆盖美国东部十三个州的 PJM 电网:

· 2026 年一季度批发电价同比涨了 76%

· 容量拍卖价格从每 MW 日 28.92 美元涨到 329.17 美元,十一倍

· PJM 的独立市场监督机构把其中 63% 的涨价归因于数据中心负荷

但放到全国看,主因还不是它。事实核查机构和罗格斯大学的结论是,在全美层面,多数州电价上涨的主因仍然是电网投资和天然气价格,数据中心还不是全国性主因。趋势在变,但还没到那一步。

结论要说精确:AI 确实在特定区域显著推高了电价,但把全美电价上涨都归咎于 AI,不成立。

这个差别很快会变得重要,因为在美国电是最稀缺的资源,在中国它是最不缺的。

━━━━━━━━━━━━━━━

▍把利润率排成一列:附加值全在两端

九层已经全部拆完。现在把每一层的利润率排成一列,会看到一个非常整齐的形状:越靠近地基越赚钱,越靠近住户越亏钱。

中间那段堆机房、装服务器的活,是最不赚钱的位置。谁干谁亏。

口径不同,毛利率、营业利润率、净利率不可直接相减,但纵向排开的形状是真的:中间的组装环节两头受挤。对照传统 SaaS 的 75% 到 85%,AI 应用层 45% 的中位数仍有巨大差距。

唯一的例外:Anthropic 反超了

原因不复杂:企业客户的 token,单位收入是消费者的三到五倍,而且查询模式确定性高,好优化、好压成本。

同样是卖 token,卖给企业是生意,卖给消费者是补贴。

应用层的真相,看 Cursor 一个案例就够了。它的年化收入从一亿涨到四十亿,被 SpaceX 以六百亿收购,可它长期是负毛利 —— 每处理一次请求都要付钱给 Anthropic 或 OpenAI 买 token,卖的是二十美元月费,成本却是不可控的推理账单。靠自研模型加上把简单请求路由到更便宜的模型,才刚刚做到毛利微微为正。

更要命的是模型公司自己下场了,Claude Code 的年化收入已达约二十五亿,占 Anthropic 总收入的 17%。

你在别人的地基上盖楼,地主随时可能自己盖一栋更好的。

━━━━━━━━━━━━━━━

▍中国这条平行链:能力趋同,资源分化

以上是美国这条链。同一栋楼,还有另一套地基。

模型能力的差距已经收窄到 2.7%,可资本开支差十五到二十倍,电却多一倍多。这个反差决定了两条链的最优解根本不同。

美国那边,电是最稀缺的资源:

· 2026 年资本开支约 7250 亿美元

· 2025 年私人 AI 投资 2859 亿美元

· 数据中心 5427 座,超过任何其他国家十倍以上

· 2025 年新增装机 53GW,而并网排队积压 2600GW、中位等待近五年

约束是电,所以最优解是省电换性能。

中国这边反过来,电是最不缺的资源:

· 2026 年大厂资本开支合计约三百到四百亿美元,差十五到二十倍

· 2025 年私人 AI 投资 124 亿美元,差二十三倍

· 可 2025 年全社会用电量 10.37 万亿度,约为美国的两倍多

· 新增装机约 540GW,是美国的十倍

约束是制程,所以最优解是用电换制程。

把这两句话摆在一起,华为 CloudMatrix 384 那套设计就说得通了。它把 384 颗自研的昇腾 910C 芯片用光纤连成一台机器,对比英伟达同级别的 GB200 NVL72 机架:算力约为 1.7 到 2 倍、内存容量 3.6 倍,代价是芯片数量堆了五到六倍、功耗 559kW 对 145kW、每 FLOP 能效差 2.5 倍。

评价华为必须两句话一起说:它不是在单卡上赢,而是用多堆芯片、光互联、便宜的电,在系统级追平了,代价是四倍功耗。

这个策略在美国不成立,在中国成立。约束条件不同,最优解自然不同。

但真正的卡点不是晶圆,是 HBM

华为囤的那批台积电旧芯片是制裁前买的,到 2026 年初已经基本耗尽。而 CXMT 的 HBM3 商业化时程已经变得不确定,分析师认为以有竞争力的良率量产,更现实的时间是 2028 年以后。

━━━━━━━━━━━━━━━

▍中芯:物理没拦住它,经济学拦住了

中芯国际确实做出了 7nm,华为手机芯片麒麟 9000s 已被拆解证实,甚至还有 N+3。但没有 EUV,它只能用上一代的深紫外光刻机做多重曝光,同一层线路分几次刻、拼出更细的图形。

代价是:

· 曝光步骤最多是 EUV 的四倍

· 光罩层数从六十层涨到八十到八十五层

· 成本比台积电同节点高四到五成

· 良率分析师估计只有 25% 到 46%

最硬的证据来自财报:中芯 2025 年四季度毛利率从 22.0% 掉到 19.2%。如果良率真有九成,财报不会长这样。

物理上 DUV 还能往下画,经济上墙就在 7nm。每加一次曝光,缺陷率、光罩成本、生产周期全部恶化,而良率是乘性衰减的。

三个高频假数字,请拉黑

上海微电子已交付四十五台、中芯 N+2 良率九成、华为已实现 HBM 全自主 —— 这三条全部没有一手证据。

上海微电子 2026 年 3 月首次公开展出 28nm 浸没式 DUV,展出是真的,量产交付不是。量化一下差距:中国 EUV 光源功率 100 到 150W,ASML 2017 年就到 250W、现在基准 600W、2026 年初已经发布 1000W 系统。

还有一个更致命、很少被讨论的点:真正的绞索不是不给 EUV,而是已有 DUV 机器的备件与维护。中芯的 7nm 跑在制裁前买的 ASML 机器上,机器会老、会坏。这条路径比禁 EUV 更慢性,也更致命。

出口管制的演变:从不让卖到不让买

截至今天,H200 的实际出货仍未发生。最能说明现状的是英伟达自己的财务表态:从 2026 财年三季度起,管理层在业绩指引中不再假设任何来自中国的数据中心收入。

曾经每年约一百七十亿美元的生意,账面上归零。

━━━━━━━━━━━━━━━

▍巨头在花自己的钱,这句话快要失效了

利润分布告诉你钱现在在谁手里。这一节问另一个问题:这些钱最后要靠什么赚回来,以及还剩多少时间。

巨头在花自己的钱,这是所有「不是泡沫」论证的最后一块基石。它在 2024 到 2025 年是对的,但正在失效,而且有明确的时间表。

交叉之后,缺口只能靠债补。而债已经进场了:

· 亚马逊谷歌、Meta、微软、Oracle 五家在 2026 年前五个月发债 1590 亿美元,超过这五家过去五年发债的总和

· AI 相关债务约占美元投资级债市净新增供给的三成

· 私募信贷对 AI 的未偿贷款从近乎零升到超过两千亿

· 另有逾一千二百亿支出被挪到表外,比如 Meta 的 Hyperion SPV 融资 295 亿,Meta 自己只持股 20%,所以不并表

有些融资结构,可能通过把杠杆移出资产负债表来掩盖杠杆。但杠杆不会因为看不见就消失。

━━━━━━━━━━━━━━━

▍国际清算银行那份报告,反泡沫的那一半经常被漏掉

国际清算银行被称为央行的央行,各国央行在它那里结算。2026 年 1 月,它发了一份专门讲这件事的报告,标题本身就是结论:《为 AI 热潮融资:从现金流到债务》。

说它不是泡沫的那一半是这样的:AI 投资约占美国 GDP 的 1%,与 2010 年代页岩油热潮相当,只有 1990 年代 IT 投资热潮的一半,远小于 1980 年代日本商业地产的约 5% 和 2000 年代澳大利亚矿业的约 6%。

紧接着是那句反直觉的警告,也是被引用得最少的一句:历次投资热潮结束后,GDP 增速平均下滑超过一个百分点;而经济收缩最剧烈的那一次,恰恰是规模最小的那个 —— 美国互联网泡沫。

小泡沫,也能砸出大坑。

报告里最锋利的一击

放贷人给 AI 公司的私募信贷利差是 6.2 个百分点,给非 AI 公司是 6.1 个百分点,几乎一模一样。

也就是说,债权人认为 AI 公司不比普通借款人更危险;而股票市场给 AI 的估值,却隐含着巨额的超额回报。

这两个市场,必有一方是错的。

━━━━━━━━━━━━━━━

▍已经有人在付代价了:Oracle

它为了接下 OpenAI 的单,先垫付了巨额资本开支,债务超过一千亿美元,2026 财年自由现金流是负 237 亿。

更能说明问题的是信用市场:

· 五年期信用违约互换报到 198 个基点 —— 市场为它会不会赖账开出的保险价,创下历史最高,超过 2008 年金融危机时的峰值

· 股价从五十二周高点 345 美元跌到 131 美元,跌了 62%

· 标普已经把它下调到 BBB−,投资级的最低一档,再降一级就是垃圾债

注意这个顺序:股市还在高位,信用市场已经在尖叫。历史上,信用市场几乎总是比股票市场先知道真相。

━━━━━━━━━━━━━━━

▍另一颗雷:GPU 到底能用几年

云厂按五到六年折旧 GPU。做空者 Michael Burry 主张真实经济寿命只有两三年,并估算这会导致行业在 2026 到 2028 年少计折旧、虚增利润约 1760 亿美元。

双方各有道理。英伟达一方的瀑布模型说,旧卡会从前沿训练下放到微调、推理、批处理,继续产生收入,只是单价更低,A100 出货六年后仍在满负荷运行。

但争议的真正核心不是能不能用六年,而是它在第四到第六年,还能不能按当初的价格产生足够现金流来覆盖折旧。

现实检验不太乐观:H100 的租赁价格两年内从每小时七到十美元跌到二到四美元,跌了五到七成。

最有说服力的证据来自亚马逊自己:

· 2020 年把服务器折旧从三年调到四年

· 2022 年调到五年

· 2024 年初调到六年,仅此一次就给当年营业利润凭空增加约 32 亿美元

· 然后 2025 年,它又把部分设备从六年调回五年,理由明确写着「AI 与机器学习领域技术迭代加快」

三次往上调,一次往下调,转折点就在这里。

一个大多数人忽略的漏洞

大家都在说美股七巨头才三十八倍市盈率,比 2000 年的八十二倍便宜多了。但这个市盈率,是在折旧被延后确认、也就是利润被高估的前提下算出来的。

如果把 GPU 折旧年限从六年改回三年,分母缩水,市盈率会显著上升。

━━━━━━━━━━━━━━━

▍铁路类比:一半对,一半致命地错

最流行的乐观论证长这样:1840 年代的英国铁路狂热让无数投资人血本无归,但铁轨修成了,而且用到了今天。

前半段是对的,数据也漂亮:铁路狂热高峰期投资约占英国 GDP 的 7% 到 13%,远大于今天 AI 的约 1%;崩盘时铁路股指数跌约 66%;可狂热期建成的线路构成了今天英国铁路网总长度的约九成,一百七十七年后仍在用。

同样的事发生过第二次:2000 年泡沫期埋下的光纤,当年八成半到九成七长期是暗的,后来成了流媒体和云计算的地基。投资人破产和基建有用,完全可以同时成立。

致命的错在后半段。这轮投的东西分两层,一层像铁路,一层完全不像:

· 壳 —— 电力、变电站、厂房、冷却,寿命二三十年,铁轨的年折旧率只有 1% 到 4%

· 芯 —— GPU,寿命两三年

而芯恰恰是这 7250 亿里占比最大的那部分,微软 67% 的资本开支花在短寿命资产上。

━━━━━━━━━━━━━━━

▍该盯什么信号,而不是盯股价

一、现金流与资本开支的交叉点,也就是国际清算银行命名的那个拐点,2026 年三季度是关键时刻

二、债务融资占资本开支的比例,已经从近零升到三成,还会不会继续涨

三、GPU 折旧年限,有没有更多公司跟着亚马逊往下调,每调一次利润就缩水一次

四、企业与消费者 AI 收入之比,Anthropic 的经验说明前者才是真生意

五、推理成本曲线,它决定了整个应用层能不能有毛利

六、也是最该盯的,RPO 也就是已签约但还没确认为收入的合同金额 —— 看 AI 需求真假这是最硬的指标,但记得剔除关联方之后再看一遍

2026 年上半年,AI 泡沫没有破。但循环交易正在被参与者自己拆掉。

真正在破的,不是 AI,也不是芯片,是用债买卡的中间商。

━━━━━━━━━━━━━━━

▍术语速查:每个词先问它属于哪一格

全部拆完了。这里把出现过的每个名词按它属于哪一格重排一遍,方便回查。模型侧的词都挂在四个零件上,产业侧的词都挂在楼层上。

【模型侧】

预训练:灌进数万亿字,每次遮住一个字让它猜,占九成以上花费。理解是猜字的副产品,这是过去十年 AI 领域最大的意外。

SFT 监督微调:岗前培训。人类写几万到几十万条好问答范例,花费不到总成本的 1%,但对你的体感影响巨大。

RLHF 强化学习:答完当场打分,学会分寸感。近两年各家投入涨得最快,因为前两步大家都会做了,拉开差距的在这儿。

7B / 70B / 671B:参数有多少个,B 是十亿。常用精度下一个参数占两字节,7B 是 14GB,游戏显卡能跑;70B 是 140GB,两张 H100;671B 是 1.34TB,十七张。

量化:把每个数字存得粗一点,两字节压到一甚至半个,占地立刻减半再减半。代价是记忆变模糊,压太狠模型就开始变笨。

MoE 混合专家:把参数分成几十个专家,每次只叫醒相关的几个,DeepSeek 671B 每次只激活约三百七十亿。省的是电费不是显存,全部参数还是得住在显存里待命。

幻觉:它生成答案的机制是算出最像真话的下一个字,不是查出真话。它不是在骗你,它压根就没有真假这个开关。

KV Cache:把已经算过的中间结果缓存下来,少搬一点。所有这类优化的全部动机,都在每秒能从内存里搬出多少字节这一句话里。

RAG、工具调用、Agent:统统不在模型脑子里,是外挂上去的。之所以要单列,是因为它绕开了训练一次就冻结这个死结 —— 模型学不会新知识没关系,让它现查就是了。2025 年之后产品层的竞争几乎全打在这一堆上。

【产业侧】

CPU:像几个博士,擅长一步套一步的复杂推理,但一次只能想一道题,不是 AI 的形状。

GPU:本来是打游戏渲染画面的,因为擅长同时做几千个简单计算,意外成了 AI 的最佳载体。通用、灵活、贵。

TPU:谷歌的 AI 专用芯片。TPU 是「我知道自己要跑什么」的人的芯片,GPU 是「我不知道下一个模型长什么样」的人的芯片。最新一代 Ironwood 明确定位推理优先。

ASIC:专用集成电路的统称,TPU、Trainium、MTIA 都是。模型架构一变,ASIC 的硅片改不了,只能等下一代,两年后见;而 GPU 当天就能跑。

CUDA:英伟达 2006 年就开始做的软件生态。它才是英伟达真正的护城河,不是芯片本身。

NVLink:把 72 张卡当成一张卡用的那套互联。你能从别家买到芯片,买不到这个。

HBM 高带宽内存:竖着叠成塔、修一条 1024 车道的宽马路直连 GPU。AI 真正的瓶颈往往不是算力,是这条马路够不够宽。

内存墙:算力每两年涨三倍,内存带宽只涨 1.6 倍。结果是 GPU 大部分时间在等内存,加算力也没用。

CoWoS:台积电的先进封装,把 GPU 核心和 HBM 内存塔焊在同一块硅地基上。2026 年真正的产能瓶颈。

Chiplet:把一颗大芯片切成几块小的分开造再拼起来。良率高,还能混搭制程。

EUV:极紫外光刻机,刻出纳米级线路的唯一工具。全世界只有 ASML 能造,一台一亿八千万美元起。

Token:AI 处理文本的最小单位,约等于半个汉字或 0.75 个英文单词。它是 AI 的计费单位,也是这条链条最终的产品。

Neocloud:新型 GPU 云,CoreWeave 这类。拿 GPU 抵押借钱买更多 GPU 的杠杆玩家。风险在于抵押物在贬值,而债务是刚性的。

RPO / Backlog:已签约但还没确认为收入的合同金额。看 AI 需求真假最该盯的指标。

资本开支:四大云厂 2026 年合计要花 7250 亿美元,其中微软约 67% 投向 GPU 等短寿命资产。

MFU 算力利用率:即使卡在转,MFU 也常只有 10% 到 30%。在用不等于用好。

液冷:GB300 单机柜 120kW 起、峰值 150kW 以上,而风冷经济上限约 30 到 50kW。液冷不是为了省电的可选项,是能不能开机的问题。

收购式雇佣:不买股权、不买合同、不买产品线,只拿技术授权加把人全挖走。好处是绕开反垄断审查,英伟达买 Groq 用的就是这一招。

━━━━━━━━━━━━━━━

▍最后:一个未解之问

AI 应用端的真实收入,能不能追上算力投入的曲线?

支持「追得上」的证据是真的:

· 谷歌的月度 token 处理量同比涨了约七倍

· AWS 上一个季度处理的 token,超过此前所有年份的总和

· Anthropic 的收入五个月翻了五倍,靠企业客户真金白银付的

· 台积电的增速还在加快,六月单月同比涨 67.9%,HBM4 产能全部售罄

支持「追不上」的证据也是真的:

· 咨询公司贝恩算出,到 2030 年,即使把所有能想到的 AI 成本节省全算进去,每年仍差八千亿美元

· MIT 发现 95% 的企业 AI 试点没产生可衡量的回报

· 2025 年生成式 AI 总支出 6440 亿,其中约八成是硬件,真正的 AI 软件收入只有约 370 亿

· 而那家四十亿年化收入、被六百亿收购的公司,毛利率刚刚才转正

这两组事实同时成立,而且都不会说谎。

所以这不是一道「是不是泡沫」的判断题,而是一场赛跑:收入曲线在往上爬,成本曲线也在往上爬,而债务的时钟已经开始走了。

谁先到达终点,决定了这 7250 亿美元最后是史上最贵的一场误会,还是下一个时代的地基。

$ASML $NVDA $TSM