AIE101 2026 Q3 Report · 该交卷了
2026年第三季度,AI行业当下在干嘛,未来又想走向何方?
takeaways
-
卡住 AI 的不是电力,是接不上电。 全球数据中心用电到 2030 年也不到全球用电的 3%,美国并网排队积压 2,600 GW、中位等 5 年,2000–2019 年申请的容量至今只有 19% 真的投运。
-
当下招聘市场中真实的技术需求:evals、observability、fine-tuning、PyTorch、latency、RAG、benchmark、tool use、throughput、pretraining。
-
parallel/distributed training、Megatron-LM、DeepSpeed、SGLang、NCCL/RDMA、TensorRT、LangGraph,这些东西企业闷头在做,但没人在说。
-
中国在招把AI应用搭起来的人,美国在招把AI系统跑稳的人。
-
头部厂商出现自由现金流基本归零,AI军备竞赛开始靠举债供养,而不是靠赚来的钱。
-
FDE 这个岗位,美国的头部 AI 公司正在大量招聘(OpenAI 一家就挂了 38 个),但在中国它还不是一个通用岗位。
给读者的信
大家好久不见👋,这里是黑犬。
和之前传来的发刊词计划里一样,今天黑犬给大家带来专栏独家的 2026 年第三季度的 AI 产业产业链以及就业状况的具体分析报告,调查独立发起,数据源和研究方法都公开可复现。
和专栏的愿景一致,我这份报告并不是只研究叙事或者 AI 工程相关技术的。而是把整个 AI 上下游的产业链进行一次完整的审视,并且从四个不同的层面去研究产业中具体的技术或者产物的价值传导链路:行业的硬约束,学界的真实能力,行业的叙事,以及真实的市场招聘需求。
请各位读者回想一下,你在网上看到的大多数分析或者行业预测。要么是以叙事为主,只关注几个头部厂商在说什么。或者说,这位技术大牛、那位大企业的高管 CEO 又发表了什么评论?要么是看了一些金融行业机构的分析报告、产业链上下游的分析报告,深度很深但是是站在公司经营的角度,用技术的不可替代性去分析这个行业的未来发展趋势。
但你有没有认真地想过,这样的分析是否都会显得有些片面?
做技术的人只关心能不能把这项技术落地、能用它做到什么?而投资人的角度只关心这个东西是否已经有了真实的PMF,能否从市场上给他带来超过他预期的超额收益。而所谓的商业上的成功,不过是投资人和做技术的人之间的双向奔赴而已。真正成功的转折点就在于两者双向奔赴且亿拍即合的那一刻。
因此个人观点:在对一个行业趋势,包括某项职业的真实价值进行分析之前,最好是不要去看某些自媒体或者某些”专家”给出的个别意见。我们应该从”做产品(技术)“以及”做投资”这两个角度,去更完整的审视我们现在所在的产业:
-
产业链是否有价值的流动;
-
是否有一些已经落地的产品能够产生真正的效益;
-
产生真正的效益公司,是否在相关的技术词条下招聘对应的技术人才。
就拿近期美国硅谷的 FDE 的这一波职业热潮来说,虽然各种自媒体以及流媒体都在炒作说,FDE 可能是一种最新、最性感的职业。但有没有人真的去调查过,这一项职业在实际市场上到底有多大的招聘需求量,又有多少公司已经在做这个事情,并且获得了可观的收益?我相信大多数人并没有。
因此,本系列的报告旨在通过一个非常清晰的四层价值链传导思维架构,帮助各位读者梳理清楚:
-
现在真实的 AI 行业到底长什么样;
-
作为从业者来说,我们要看到它的真实需求点到底在什么地方。
接下来就为各位读者一一展开这四层分析,自上而下,由浅入深。长文创作不易,如果你觉得这份报告对你有帮助,免费的转评赞能给我很大的鼓励。也欢迎大家在评论区留言,提出你们的疑问和想法,我会一一解答。
一、硬约束
首先,在分析一个行业之前,我要先确定这个行业的死生之地到底在什么地方。这样才知道整个行业发展的上限和边界在哪里,避免无意义的无限发散。
结合 SEC 财报原始披露、IEA 和美国能源实验室的公开报告、Epoch AI 和 MIT 的公开研究,AI行业的硬性约束一共有九个:电力电网、算力供给、内存墙、需求侧的 ROI、 数据和范式、相关的人才、资本循环、责任保险、监管合规。
为什么是这九样东西?我的评判标准是在 3 到 7 年的一级市场持有期内,有多大的概率以及多快的速度,它能在多大的范围内摧毁整条产业链上产生的价值。评价的方法是问六个问题,每个打 1 到 5 分:它卡住的东西有多少人要用?供给能不能马上加上来?就算现在动手要多久才见效?砸钱能不能解决?能不能绕过去?它断了会不会连累别人?(注意,分数仅代表分析判断,而不是客观的测量。)
据此可以得到这九个约束的实际致命度评分表如下图:

每一列就是上面那六个问题之一,格子里是 1 到 5 分。光看分数没意义,得看这个分是怎么来的——拿排第一的电力/电网逐格走一遍,你就知道我在打什么了:
-
时间刚性给了 5 分,是整张表唯一的满分。 依据是:并网排队中位等待接近 5 年、高压变电设备交期 3–5 年、燃机交付周期约 3 年且 2028 年前基本售罄。关键不在于”久”,而在于这个时间资本压不动——它是九条约束里唯一一个连”举国体制式砸钱”都没办法在三年内解决的。这一格就是它排第一的直接原因。
-
但不可绕行性只给了 3.5,没给更高。 因为”自己发电”(数据中心自带电源)确实是一条能部分绕过去的路。这也是为什么我用 0.5 的粒度打分——得容得下”介于两档之间”的证据,而不是非黑即白。
-
传导杠杆度和供给刚性各 4.5。 前者是因为算力、模型、应用全在它下游;后者是因为电网的供给对价格几乎没有弹性——你出再高的价,审批和施工周期也不会变短。
对比排第二的算力就更清楚了:它的传导杠杆度是满分 5(比电力还高,卡住的节点更多),但资本不可溶性只有 3.5——长约和预付款确实能买到优先供货。所以它 4.15 分,比电力的 4.27 低。两者的差距就差在”钱管不管用”这一格上。
至于权重为什么是前两问各占 20%、其余各占 15%:一级市场的头寸没有流动性,不能像二级那样看到缓解信号就立刻退出,所以”卡住多少价值”和”供给能不能响应”这两件事,比”价格多贵”更决定你的退出窗口。
最后,最右边那一列不是评分,是我这份数据能不能验证这条约束。标「测不到」的三条,目前没有公开数据能验证它们的致命度,这三条约束的致命度只能通过后续的行业发展来验证。
但不能只看排名。举个例子:资本循环的系统传染性是满分 5——它是唯一一条能把别的约束的断裂放大成全行业危机的,可它总分只有 3.30、排在第七位,因为它的时间刚性只有 2 分,融资阀门一年就能调节。电力正好相反:时间刚性满分,系统传染性反而只有 4。
一个是”很快能解开,但断了会拖垮所有人”,一个是”只伤它自己那一环,但十年解不开”——这是两种完全不同的致命,压成一个总分就看不见了。所以我把这两个维度单拎出来重画一遍:

越靠右 = 越难解开,越靠上 = 断了牵连越广,点越大 = 加权致命度越高。右下角是「极难解,但断了主要影响它自己那一环」(电力就在这儿);左上角是「一年就能调节,却能把别人的断裂放大成全行业危机」(资本循环就在这儿)。
一个比较有趣的发现是,根据IEA基准情形的报告,全球数据中心用电 2024 年 415 TWh → 2030 年 945 TWh,占全球用电不到 3%。真正卡住的是并网排队:美国最明显,积压约为 2,600 GW、中位等待近 5 年、2000–2019 年申请的容量到 2024 年底仅约 19% 真正投运。也就是说,网上长期流传的”AI 会把电用光”的说法是完全错误的,目前全球的发电量完全足以支持 AI 的训练以及推理服务。但一个真正的卡点是接入电网要排队,这是一个钱买不到、也无法通过技术短期内进行缓解的非常硬性的约束,也很好理解,因为资本可以加价在 18 个月内买到大量的 GPU 卡,但是没办法直接买 5 年后才并网的数据中心。

关于目前讨论度很高的资本我也去调研了SEC EDGAR 的 10-K XBRL 结构化披露,并且结合了公开的财报数据,发现:头部厂商的军备竞赛已经开始靠举债供养,而不是靠赚来的钱。以北美5大云厂商为例,最新财年资本开支合计约 4,648 亿美元;这个总额本身不算特别有信息量,真正该看的是它占各家自己经营现金流的比例——这度量的是「还能靠内生现金流撑多久」。Alphabet 55.5%、Meta 60.2%、Microsoft 63.4% 还算自筹得起;Amazon 已经到 94.5%,自由现金流基本归零;Oracle 174%,等于已经确定性地转入对外融资依赖(见下图)。

而且在这一轮的 AI 竞赛当中,中美卡住的地方根本不是同一个。
美国卡在物理基建来不及建:并网排队 5 年、燃机售罄到 2028,前面已经说过了。
中国卡在算力买不到、收入撑不住。算力这边是 EUV 禁运叠加国产芯片良率还在爬坡——昇腾 910B 到 2025 年底良率约 30%、月产约 7,000 片晶圆,卖方测算要到 2027 年才修复到 70% 良率、1.8 万片。注意这里的关键词是”买不到”而不是”买不起”,钱在这条约束面前不太好使。收入那边则是另一副样子:智谱 2025 上半年研发开支是收入的 835%,MiniMax 资产负债率 343%、股东权益为负——效率叙事是真的(MiniMax 用不到 OpenAI 累计花费的 1% 做进了全模态第一梯队),但效率替代不了收入。
反过来,电力在中国几乎不构成约束:2024 年新增装机 543 GW,2030 年预计富余约 400 GW,差不多是届时全球数据中心总需求的三倍。
所以中美不是同一个产业的两个版本,而是约束结构完全镜像的两个产业——一边有瓦特没算力,一边有算力没瓦特。这也直接意味着:一边得出的结论不能平移到另一边。
在经历了这些观察之后,我大胆做出如下的猜想,而且我会在后续的章节中用真实的数据去验证它们:
-
如果算力是中国的第一约束,那么中国的招聘市场在模型训练和 AI 基础设施类技术术语上渗透率应该显著高于美国。(渗透率 = 提到这个词的合格 JD 份数 ÷ 该国合格 JD 总数。「合格 JD」是怎么筛出来的,第四部分会讲。)
-
如果目前 AI 行业算力的供给真的受限,那么算力受限应该会推动学术界做更多”用更少的算力做同样事情”的研究。例如:模型的蒸馏、量化、MoE 架构,这些方法在学术研究中的存在感应该会更强。
-
如果内存墙是 AI 行业的一个重要壁垒,那么在整个行业的叙事当中,推理成本和吞吐量的叙事应该会大于模型能力本身的叙事。而且推理优化类的岗位相关术语,比如 TensorRT、SGLang、vLLM,在中美的招聘市场当中应该同步上升——注意是「同步」,因为这是物理约束驱动的,而物理约束不认国界;如果只有一个国家在涨,那多半就不是内存墙,而是地缘政治或产业结构造成的。
-
需求层的 ROI 如果压力大,那么目前企业应该更倾向于证明 AI 有用,所以模型的评估、可观测性包括 Harness 层面的技术叙事应该会更强,而且美国应该比中国更明显(经验判断美国企业的软件预算更成熟,更早进入验收阶段)。
-
如果数据短缺以及模型范式的转移是一个重要问题,那么在学术研究上,预训练的研究相对强度应该会弱于后训练。而在实际招聘市场当中,微调和 RLHF 类岗位的需求也应该会比预训练更强。
二、能力
第一部分框定了整个行业的上限,这一部分我问的是能力:这帮从事AI相关工作的、最聪明的且每天投入大量时间做研究的人,他们到底能做什么?手上有什么牌?具体的做法就是分别看学界在写什么,以及业界在发表什么。去观察他们的共性以及研究之间的差异。学界的话就以论文为主,业界的话就以他们官方发布的工程博客为主,两者虽然在形式以及可复现的程度上有一定的差异,但是它们的共同表现是:都是专业人群所撰写的文章,表达出自己达到了什么成果以及他是如何做的,并且公开发表出来供大众审视。
两个方面的数据选择:
-
学界 = arXiv 预印本(cs.AI + cs.SE + cs.RO 三个类目,滚动 18 个月窗口,共 98,174 篇)
-
业界 = 工程博客(21 家公司的官方技术博客,共 1,803 篇)


为什么学界用 arXiv。 它是目前在线、免费、不用注册就能打开、收录量全球最大的论文库——这一条直接决定了这份报告能不能被你复核。换成知网、IEEE、ScienceDirect 也能查,但你得注册、得掏一笔不小的钱才拿得到全文,那我写出来的数字你就只能选择信或不信。我认为读者打不开的数据源,等于不可复现。
那为什么不去追踪顶会?因为每个顶会各有各的侧重:NeurIPS 偏机器学习和语言模型、CVPR 偏视觉、ICRA 偏机器人,任何一个单拎出来都只覆盖这个行业的一角;而且会议一年一届,从录用到公开动辄半年以上,审核方式每家还有差异,等它出来,季度报告要看的那段时间早就过去了。arXiv 是日更的,而且上面这些会的论文绝大多数正式发表前也会先挂到 arXiv 上。
为什么是这 21 家公司? 判据只有一条:产业链上的节点覆盖。每个环节挑 1–2 家对这个环节技术路线影响最大的公司——前沿模型挑 OpenAI、Anthropic、Google DeepMind,推理引擎挑 vLLM、LMSYS,芯片挑 Cerebras、Groq,数据中心和电力冷却挑 CoreWeave、Vertiv,训练框架挑 PyTorch、Meta,编码 Agent 挑 Cursor(公司名 Anysphere)、Cognition,其余 Agent 框架、检索、评测、语音、网关边缘、具身、FDE 各挑一到两家。公司大小和发文数量都不是判据——模型公司可能几个月才发一篇,而一家做边缘网关的可能一个小功能就发一篇,比篇数只会比出谁的市场部人多。另有两道硬门槛:抽不到发布日期的源一律不要(这一层的价值就在时间戳上),以及只收「我们是怎么做的」这类工程复盘,不收产品公关稿——判据是「这篇文章有没有做出一个可能是错的断言」,教你怎么调用 API 的那种不可能错,那是在卖东西,不是在讲技术。
术语是全篇共用的一套。 我维护了一份 72 个技术词的清单,能力、叙事、需求三层用的都是它,这样三层之间才对得上号。其中 10 个是对照组词(接口、团队、部署这类通用词),只用来检验我的统计方法有没有整体偏向某一边,不进任何结论;所以这一部分实际统计的是剩下的 62 个。
为什么没有中国国内的数据源?是鉴于读者可复现原则和工程问题所以没收录,并非没有调查。 采集的判断标准里从头到尾就没有「国别」这一项。真正卡住中国源的是前面那两条:学界这边,国内论文库要注册要付费,你复核不了;业界这边,我实际测过国内几家(智元、逐际为例),技术上很好抓、日期也干净,但内容全是「第 15000 台下线」「斩获冠军」「Pre-IPO 轮融资」——大部分是发布会通稿,更别说部分官网有反爬机制。
局限性说明:arXiv 是预印本非同行评审后发表的刊物,它能反映的真实信息是学界有多少人在写这个事,而不是说学界是否真的已经完全认可这个事。工程博客也是业界研发的总结性产物。公司可以选择性地做了但不写,或者写了又不披露真正实现的细节。
由于学界和业界的数据总体量差距比较大,所以我更多是看百分比,而非直接看一些专业术语在其中出现的数量和频率。最终取两边合计百分比最高的 24 个专业术语,可以清晰地看出北美的学界和业界在过去一年写得最多的东西如下:

当然,只看两个侧面的文献在什么东西上写的最多还远远不够,最重要的是要观察到两边都在文章当中高频提到的术语,这才是最重要的。
具体的做法很土:一个词在论文里出现在百分之几的文章中、在博客里出现在百分之几的文章中,各算一个数,然后看它是不是在两边都排在中间线以上,最终得到下面这幅坐标轴图:

两侧都在写,而且都在中位数以上的相关技术名词共有 19 个:agent、evals、latency、benchmark、observability、throughput、harness engineering、tool use、embedding、quantization、MCP、fine-tuning、MoE、KV cache、RAG、multi-agent、chunking、long context、LLM-as-judge。(其中 agent 因为几乎人人都提,后面的交叉表会把它单独拿出来说)
反过来还有两组也值得看一眼:只有学界在写、业界基本不碰的 12 个(pretraining、distillation、VLA、LoRA、GRPO、imitation learning、sim-to-real、prompt engineering、PPO、RLVR、teleoperation、DPO),个人猜测它们要么还停在纸面上,要么是业界做了不写。
以及只有业界在做、学界没什么研究动机的 12 个(vLLM、PyTorch、LangChain、GPU kernel / 算子、DeepSpeed、parallel / distributed training、subagent、Claude Code、Cursor、guardrails、显存 / HBM、SGLang),个人猜测基本全是工程问题,学界没有发论文的动机。
站在时间序列的角度看两侧在相关技术上面的曲线升降,又可以得到下面这幅图:

局限性说明:62 个术语里,有 33 个是「判不了」的——要么某一侧的样本太薄(一个月不到 30 篇,涨跌都是噪音),要么某一侧被单一来源占了六成以上(比如 DeepSpeed 的博客有 99% 出自 PyTorch 官方,那不叫「业界在写」,那叫「一家在写」)。所以下面四种状态加起来只有 29 个,不是 62 个。
所以在这一部分,我结合总量、坐标轴对数以及时间序列角度看的增长曲线,可以发现两边都在升高的专业术语一共有八个:claude code、KV cache、latency、LLM-as-judge、MCP、observability、subagent、tool use。
比较有趣的是,北美的学界和业界两侧都没有对应增长的,是这 13 个:benchmark、embedding、fine-tuning、GPU cluster / 千卡万卡、LoRA、parallel / distributed training、pretraining、prompt engineering、quantization、RAG、throughput、vector database、显存 / HBM。
⚠ 注意「没升」不等于「在退潮」——判据是后六个月比前六个月,涨两成以上算升、跌一成七以上算降,中间一大片都算「平」。上面这 13 个绝大多数是平,也就是已经进入稳定期的常规技术,而不是该技术已”死”。
而且这 13 个里恰好埋着我第一部分那条猜想的一个反例:我猜「算力受限会推动学界去做用更少算力做同等事的研究」,点名了蒸馏、量化、MoE 三个。结果 distillation 学界在升、MoE 也是学界在升,唯独 quantization 前后六个月基本没动。所以这条猜想只兑现了三分之二,至少可以说这方面的学术研究还没有完全萎缩。
三、行业叙事
叙事是这四层里信噪比最低的一层,原因在于,业界当中的厂商很多时候在公开的舆论场或者说是互联网上面发表言论以及技术看法的时候有不可避免的自利性偏差。
那为什么我还是要看这一层?答案其实很简单,行业的叙事并没有提供很多一级市场投资或者实际市场反应的判断依据。但是,却能非常直观地表达厂商在做什么、想做什么,以及希望投资人和用户看到什么。上一层看到的是有能力做事的人,他们已经做出来了什么东西;而这一层要看的就是他们想站到台上来,去说什么东西。
业界叙事比起学术能力更有效的依据是:厂商说出口的这些东西,通常已经是他们有能力去做并且想做的事情,并且已经做好了为其承担商业化结果的思想准备。
所以在这一层的分析当中,我着重只挑选了 ai.engineer 这样的顶级 AI 工程师大会的录音稿。
至于为什么不选别的大会,我把三类会放在一起对了一遍:
| ai.engineer | WAIC 世界人工智能大会 | 厂商自办大会(火山引擎 FORCE、云栖、Create 这类) | |
|---|---|---|---|
| 谁办的 | 独立的行业会议主办方 | 外交部、发改委、科技部、工信部、网信办、中科院、中国科协与上海市政府共同主办,2025 年国务院总理出席开幕式 | 一家公司自己办自己的(FORCE 是字节跳动旗下火山引擎,一年两场) |
| 台上谁在讲 | 公开征稿,谁都能投;讲者来自近 400 家公司和机构,最大的一家不到 6% | 2025 年 73 个国家 1572 位嘉宾,以政企与治理层面的高级别对话为主 | 只有自己和自己的生态伙伴 |
| 主体是什么 | 技术分享,标准时长 18 分钟、台上不留 Q&A | 主体是展会:2025 年展览面积首破 7 万㎡、827 家企业参展、展示成果 3055 项,签约总投资 450 亿元 | 产品发布:2025 年 6 月那场的主线是豆包大模型全线焕新、Agent 开发工具升级 |
| 内容能不能复核 | 全部演讲免费上 YouTube,任何一句话都可追溯 | 主论坛有转播,但绝大多数分论坛没有可逐字复核的完整录像 | 有回放,但内容本身就是自家的产品口径 |
| 对这一层有没有用 | ✅ 能用 | ✗ 它测的是政策与产业动员,不是工程师在做什么 | ✗ 它测的是这一家想卖什么 |
关键差别不在”哪个更高端”,而在这一层要测的东西是”业界想站到台上说什么”,那么台上必须站着足够多不同的人。厂商自办的会,台上只有一家;WAIC 的主体是展台和高级别对话,测出来的是产业动员强度。
ai.engineer 这边我实际数了一遍:756 场演讲里有 638 场能定位到讲者所属的机构,一共 390 家不同的公司和机构——最大的一家 Google DeepMind 只占 5.0%,前十家加起来才 22.3%,还有 297 家只讲过一场。按讲者身份看:工具厂商 340 场、前沿实验室 100 场、基础设施厂商 97 场、真正在用这些东西的甲方实践者 63 场、独立开发者与学术 40 场、投资方 10 场(一场演讲有多位讲者时会重复计入,所以加起来略多于 638)。这就是”分散”的实际含义:它不是任何一家的主场,所以它讲什么,比一场发布会更接近整个行业在讲什么。
局限性说明:那份「讲者 → 所属机构」的对应表是自动抽取的,还没逐条人工复核,所以它确实存在同一家公司被拆成两行的情况——榜单里就有两处(Google 和 Google DeepMind、Arize 和 Arize AI)。把这类明显重复的合并掉之后是 386 家、最大一家 5.6%、前十家 24.3%,方向和量级都没变,所以上面那句”不是任何一家的主场”站得住。
那么,我要关注的是:
-
现在在资本市场最火热、每天都有投资人跟进进度的这些头部大厂,他们在顶级的 AI 工程大会上公开发表了什么样的演讲;
-
这些话题里,哪些是第一次被推上台面成为焦点,哪些是每一届都在讲的常青话题,哪些只热了一届就没人提了。
在分析了 ai.engineer 至今为止 756 场演讲的录音稿之后,我观察到以下现象。
局限性说明:第一,下面按届统计的图用的是 674 场,不是 756 场——有 44 场对不上任何一届(油管频道上传时缺少归属信息),另有一批被排除,这些我一律不硬塞进某一届里去凑数。第二,2023 和 2024 年加起来只有 44 场(2023 年 6 场、2024 年 38 场),因为这个频道是在 2025 年 2 月才把旧录像补传上来的,那两年的样本又薄又偏。所以任何跟时间有关的判断,请只看 2025 年之后的部分。
所有大会里出现过的技术名词,频率最高的 40 个如下:

再结合上一层对学术界发表的观察,可以发现:有一些是叙事跑在能力前,也有部分技术是有能力,但在台上并没有说出来的。(如下图)

这张图的横轴需要解释一句:它是把上一层「学界热度」和「业界热度」两个百分比各自归一化之后取的几何平均——说白了就是「两边都得写,才算分高」,只有一边写得多、另一边完全不碰的词,会被压到很低。用几何平均而不是加起来除以二,就是为了让「一边为零」这件事付出代价。横轴取的是对数刻度,因为这两个分布都是长尾。
四、职业市场需求


有人问我:黑犬,你要分析一个行业或者方向的生死,直接看它的职业市场招聘需求不就完了吗?前面分析那么多干嘛?
请思考这么一个问题:仅仅看求职市场的反馈真的能判断一个行业或者一个方向的真实需求吗?
很早前我也是这么想的。当行业当中有大量的招聘需求,而且招聘岗位的 JD 里面写了很多的技术名词时,这一定会成为风向标。跟着 JD 学习相关技术以及行业的知识,肯定就不会错。
但是很快我就被现实上了一堂课。
这两年职业市场上的招聘需求,相信正在阅读这篇文章的读者也有所体验:岗位的需求顶多能够表达企业在这一方面有探索上的投入意愿,但并不意味着这个岗位所做的东西已经是被行业所验证的方向。
这个事在过去的几年当中已经有无数类似的先例,比如说商业分析、数据分析、数据科学类岗位,比如说 2023 年曾经火爆过一段时间的提示词工程师,以及很多自媒体和职业培训在鼓吹的FDE岗位,这些岗位真的有公司招,技术相关的知识真的有人学,但是最后我们会发现,真的能上岗并且拿到性感薪酬的人其实并不多,而且收缩的也很快。
局限说明:这是个人体感,没有客观数据支撑。FDE 这边我目前抓到的数据量还比较小,不足以下判断——能看到的只是谁在招、招了多少,至于这批岗位两三年后还在不在,没人能预测。
有些岗位就是行业叙事最高点时,企业为了应付自己的焦虑紧急补出来的。说到底,连企业自己都不知道招这个人进来能干什么。等叙事退潮、内部发现没有真实需求,这些岗位就死得很快,而且技能迁移不到别的行业去。大厂尚且如此,那些管理水平一般、战略又不清楚的公司,入职之后一两年一次架构调整就被裁的,比比皆是。
所以说,要先看前三层的分析和结论,最后再落到职业市场上,这样才是最有效的。前面我分析了整个行业的上限在哪儿,又看了这个行业里面的人有能力做什么、他们想要做什么。只有当他们嘴上说了,然后又掏出钱来,真金白银地去执行这件事,我才会认为这个事大概率是可靠的。
那么问题来了,公司名单怎么定?去把市面上所有公司的招聘数据都抓下来是没用的——很多公司主业根本不是 AI,挂几个 AI 岗只是想在这个方向上试试水,连他们自己都不清楚要做什么。我要的是在这个行业里已经砸下真金白银、并且在市场上真拿到过反馈的公司。 所以一家公司要进这份名单,得先过下面这一关,四条满足任意一条即可(每一条都要能拿出可查的证据):
| 门槛 | 为什么这条算数 | |
|---|---|---|
| A1 | 累计披露融资 ≥ 5,000 万美元(中国 ≥ 3 亿人民币),且主业是 AI | 有人真的给钱了。要留下轮次、金额、日期 |
| A2 | 有自研的基础模型,并且上过公开榜单 | 不是自称有模型,是拿出去被人比过 |
| A3 | 上市公司或集团里的 AI 专属部门,而且我能筛到部门这一级 | 大厂整体招聘量太大,筛不到部门就等于把它的游戏、电商岗位一起算进来 |
| A4 | 是这个环节事实标准开源项目的主体(参考线 GitHub 一万星以上) | 像 LangChain、Ray、Colossal-AI 这类,靠的不是融资规模而是开源影响力 |
实际情况:美国这边 31 家靠融资进来、6 家靠自研模型上榜、6 家靠开源项目;中国这边 9 家靠自研模型、8 家是大厂的 AI 部门、7 家靠融资、4 家靠开源项目。(在册家数,实际抓到数据的是 38 / 23 家)
光是单家够格还不够,名单整体也得均衡,否则热门赛道堆满、冷门赛道一家都没有,比出来的差异全是名单造成的。所以另加两条:每个赛道至少 3 家,而且至少有 1 家不是这个赛道的头部(防止「头部即赛道」);已经收缩、被收购、上市状态变了的公司一律不删除,只改状态标签——一家公司的岗位数掉到零,这件事本身就是最有信息量的一列,删掉它等于每季度都在给自己挑幸存者。
最后还有一道纯粹是采集上的门槛:招聘信息必须公开可查,我不登录、也不绕过任何验证。这一条我单独说,是因为它和上面那些不是一回事——它筛的是”我抓不抓得到”,不是”这家重不重要”。有几家公司完全够格,只是它的招聘页要登录或者做了防护,那我就抓不到,这在中国这边尤其明显。这类缺席一律不能读成”这家不重要”。
这一节问三件事:说了的词招不招人、从开始讲到开始招隔多久、中美在招的东西差在哪。
最后那件事最容易骗人——两个百分比摆在一起,看着差一倍,可能只是运气。所以中美的每一条差异都要走四道闸门,四道全过才写进结论:
| 这道闸门在筛选什么 | 剩下几个 | |
|---|---|---|
| 第一道 | 只用中英文写法都给全了的词。只有英文写法的词,在中文岗位描述里天生就测不到,拿它比中美等于在比我的尺子 | 31 个 |
| 第二道 | 换一批公司来抓,差异还在不在。 抽样按公司抽而不是按岗位抽,再加上”我一共比了 31 次,总会蹦出几个巧合”的修正 | 12 个 |
| 第三道 | 去掉最大的那一家,方向还在不在 | 12 个 |
| 第四道 | 只在同一个赛道里比,不拿做具身的和做基座的凑一起 | 8 个 |
下面按这个顺序走。
第一件事:他们嘴上说的东西,到底招不招人? 做法是把每一个在大会上真正成过焦点的词,拿去数中美的合格岗位里有多少份提到了它,过门槛的算”在招”。

第二件事:从开始讲到开始招,隔多久? 今年讲、明年才招,说明这个技术还在等市场检验。做法是把一个词”第一次在大会上成为焦点”的那一届,和它今天在招聘市场上的渗透率放在一起看。

⚠ 这张图的横轴只有 3 个取值——一个词第一次成为焦点,只能落在某一届会期上(本季是 2025-02、2025-06、2025-11)。所以这里的”隔多久”其实是”在哪一届达的阈”。招聘那边目前只有一个季度的快照,所以这张图能看出先后,看不出速度。
第三件事:中美在招的东西差在哪? 先看第二道闸门里那个”运气”是怎么估出来的——假设中美真实比例完全一样,各按现有规模抽一次、比 31 个词,看”最夸张的那一个”能夸张到什么程度:

把这个运气扣掉,再换一批公司重抽,31 个词里活下来 12 个:

中国明显更多的 10 个:fine-tuning(微调)、tool use、pretraining(预训练)、RLHF、parallel / distributed training(并行与分布式训练)、GPU kernel / 算子、显存 / HBM、distillation(蒸馏)、MoE、reranking(重排序)。美国明显更多的 2 个:evals、observability(可观测性)。
接下来是第三道闸门。中国这边字节一家就占了合格岗位的 36%(美国最大的 OpenAI 只占 13%),一家独大到这个程度,就得问一句:会不会某条差异其实只是这一家在招?做法是逐个词去找”在这个国家里最爱提这个词的那家公司”,把它整家删掉再算一遍。结果是 12 个一个都没掉。

第四道闸门是只在同一个赛道内部比:

局限性说明:9 个赛道里只有具身和基座模型两个是中美双边都够厚、能真放在一起比的,其余 7 个都是一国近乎为零——那是我这份名单没覆盖到,不是”那边不招”。而且这两个能比的赛道各有各的毛病:中国的具身里智元一家占 88%,实质是”这一家 vs 美国那几家”;中美的”基座模型”更是同名不同物——中国 92% 的合格岗位都挤在这一格(1,369 条、13 家,从预训练到搜广推到内容平台的大杂烩),美国这一格只有 5 家 248 条纯前沿模型公司。
四道闸门走完,31 个里剩下 8 个:

这 8 个,是这一季唯一站得住的中美差异:
-
中国在招把 AI 应用搭起来的人(6 个):fine-tuning(中 36.2% vs 美 12.7%)、tool use(24.9% vs 8.1%)、pretraining(18.9% vs 5.0%)、RLHF(16.0% vs 3.4%)、GPU kernel / 算子(16.6% vs 7.0%)、distillation(7.7% vs 2.1%)
-
美国在招把 AI 系统跑稳的人(2 个):observability(中 11.2% vs 美 46.7%)、evals(33.8% vs 57.3%)
另外 23 个没走完四道闸门,它们既不算”有差异”也不算”没差异”,所以不写进结论。每一个是卡在哪一道、为什么卡,都列在公开的方法与数据 notebook 里。
⚠ 最后提醒一句:中国的合格岗位有 1,491 条、比美国的 826 条多,这不代表中国需求更大。两边的门槛、公司家数、赛道构成都不一样,绝对条数不可比——能比的只有上面这种渗透率。
结语
在本篇报告的结尾,我用最简单粗暴的方式,把这份报告的思路再梳理一遍,草履虫都懂。其实所谓的四层传导架构,无非不过是四件最简单的事情:
-
当你要做一个行业的时候,这个行业谁来给钱?谁来给你提供物质上的资源?它的最上游是什么?当最上游的成本以及资源发生变化的时候,会不会影响到下游的任何一个环节?众所周知,只有当一个产业链真的是在产生价值的时候,才会有上游的钱和资源在涌入。当你在研究一个新兴的领域的时候, 它非常新潮、非常酷,但你没有办法找到任何证据证明上游正在大量涌入资金和资源,那么这就值得打一个问号。
-
当你要做一个行业的时候,世界上最聪明的一群大脑,他们到底在这个行业、在这件事上面能达到什么样的高度?他们到底能做什么?当然,这并不是限制你去做这个行业的理由,但是你可以有一个比较客观的参考系。工作和创业最重要的是你能做到什么,而不是你想做什么。
-
当你要做一个行业的时候,整个行业他们在干什么?他们想要做什么?行业的厂商也是非常精明的一群人,他们从来不会拿自己完全没有把握的事情去向投资人要钱。在这一层的思考当中,判断某一个叙事对你来说到底有没有价值,很简单:他有没有因此真的拿到钱?他有没有拿着拿到的钱去市场当中招有相关技术背景的人?他招到人之后,公司还有没有接着在赚钱?但凡有一个环节出现了问题,那么这个叙事就不值得你去相信。
-
当你要做一个行业的时候,这个行业到底需要什么样的人?不仅要看 JD 上面给的技能列表,也要看这些岗位在真实就业市场当中的占比。这里要提醒一句:本报告统计的是需求侧(企业在招什么),没有供给侧(有多少人在投这个岗),所以给不出供需比——供需比要你自己结合求职端的体感去补。同时,这一层的思考要结合另外前三层的思考来理性地看待。相信你也应该认同我的结论: 学界嗨、业界吹、老板拍脑袋要尝试,打工的你我别买单。
最后,交叉四层的分析,本季我一共跟踪了 61 个专业技术名词——比前面统计用的 62 个少一个,少的是 agent。它在每一届大会上都有 77%~93% 的演讲提到,工程博客里也有 58% 的文章提到(第二部分那张图里它就是最高的一个)。一个几乎人人都在说的词,放进「能做/在说/在招」的交叉表里区分不出任何东西,所以它照常计数、照常出现在前面的图里,但不进这张交叉表。其中 23 个是三样都占的——学界业界都有能力支撑、台上在讲、招聘市场上也真在花钱招;另外有一批只符合其中两个条件,那才是最需要我们再去做深度思考与判断的部分:

交叉能力、叙事、求职市场三层的分析,61 个术语里有 52 个至少占到了其中一样,按渗透率排序,得到如下图:

至此,回头看我在第一部分提出的那五条猜想。五条里有三条这一季已经能给出说法,另外两条还不能:
- ✅ 算力是中国的第一约束 → 中国在训练 infra 类术语上的招聘渗透率应显著高于美国。
成立。GPU kernel / 算子在走完全部四道闸门之后,中美差异依然显著(中 16.6% vs 美 7.0%),parallel / distributed training 也一路撑到了第三道闸门。与「算力买不到 → 只能在既有的卡上把效率榨出来」这条约束一致。
- ❓ 算力受限 → 蒸馏 / 量化 / MoE 这类「用更少算力做同等事」的研究应该更强。
部分成立,如果你问的是「有没有萎缩」,三个都没萎缩(distillation 学界在升、MoE 学界在升、quantization 持平)。
- ⏳ 内存墙 → 推理成本/吞吐的叙事应压过模型能力本身,推理优化类岗位在中美应同步上升。
还不能验。注意原本的说法是「同步上升」——这个「同步」才是关键,它是用来区分「物理约束」和「某国的政策差异」的:物理约束不认国界,政策差异认。而要看「上升」就必须有两个季度的招聘快照,一个季度的快照什么都看不出来。
- ✅ 需求侧 ROI 压力大 → 企业更需要「证明 AI 有效」的工程。
成立,而且是本季最干净的一条。observability(中 11.2% vs 美 46.7%)和 evals(中 33.8% vs 美 57.3%)是仅有的两个美国显著高于中国的术语,两个都在「证明它有效」这一类上。与「美国企业软件预算更成熟、更早进入验收阶段」一致。
- ⏳ 数据墙与范式迁移 → 学术上预训练弱于后训练,招聘上微调/RLHF 强于预训练。
只验到了半条。招聘侧确实看到 fine-tuning / RLHF / pretraining 三个都是中国显著高于美国——但这是「中美差异」,不是「时序迁移」。这条猜想问的是「后训练有没有取代预训练」,那是一个时间上的问题,而我这一季的招聘数据只有一个横截面,给不出方向。同样要等下一季。
一句话总结当前的数据反映的AI行业的总体趋势:
行业的瓶颈已经整体从”做不做得出来”移到了”排不排得上、能不能兑现”——电要排队五年,钱开始靠借,话说了一大堆,只有三分之一变成了真的岗位,企业亟须能快速验证AI的价值的人,到了真正要验证价值的时刻,该交卷了。
这里是黑犬,暗海淘金,有趣常青,希望看完这份报告的你能得到自己想要的东西,天天开心,我们下一个季度再见👋。
附录
数据总览
| 这一层 | 采的是什么 | 总数 |
|---|---|---|
| 硬约束 | 九条约束的六维评分与支撑证据 | 9 条约束 · 27 条证据 |
| 能力 · 学界 | arXiv 预印本(cs.AI + cs.SE + cs.RO) | 98,174 篇 |
| 能力 · 业界 | 21 家公司的官方工程博客 | 1,803 篇(21 家) |
| 叙事 | ai.engineer 大会演讲录音稿 | 756 场(计入统计 674 场) |
| 需求 · 美国 | 38 家公司的公开招聘岗位 | 3,670 条(其中合格 826 条) |
| 需求 · 中国 | 23 家公司的公开招聘岗位 | 4,124 条(其中合格 1,491 条) |
| 术语清单 | 三层共用的技术词表 | 72 个(62 个进结论 + 10 个对照组) |
| 文档合计 | 108,527 份 |
四层数据各自覆盖到哪一段时间,看这张图——它们的时间性质完全不同:论文和博客是连续的(条形),大会是一届一届的脉冲(菱形),招聘是季度快照、时间不可回溯(菱形)。所以跨层比较只能在重叠的那一段里做。

数据和分析全部开源
这份报告用到的全部原始数据、统计方法和作图代码,都已经上传到:
https://github.com/shuheng-mo/AIE101
里面有一个可以直接跑的 notebook,正文里每一张图、每一个百分比都能在上面重算一遍。欢迎你去挑错——如果哪个数字复现不出来,或者你觉得哪一步的判据不合理,来提 issue,下一季我会把它写进修订记录里。
觉得有用的话,给个 Star ⭐ 对我是很大的鼓励,也能让更多人看到这份报告。