TechTrends360 科技前沿

聚焦全球科技前沿资讯:AI、芯片、互联网大厂动态,每日更新

人工智能

Epoch AI:到2027年芯片可支持19亿AI智能体

导语:一份报告把”AI烧钱”换算成一个具体数字

AI 公司每年在芯片和数据中心上砸下数千亿美元,赌的是未来有海量 AI 智能体在这些硬件上替人类工作。但到底能跑多少个智能体?一直没有人给出一个经得起推敲的数字。当地时间 10 月 2 日,专注于追踪 AI 算力的研究机构 Epoch AI 发布了一份新报告——《2025 至 2027 年出货的 AI 芯片能同时运行多少个 AI 智能体?》,第一次把这个抽象问题变成了可计算、可验证的答案:2025 到 2027 年出货的 AI 芯片,理论上可以同时支撑 3000 万到 1.7 亿个前沿模型智能体;如果运行的是高效开源模型,这个数字可以达到约 19 亿个。

报告作者是 Epoch AI 研究员 Jason Li,代码和数据已在公开仓库中开源,可供复现。这份报告的核心结论不是”芯片太多”,而是”需求才是真正的未知数”。

报告说了什么:两种智能体,两种量级

Epoch AI 的计算逻辑并不复杂,核心是两个数字相乘:出货了多少可用显存,以及每单位显存能服务多少个智能体会话。

为什么用显存而不是芯片数量来衡量

AI 模型生成文本时,需要把模型权重放在高速显存里,还要为每个对话维护一份不断增长的”草稿纸”(KV 缓存)。每生成一个新词,都要把大量数据重新流过芯片一次。因此真正卡脖子的往往是显存容量和带宽,而不是纯算力。Epoch 据此统计了 2025 年以来出货的高带宽内存(HBM),将其折算成英伟达 GB300 加速器(单卡 288GB 显存)的等效数量:在中心假设下,到 2027 年底累计约为 6000 万张 GB300 等效算力,并假设下一代显存每 GB 能服务的会话数翻倍。

前沿闭源模型:3000 万至 1.7 亿个同时在线智能体

对于 Claude Code、Codex 背后的闭源前沿模型,外界看不到服务商的机房内部,Epoch 只能从成本反推:实测编程智能体的运行轨迹,估算出每个持续运行的智能体每小时花费约 30 美元;假设服务商的收费是其服务成本的 5 到 10 倍,再对比约 5 美元一小时的 GPU 租赁价格,得出每张 GB300 大约能跑 1 到 2 个智能体会话。在中心硬件假设下,对应的是 5000 万到 1.01 亿个同时在线智能体。

高效开源模型:约 19 亿个同时在线会话

对于开源模型,Epoch 采用了 SemiAnalysis 的 AgentX 基准测试的直接测量数据——该基准回放了真实的编程智能体会话。结果显示,DeepSeek V4 Pro 在每用户每秒 50 token 的速度下,每张 GB300 可支撑约 31 个会话,折算下来就是约 19 亿个同时在线会话;如果把速度提高到每秒 100 token,则降至约 8.7 亿个。

报告用了一个形象的比喻:同样一栋楼,前沿闭源模型像只能接待两桌客人的高级品鉴餐厅,开源高效模型像能接待三十桌的快餐店——楼是一样的,吃的饭完全不同。这两个数字是同一批显存的两种不同用法,不能相加。

为了让人体会 19 亿这个数字的分量,Epoch 还给了一个尺度参照:19 亿个全天候在线的会话,相当于约 80 亿人每周工作 40 小时的总时长。但报告也明确警告:智能体的速度和质量差异很大,时长相等不等于工作量相等。

真正的悬念在需求端:算力可能过剩

报告最引人注目的一句话是:“需求可能跟不上这种潜在供给,造成产能过剩。”(”Demand could fall behind this potential supply, creating an overabundance of capacity.”)

为了验证这一点,Epoch 建模了一个只有五分之一产能被有效利用的场景:即便如此,这些产能在中心假设下仍意味着每年 2.6 万亿至 5.3 万亿美元的 API 等效支出——而如果开发者收入延续近期的五倍增长势头,到 2027 年底的年化收入也只有约 1 万亿美元。换句话说,即便打两折使用,供给侧的”账单”依然大得惊人,需求端能否消化是最大的不确定性。

这也解释了为什么报告把问题定性为”供给问题”而非”预测”:它假设所有出货的芯片都被安装、通电并 24 小时专用于智能体负载,而现实中数据中心建设往往大幅滞后于芯片交付;2026 和 2027 年的显存出货量本身也是预测;闭源模型的数字还建立在定价加成的假设之上。报告特别提醒,此前在 Reddit 上传播的”19 亿智能体”说法,混淆了高效开源模型场景和前沿模型区间这两个完全不同的概念。

分析:从”芯片竞赛”到”需求竞赛”

过去两年,AI 行业的叙事主线一直是”抢芯片”:英伟达的 H100、H200 供不应求,各家大厂囤积算力、签长期供电合同,仿佛只要有卡就有未来。Epoch AI 这份报告第一次系统地回答了”囤来的卡到底能干多少活”,并把聚光灯转向了另一端——谁来为这些算力买单。

值得注意的是,报告中开源模型与闭源模型的效率差高达十倍以上。这意味着,开源高效模型的进步不只是”省钱”,它直接决定了整个行业算力投资的数学是否成立:同样的硬件,跑高效模型能服务的用户是前沿闭源模型的十几倍。DeepSeek V4 Pro 在这里成为标杆案例,也呼应了近期中国开源模型在成本效率上的持续领先。

与此同时,报告也给 AI 基础设施的狂热泼了一盆冷水:产能上限不等于需求,数据中心从芯片到货到真正点亮还有很长的路。Ground Truth 此前追踪的数据显示,今年新增算力中约三成被两家实验室拿走——供给在集中,需求却高度不确定。

展望:数字会修正,但问题不会消失

Epoch AI 的估算仍有不少粗糙之处:闭源模型的成本反推依赖多层假设,显存出货预测可能偏离,Reddit 上的误读也说明这类数字极易被断章取义。报告发布后,目前尚未出现独立专家的同行评议。

但它提出的问题是真实的,而且会越来越尖锐:当 2027 年 6000 万张 GB300 等效算力摆在面前,AI 行业必须回答——谁来用?付多少钱用?如果答案跟不上,过去两年以”token 工厂”为名的万亿级资本开支,就要面对最残酷的一课:供给可以靠砸钱解决,需求不行。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注