TechTrends360 科技前沿

聚焦全球科技前沿资讯:AI、芯片、互联网大厂动态,每日更新

芯片半导体

OpenAI自研Jalapeño芯片部署:弃英伟达选AMD

OpenAI 自研芯片计划迎来实质性进展。据科技媒体 Tom’s Hardware 当地时间 10 月 2 日报道,OpenAI 首款自研推理芯片 Jalapeño ASIC 已在其内部数据中心完成部署,与之搭配的并不是英伟达的新款 Vera CPU,而是 AMD 的 EPYC Turin 处理器。OpenAI 副总裁兼硬件主管 Richard Ho 在接受采访时表示,选择 AMD 是出于”务实”的去风险考虑,而英伟达 Vera CPU 在成熟度上”略微落后”。

事件详情:128 颗芯片组成双机架推理单元

此次曝光的是 Jalapeño 的机架级部署形态:

  • CPU 主机架(代号 Katsu):16 个托盘,每个托盘搭载 2 颗 AMD EPYC Turin 处理器与 1.5TB DRAM 系统内存;
  • 加速器机架(代号 Vindaloo):16 个托盘,每个托盘 8 颗 Jalapeño 芯片,共计 128 颗;
  • 两个机架通过 8 组 Chana 交换托盘互联,整套双机架功耗约 160 千瓦,其中加速器部分约 130 千瓦;
  • 该设计可扩展至 16 个机架、2048 颗 Jalapeño 芯片,构成大规模推理算力池。

Ho 解释,Jalapeño 团队在设计阶段即确立了”去风险”与”快速落地”两大原则:Turin 性能已满足项目全部需求,且合作伙伴对该平台经验丰富,有助于加速部署。公司希望在性能指标和成本控制上保持激进,但平台选择必须符合既有的工程决策框架、确保项目可控。

背景分析:从流片到内部上线的自研路线

Jalapeño 是 OpenAI 与博通(Broadcom)合作开发的专用推理 ASIC,由 Celestica 负责系统设计,2025 年 11 月完成流片,采用台积电 3nm 工艺。据 OpenAI 公布的测试数据,Jalapeño 每瓦 AI 吞吐量达到对比 GPU 系统的 1.5~1.9 倍;在 DeepSeek R1 模型上,每瓦性能约为英伟达 GB300 的 1.7 倍;端到端推理延迟降至对比系统的 28%~59%。芯片额定功耗 700W,高负载下持续功耗可维持在 550W 以内,远低于 GB300 的 1400W 标称功耗。

需要明确的是,这些领先数据仅限定于大模型推理场景的基准测试。Jalapeño 是高度定制的专用 ASIC,能力收敛于 LLM 推理;而英伟达 Blackwell 系列是通用 GPU,兼顾训练、微调、多模态与通用计算,两者产品定位并不完全对等。OpenAI 也强调,英伟达仍是重要合作伙伴,模型训练任务依旧高度依赖英伟达高端 GPU 集群——自研 ASIC 的核心目标是压低自身推理业务的总体拥有成本(TCO),补齐推理侧算力供给,而非全面替代 GPU。

按计划,Jalapeño 将于 2026 年底小规模上线,2027 年逐步扩大算力规模;第二代芯片已进入后期开发,第三代启动概念设计。这套芯片与配套机架仅供 OpenAI 内部算力集群使用,不对外销售。

影响与展望:推理算力正在走向硬件分化

Jalapeño 的真正行业意义不在于跑分高低,而在于验证了一个趋势:当业务规模足够大时,专用 ASIC 可以在推理场景取得显著优于通用 GPU 的综合成本优势。训练负载看重可编程性与生态,推理负载则极度看重内存带宽、token 生成延迟与单位能耗产出——两者正在走向硬件分化。

这条路线并非 OpenAI 独有:谷歌有 TPU,AWS 有 Trainium 与 Inferentia,微软有 Maia,Meta 也在持续投入内部加速器。如今 OpenAI 加入战局,意味着头部大模型厂商正从”买芯片”转向”围绕工作负载设计系统”。

对 AMD 而言,这是一场及时的数据中心 CPU 胜利:在 AI 服务器主机 CPU 的争夺中,Turin 凭借成熟度赢得了 OpenAI 首款自研芯片的首发搭档。对英伟达而言,Vera 的缺席更多是成熟度时间表问题,而非架构被否定——但头部客户开始为推理环节准备”Plan B”,无疑会加速 AI 算力市场的分层竞争。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注