2026年6月24日,OpenAI与博通联合发布首款自研AI推理芯片Jalapeño(西班牙语"墨西哥辣椒")。这颗从零开始为大语言模型推理设计的ASIC芯片,从设计到流片仅用了9个月,创下高性能半导体领域最快的开发纪录。早期测试显示,每瓦性能大幅优于当前最先进水平,推理成本相比传统GPU预计降低约50%。
这不只是一颗芯片。这是OpenAI从"纯AI软件公司"向"软硬一体全栈基础设施公司"转型的标志。
💰 为什么OpenAI要自己造芯片?
先说一个数字:500亿美元。
这是OpenAI总裁布罗克曼在5月初透露的今年算力投入预算。而2025年全年,公司总共烧掉了340亿美元。光是今年花在算力上的钱,就超过了去年全部支出的1.5倍。
9亿周活用户意味着每天数以十亿计的推理请求。每一次你在ChatGPT里提问、每一次Codex帮你写代码、每一次API调用——背后都是真金白银的算力消耗。而目前,这些推理请求绝大部分跑在英伟达的GPU上。
英伟达GPU是通用加速器——就像用瑞士军刀切菜,能干,但不够高效。对于LLM推理这种高度特定化的计算模式,通用GPU存在严重的资源错配:算力可能过剩,但内存带宽跟不上。更关键的是,推理端算力消耗已经超过训练端——真正烧钱的环节变了。
布罗克曼在内部播客里说得很直白:
我们对自身的业务运算需求有着深刻理解。我们一直在挖掘那些现有芯片难以适配的特定运算场景,并思考该如何打造一款硬件,进一步释放AI技术的性能上限。
翻译一下:英伟达的芯片不够贴合我们的需求,那就自己造。
🔬 Jalapeño到底是一颗什么样的芯片?
核心参数一览
| 参数 | 规格 |
|---|---|
| 芯片类型 | ASIC推理专用芯片 |
| 制造工艺 | 台积电 3nm(N3) |
| 核心架构 | 脉动阵列(Systolic Array) |
| 内存 | 高带宽内存(HBM3E / HBM4) |
| 配套CPU | Arm 定制设计 |
| 网络互联 | 博通 Tomahawk 交换芯片 |
| 设计周期 | 9个月(传统需18-24个月) |
| 已跑通模型 | GPT-5.3-Codex-Spark |
三大设计思路
大模型推理的真正瓶颈不是计算本身,而是数据搬运。LLM推理的本质是权重矩阵与激活向量的反复乘累加,但每次计算都需要从HBM中把权重搬到计算单元——这个搬运过程的能耗和延迟远超计算本身。Jalapeño在数据路径上做了定向优化:片上多级缓存、数据流架构的"邻接传递"、智能预取——尽可能让数据少跑路。
传统GPU追求极致计算吞吐量——更多的CUDA核心、更高的频率。但这在推理场景中容易造成资源错配:算力过剩但内存带宽不足。Jalapeño反过来,在设计时就让计算单元规模与内存带宽精确匹配,网络互联带宽与机架内通信需求对齐,确保每个环节都不拖后腿。
通用GPU的理论峰值利用率在实际工作负载中往往大打折扣。Jalapeño通过定制推理内核、确定性调度和硬件-软件协同设计,把实际利用率压到了接近理论极限。这意味着买到的每一分算力都能被真正用上。
我们围绕对前沿AI模型最为关键的内核、内存传输、网络以及服务模式,对架构进行了全面优化。
🤖 "AI造芯":9个月流片背后的秘密
9个月,从零设计到流片成功——这个数字到底有多夸张?
传统高性能芯片的开发周期通常是18到24个月,甚至更长。Jalapeño只用了一半的时间,而且创下了高性能先进半导体领域ASIC的最快开发纪录。
答案是:用AI设计AI硬件。
OpenAI首次深度调用自家大模型参与芯片设计流程。AI被用于逻辑电路布线、热性能管理及功耗预测,大幅压缩了工程验证与迭代的时间。
服务于用户的AI模型,已经被反向用于支撑未来模型运行的基础设施研发。如果AI能帮工程师更快设计出更优芯片,那么整个行业的算力成本将进入一个正反馈循环——AI优化硬件,更强的硬件运行更强的AI,更强的AI再优化下一代硬件。这个闭环一旦转起来,飞轮效应是惊人的。
产业链分工
| 合作方 | 职责 |
|---|---|
| OpenAI | 底层架构与算法设计 |
| 博通 Broadcom | 硅片实现、流片及网络硬件(含Tomahawk网络芯片) |
| 台积电 TSMC | 3nm晶圆代工制造 |
| 天弘科技 Celestica | 板卡、机架与系统集成 |
博通CEO陈福阳(Hock Tan)在发布会上表示,双方已制定多代芯片路线图,下一代产品代号"Serrano",预计2028年推出,此后每年迭代一次。
这仅仅是一份跨越数代的路线图的开端。
🏁 英伟达的"超级客户清单",正在变成"竞争对手名单"

OpenAI不是第一个走这条路的。
训练 + 推理
AWS 云服务
云端加速
首款自研
这些公司有一个共同身份——英伟达最大的客户。
谷歌、微软、亚马逊、OpenAI,构成了英伟达数据中心GPU业务的核心收入来源。而现在,这些大客户一个接一个地走上了自研芯片之路。
英伟达当然没有坐以待毙。黄仁勋6月初表示,OpenAI将率先部署英伟达最新款Vera系列处理器。但Jalapeño的出现说明,即便是最紧密的合作关系,也无法消除AI公司对"算力命脉掌握在别人手里"的焦虑。
世界正在迈向以计算为核心的经济时代。
当算力成为核心生产资料,没有人愿意把命脉完全交给供应商。
🏗️ 全栈战略:从模型到芯片的闭环

Jalapeño不是一颗孤立的芯片,它是OpenAI全栈战略的关键拼图。回顾OpenAI的算力演进路线:
OpenAI在公告中这样描述自己的定位:
公司不只是研发前沿大模型、基于模型打造应用产品,同时还在搭建底层全套基础设施:芯片架构、计算内核、内存系统、网络通信、任务调度、部署系统以及产品使用体验。正因为OpenAI掌握全栈技术,每一层软硬件都可以围绕同一个目标优化:让旗下模型运行速度更快、稳定性更强,同时降低用户使用成本。
这段话的信息量很大。它意味着OpenAI的野心不再局限于做一个"模型公司",而是要成为类似苹果那样的端到端控制者——从底层硬件到上层产品,全部自己定义。
🎯 对普通人意味着什么?
说了这么多技术参数和行业格局,回到一个最实在的问题:这跟你我有什么关系?
- ChatGPT可能会变得更便宜、更快。推理成本降低50%,如果顺利部署,意味着OpenAI可以更低的成本服务9亿用户。不管是订阅费降价、免费额度增加,还是响应速度提升,最终受益的都是终端用户。
- AI产品进入"全栈竞争"时代。当OpenAI、谷歌、亚马逊都开始从芯片到产品全面自研,AI竞争的维度就不再只是"谁的模型更强",而是"谁的整条链路更高效"。对用户来说,这意味着更好的体验和更低的成本。
- IPO的信号弹。奥特曼近日表示公司正考虑"在未来一年内"上市,已秘密提交S-1草案。德意志银行等机构预测,OpenAI上市估值可能超过1万亿美元,募资规模或达600亿美元——有望成为美国公开市场历史上最大的科技IPO之一。



