Pat Gelsinger 访谈:AI 时代,硬件为什么重新成为主战场
这期 a16z / The Ben & Marc Show 由 Marc Andreessen 和 Ben Horowitz 采访 Pat Gelsinger。节目讨论的不是一句宽泛的“硬件回来了”,而是 Gelsinger 基于 Intel、VMware 与 Playground Global 经验,对 AI 计算瓶颈迁移做出的系统判断:AI 可以加快部分芯片设计,但真正的约束会继续转向制造周期、封装、内存、互连、电力、散热、数据中心交付和 agent 管理抽象。
一、嘉宾背景
这期节目来自 a16z / The Ben & Marc Show,标题是《Former Intel CEO: Why This is the Best Time to Build Hardware》,由 Marc Andreessen 和 Ben Horowitz 主持,a16z 于 2026-10-09 上传,时长 3194 秒。节目中的明确嘉宾是 Pat Gelsinger。证据中给出的身份是:他现在是 Playground Global 的 General Partner,曾担任 Intel CEO、Intel CTO,也曾领导 VMware。主持人开场把他放在这组经验坐标中:他既亲历过 Intel 处理器和工具链形成的年代,也领导过 VMware 这类抽象层和管理软件公司。
这个背景决定了访谈的视角。Gelsinger 不是以外部评论员身份谈论“硬件热”,而是从两条经历线索进入问题:一条是早年 Intel 处理器设计和 EDA 工具链的形成,另一条是 VMware 式计算抽象如何在新的计算时代被重写。他在节目中回忆,自己 16 岁进入技术学校,18 岁被 Intel 招聘,先做 technician,随后进入 286 后期设计,成为 386 的第 4 号工程师,并在 486 项目中担任 architect 和 design manager,同时完成本科、硕士和博士学习。这使他讨论 AI 芯片时,关注的不是单个架构图,而是从设计、验证、硅片、封装到机架的完整链条。
节目分析的对象是 AI 时代的硬件基础设施,而不是某一家公司的产品发布。Gelsinger 和主持人谈到,486 项目发生在 Verilog 和现代 EDA 成熟之前,Intel 当时自建 Hardware Description Language、compiler、automatic placement、routing 和 timing management;他们也讨论了 AI 是否会像当年的 EDA 一样改变芯片设计。随后,话题扩展到 AI inference accelerator 公司是否会收敛、HBM 与新内存、3D 堆叠、光互连、scale-up 和 scale-out 网络、电力供应、800V DC 数据中心,以及面向 AI agents 的虚拟化管理。
二、本期主要内容
这期访谈的主线,是 Gelsinger 对“AI 是否让硬件变得更容易”这一问题的拆解。他承认 AI 正在改变芯片设计,尤其是 logic functions 可以越来越多地由 AI tools and techniques 完成;但他也把边界说得很清楚:analog design 仍然困难,因为它需要大量真实 silicon data,也受工艺边界制约,很多时候仍要依靠保守设计和传统工程方法。换言之,AI 会加速一部分设计工作,但不会自动替代工艺、硅片反馈和物理约束。
主持人把问题从设计推进到下一层瓶颈,Gelsinger 的回答是:当一项技术让某件事变容易,瓶颈就会转移。他用一个假想 AI 芯片项目说明:团队也许三个月就能用 AI 工具做出很好的设计,但 silicon processing、advanced packaging、3D packaging 和 rack-scale integration 可能还要大约九个月,芯片才能真正开始使用。他进一步说,如果从设计到 scale、software readiness 和客户 workload 落地需要一年半,那么芯片设计时对 AI workload 的理解,到交付时可能已经失效。他以 Graphcore 为例说明:问题未必是设计差,而是世界变化太快。
这也是节目标题中“现在是构建硬件的最佳时刻”的真实含义。Gelsinger 并不是说硬件突然简单了,而是说 AI 把旧瓶颈暴露出来,同时制造了新的创业机会和系统重构机会。芯片设计不再只是“能不能画出更聪明的 accelerator”,还包括能不能缩短制造反馈周期、降低原型前 mask cost、把 chip 放进 advanced package,再进入 rack-scale solution。他明确提到,希望设计流程不必在进入 prototyping 前承担 5000 万美元级别的 mask cost。
访谈后半段继续沿系统链条展开。内存方面,他把 HBM 视为当前最好的选择,但批评其 bit density、shoreline bandwidth、power、thermal 和 DRAM heat sensitivity;他强调 AI 是 memory-compute workload,因此 memory 不是附属部件,而是核心瓶颈。互连方面,他支持 I/O 光学化,却反对在 core compute-memory complex 中频繁进行 optical-electrical-optical conversion,因为通信能耗相对计算能耗太高。能源方面,他提出 energy capacity equals economic capacity,并把 AI data center 的上限连接到发电、供电转换、冷却、turbines、refrigerants 和数据中心资本承诺。最后,节目转向 agent infrastructure:Gelsinger 认为 virtual machine abstraction 仍然基础,但 AI agent swarms 会要求重新设计安全、性能、迁移、policy、guardrails 和 dashboard。
三、核心观点:推理、例子与边界
第一层核心观点是:AI 不会消灭硬件复杂性,只会重新分配复杂性。Gelsinger 的推理从 486 时代开始。当时 Intel 没有成熟的 Verilog 式工具链,于是自己做 HDL、compiler、placement、routing 和 timing management;这段经历让他把 AI 芯片设计视为类似的转折点。但他没有把类比推向“设计全自动化”,而是强调逻辑设计和模拟设计的差异。逻辑功能可以被 AI 工具更大幅度接管,analog 仍然受 silicon data、工艺边界和保守工程约束。这里的限制是,节目提供的是 Gelsinger 的专业判断,不是对所有模拟设计任务的系统测量;更稳妥的表达是:在他看来,AI 自动化会先集中在更可形式化、可验证、数据更充足的部分。
第二层观点是:设计速度与落地速度之间的剪刀差,会成为 AI 硬件创业的结构性风险。Gelsinger 的例子很具体:三个月完成设计,九个月等待硅片、封装、3D package 与 rack-scale 系统,最后可能一年半才进入规模化和软件适配。AI workload 的变化速度太快,这意味着一个芯片团队今天针对 prefill、decode、midfill 或某种模型结构做出的假设,交付时可能已经错位。他提到 Graphcore,不是为了给出完整公司史,而是用来说明“设计不差但世界变了”的风险。这里的边界同样重要:一年半不是所有芯片项目的普适定律,而是 Gelsinger 在访谈中用来说明硬件周期和 workload 迁移错配的情境判断。
第三层观点是:AI accelerator 市场会收敛,原因不只是资本市场冷暖,而是系统部署不允许无限细分。主持人提出约一百家 AI inference accelerator 的现象,Gelsinger 认为这只是 temporary。他反对 at-scale specialization:今天为 prefill、decode、midfill 分出不同硬件,明天 reasoning models 可能又更像 CPU,后天 3D、molecules、chemicals、imaging 或 HPC-like high precision workload 又会改变计算形态。即使 AI 让 heterogeneous hardware 更容易编程,Gelsinger 仍提醒,真正把硬件放进 million-GPU scale data center 时,会遇到 build cycle、500 亿级资本开支、power commitment、fleet management、upgrade、connectivity 和 fault domain 成本。因此他预期,异构性更多会被大平台抽象和隐藏,而不是以大量可见平台的形式长期并存。
第四层观点是:内存正从长期商品化部件变成 AI 基础设施的战略瓶颈。Gelsinger 对 HBM 的态度很有代表性:它是最好的可用方案,却仍然 hideous。他列出的缺陷包括 bit density、shoreline bandwidth、power、thermal,以及 DRAM 不喜欢高温,而 AI 恰恰是 memory-compute workload。他进一步说,过去 30 年重大新内存几乎没有出现,主流仍是 DRAM、SRAM、flash;他个人接触过至少五种 new memory architectures,也知道近百种行业尝试,但大多没有成功。他的乐观来自激励结构变化:AI 让 memory vendors 市值和资本能力上升,也让系统瓶颈明确指向内存。因此,新材料、ferroelectrics、non-capacitive high-density memories、stackable high-performance memories、memory-compute structures 都重新值得押注。限制是,Gelsinger 同时承认这是预测;过去失败很多,说明新内存不是有资本就自然成功。
第五层观点是:3D 堆叠与光互连都不是“越多越好”的线性升级。Gelsinger 反对把堆叠想象成一路走向 16 层、32 层,因为 yield、defects、cracked die、thermal、power delivery、RDL signal distribution 和 manufacturing perfection 会迅速变成硬墙。他更看好三、四、五层这样的 sweet spot,memory stack 可能更接近二或四层。类似地,他非常支持 I/O optical,却反对把 core compute-memory complex 全部 optical 化。理由是每次 optical-electrical-optical conversion 都有损耗,而且 femtojoules per bit of communication 相比 femtojoules per compute 大约差一千倍。访问大 memory pool 听起来优雅,但如果通信能耗过高,就违背底层 physics。
第六层观点是:AI 网络与能源将决定系统上限。光互连的突破点在 scale-up environment、large radix clusters 和 predictable AI flows,而不是装饰性地替代所有铜线。Gelsinger 说 copper 在 scale-up 中正在变成越来越短的 waveguide,预计 NPO、CPO 等路线会在 2028、2029 年左右成为转换点;他把 Nvidia NVL72 称为 engineering marvel 和 manufacturing nightmare,说明现有铜与封装路线已经逼近复杂度边界。网络上,他借 Nick McKeown 的表述说,传统网络为 unknown packet anywhere 设计,而 AI 是 large predictable flows,因此更像 switch 或 optical circuit switching 问题。能源上,他提出 digital age 中 energy capacity equals economic capacity,并称美国过去 10 到 15 年总体 energy capacity 基本 flatline,近年增长也可能只是约 4% per year。这里应保留不确定性:这些数字是嘉宾在节目中的判断,不能当作外部核验后的宏观统计;但它们在节目中的作用,是支撑“AI data center 不只受 GPU 数量限制”的分析。
四、学习与应用
对 AI 硬件创业或投资评估,第一条应用是把问题从“芯片架构是否聪明”扩展为“完整交付链是否成立”。如果一个团队声称 AI 工具让设计周期大幅压缩,就要继续追问:silicon processing 能否同步压缩,advanced packaging 是否可得,3D package 的 yield 和 thermal 如何处理,rack-scale solution 什么时候能交付,software stack 与客户 workload 是否会在一年后仍然匹配。Gelsinger 的框架提醒我们,AI 可能让 prototype design 更快,但不会自动让 fab、package、data center、power 和 customer adoption 更快。适用条件是评估资本密集型硬件项目;边界是不能把他的三个月、九个月、一年半数字机械套用到所有项目,而要把它们当作检查时间链错配的警示模型。
第二条应用是评估 accelerator 专用化时,要同时看效率收益与迁移风险。针对 prefill、decode、midfill、diffusion、reasoning 或 high-precision scientific workload 优化,短期可能带来性能优势;但如果模型结构、算法范式或客户 workload 快速迁移,极端 specialization 就会变成锁定风险。更稳健的问题不是“这块卡在一个 benchmark 上是否最好”,而是“当 workload 两三年后变化时,它能否通过软件、抽象层、客户部署和平台资本继续演进”。对于大型客户,Gelsinger 的观点还意味着异构硬件可以存在,但最好被平台层隐藏;对于创业公司,则意味着必须证明自己不只是某个窄 workload 的一次性优化。
第三条应用是把 memory 当作系统设计的一等变量。HBM 流行不等于 memory problem 已经解决。评估 AI 系统时,需要同时看 bandwidth、density、power、thermal、shoreline limits、DRAM heat sensitivity,以及 memory 与 compute 的物理距离。新内存、新材料、ferroelectrics、non-capacitive high-density memory、stackable memory 和 memory-compute structures 值得关注,但不能因为“AI 需要内存”就自动相信每条路线都会成功。过去 30 年新内存失败很多,说明制造、成本、耐久、性能、生态与客户迁移同样关键。Gelsinger 对 PIM 的怀疑也给出边界:如果把 compute 推进 memory 会限制 workload,那么靠近真实 compute engine 的 high-bandwidth memory 可能比更激进的 compute-in-memory 更通用。
第四条应用是对 3D 堆叠和光互连保持工程化判断。堆更多层并不天然更好,必须把 yield、bad blocks、cracked die、heat spreading、power rails、RDL signal distribution、optical I/O integration 和 manufacturing complexity 一起计算。光互连也不是“全光化”口号:Gelsinger 支持 I/O optical、scale-up optical、large radix clusters 和 predictable-flow switching,但反对 core compute-memory complex 中过多 OEO conversion。设计取舍应围绕每 bit communication energy、conversion loss、thermal environment、supply-chain maturity 和 package integration,而不是围绕单一技术标签。
第五条应用是把 AI data center 规划放进能源与电力转换现实。采购 GPU、建设机架和浇筑水泥之前,必须确认电力容量、grid connection、baseload strategy、conversion stages、cooling loop、turbines、refrigerants 和 power delivery network。800V DC、vertical GaN、solid-state transformers、better cooling 等方向的价值,在于减少转换损耗并提升可供电规模;但它们也受标准化、供应链、可靠性和部署周期约束。最后,对 agent infrastructure 的启发是:agent 时代仍需要类似 VMware 的抽象层,只是服务对象变成 agent swarms 与人类治理。产品设计要同时满足 agent 的启动速度、性能、安全 profile、migration,以及人类设置 policy、constitution、guardrails、dashboard 的需求。边界在于,这不是把旧 VM UI 换个名字,而是围绕 agents 的运行方式重写管理面。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment