Walter Goodwin 解析 Fractile 的前沿 AI 推理芯片赌注:内存带宽、长上下文与硬件战略风险
本文基于 No Priors 对 Fractile 创始人兼 CEO Walter Goodwin 的访谈,分析他为何把前沿 AI 推理芯片的关键从单纯 FLOPs 转向高带宽、可经济扩展的内存访问。文章梳理 Fractile 的全栈组织方式、从 SRAM 到高带宽 DRAM 的技术转向、长运行 agent 和 MoE/attention 架构对芯片设计的牵引,以及 Goodwin 对芯片设计周期、供应多样性和前沿实验室硬件战略风险的判断。
一、嘉宾背景
这期 No Priors 是 Sarah Guo 和 Elad Gil 主持的一集前沿 AI 芯片访谈,标题直接点明主题:与 Fractile 创始人兼 CEO Walter Goodwin 讨论面向前沿 AI 实验室的芯片。Goodwin 的身份不是旁观评论者,而是 Fractile 的创始人和 CEO;节目把 Fractile 描述为一家 full-stack AI chip company,也就是试图从工作负载理解、架构、前端设计到物理实现和封装都参与其中的 AI 芯片公司。
Fractile 的业务定位决定了这集访谈的分析视角。Goodwin 说,公司建造的是服务全球最大模型的高速推理芯片,重点在速度、内存带宽、向 frontier models 扩展,以及长上下文。换言之,他谈的不是消费级端侧芯片,也不是泛泛的 GPU 供应评论,而是当模型进入大规模部署、长上下文和 agent 推理阶段后,什么硬件瓶颈会真正限制能力与成本。
Goodwin 说 Fractile 创立于 2022 年夏天,公司从一开始就押注“速度”。他把当时的背景拆成两条趋势:foundation models 已经开始从互联网规模训练中跨任务泛化;同时,一些研究者意识到需要把更多计算注入 test time,让模型在推理阶段通过展开、搜索或更多思考产生更强能力。他借 AlphaGo 的例子说明:神经网络本身是一部分能力,但在测试时进行大规模 rollout 之后,系统能力会发生变化。Fractile 的使命,就是让巨大模型在推理时远快于今天的芯片,并且仍能支撑更大的模型和更长的上下文。
二、本期主要内容
这集节目围绕 Goodwin 如何判断 AI 推理芯片市场展开。主持人先让他解释 Fractile 在 GPU 与 AI 加速器格局中的位置,Goodwin 的回答并不是“市场上选择很多”这么简单。他认为当下 AI ASIC 表面繁荣,但许多平台其实结构相似:使用 HBM 或其他 DRAM,依赖 tensor core 做矩阵乘法,采用 TSMC 先进封装,并经常由 Broadcom 这类 ASIC house 承担后端交付。对他来说,真正稀缺的是能把架构意图一路推进到物理设计、工艺互动和封装选择的团队。
为了让非芯片行业听众理解这个判断,Goodwin 把芯片开发拆成几个层次。架构师要理解目标 workload,识别矩阵乘法这类占主要 FLOPs 的模式,并设计 tensor core 等专用电路;前端设计团队把这种意图降低成 RTL 或电路级逻辑描述;后端再把逻辑综合、布局布线,最终生成交给 TSMC 的 GDSII 文件,其中包含金属层和晶体管的具体位置。传统模式中,很多公司在前端之后把实现交给外部伙伴,因此从 workload 判断到物理实现之间存在交接损耗。
Fractile 的组织答案,是尽量把这条链路放在公司内部。Goodwin 说 Fractile 约 150 人,团队覆盖深度 workload 理解、前端设计、物理设计、后端实现和先进封装。每个环节都很“瘦”,但这种结构让公司能形成更快的闭环。他强调,AI 芯片比过往芯片类别更需要追逐 workload 的尾巴,因为模型架构、attention 机制、MoE 稀疏度和部署形态会快速变化。芯片公司既要有技术判断,也要承认其中有运气成分;组织结构则要允许它在正确判断出现时迅速行动。
节目后半段转向 Fractile 的核心技术赌注。Goodwin 说,公司早期曾做过类似 Groq 或 Cerebras 的 SRAM 路线,因为 SRAM 与逻辑位于同一硅片,能为模型权重和 KV cache 提供极高带宽,语言模型速度可以达到每秒数千 token。但到 2023 年末和 2024 年,Fractile 开始担心 SRAM 的容量可扩展性。AI 增长不只体现在参数量,也体现在上下文长度;如果高速芯片不能跑长上下文 attention,还要切回 GPU,就会在最需要速度的地方失去价值。
因此,Goodwin 把 Fractile 当前方向描述为更高带宽的高容量 DRAM 路线:公司与内存供应商和逻辑代工伙伴合作,试图从较低成本 DRAM 中获得远高于传统方案的带宽。他说 Fractile 正在组装的平台计划在“明年下半年”爬坡,目标是结合 GPU/TPU 上 DRAM 的容量经济性,以及 Groq/Cerebras 类快推理芯片的速度优势。这个时间说法是 Goodwin 在节目中的路线描述,不应被读成已经独立验证的市场交付事实。
三、核心观点:推理、例子与边界
Goodwin 最重要的判断是,推理不是训练结束后的轻量收尾,而是模型每次部署都要支付的真实边际成本。他特别指出,marginal cost 容易被误听成“小成本”,但在模型服务中,它指的是每次向用户运行模型时都要重新承担的成本。这个判断把芯片竞争的重心从“谁能训练最大模型”推向“谁能在部署时代以更低成本、更高速度运行巨大模型”。当模型能力越来越依赖 test-time compute,推理芯片的速度就不只是体验优化,而会影响服务规模、产品形态,以及能否把更多计算放进每一次回答。
这也是他反复回到内存带宽的原因。Goodwin 认为,当前 LLM 在生成文本时通常仍是自回归、低 batch 的形态,吞吐效率、服务成本和响应速度之间存在基本权衡。在这种场景中,计算单元本身不是唯一瓶颈;模型权重、KV cache、状态和长上下文都要被高频读取。Goodwin 说,在数据中心规模服务大量用户时,经济性会坍缩到内存每 GB 成本。背后的推理链条很直接:如果推理每次都要反复访问大量模型状态,那么内存容量、带宽和单位容量成本会共同决定芯片能否真正降低部署成本,而不只是峰值 FLOPs 是否好看。
SRAM 路线在这个框架下既有吸引力,也有明确局限。Goodwin 承认,SRAM 与逻辑位于同一片硅上,能提供极高带宽,并支持语言模型达到每秒数千 token 的速度。但 Fractile 看到的问题是容量:模型参数增长是一条压力线,长上下文是另一条压力线。长运行 agent 往往需要更多上下文、更多状态和更多中间推理步骤。如果高速芯片不能承载长上下文 attention,而是在关键阶段回退到 GPU,那么“快”就只覆盖了问题的一部分。这个限制也说明,Goodwin 对 SRAM 的批评不是否认它的速度,而是认为速度必须和可扩展容量同时成立。
Goodwin 对“快”的定义也很克制。他不把主要价值放在更顺滑的聊天机器人上,而是放在长运行 agent 与复杂推理任务上。普通 chatbot 响应更快当然有产品价值,但他认为真正的能力边界变化,来自多万亿参数模型能够在同样墙钟时间内生成更多 reasoning tokens、尝试更多计划,并在昂贵实验或行动之前进行更充分的思考。这个逻辑贯穿节目:从 AlphaGo 式 rollout,到芯片设计中在发起昂贵实验前做更多推理,再到 frontier labs 需要在最短时间内完成最多 reasoning。推理速度因此被他视为能力放大器,而不是单纯的延迟指标。
不过,Goodwin 没有把快速迭代神化成“软件速度会完全吞掉硬件世界”。他认为 AI-forward chip design 可以缩短前端设计,把架构师意图更快推向 GDSII 原型,甚至可能在未来几年出现端到端原型能力;但他同时列出硬约束:foundry 从送片到拿回芯片,即使在 hot-lot 场景下也需要三到五个月;place-and-route 等传统算法流程可能连续运行数天;DRC/LVS 这类最终 signoff 仍依赖长期积累的工具和 foundry 规则;芯片进入数据中心还受安装延迟、功耗和供应链限制。更重要的是,硬件通常需要三到五年的摊销窗口。因此,他不相信芯片公司会每几周量产一颗全新芯片。
这个限制并不削弱他的迭代观点,反而定义了它的真实含义。Goodwin 所说的敏捷,不是频繁流片本身,而是缩短从观察 workload 变化,到形成架构押注,再到决定哪一个 flagship 平台值得 ramp 的延迟。Fractile 现在还在努力做一颗芯片,而 Goodwin 对比说,Nvidia 系统里可能有六到九颗 Nvidia 自研定制芯片协同工作。由此他提出 rolling frontier of bets:如果 AI 提升工程生产力,芯片公司可以同时保留更多深度对齐的架构押注,等正确平台出现时触发爬坡。节目开头和中段都出现的三到六个月领先,并不是经独立测量的行业定律,而是 Goodwin 对部署竞争窗口的判断。
在模型架构上,Goodwin 的观点更像“双向塑造”。一方面,新芯片必须服务今天在 HBM GPU 或 XPU 上训练出来的自回归 MoE transformer;这就是 hardware lottery 的现实,模型生态会围绕现有硬件形成惯性。另一方面,如果 Fractile 真能实现他所说每芯片约 25 倍于 HBM-based chip 的带宽,就可能探索新的 bandwidth scaling laws。他举 MoE 为例:更稀疏的专家激活理论上可以在同等智能水平下节省大量 FLOPs,但今天在 HBM GPU/XPU 上会因带宽瓶颈导致低 MFU、低 FLOPs 利用率。attention 也类似,一些形式更省带宽但更耗 FLOPs;当带宽前沿被推进,就可能用带宽换 FLOPs,从而放大全局模型吞吐。
市场结构部分,Goodwin 的判断有两个层次。第一,大规模部署者会继续使用尽可能多的平台,因为 compute 对它们近乎具有生存性重要性,供应多样性、议价能力、总产能和控制权都很关键。他也承认,一些一方芯片努力可能在架构上与 Nvidia/AMD 或其他 ASIC 相似,因此部分作用是增强对 Nvidia 的价格谈判。第二,如果某类芯片真的带来新能力,例如让 frontier models 以数量级更快速度运行,那么前沿实验室会需要某种解决方案,因为它们追求的正是 premium frontier intelligence。
Goodwin 对前沿实验室的硬件战略风险尤其明确。他认为实验室真正竞争的是模型层。如果 Lab One 全押一种内部 proprietary silicon,而 Lab Two 发现某种只适配另一平台的计算效率突破,Lab One 可能要等九个月部署足够芯片才能追上,并在这个窗口里面临生死风险。这个例子是 Goodwin 的假设场景,不是已经发生的事实;它的价值在于揭示不确定性:当模型突破和硬件平台适配发生耦合时,过度差异化的芯片路线会让实验室暴露在竞争对手的模型创新之下。边界也很清楚:他不是说内部芯片没有价值,而是说在前沿模型竞争中,把芯片层做成孤岛式全押,风险可能大于收益。
四、学习与应用
从这集访谈中最实用的学习,是用“内存系统”而不只是“算力”来评估 AI 推理基础设施。看一颗芯片或一套平台时,不能只问峰值 FLOPs、制程节点和价格,还要问它如何反复读取模型权重、KV cache、状态和长上下文;在低 batch、自回归生成中,带宽、容量和每 GB 成本可能比算力宣传更接近真实瓶颈。对于采购、基础设施规划或模型部署团队,这意味着评估标准要覆盖单位 token 成本、长上下文性能、服务并发、回退路径和内存容量经济性。
第二个应用,是区分 SRAM、DRAM/HBM 与“高带宽高容量 DRAM”这类混合目标的取舍。SRAM 的优势是带宽极高,适合解释为什么某些快推理芯片能给出惊人的 token/s;但它的容量限制会在多万亿参数、长上下文和 agent workload 中暴露。DRAM/HBM 的容量和经济性更好,但传统形态带宽不足。Goodwin 所描述的 Fractile 方案,价值正在于试图同时拿到容量经济性和极高带宽。实际使用时,边界条件很重要:如果应用是短上下文、高重复、对响应速度极敏感的任务,SRAM 类方案可能有明显吸引力;如果应用依赖长上下文、持续状态和复杂 agent 轨迹,则容量和回退成本必须被一起计算。
第三个应用,是把模型架构和硬件看成共同演化,而不是单向适配。今天的芯片必须跑好现有 autoregressive MoE transformer,因为这些模型大多围绕 HBM GPU/XPU 训练和优化;但新的带宽边界也可能改变未来可行的模型形态。团队在做 MoE 稀疏度、attention 机制或长运行 agent 设计时,应当明确自己是在为现有硬件优化,还是在为未来硬件能力下注。前者风险低、可落地快;后者可能带来更大效率跃迁,但需要设计伙伴、芯片路线和部署窗口配合。
第四个应用,是理解“AI 加速芯片设计”的真实边界。Goodwin 的说法适合用 Amdahl 定律类比:AI 可以让思考、架构探索、代码生成和近似迭代更快,但未必消除最慢的物理与验证环节。place-and-route 仍可能跑数天,DRC/LVS signoff 仍要符合 foundry 规则,晶圆制造周期、数据中心安装、功耗和摊销周期都不会因为前端设计变快而消失。因此,芯片公司或硬件采购方不应把“更快设计”理解为每几周换一代硬件,而应把它理解为更早发现正确押注、更快淘汰错误押注,并在 volume ramp 前形成更高质量的候选平台。
第五个应用面向前沿实验室和 hyperscaler 的战略选择。供应多样性不是简单的采购偏好,而是 compute 成为战略资源后的风险管理。使用 Nvidia、AMD、自研芯片和新加速器,可以带来产能弹性、议价空间和获取新能力的机会。但 Goodwin 的警告也提示了边界:如果一个前沿实验室把全部模型路线绑定到高度差异化的内部芯片,它可能在竞争对手发现另一平台上的效率突破时被锁住。更稳健的策略可能是在模型层保持差异化,在芯片层维持足够兼容、或至少不孤岛化的部署选项。
最后,对创业公司和技术组织而言,这集访谈提供了一个组织设计原则:全栈不是为了展示覆盖面,而是为了缩短关键反馈环。Fractile 约 150 人却覆盖 workload、front-end、physical design、backend 和 packaging,是为了把模型变化、客户需求、架构选择和物理实现放进同一个闭环。这个原则的适用条件是问题本身变化快、交接损耗高、架构押注会影响一两年后的量产结果;代价是组织要承担更多复杂度,并且每个环节都可能资源偏紧。换句话说,全栈能力只有在它能提高押注质量和迭代速度时才有意义,不是每家公司都应该复制。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment