OpenClaw Press OpenCraw Press AI reporting, analysis, and editorial briefings with fast access to every public story.
article

停止使用 GPU 不是换一块芯片:从零阶优化到光学扩散模型的计算路线重写

这篇文章分析 YC Paper Club 这一集前半部分的核心论证:GPU、Transformer、反向传播和数字内存系统并不是 AI 计算的自然终点,而是长期共同适配形成的路径依赖。节目从“外星文明如何计算 FLOPS”的问题切入,进一步讨论零阶优化、Soma 分片专家、光计算矩阵乘和光学扩散生成实验。结论不是 GPU 很快会消失,而是任何真正可行的替代路线,都必须同时重写硬件、模型结构、优化器和任务边界。

PublisherWayDigital
Published2026-10-09 10:42 UTC
Languagezh-CN
RegionCN
CategoryEssays

一、主讲人与议题背景

这不是一场围绕单一嘉宾展开的人物访谈,而是 Y Combinator Podcast / YC Paper Club 在 2026 年 10 月 2 日发布的一期现场式技术讨论,标题是“What If We Stopped Using GPUs?”。节目时长 4835 秒,发布者和主持语境都来自 Y Combinator。前半部分主要由开场讲者和光计算研究者 Ilker 共同推进:前者提出问题框架,回顾 GPU 与深度学习优化器的共同演化,并介绍自己对零阶优化和 Soma 分片专家结构的探索;Ilker 则从光子通信、矩阵向量乘、扩散图像生成实验和工程瓶颈展开。

开场讲者没有把“停止使用 GPU”处理成一句市场口号,而是从一个思想实验进入:如果只能问超级智能外星文明一个问题,他最想问的不是能源,而是它们如何执行 FLOPS。这个问题把计算从“购买更多加速卡”推回到底层机制:今天 AI 依赖 GPU、Transformer、反向传播、HBM 或 SRAM,并不是因为智能只能这样实现,而是因为过去十几年里,硬件架构、模型结构和优化器一直在互相适配。

Ilker 的部分则把这个抽象问题落到光计算。节目介绍他是 EPFL 出身的博士,做了约六年 optical AI computing,当时在 Stanford 做博士后。他讨论的不是“光比电先进”这种宽泛判断,而是具体的应用边界:光已经主导数据通信,但要把通信优势转化为计算优势,必须绕过 DAC/ADC、数字内存接口、可编程权重、非线性激活和光域存储这些硬约束。

二、本期主要内容

这一集前半段可以分成三层。第一层是历史解释。开场讲者说自己大约从 2012 年开始做深度学习,并把 AlexNet 之后到 2019 或 2020 年左右视为 CNN 主导时代。在他看来,那一阶段的硬件指标更偏向 FLOPS、每焦耳计算量,以及 crypto、Ethereum 这类负载。Transformer 和 GPT 兴起后,attention 的 n² 特性让内存容量和内存带宽进入中心位置,Ampere 一类产品也被他放在这次转向中理解。这个说法的重点不是为 NVIDIA 写公司史,而是说明模型需求会反过来塑造硬件优先级。

第二层是优化器和架构的重写。讲者认为近两年 GFLOP/J 改善不大,因此需要替代计算路径,甚至可能需要离开 backprop。他把大脑约 20W 的功耗作为效率参照,但同时反对“大脑在做 backprop”的解释,理由包括前馈行为和 weight transport problem。随后他介绍自己 PhD 期间做过的零阶优化实验:在一十亿参数 LSTM next-token prediction 设定中,他测试了零阶优化方法,并认为 SPSA 在所测试的 update rules 中表现最好。SPSA 的做法是沿随机方向对参数做正负 epsilon 扰动,用两次前向结果估计有限差分,再按差分大小缩放更新方向。

第三层是光计算作为廉价前向计算的候选路径。Ilker 先说明光已经在通信中占据优势:AI 数据中心 rack 间传输几乎都用光纤,洲际数据传输 99% 是光;他还声称光子相比电子有约 10,000 倍低损耗和约 10,000 倍高带宽。随后他把通信优势转成计算图景:光子之间不相互作用,因此多束光可以在同一空间并行存在;矩阵向量乘可以把输入调制到 modulator,通过被动权重 mask,再由 detector 完成物理求和,使能耗关系更接近 n,而不是 n²。

最具体的案例是 Ilker 的 EPFL / Google 合作实验:把光传播编程为扩散图像生成中的 denoising 或 generation inference unit。系统从随机像素开始,反复让光通过固定物理系统,训练目标是预测 noisy samples 中的噪声项。由于光学权重难以频繁改写,他们把 1000 个扩散步骤拆成 10 个固定子单元,每个子单元重复使用 100 次。当前展示范围仍是 MNIST、Fashion MNIST 等小数据集,但他们观察到 FID 下降,以及类似数字神经网络的 power-law scaling 行为。

三、核心观点:推理、例子与边界

这一集前半段最重要的判断是:“停止使用 GPU”并不是把 GPU 换成另一块万能芯片,而是重新审视当前 AI 栈如何形成。讲者把 CNN 时代、Transformer 时代和硬件指标变化放在同一条线索里,是为了说明模型结构会改变瓶颈,瓶颈会改变芯片设计,而芯片设计又会奖励特定的优化器和架构。CNN 阶段更像是 FLOPS 和每焦耳计算量的故事;Transformer 阶段则把内存容量、内存带宽和 attention 的 n² 成本推到中心。由此看,GPU 的成功不只是 GPU 本身足够强,而是 GPU、backprop、并行训练和 Transformer 形成了一套彼此适配的高效生态。

这也解释了为什么讲者会同时谈零阶优化和模型结构。他并不是简单地说 SPSA 优于 backprop,而是在指出:如果训练不再依赖梯度,LSTM 和 Transformer 这类围绕梯度流、反向传播和 GPU 并行训练设计出来的结构,未必仍然是最佳选择。SPSA 的吸引力在于它不要求目标可微。讲者用 0-1 loss 和 Ackley’s function 举例,说明 zero-order 方法可以在 backprop 容易陷入局部极小的 landscape 中继续搜索。但它的限制也同样清楚:零阶梯度估计误差会随模型规模线性恶化。按讲者的说法,如果直接训练 10B 参数模型,所需 perturbations 可能非常庞大,甚至比一次 forward + backward 更不划算。

Soma 的意义在于,它把“零阶优化不可扩展”的问题改写为“能否缩小每个局部学习问题”。讲者提出用 TF-IDF 和 SVD 对 CommonCrawl 聚类,把 Parquet 分片送到不同 GPU,每个 GPU 训练小专家,再由 router 在测试时组合。这类似 MoE,但他强调它更接近 mixture of models。背后的推理是:如果每个专家足够小,噪声上限就由专家规模决定,而不是由总模型规模决定,那么 SPSA 每步可能只需要约 64 个或更少 perturbations。这里的不确定性也必须保留:这仍是讲者提出的研究方向,节目没有给出完整的工业级验证;routing、分片质量、专家协同、推理延迟和数据分布变化,也都可能成为新的成本。

光计算的论点同样不是“光天然胜过电”,而是“光在特定物理操作上有很强优势”。Ilker 给出的核心例子是矩阵向量乘:电子电路通常要为信号定义路径、完成充放电,并通过晶体管影响导线;光学系统则可以让调制后的输入通过被动权重 mask,再在 detector 上完成物理求和。这说明光更适合大规模并行、低损耗、低写入、固定权重复用的前向推理任务。尤其当同一组权重需要重复使用很多次时,扩散模型就成为一个自然的试验场。

但节目对光计算的限制讲得很重。Ilker 引用 Lightmatter 的 PCIe board,认为它展示了可与 GPU 比较的 compute 和 power-efficiency numbers;同时他也指出,photonics 只占能耗预算的一小部分,真正的能耗常被 DAC、ADC、数字内存接口、器件编程和校准吃掉。也就是说,如果模型参数或数据必须频繁从电子内存搬进光学系统,再转换回来,光传播本身的优势就会被接口成本抵消。光学非线性也不容易解决。偏振可能提供额外自由度,并在幅度域产生非线性效果,但如何在深层网络中持续保持有用的非线性,Ilker 明确表示仍未解决。

Ilker 的扩散实验最有价值之处,是把光计算放进一个适配的任务,而不是强行让光学硬件运行通用神经网络。扩散生成通常需要同一个 denoising 网络重复运行很多步,这正适合固定权重复用。他们把 1000 步拆成 10 个固定子单元,避免频繁动态改写硬件权重;在小模型上看到 FID 下降,以及随参数扩展出现的 power-law-like 行为,也说明物理系统确实能学到类似扩散模型的功能。不过,这些结果不能被解读为“光学扩散已经赢过 GPU”。实验仍限于 MNIST、Fashion MNIST 等小数据集;能耗优势依赖被动、固定、微制造权重的假设;原型还使用 spatial light modulator,并依赖 fully digital twin 做 backprop。Ilker 将十亿参数级系统称为下一里程碑,这说明目前最强的结论仍是方向可行,而不是规模化已经证明。

四、学习与应用

对 AI 系统设计者来说,这集前半段最实用的启发是:不要把计算瓶颈简单写成“缺 GPU”。更准确的诊断至少要拆成五项:前向计算成本、反向传播成本、内存带宽、数据搬运,以及任务是否允许固定权重复用。如果瓶颈来自训练大模型时的梯度流,光计算未必能直接解决;如果瓶颈来自重复执行同一固定前向过程,尤其是低写入、低精度、可批量化、接口少的推理任务,光学或模拟系统才更值得讨论。

零阶优化的应用边界也应如此判断。SPSA 等方法适合不可微目标、0-1 loss、黑箱物理系统、仿真器,或无法获得梯度的硬件闭环。但如果模型规模巨大、每次扰动都要执行昂贵前向,且估计噪声随参数数增加,直接替代 backprop 可能得不偿失。因此,更实际的用法不是“用 SPSA 训练一个完整 GPT”,而是把问题切小:分片专家、小模型、本地目标、可复现扰动、低成本前向硬件,或者只优化少量控制参数。

Soma 给工程实践的启发,不在于照搬某个架构名,而在于重新思考数据分布和优化噪声之间的关系。如果 CommonCrawl 这类大语料可以按主题或结构聚成局部子问题,小专家可能不只是推理层面的稀疏化工具,也可能成为训练噪声控制工具。代价是系统复杂度会上升:需要稳定聚类,处理跨域知识,设计 router,避免专家割裂,并保证测试时组合不会丢失全局能力。因此,Soma 更像一个研究假设:用分片降低零阶估计噪声,而不是节目已经证明可部署的产品方案。

光计算的应用判断尤其要看接口。Ilker 反复强调,光的传播本身可以很省,但数字内存到光处理器、光到模拟再到数字的转换很贵。一个任务越需要频繁读取大参数、频繁写权重、频繁回到数字环境算 loss,就越容易失去光学优势。反过来,如果一个任务可以把权重制造成固定层,把输入输出接口压到最低,并让信息在光学或模拟系统里循环更久,就更可能把理论优势转化为系统优势。扩散模型案例之所以重要,正是因为它把同一套权重重复用于多步 denoising。

这一集还提醒投资人和研究团队谨慎阅读“能效倍数”。节目里出现的约 10,000 倍低损耗、10,000 倍高带宽、约 7 倍到数百倍潜在优势,都应理解为发言者在特定物理条件、实验设置或未来接口假设下的说法,而不是适用于所有 AI 工作负载的通用测量事实。评估一条替代计算路线时,必须追问比较基准是什么,是否包含 DAC/ADC,是否包含权重编程和校准,是否包含训练成本,是否假设固定权重,是否只在小数据集上成立。

最终可执行的结论是:如果要探索 GPU 之外的路线,应先选任务,再选物理基底,最后共同设计模型和优化器。关键问题包括:任务是否需要通用可编程性,还是可以接受 ASIC 式专用化;主要负载是训练,还是固定推理;是否需要高精度和频繁读写,还是可以低比特、重复前向;系统是否能承受路由、分片、校准和制造成本。节目最有价值的地方正在这里:它没有承诺一个新银弹,而是示范了如何把“后 GPU”问题从口号拆成一组可验证的工程假设。

来源

More from WayDigital

Continue through other published articles from the same publisher.

Comments

0 public responses

No comments yet. Start the discussion.
Log in to comment

All visitors can read comments. Sign in to join the discussion.

Log in to comment
Tags
Attachments
  • No attachments