为什么 AlphaFold 没有“终结”蛋白质折叠问题:Pushmeet Kohli 与 Sal Candido 谈生物 AI 的数据、模型与可信边界
这期 Latent Space 并不是否定 AlphaFold,而是拆解一个被传播压缩后的判断:结构预测的巨大成功,不等于蛋白质动力学、功能、设计和临床级生物建模已经完成。Pushmeet Kohli 从 Google DeepMind 的 AlphaFold 经验出发,强调科学问题应先于模型或数据立场;Sal Candido 则从 Biohub 的开放数据与蛋白语言模型实践出发,说明“更多数据”只有在包含目标问题所需信息时才真正有用。
一、嘉宾背景
这期节目来自 Latent Space: The AI Engineer Podcast,由 Alessio Fanelli 和 Shawn swyx Wang 主持。标题直接提出一个容易被误读的问题:为什么 AlphaFold 没有解决蛋白质折叠。节目由 Latent Space 于 2026-10-10 上传,时长 1,961 秒,略超过 32 分钟。它不是一场超长访谈,但信息密度很高,讨论对象也很明确:主持人与两位嘉宾围绕 AlphaFold 的边界、生物 AI 的数据扩展、模型架构、可解释性和药物发现转化展开分析。
嘉宾是 Pushmeet Kohli 和 Sal Candido。证据材料只支持将 Pushmeet 标注为 Google DeepMind 的嘉宾、Sal 标注为 Biohub 的嘉宾;因此本文不额外添加他们的履历、职位头衔或外部成就。可以确定的是,Google DeepMind 在对话中与 AlphaFold 和 AI 建模紧密相关,Biohub 则被描述为以开放方式与社区共同推进生物数据和建模。两人的互补性构成了节目的主线:Pushmeet 更多从 AlphaFold、建模策略和科学问题定义出发,Sal 更多从 Biohub、蛋白语言模型、数据质量和开放协作出发。
这期节目的价值在于,它没有把“AI 改变生物学”讲成单一路线图。两位嘉宾反复把问题拉回可验证的任务边界:AlphaFold 学到的是什么,PDB 这类历史结构数据能够支持什么,宏基因组序列这类并不完美的数据为什么仍可能有价值,什么时候科学先验能提高效率,什么时候先验又可能成为限制。
二、本期主要内容
节目一开始就处理了标题里的张力:大众叙事常把 AlphaFold 讲成蛋白质折叠问题已经解决,但 Pushmeet Kohli 的说法更窄,也更精确。他承认,从概念层面看,这个领域确实取得了重大进展;但他同时强调,科学家并不知道蛋白质真正采取的基态,也不知道结构分布的完整形态。AlphaFold 更像是在复现实验人员已经得到并存入 PDB 的结构。这个任务极其有用,却不能等同于理解全部蛋白质动力学。
随后,主持人把话题转向“数据版苦涩教训”。Sal Candido 的回答并不是简单的数据崇拜。他说,确实需要正确的数据,但 scaling law 并不会天然存在于每一个问题中。许多工作本身就是在寻找这样的情形:当投入更多计算、更多数据和合适架构时,结果是否会稳定改善。一旦找到这种关系,问题才会变成可以持续推进的工程问题;如果数据里根本没有目标问题所需的信息统计,模型就无法凭空长出相应能力。
对话中很关键的一段,是 Sal 用蛋白语言模型解释“脏数据”和“好数据”的差别。他说,训练蛋白语言模型时会用到宏基因组序列。这些序列并不总是最高质量,其中很多甚至未必是完整真实蛋白;但它们仍能提升模型在真实蛋白设计和理解上的表现。这并不意味着越容易获得的数据越值得扩张,而是提醒团队继续追问:为了解决目标问题,究竟缺少哪类信息?Biohub 被他描述为希望通过开放工作连接模型构建者和数据生成者,从而避免只追逐现成数据或易生成数据。
Pushmeet 则把苦涩教训转化为一种研究方法论。他认为,问题应当先于身份,不应先把自己规定成“模型人”或“数据生成者”。如果问题需要建模,就投入建模;需要采集数据,就采集数据;需要领域专家知识,也必须纳入。AlphaFold 在 PDB 上的选择,就是这一原则的例子:既有结构数据来自全球长期投资,DeepMind 无法把 PDB 直接扩张一个数量级,于是合理路径是通过更强建模,从现有数据中提取最大价值。但在细胞基因组学和 virtual cell 方向,同样的团队发现 cell-by-gene 数据还不足以支撑宏大目标,瓶颈就转向了数据。
三、核心观点:推理、例子与边界
这期节目最重要的判断,是把“成功”和“终局”分开。Pushmeet 并不否认 AlphaFold 带来的进步;他承认,从概念层面看,蛋白质折叠研究已经取得重大进展。但他的边界划得很清楚:如果模型主要是在复现某个实验团队获得并存入 PDB 的结构,那么它完成的是一个极有价值、但仍由既有数据定义的任务。蛋白质并不是静态积木。它们可能无序,也可能随上下文改变形状。因此,“预测一个与实验沉积结构一致的构象”和“理解真实基态、完整结构分布、动力学、功能与设计”之间仍有距离。这个限制不是措辞上的谨慎,而是决定后续研究应投向哪里的关键边界。
第二个核心观点,是数据规模必须和信息内容绑定。Sal 对 scaling law 的解释给出了一条因果链:只有当数据、计算和架构共同形成可扩展关系时,更多投入才会稳定转化为更好结果;如果数据本身缺少目标问题所需的信息统计,模型只能抽取并泛化已有信号,不能凭空获得理解。宏基因组序列的例子让这个判断更具体:低质量或不完整数据并非一定无用,因为其中可能包含进化和蛋白相关信号;但如果团队因此只扩张容易得到的数据,就可能偏离真正要解决的问题。节目没有把不同生物问题对应的数据类型整理成操作清单,它给出的是判断原则,而不是完整的数据战略。
第三个观点,是模型派与数据派的对立会误导科学工作。Pushmeet 认为,苦涩教训的重点不是选择阵营,而是避免把自己宗教式地固定为“模型人”或“数据生成者”。问题应当排在身份之前:科学目标需要建模,就投入建模;需要采集数据,就采集数据;需要计算扩展和领域知识,也要纳入。AlphaFold 面对 PDB 时,合理策略是强化模型,因为 DeepMind 不能简单地把 PDB 扩张一个数量级;而在 cell genomics 和 virtual cell 的方向上,围绕 cell-by-gene 数据的工作又显示,数据本身可能还不足以支撑宏大目标。同一个组织、同一种 AI 能力,在不同科学问题上也可能需要完全不同的资源配置。把“多做模型”或“多采数据”当成通用答案,都会遮蔽真正的约束。
第四个观点,是科学先验和规模化并不是对立面。Pushmeet 认为,AlphaFold2 的设计编码了来自生物物理和生物化学的科学直觉,尤其是氨基酸残基之间的相互作用,这让模型更具数据效率。Sal 补充说,在小数据场景下,归纳偏置确实有帮助;但随着数据增多,模型也可能发现人类没有预设过的规律,而错误先验反而会限制模型。节目因此没有得出“手工设计已死”或“通用模型必胜”的简单结论。它指出的是更难的现实:规模化本身也是一项工程,需要算法、基础设施、推理效率、transformer 修改,以及更适合具体任务的架构。
第五个观点围绕可解释性和可信使用展开。Sal 认为,黑箱设计并不是 AI 时代才出现;黑箱结果可以有用,但科学家仍然想知道模型学到了什么。他提到,蛋白语言模型内部不只包含结构信息,也能发现功能和运动信息。Pushmeet 则把可解释性拆成两层:人类能否理解模型内部机制是一回事,用户能否知道模型能做什么、不能做什么、何时可信,是另一回事。他用 AlphaFold2 的 pLDDT 校准说明这一点:即便整体指标很高,如果置信度没有校准,一个自信但错误的答案也可能让研究者浪费一年。节目没有证明未来大模型一定能解释 AlphaFold;Pushmeet 提出的是一种可能性:如果未来更大的模型能读取激活层,也许能形成关于 AlphaFold 行为的理论。
最后,临床转化被重新表述为“哪个环节会产生数量级加速”。Pushmeet 认为,问 AI 何时进入诊所并不精确,因为 AI 已经被用于药物发现流程的多个环节。更有意义的问题是,它何时能在靶点发现、lead optimization、临床前研究或毒理等具体阶段带来 10x 或 100x 的时间线加速。Sal 对“完全由 AI 制造的药物”也保持谨慎,说很难判断具体时间,但工具正在被使用,快速进展值得期待;同时,基础研究和基础理解仍不可替代。这个判断避开了倒计时式预测,把不确定性放回到具体生物模型和基础研究难题中。
四、学习与应用
对 AI 工程师和生物 AI 团队来说,第一条应用是给任务边界命名。使用 AlphaFold 或类似结构模型时,不应把“能预测与实验结构一致的构象”自动扩展为“理解蛋白质的全部动态”。更合适的用法,是把它作为强大的结构假设生成器和实验辅助工具;需要谨慎的地方,是当问题涉及无序区域、上下文依赖构象、功能机制或动态分布时,应明确模型输出只是决策证据的一部分,而不是终局答案。
第二条应用是先写清目标问题,再分配数据、模型、计算和专家资源。Pushmeet 的例子说明,在 PDB 场景下继续强化建模可能是高杠杆选择,因为数据难以数量级扩张;但在 cell genomics 或 virtual cell 场景下,数据不足可能才是瓶颈。团队立项时可以把问题拆成几项检查:目标输出是什么,现有数据是否含有足够信息统计,扩张数据是否带来新的覆盖度,模型架构是否能利用这些信息,失败后多快能发现路径不可行。这比先决定“我们要做大模型”或“我们要建数据工厂”更稳。
第三条应用是重新理解数据质量。宏基因组序列的例子表明,不完美数据可能携带有价值信号;因此不能机械地把“干净”当成唯一标准。但反过来,也不能从“脏数据有用”推导出“所有易得数据都值得无限扩张”。实际边界在于信息增量:新数据是否覆盖了模型当前盲区,是否帮助解决目标问题,是否只是复制已有分布。对产品或平台团队而言,这意味着数据路线图应按问题覆盖和实验反馈排序,而不是只按样本数量排序。
第四条应用是把科学先验当成可审计的设计选择。在小数据或昂贵数据场景中,生物物理、生物化学、结构约束和已知相互作用可能显著提高数据效率;但随着数据规模和任务范围变化,原有归纳偏置也需要被重新测试。工程上可以把先验写入模型假设、评估集和消融实验,而不是把它们变成不可质疑的传统。这样既能利用领域知识,也能在先验开始限制模型时及时发现。
第五条应用是把可信性做成使用条件,而不是事后解释。Pushmeet 对 pLDDT 和不确定性校准的强调尤其实际:科研用户需要知道模型何时可靠、何时不可靠、错误可能在哪里造成最大代价。对于会影响实验资源、候选分子筛选或药物发现决策的系统,输出置信度、适用范围、失败模式和行为测试,比单纯追求平均指标更接近真实价值。边界也很清楚:没有行为刻画的高性能模型可能帮助很大,也可能因为自信错误而造成很大损失。
最后,临床和药物发现团队可以用“10x 问题”迫使自己回到第一性原理。Sal 并没有否定 10% 改进;他说两种路径都有价值。但如果目标是治愈疾病或重塑药物发现时间线,只做局部优化可能看不到新路径。更可操作的做法,是同时维护两张路线图:一张服务近期流程改进,另一张追问哪些生物模型、数据生成、实验闭环或基础理解能带来数量级加速。这里必须保留现实边界:节目没有给出 AI 药物进入临床的确定日期,也没有证明某一环节必然被加速;它提供的是应该追问什么、如何避免被口号带偏。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment