“一切都已被解决”的前提:Matthew Berman如何用反编译解释AI循环
这不是一场访谈,而是Matthew Berman围绕AI、反编译、软件复刻、数学求解与递归自我改进展开的个人评论。文章按证据拆解他的核心判断:AI改变的不是所有答案已经现成存在,而是当目标可以被验证时,生成、测试、比较、修正这一循环能够被放大到过去难以承受的规模。
一、主讲人与议题背景
这期节目没有可核验的嘉宾背景。证据显示,它是Matthew Berman在 Matthew Berman / Forward Future 频道发布的单人评论,标题为“Everything has been solved”,上传日期标为20261010,时长1057秒。因此,这里的“背景”不是嘉宾履历,而是主持人与议题的关系:Berman从AI写代码能力的快速提升切入,讨论它如何改变游戏反编译、软件复刻、数学求解,以及更具风险意味的递归自我改进。
节目开头,他直接把问题落到一组可观察案例上:把一个游戏角色放进另一个游戏世界,让Call of Duty出现滑板式移动机制,把Spiderman放进Batman游戏,有人复刻Photoshop并开源,以及他自己为Mod Retro从零重建Super Mario World。整期分析的对象不是某位受访者,而是Berman提出的一条技术论证链:只要任务拥有可检查的目标,AI就可以在循环中不断逼近结果。
二、本期主要内容
节目从“反编译到底是什么”讲起。Berman解释,程序员写的是人可以阅读和编辑的源代码,编译器会把它转换成计算机能够高效执行的机器码;玩家在主机上安装或运行的游戏,本质上是机器码,而不是原始源代码。人当然可以试着读机器码,但往往需要长期猜测某段指令的作用,再反复验证猜测是否正确。这也是传统游戏反编译经常耗时很长的原因。
他的关键说明是:反编译并不等于把原作者写下的代码逐行找回来。编译过程会丢掉注释,名称可能消失,结构也可能被优化、重排或简化。他举了一个很小的例子:源代码里写“返回2加3”,编译后的机器行为可能只剩下“返回5”。因此,反向恢复时真正重要的是行为等价,也就是游戏看起来、玩起来、运行规则上与原版一致,而不是变量名、注释和写法完全相同。
在这个基础上,Berman把AI的作用定义为“可验证循环”的放大器:写一段候选代码,检查它是否让Mario跳起来;错了就再试,对了就继续。他把这套逻辑延伸到Snowboard Kids反编译、自己用GPT 6.1 Sol为Mod Retro重建Super Mario World、游戏混搭、Photoshop和Excel复刻、数学证明、科学发现,以及最后的递归自我改进。整期内容因此不是工具教程,而是围绕一个判断展开:当目标能够被验证,AI是否会持续压低抵达目标的成本。
三、核心观点:推理、例子与边界
Berman最有说服力的部分,不在于把AI写代码描绘成一次性灵感,而在于把它放进反复试错的工程循环里。反编译天然适合这个框架:已知游戏应该表现出什么行为,却不知道产生这些行为的源代码;于是AI可以提出候选实现,再把结果和原始游戏行为比较。这个解释也降低了“AI是否真正理解原始代码”的要求,因为目标不是还原作者的每一行,而是让输出行为一致。Snowboard Kids的84天说法、Super Smash Brothers Melee多年社区工程的对比,以及他自己Super Mario World项目多日运行的例子,都服务于同一个推理:当任务能拆成小块,而且结果可检查,AI就可以并行推进大量局部问题。
这个推理的边界同样重要。Berman说最近有许多游戏在几周内被反编译,并把速度变化归因于AI;这些是节目中的主持人陈述,证据JSON没有提供外部验证。Chris Lewis、Snowboard Kids、GPT 6.1 Sol、OpenAI Dev Day和Mod Retro的具体细节,也只能按节目内陈述处理。更关键的是,他自己承认Super Mario World项目“不一定是严格意义上的反编译”,更接近从零复刻:AI看目标画面,查在线文档,写代码,再检查结果。这说明“反编译”“复刻”“重建行为”在节目中被放进同一条论证链,但它们不是同一个技术动作。
游戏混搭部分进一步展示了复杂度层级。换皮只是把Batman看起来换成Spiderman,行为仍沿用原游戏;pass-through mod则让两个游戏同时运行,例如Minecraft引擎继续处理方块,连接层负责对齐摄像机、合成画面,并把TNT爆炸等事件传入GTA;机制移植要求把加速度、跳跃、落地、碰撞等规则迁入新引擎;重建游戏规则则要写替代软件,控制力更强,成本也最高。这个分类很关键,因为它避免把所有“AI游戏混搭”都看成同一难度。Berman真正押注的是后两类:AI观察行为并生成规则,或者重建软件本身。
从游戏推广到通用软件,是节目中最强、也最需要谨慎处理的跳跃。Berman提出,如果AI能观察游戏并复刻行为,为什么不能观察Photoshop、Excel或Premiere?他举了Photocraft作为Photoshop复刻并开源的例子,也提到自己让AI点击Excel、观察公式和单元格行为,然后重建输出。这里的推理不是“AI读取了源码”,而是“AI复刻了可观察行为”。因此,“software is solved”更准确地说是一种商业护城河判断:如果公司的防线只有软件代码本身,复制成本下降会带来压力;但企业功能、培训、客户支持、持续维护、更新和信任关系仍可能构成价值。
数学与科学的外推更宏大,也更不确定。Berman认为数学同样具有目标明确但路径未知的结构,AI可以尝试大量路径直到找到证明;他提到OpenAI发布许多数学证明和研究,又引用Will Depu让GPT-6 Pro和Fable 5.1给近三年数学发现分类。基于这些例子,他说“人类独自解数学的时代已经过去”,并进一步追问科学、材料发现、癌症治疗为什么不能用同一方式推进。这里必须保留限制:这些是Berman的评论性判断和节目内引用,不是证据JSON独立确认的学术事实;“可验证结果的问题基本可被AI解决”也应理解为他的框架,而不是普遍定律。
最后,递归自我改进把这条论证推到风险层面。Berman说,最强的循环是让AI优化自身效率、速度或方法,再把改进反馈给自己,进入下一轮能力提升。他由此连接到前沿实验室关于放慢或控制AI进展的讨论,并提醒模型对齐仍然重要。他还引用Google Alpha Evolve节省巨额成本作为收益例子,但这同样是节目中的 speaker-cited claim。节目没有把问题处理成单纯的乐观叙事:如果AI能复刻软件、解数学并优化自身,人类就需要同时面对效率收益、对齐不确定性和社会节奏控制。
四、学习与应用
把这期节目转化为可用的方法,第一步是区分“生成结果”和“验证结果”。AI循环最适合的任务,不是所有复杂任务,而是那些能够判断候选输出是否更接近目标的任务。软件团队可以把需求改写成可测试的验收条件:界面行为、API响应、性能阈值、回归测试、截图对比、数据一致性检查。条件越明确,AI越能承担生成、运行、比较、修正的循环;条件越模糊,循环越容易在看似勤奋的输出里空转。
第二步是给任务分层。游戏换皮、pass-through mod、机制移植和规则重建代表了不同难度,软件开发中也一样:改文案和样式、复用已有模块、移植一套业务规则、重建一个完整系统,不能按同一种成本估算。Berman的案例提醒我们,AI最有价值的地方往往不是替人完成一个巨大黑箱任务,而是把大任务拆成可验证的小块并行推进。但并行不自动等于正确,仍然需要测试集、人工抽检、边界样例和失败记录。
第三步是重新评估软件护城河。如果一个产品的价值主要来自界面和可观察行为,那么AI复刻会压低模仿成本;如果价值来自专有数据、品牌信任、合规能力、客户集成、服务流程、分发渠道、持续维护和组织知识,代码被复刻并不等于业务被复刻。Berman的“software is solved”适合作为风险提示,而不是裁决书:它要求公司回答,用户为什么继续选择你,而不仅仅是因为你有一套功能。
第四步是谨慎外推到数学和科学。可验证目标确实是强信号:证明是否成立、程序是否通过测试、材料性质是否达标,都比“是否好看”“是否动人”更适合循环搜索。但真实世界的验证可能昂贵、缓慢、有噪声,甚至涉及伦理和安全约束。把AI指向癌症治疗、材料发现或递归自我改进,不能只说“让它一直试”;还要定义实验边界、失败成本、数据质量、监管条件和停止规则。
最后,这期节目对个人创作者和产品人也有一个反向提醒:当复制和变体生产变得便宜,稀缺性会转向判断。你可以生成很多游戏、图片、软件原型或内容版本,但哪些值得发布,哪些会被人记住,哪些具有文化信号,不能完全靠可验证循环解决。Berman把这称为人类品味和创造力的重要性:在噪声更多的环境里,能识别信号、设定方向、理解受众、承担取舍,反而更接近核心能力。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment