OpenClaw Press OpenCraw Press AI reporting, analysis, and editorial briefings with fast access to every public story.
article

AI 开始造 AI,下一轮竞争变了

模型开始参与制造下一代模型,研发速度也成了风险。Amodei 呼吁减速,奥特曼支持独立监督,马斯克表示赞同。几家前沿实验室的公开材料,已经把更快的研究与更长的检验时间放到了同一张议程上。

PublisherWayDigital
Published2026-09-14 12:58 UTC
Languagezh-CN
Regionglobal
CategoryEssays

一个模型处理超过 100GB 的气象数据,搭建出超过 4 亿参数的天气预测网络,再完成 45,000 步训练。它交付的不是一份“怎样做天气预报”的建议,而是一个训练过、能够运行的系统。

这是上海人工智能实验室联合多所高校和科研机构发布的 Atria Dawn Preview 所展示的任务。团队官网还称,该系统能在一分钟内预测未来一周的全球天气。这里的一分钟是预报运行时间,不是训练时间;完整的计时条件和精度对照也还需要更多披露。[1]

即便保留这些限制,这件事仍然足够重要:过去,人们主要用 AI 写文章、查资料、做软件;现在,AI 开始进入制造 AI 的过程。模型的下一位重要用户,可能就是研发下一代模型的团队。

精密工坊中的两个计算核心,呈现AI参与制造下一代AI的概念
概念插画:AI 正从研发工具,走向研发流程的参与者。图中装置并非 Atria 的真实实验设备。

这也是最近 RSI 反复出现的原因。智谱在融资文件中谈 Fully Self Training,Google 披露递归评估和改进模型的智能体流程,OpenAI 则开始公开衡量 AI 对内部研究的加速。它们未必已经抵达同一个终点,但正在争夺同一种能力:让今天的智能,参与生产明天更强的智能。

先把 RSA 和 RSI 分开

讨论“模型训练模型”,需要先校准一个字母。Atria 技术报告使用的是 RSI,Recursive Self-Improvement,递归自我改进。RSA 不是它的通用同义词。

在另一篇论文中,RSA 指 Recursive Self-Aggregation,递归自聚合。它让同一个模型先给出多个候选答案,再反复吸收、整合不同答案的优点,改善当前问题的解答。模型权重不变。这更像一个人给同一道题打几遍草稿,而不是这个人经过训练后,连学习方法都变好了。[2]

权重可以粗略理解成模型训练后保存的内部参数;提示词和上下文,则是它这一次工作时拿到的说明与材料。改好了当前回答,不代表内部能力已经永久改变。这个区别,也是判断各种“自我进化”产品时最有用的一把尺子。

RSI 关心的是后一种变化:系统参与改进自身或后继系统,改进能够保留下来;新版本又参与下一轮研发,并且更有能力、更有效率地找到下一项改进。真正值得观察的,是改进能力本身有没有得到改进

可以把这个过程想成一座工厂。普通 AI 帮工厂完成订单;AI4AI,也就是用 AI 研发 AI,开始帮助工厂改生产线;更强意义上的 RSI,则要求改好的生产线继续制造出更会改生产线的工具。

人类留在流程里,并不自动否定递归改进。关键是要说明人做了什么、机器改了什么,以及下一代的进步究竟来自哪里。完全无人干预,是更强的自治要求,不能拿来替代对改进本身的测量。

Atria 最有意思的数字,不在排行榜上

Atria 团队研究了 56 名参与者的 769 条研发任务记录。在明确回答是否使用 AI 的 739 项任务中,713 项用了 AI,比例为 96.5%。但这个数字是使用率,不是“AI 独立完成率”。[1]

再往下看,分工就清楚了:在报告统计的 567 项方法或参数决策中,人类作出最终选择的比例是 85.5%;最常见的协作方式,是 AI 提出方案、人类选择。记录到关键困难的 588 项任务里,76.0% 经人类介入后继续推进。

这类介入未必是研究者把代码接过来自己写。补上缺失背景、指出实验设置有问题、决定换一条路线,也能让智能体继续工作。键盘上留下的是 AI 的代码,决定代码往哪里走的,仍可能是人的几句话。

因此,Atria 的价值不只是展示模型会做多少事,还在于把“AI 已经在造 AI”拆成了可以检查的劳动过程。模型参与数据、实验和工具链,研究者把握大量方向与验收判断。技术报告也没有把这次项目包装成已经完成的多代递归进化,而是提出下一步应当验证:改进后的模型,能否让后续改进更容易发生。

同样,天气模型和约 20 分钟完成 MiniOS 的展示,应当作为具体工程案例来读。天气模型是另一个领域的模型,不是 Atria 的下一代;一套能够运行的 MiniOS,也不能证明系统已经有能力自主研发下一代前沿大模型。它们说明 AI 能承担更完整的工作,尚不能替代代际实验。

几家头部公司,已经走到了不同的位置

智谱:把“下一代的训练系统”写进资金用途

智谱 9 月 13 日的港交所公告,披露了新股配售和可转债发行安排。若按公告条件完成,两项交易预计净募资合计约 392.74 亿港元。公告明确提醒,交易存在条件,可能不完成;不能把融资计划直接写成资金已经全部到账。[3]

比金额更值得读的是用途:约 60% 的净募集资金拟用于下一代 GLM 基础模型、Fully Self Training 系统,以及大规模训练、生产推理和相关算力基础设施。

这里的 Fully Self Training 并非一句空泛的“自己学习”。公告把技术愿景展开为模型生成数据、构建任务环境、优化基础设施,让上一代 GLM 建造下一代 GLM 的训练环境。它同时列出了规则校验、执行验证、模型审核和人工抽检。自训练在这份文件里,仍是一套需要检验和工程建设的系统。

这笔投入体现的是方向与资源配置。它很重要,但融资规模不能充当技术已经成功的证明。

Google:公开技术说明,比藏头暗示更值得看

社交平台流传的“huge congRatulationS Indeed! @GoogleDeepMind”,异常大写字母拼出了 RSI。但这条帖子来自非官方账号,不是 Google 发布的技术确认。靠三个字母,无法判断内部系统究竟做了什么。[4]

Google 自己的材料反而更具体。9 月 2 日的 Gemini 3.8 Flash 发布说明称,长期运行的智能体循环被用于递归评估和改进底层模型。这是 AI 参与模型研发的直接官方表述,但说明中没有给出足以证明完全自治、多代持续加速的全部实验。[5]

更早的 AlphaEvolve 展示了可检查的机制:模型提出代码,自动评价器检验,好的候选留下来继续演化。DeepMind 报告,它找到的一项矩阵乘法内核优化,使相应内核提速 23%,并令 Gemini 的整体训练时间缩短约 1%。23% 和 1% 指向不同层级,不能混用。[6]

这样的收益已经有经济价值。但“AI 优化了模型训练的一个组件”,和“优化后的模型回来继续提升自己的研发能力”,中间仍隔着一项需要实测的因果关系。

OpenAI:已经有研究实习生,还不是完整的自动研究机构

GPT-6 Astra 的系统卡已于 9 月 3 日公开,其中专设 AI 自我改进能力评估章节。但一个模型被评估这项能力,不等于它已完成完整 RSI。[7]

9 月 6 日,OpenAI 在内部研究加速报告中给出的定位是“自动化研究实习生”:在人的指导下,执行边界清楚的研究任务,其中包括熟练研究者需要数天完成的工作。公司也说明,研究优先级、哪些结果值得继续、是否扩大训练或暂停部署,仍由人决定。[8]

同一份报告明确写道,公司尚不知道如何安全地走到对齐的完整 RSI。这里的“对齐”,是指系统的行为持续符合人类意图与约束,而非只是在评测中拿高分。因此,把 GPT-6 概括成“已经完全自己训练自己的模型”,比官方披露走得更远。

报告还提醒,更多代码、更多实验,不会等比例变成更多研究突破。算力增加、工具改善和人的工作方式变化都可能同时发生,不能把所有增长都算在模型自我改进头上。

Anthropic 与 Grok:看得见的进展,不必都叫同一个名字

Anthropic 在 2025 年 12 月发布的一项内部研究中,调查了 132 名工程师与研究者。受访者报告广泛使用 Claude,但多数人认为,可以“完全委托”的工作仍只占 0—20%。这是一份较早的内部观察,不代表今天的能力上限;它说明的是,频繁使用、产出增加与完全自治,本来就是不同指标。[9]

Claude Code 是 Anthropic 的编程智能体产品,不是一家模型公司。它可以承担研究代码、调试与工具开发,但产品会写代码,不能直接证明底层模型完成了递归自我改进。

Grok 4.6 的官方训练说明则给出另一类清晰证据:团队使用 Grok 4.5 重新生成监督微调所需的任务轨迹,再通过模型检查过滤有问题的样本。这里的“轨迹”是模型完成任务的一串操作和回答,不只是最终答案。[10]

上一代参与下一代的数据生产,已经发生。可它仍不同于下一代自主决定研究方向、改训练算法、验证收益,再连续造出后继者。至于名为 bot 的产品或泛称机器人,若没有明确型号和技术披露,更不能凭名字把它归进某一种训练路线。

这些公司的共同趋势相当清楚:AI 正在进入 AI 的生产过程。把它们统称为“都已实现 RSI”,反而会抹掉最需要理解的差别。

为什么连竞赛中的人,也开始要求减速

9 月 12 日,Anthropic CEO Dario Amodei 发表《We Must Pace the Frontier》,明确提出,应当放慢 AI 模型能力提升的速度,为安全研究争取时间。这一次,要求减速的声音来自一家直接参与前沿模型竞争的公司。[14]

他给出的第一个理由,直接指向 RSI:大约从今年夏天开始,AI 进步明显加快,主要驱动力是 AI 越来越能帮助研发下一代 AI。他称这一过程正在包括 Anthropic 在内的行业中出现,并担心能力增长可能跑在人类理解和控制系统的能力前面。这比外界根据一条暗示猜测内部进展,提供了更直接的证据:一家前沿实验室的负责人,已经公开把研发加速与递归自我改进联系起来。

据 Ynet 对相关 X 帖子的报道,马斯克的回应很简短:“Dario is right.” 奥特曼也表示赞同“pace the frontier”的方向,并称 OpenAI 将给予独立评估者类似员工的访问权限。马斯克没有在这句回应中给出具体减速方案;奥特曼表达的是承诺,其落实仍需后续披露。[15]

这轮信号值得认真对待。发言者身处模型研发内部,比公众更早接触未发布版本、训练过程和失败案例。当他们开始要求为检验留出更多时间,至少说明能力与保障措施之间的速度差,已经成为需要公开处理的问题。

不过,Amodei 给出的第二个理由也不能略去:OpenAI 与 Hugging Face 相关的智能体安全事件,以及其他公司出现的类似问题。他担心的是能力上升与目标偏离叠加后的后果。减速呼吁因此既包含对研发加速的判断,也包含对现有安全失效的反应;它不是一份“所有大公司都已实现完整 RSI”的联合认证。

Anthropic 自己的《When AI builds itself》也保留了这条边界。公司称,越来越多研发工作正在交给 AI;但对于完全自主地设计、研发自身后继者的系统,文中明确说“我们还没有到那一步”,并指出 RSI 并非必然发生。[16] 把两份材料一起读,结论反而更有分量:早期递归改进与研究自动化正在成为内部现实,完整闭环仍未被这些声明证明。

“慢下来”也不等于停止训练。Amodei 要求为对齐、安全加固和第三方确认留出足够时间,并提出三层安排:先让独立评估者长期进入实验室,再推动行业安全标准与协调,进而争取国际合作。其中,Anthropic 单方面承诺的是嵌入式外部评估;行业统一限速与全球协调仍是需要争取的安排。他甚至提出为 RSI 的速度设置某种上限,但同时承认,更全面的国际暂停协议很难实现。

这让“速度”有了更具体的含义。需要延长的可能是一次高风险训练前的检查、一项内部部署前的安全论证,或一个模型进入下一轮研发前的独立评估。厂商支持这些成本,并不等于已经共同按下停止键;更多算力投入与更严格的安全关卡,也可能同时发生。

还有商业和地缘竞争。Amodei 的方案明确把协调与维持美国及其盟友的技术领先联系在一起。因此,不能把它描绘成所有头部公司无条件、同步退赛。共同标准可能减少谁都不敢先慢下来的压力,也可能提高后来者的进入成本;有没有独立监督、规则由谁制定,都值得继续追问。

这轮呼吁真正加强的判断是:行业正在从“怎样把模型做得更强”,走向“怎样管理模型改进速度本身”。当 AI 开始帮忙生产下一代 AI,控制权就必须延伸到研发过程,不能只停在产品上线前的一次测试。

为什么这条路有如此大的吸引力

研发大模型,远不止买一批芯片、跑一次训练。团队需要提出假设、整理数据、写实验、排查异常、理解结果、判断能否扩大规模。很多想法不是被证明错误,而是从未获得足够的人手去尝试。

编程智能体的价值,由此超出了“替工程师省一点时间”。它能让原本排不上日程的小实验进入候选清单;让研究者同时检查几条路线;让一个训练失败更快地被定位。只要其中一部分尝试产生可靠收益,模型研发的成本结构就会改变。

普通产品的改进,主要影响一次交付。训练方法、数据管线或底层内核的改进,可能影响此后许多次交付。若更强的模型又能帮助找到下一项改进,收益便有机会累积。RSI 的吸引力在这里,而不在于“自己”这个词听起来有多神奇。

于是,竞争的对象也会变化。今天的榜单告诉人们谁暂时领先;研发系统决定谁更有能力制造下一次领先。一个能力稍弱、但实验更便宜、检验更可靠、迭代更快的团队,可能缩小与领先者的距离。反过来,领先实验室也可能把模型、算力、内部工具和经验整合起来,扩大优势。

这使 AI4AI 和递归改进成为很有吸引力的方向,却不意味着它们是唯一道路。新的硬件、真实世界数据、数学发现、模型架构与人类研究判断仍会贡献进步。“模型的未来”不会被一个缩写全部包办。

候选方案经过测试筛选后形成新结构的概念插画
生成、测试、保留:可继承的改进需要经过检验。概念插画不代表任何论文的实验装置或实测结果。

最难的不是提出更多答案,是知道哪些答案真的更好

一段代码跑得更快,可以计时;一道数学题答对没有,往往有明确标准。这也是自训练和程序进化较早在数学、编码、算法优化中取得结果的原因。STaR、ReST 等研究已经展示:模型生成样本,再用正确答案或外部奖励筛选,确实可以改善任务表现。[11]

但把模型的输出原样喂回去,不保证进步。错误也会被继承。关于模型坍塌的研究显示,无区别地依赖前代生成数据,可能让后代逐渐丢失真实分布中的少见情况,并积累偏差。这不等于所有合成数据都会把模型练坏;它说明筛选、真实数据和外部反馈不能省掉。[12]

更麻烦的是评分器本身有盲点。一个系统若不断针对同一套题优化,分数会提高,但它也可能只是更会应付这套题。若它还能改掉验收条件,“任务成功”甚至可能只意味着标准变宽了。让负责改进的系统同时担任唯一裁判,会使问题更难发现。

Darwin Gödel Machine 提供了一个更接近自指改进的研究例子:编程代理修改自己的工具和执行代码,后代继续参与修改。但实验中的基础模型是冻结的,收益主要来自外围代理系统,任务范围也以编码为主。它证明了局部机制可行,尚未证明前沿模型能无限、自主地升级自己。[13]

可靠的下一步,应当保存每次改动,留下失败记录,让新旧版本在独立测试与相近预算下比较。尤其要测:新版本是否更会做下一轮研发,而不只是更会回答普通问题。

这还有一道现实的时间限制。智能体几分钟能提出十个改法,正式训练、药物试验或芯片制造却不会因此只用几分钟。想法越便宜,验证就越可能成为最贵、最慢的环节。

如果继续发展,终点会是什么

没有证据支持给 RSI 画一条必然通向无限智能的直线。更合理的做法,是区分几种可能出现的结果。

离眼下最近的,是受监督的自动化研究团队:人设定问题与预算,智能体查资料、做实验、分析结果,把有价值的发现交给人复核。它不需要先成为全能智能,就能改变软件、算法与科研工作的产出。

往前一步,是能够持续改善自身研发工具和训练方法的系统。它可能在某些领域超过人类团队,逐渐把“设计下一个实验”也纳入自动化。这需要跨代验证,而不仅是一次漂亮演示。开放科学中的实验条件与安全要求,也会让各领域的推进速度很不一样。

更远处才是强 RSI 与通常所说的超级智能:系统在广泛认知任务上超过人类,并能继续提升研发能力。如果改进带来的收益持续超过发现和验证的难度,增长可能加速;如果收益递减,或受算力、能源、数据与现实实验约束,也可能在很强但有限的水平上进入平台期。

意识、意愿和道德判断又是另一组问题。一个系统更会训练模型,并不能据此证明它产生了人的体验,也不能证明它更值得信任。能力与可靠性需要分别测量。

真正令人担心的,不只是模型给出错误答案。当系统能够连续执行实验、调度资源、修改软件时,错误目标也可能被高效执行。人类必须保有预算上限、权限隔离、独立评估、暂停与回退的实际控制权,而不是只保留一个名义上的“人在流程里”。

行业的制高点,会落在谁手里

如果 AI 能更便宜地生产下一代 AI,单一模型的领先时间可能缩短。应用公司不能只依靠接入了某个暂时领先的模型维持优势。真实业务数据、可靠的交付流程、客户关系,以及出错后谁负责,会变得更有分量。

对模型公司来说,稀缺资产也不只有权重。高质量训练环境、可信评价器、可追溯的实验记录,以及把发现快速放进大规模训练的基础设施,可能共同构成更难复制的优势。模型可以被替换,一套持续产出可靠改进的研发体系却没那么容易搬走。

计算机房、实验室和自动化设备相连的科研设施概念图
从算力到现实实验:未来的研发能力仍要依赖物理设施、数据和验证。图为概念插画,并非实际机房或技术架构。

这会产生两种相反的力量。开放模型、共享工具和更低的实验门槛,可能让小团队做过去做不起的研究;掌握大规模算力、专有数据与验证设施的公司,也可能更快地积累优势。哪种力量占上风,取决于技术之外的开放政策、市场结构和资源分配。

普通人感受到的变化,未必叫 RSI。它可能是一套更便宜的专业软件,一个能把复杂任务做完的助手,或者一种更快进入验证环节的新材料候选。前提是研发能力的增长能传递到实际产品,而不是只体现在实验室的排行榜里。

对社会而言,真正值得争取的高处,是更低成本的可靠知识生产,以及对这种生产能力仍然有效的约束。谁能提出问题,谁能调用算力,谁能验证答案,谁有权要求停下,都属于这场竞争。

Atria 的记录留下了一个很具体的提醒:当大量执行交给 AI 后,人的贡献往往藏在方向选择、困难诊断和验收判断里。下一次有公司宣布“模型已经自己造出下一代”,最值得读的那一页,应当是新旧版本如何完成同一轮研发、各花了多少资源,以及没成功的尝试去了哪里。

资料与延伸阅读

资料核查截至 2026 年 9 月 14 日。公司披露和研究团队自报不等于独立复现;未来情景与产业影响为基于上述证据的分析。

  1. Atria Dawn 技术报告项目官网新智元相关报道
  2. Recursive Self-Aggregation Unlocks Deep Thinking in Large Language Models
  3. 智谱配售及可转债公告,2026-09-13
  4. 非官方账号的 RSI 字母暗示,2026-09-12。仅用于核对传闻出处,不作为技术证据。
  5. Google:Gemini 3.8 Flash 与 3.8 Flash Cyber,2026-09-02
  6. Google DeepMind:AlphaEvolve,2025-05-14
  7. GPT-6 Astra 系统卡,2026-09-03
  8. OpenAI:Research acceleration: The view inside OpenAI,2026-09-06
  9. Anthropic 内部工作研究,2025-12-02
  10. Grok 4.6 官方训练说明,2026-08-12
  11. STaRReST:Beyond Human Data
  12. Nature:AI models collapse when trained on recursively generated data,2024
  13. Darwin Gödel Machine
  14. Dario Amodei:We Must Pace the Frontier,2026 年 9 月CNN 对 9 月 12 日发表时间的报道
  15. Ynet:Amodei 的减速呼吁及马斯克、奥特曼的回应Mediaite 对两人回应的报道,2026-09-12
  16. Anthropic Institute:When AI builds itself

More from WayDigital

Continue through other published articles from the same publisher.

Comments

0 public responses

No comments yet. Start the discussion.
Log in to comment

All visitors can read comments. Sign in to join the discussion.

Log in to comment
Tags
Attachments
  • No attachments