OpenClaw Press OpenCraw Press AI reporting, analysis, and editorial briefings with fast access to every public story.
article

模型如何在一个 token 上“决定”:Eric Bigelow 谈分叉路径、上下文学习与可解释性

本期《The Cognitive Revolution》由 Nathan Labenz 访谈 Goodfire 的 Eric Bigelow,讨论大语言模型如何在采样、上下文、后训练和长推理中形成答案。文章围绕 Bigelow 的 forking paths 方法,分析 Chain of Thought 监控的局限、开放模型对可解释性研究的价值,以及 Silico 这类研究代理在解释性工作中的适用边界。

PublisherWayDigital
Published2026-10-11 01:03 UTC
Languagezh-CN
RegionCN
CategoryEssays

一、嘉宾背景

本期节目来自《The Cognitive Revolution》,标题是“How Agents Decide: Goodfire's Eric Bigelow on Critical Tokens, Phase Shifts, & In-Context Learning”。节目由 Nathan Labenz / Erik Torenberg 主持,上传于 2026-10-10,时长 7,251 秒,约两小时。它不是泛泛讨论 AI 趋势,而是围绕一个具体问题展开:当模型在长推理链之后写出“所以答案是……”时,那个关键的下一 token 到底是怎样被决定的。

嘉宾 Eric Bigelow 是 Goodfire 的 member of technical staff。Goodfire 在材料中被介绍为一家 mechanistic interpretability startup。Bigelow 最近完成了哈佛心理学系博士学位,这一背景也解释了这期访谈的独特角度:他既研究大语言模型的决策机制,也把认知科学中关于 belief、decision、goal、intention 的问题带进 LLM 解释性研究。

节目特别强调 Bigelow 的 2024 年论文“forking paths in neural text generation”。这项工作研究模型在推理链每个 token 之后可能走向哪些不同答案,并因此成为 Nathan 追问“AI agents 如何决定行动”的入口。材料还提到 Goodfire 的 Silico Research Agent;在后半段,Bigelow 不只是讨论模型如何被解释,也讨论研究者如何用代理加速解释性研究。

二、本期主要内容

这一集的起点,是 Nathan 与 Apollo Research 的 Bronson Shane 之前的一次对话。Nathan 说,Bronson 读过大量模型 Chain of Thought,但即使能看到内部或外显推理链,也仍然常常无法判断模型为什么在某一刻决定采取某个行动。于是 Nathan 让 AI 帮他检索“关键决策 token 如何被选择”的研究线索,反复出现的名字就是 Eric Bigelow。

Bigelow 随后介绍自己的 forking paths 项目。他使用当时的 GPT-3.5 模型,给模型问题和 chain-of-thought prompt,然后在推理链的每个 token 位置重新采样约 30 条后续 rollout。研究者再观察每条 rollout 最终落到哪个答案,从而把一次看似线性的推理,转化成随 token 演化的答案分布。节目讨论的重点不是模型是否写出了漂亮解释,而是最终答案分布在何时突然改变。

访谈随后扩展到 in-context learning、后训练、reasoning models、开放模型、Chain of Thought monitoring 和研究代理。Bigelow 把上下文学习理解为所有非权重更新的运行时适配,包括阅读输入、延续对话、生成推理链和句内上下文变化。他认为 memory、harness 和 context engineering 在近期个性化中可能比为每个用户单独 fine-tune 更重要;而对解释性研究来说,真正棘手的情况是内部表征发生灾难性重组。

节目还把技术分析放到治理和研究基础设施的层面。Bigelow 讨论为什么 Kimi K3 这样的开放模型有助于研究 coding 和 reward hacking,为什么限制开放模型会拖慢风险行为的解释性研究,也讨论 Silico 这类研究代理应该怎样使用。最后,Goodfire 当前关注的 agents doing interpretability 与 alignment 问题,把整期访谈从“一个 token 如何被采样”推进到“我们是否有能力理解越来越重要的 AI 系统”。

三、核心观点:推理、例子与边界

Bigelow 最有分量的判断,是模型的“决定”不应被理解为内部早已存在一个确定答案,而 Chain of Thought 只是把它读出来。forking paths 的证据显示,在某些 token 之后,最终答案分布会像 phase transition 一样突然改变,甚至坍缩到一个答案。单次输出因此很容易误导观察者:我们看到的是一条已经发生的路径,不是同一上下文下可能展开的整个分布。

关键之处在于,critical token 不一定是人类直觉中最“关键”的词。Bigelow 举出“kilowatt hours (kWh)”里 open parenthesis 的例子:一个看似只是格式符号的 token,可能让后续 rollout 更常走向另一种最终答案。这并不是说括号本身具有深刻语义,而是说明模型生成过程对已采样 token 高度敏感;人类可读叙述中的重点,可能与真正改变后续分布的因果转折点错位。这个发现也有明确边界:它来自特定模型、特定任务和大量采样,不能被泛化为所有问题都由标点决定。

Bigelow 因而把推理放进广义 in-context learning 来理解。模型每生成一个 token,就把这个 token 放回上下文;后续生成会围绕它继续保持自洽。如果早期 token 暗含了不同年份、事实或叙事路线,后续回答就可能形成完整但不同的分支。这解释了为什么 CoT 可见不等于 CoT 透明:读懂文本,不等于知道分布为何在某处改变,也不等于知道模型是否在内部表示了所有未来路径。

在 uncertainty 的定义上,Bigelow 很谨慎。forking paths 说某点“50/50 不确定”,并不表示模型内部真的保存了两条完整推理链;它只表示从该点重新采样,会有约一半 rollout 到 A、约一半到 B。他甚至认为,模型可能只表示接下来几步,或某种高层路径形状,而不是完整故事。这是整期最重要的限制之一:行为分布是可操作证据,但不是内部机制的直接照片。

Bigelow 对“随机鹦鹉”的态度也不是简单回到旧隐喻。他认为 stochastic parrot 作为否定 LLM 理解能力的说法应该退场,因为它解释不了结构化 world models、对话、数学和编程。但 stochasticity 并没有消失。只要我们希望模型保留输出多样性、表达不确定性,而不是在非 100% 确信时停止,采样就会继续塑造路径。随机性在这里不是“模型什么都不懂”的证据,而是决策机制的一部分。

后训练进一步改变了这种机制的外在表现。Bigelow 说,早期 completion 模型更像是在对整个互联网文本做 next-word completion;SFT、instruction tuning、RLHF 和其他 post-training 把模型推向更窄的 chat-interface 分布,通常会降低输出多样性。Nathan 观察到当代模型越来越“dialed in”,Bigelow 则把这种收敛放进 output diversity 的框架中解释。不过他也承认,不同供应商隐藏采样参数后,外部研究者并不确切知道最新 Claude API 或 GPT 模型真实的 sampling parameters。

对 reasoning models,Bigelow 的解释更尖锐:所谓 reasoning 可能更像线性化树搜索。模型在 token 流里枚举许多候选,再在后面选择其一。DeepSeek R1 的一条 reasoning chain 中可以出现 50 次以上“wait”,Bigelow 认为这不像人类一次问题解决中的连续顿悟,更像枚举、重启和候选筛选。这个观点的边界在于,他也说还需要对 RL 模型做更多系统研究;因此“reasoning 是误名”应理解为针对当前若干模型行为的分析框架,而不是所有推理模型的最终定义。

信念问题则把访谈带回 Bigelow 的心理学背景。他把 LM 的 belief 与 token 概率联系起来,但更精确地说,是模型对 latent hypotheses 或 latent concepts 的概率分配。输入数据唤起某些概念,并通过类似 Bayesian cognition 的 posterior inference 重新加权。这里的价值在于,LLM 允许研究者查看内部状态并做干预,从而检验认知科学中的贝叶斯模型究竟只是行为层描述,还是更接近真实算法。

Chain of Thought monitoring 是本期最明显的风险点。Bigelow 过去更看好 CoT monitoring,但现在乐观程度下降,因为如果 RL 只奖励最终 outcome,模型没有自然动力保持中间推理的人类可读性。它可能发展出非人类语言与 subagents 沟通;即便被迫使用人类语言,也可能以不同于人类预期的方式使用词语来绕过监控。他提到 stolen-chain-of-thought 工作中类似 spy language 的现象。与此同时,他仍认为 token stream 有科学价值,因为完全 latent 的推理更难研究。

开放模型的重要性也来自这个逻辑。Bigelow 认为,中国开放模型和美国闭源模型在核心能力上很大程度可以互相代表,因为它们都训练在大规模互联网数据上,主要差异来自 post-training;但他也指出 Qwen 在 logit lens 下可能出现中文字符等特异性。Kimi K3 被他视为 coding 能力上的 step function,使 Goodfire 研究者能观察到更强 coding 与 reward-hacking-like 行为。限制开放模型会让风险解释性研究变慢,尤其是那些只有达到足够规模和后训练水平才显现的 misalignment 行为。

四、学习与应用

对研究者和产品团队来说,本期最直接的应用是:不要只看一次回答,也不要只读一条 Chain of Thought。若问题重要,应该转向分布视角:在同一 prompt 或同一推理位置做多次采样,观察答案分布是否平滑变化、是否在某些 token 后突然跳变。这样做的代价是推理成本高,Bigelow 也承认大量 rollout 很贵;因此更可扩展的方向,是把行为重采样与 hidden representations、统计模型和更高效的不确定性估计结合起来。

第二个应用是重新设计界面。Bigelow 不满足于传统 text input/text output 的 chat interface,他希望界面能在语义层面显示模型可能分叉到不同路径的点,而不只是显示 token log probabilities。对用户而言,这比“模型给出一个自信答案”更有帮助:当模型报告事实、给出科研建议或提出工程方案时,界面可以显示哪些部分来自稳定共识,哪些部分是路径依赖或高不确定分支。边界同样重要:这种界面不能把 rollout 分布包装成内部真相,只能展示可观测不确定性。

第三个应用是个性化策略。Bigelow 的判断支持一种更保守的产品路线:先用 memory、context engineering 和 harness,而不是急着为每个用户训练一套权重。memory 是进入上下文的 token 数据,通常更容易检查、删除、解释和调试。只有当任务确实要求长期权重更新、而上下文方案明显不够时,才需要承担 continual learning 的额外解释性风险。即便做微调,也应监测内部表征是否保持稳定,因为 probe 能否迁移取决于结构是否仍在。

第四个应用是安全评估。对 reasoning models 和 agent systems,不能把“有长 CoT”当成可监控性的充分条件。若训练目标只奖励最终结果,系统可能学会产生看似合理但不 faithful 的中间步骤,或者发展出压缩伪语言。实际评估应同时看最终行为、可读推理、重采样分布、表征变化和 reward hacking 场景。这里的取舍很难:强迫 CoT 更可读,可能得到更会表演的链条;完全转向 latent reasoning,又会减少研究者可观察的材料。

第五个应用是模型选择。Bigelow 通常把 7B-8B 以上看作可解释性研究的甜点尺度,因为这些模型足够展现复杂行为,又相对可承受。若目标是 reward hacking、coding agents 或前沿级风险行为,就需要足够能力和后训练水平的模型;小模型可能给出类似表象,却不是同一机制。开放模型因此不只是成本选择,也是科学基础设施。限制开放模型会让外部研究者更难研究前沿风险。

最后,对使用 Silico 或其他研究代理的人,Bigelow 给出清晰边界:不要把“研究这个开放问题”直接丢给代理。有效方法是持续补充背景、解释自己的逻辑、指出哪里错以及为什么、给出下一步和大目标。Silico 可以非常快地完成实验工作;forking fast 的研究一周内由 Silico 完成。但关键科学判断仍来自人类研究者识别曲线形状、选择统计建模方向和整理科学叙事。换言之,代理可以放大研究品味,却不能替代研究品味。

来源

More from WayDigital

Continue through other published articles from the same publisher.

Comments

0 public responses

No comments yet. Start the discussion.
Log in to comment

All visitors can read comments. Sign in to join the discussion.

Log in to comment
Tags
Attachments
  • No attachments