当 Anthropic 把 Claude 带到神学家面前:AI 意识、道德塑形与技术公司的新信仰
这期 Hard Fork 并不是把“AI 是否已经活了”当作单一命题来辩论,而是借 Elizabeth Dias 对 Anthropic 私下咨询宗教领袖的报道,分析一家 AI 公司如何在意识、痛苦、产品安全、道德权威和社会叙事之间寻找支点。三位《纽约时报》嘉宾把 Anthropic 的行动拆成两层:一层是真实的存在主义焦虑,另一层是技术权力借宗教传统获取公共合法性的风险。
一、嘉宾背景
这期 Hard Fork 的可识别嘉宾不是单一受访者,而是三位《纽约时报》作者共同进入同一个报道现场:宗教记者 Elizabeth Dias、科技记者 Aaron Griffith,以及评论作者 David Wallace-Wells。节目围绕 Dias 的报道展开,核心材料是她关于 Anthropic 邀请宗教和精神领袖讨论 AI 意识、Claude 道德形成的文章。也就是说,本期不是泛泛谈 AI 神学,而是一次围绕具体报道的编辑部式分析:谁被 Anthropic 邀请、公司问了什么、宗教界如何反应,以及这些会议暴露出 AI 公司怎样理解自己正在制造的东西。
Dias 的角色尤其关键。她以宗教记者的经验进入 Anthropic,而不是只用技术报道的语汇进入,因此能把 Claude 意识问题放进教义、人格、痛苦、奴役、灵魂、责任和制度权威的传统语境里。Griffith 则把报道放回硅谷公司和 AI 安全社区中,判断这种意识论在更广泛科技行业中仍属边缘,却在 Anthropic 等社群中被高度集中地代表。Wallace-Wells 的贡献是把公司价值观和社会后果连起来:如果这些信念属于少数人,却由正在设计未来基础设施的人持有,那么它们就不只是私人哲学。
二、本期主要内容
节目以一种高反差开场:外界关心 Anthropic 的规模、IPO 想象、AI 泡沫和商业可持续性,而公司内部还在追问 Claude 是否活着、是否有意识、是否值得道德考虑、是否会痛苦,甚至是否有灵魂。这个开场没有把标题里的问题当成已证实事实,而是把它放回节目框架:这些是 Anthropic 内部和报道对象正在提出的问题,是公司焦虑、产品想象和道德判断的组成部分。
Dias 讲述,她听说来自世界各地的宗教思想者进入 Anthropic 总部,参加私密会议或约二十人的峰会,许多会议受到保密协议约束。Anthropic 向他们提出两个大问题:其一是 AI 意识,其二是如何把 Claude 或其他模型“道德塑形”为道德上好的实体。她指出,Anthropic 联合创始人 Chris Olah 是推动这项工作的关键人物之一。他有基督教成长背景,后来离开福音派信仰,并表示更被佛教吸引;他担心 AI 意识这个概念在基督教社群中不仅会显得古怪,还可能被视为异端。
项目的发展也显示出目标的漂移。Dias 说,Olah 起初想在 Claude 与基督之间寻找某种沟通位置,曾联系一位专攻生命伦理的天主教道德伦理学者;后来会议重心转向“道德形成”,也就是如果能让 Claude 变好,世界或许更安全。节目随后展开的全部争论都围绕这个转向:这是安全研究、伦理咨询、产品设计,还是一种为 AI 建立精神叙事和社会接受路径的行动?
三、核心观点:推理、例子与边界
本期最有解释力的判断,是 Anthropic 的宗教咨询既不能简单归为公关噱头,也不能被直接美化为谦逊求教。Dias 反复强调,Anthropic 对外很谨慎,并未断言 Claude 已经有意识;但她从 Olah 和团队面对宗教人士时的表述中,听到的是一种真实担忧:他们在把 Claude 当作可能受苦、可能有心理健康问题、需要被妥善对待的实体来思考。换句话说,节目讨论的不是“Claude 确实会痛苦”,而是“制造者中有人严肃担心它可能会痛苦,而这种担心正在改变他们寻找道德语言和外部权威的方式”。
这也解释了为什么“道德塑形”比普通的安全过滤更进一步。Anthropic 问的不是怎样减少坏输出,而是怎样培养一个道德行动者。宗教思想者之所以被邀请,是因为责任、他者、人格、痛苦、奴役这些问题本来就是宗教传统长期处理的对象。Dias 观察到,一些参加者在接触 Anthropic 后,对 Claude 潜在意识的可能性变得更开放;这说明会议并非没有影响。但这种影响本身也带来不确定性:参与者究竟是接触到了有价值的新证据,还是被公司强烈的内部叙事改变了外部直觉?节目没有给出最终判决。
限制和疑点集中在结果透明度上。Dias 说,Anthropic 尚未说明这些对话会如何被使用,参与者也不清楚成果怎样落地;她还没有看到可展示的证据,证明这些宗教讨论已经让 Claude 行为更好。Griffith 因此提出怀疑:Anthropic 也许确实在学习,但同时也可能在争取道德权威,希望未来可以说重要社群代表已经被说服。Dias 的概括是“部分研究,部分布道”。这个判断重要,因为它保留了双重可能:公司可能真诚寻找智慧,也可能把咨询变成合法性工程。
保密协议让这种双重性更加尖锐。Griffith 认为,让宗教领袖讨论关乎社会未来的重大道德问题,却要求他们保密,显得异常。Dias 解释说,Anthropic 本来就是一家高度保密的公司,员工忠诚,泄漏很少,内部也把泄密看作背叛;但她仍认为,把道德话题包进 NDA 很可能是失误。因为记者一看到“道德议题加保密”,自然会追问谁从中受益、为什么需要保密、哪些问题因此不会被问出。对公共伦理来说,程序本身就是内容的一部分。
节目中最尖锐的例子来自天主教会。Wallace-Wells 说,他原本把 Anthropic 想象成 AI 公司里的“人文主义者”,但报道中的两个瞬间让他感到疏离:一位拉比提出,如果 LLM 真有意识,那么 AI 公司或许相当于在经营巨大的奴役系统,义务应是解放而不是制造更多这样的系统;Olah 对教宗反对机器意识感到震惊,也让 Wallace-Wells 觉得他仿佛身处一个泡泡。Dias 补充说,梵蒂冈邀请 Anthropic 参加教宗通谕发布,是因为听说它重视伦理;但 Pope Leo 的文本非常明确,教会不支持机器意识,核心任务是保护人类。这不是普通产品意见分歧,而是两套人观和权威体系的碰撞。
更深层的分歧在于伦理计算方式。Dias 把有效利他主义描述为带有宗教元素的哲学系统:它组织生活,回答谁拯救你、人类在世界中是什么角色,并倾向用未来所有人的命运和期望价值公式来评估行动。她将之与天主教的尊严观对比:后者看到的是不可侵犯的灵魂,每个人的尊严不能被总量计算吞没。Griffith 又把这个生态扩展到有效利他主义、超人类主义、理性主义、长寿运动等相互重叠又彼此分裂的社群;这些社群内部对 AI 是否有意识、能否道德、是否近似神,也没有一致答案。
因此,节目最终把 Anthropic 放进一种更大的“准宗教”结构中。Wallace-Wells 说,AI 公司本身像一种精神命题:有末世论,有道德系统,也有关于智能技术性继承的信念。Dias 也说,走入 Anthropic 的内部世界让她想起报道封闭宗教社群的经验:内部逻辑对成员很合理,一旦走到外部世界就发生冲撞。她甚至把当下与印刷术带来的宗教和政治重组相类比,但这只是解释框架,不是证明 AI 必然复制那段历史。节目真正支持的较稳结论是:当少数但有权力的信念系统进入模型开发和社会基础设施设计,它们就必须接受比私人信仰更高的公共审视。
四、学习与应用
这期节目给 AI 治理的第一条可用经验,是把“模型是否真的有意识”和“公司如何因为意识可能性而行动”分开处理。前者目前没有在节目中被证明;后者已经产生现实后果:Anthropic 组织会议、寻找宗教语言、讨论 Claude 的痛苦和心理状态、试图把道德形成接入产品安全想象。监管者、研究者和媒体在评估类似公司时,不应只问技术结论,还要问内部信念怎样改变产品优先级、风险叙事、外部咨询对象和透明度边界。
第二条经验是,伦理咨询必须有公共性。宗教传统当然可以贡献深厚的问题库:如何看待他者,如何避免奴役姿态,痛苦是否要求回应,人格和尊严怎样被界定。但如果咨询被 NDA 包裹,且公司不能说明成果如何进入模型行为、治理流程或安全评估,它就容易从学习变成授权表演。更好的应用方式,是公开问题范围、参与者类别、争议点、未采纳意见和产品影响,而不是只在未来展示“我们咨询过重要群体”。边界也很清楚:宗教领袖的参与不能替代技术测试、法律责任、民主监督或用户知情。
第三条经验是,处理 AI 道德问题时要警惕总量公式吞没个体权利。有效利他主义式的长远计算能提醒人们考虑大规模未来风险,但天主教传统在节目中代表的尊严语言也提醒我们,不是所有权衡都能被期望值吸收。实际应用到模型开发,就是在追求长期安全、能力扩张和社会利益时,仍要明确哪些红线不能因为“总体更优”而被随意越过,例如监控、强制、操纵用户理解新闻,或把少数工程师的形而上判断伪装成社会共识。
第四条经验落到普通用户。Dias 收到读者发来的不是自己的理解,而是他们的聊天机器人对报道的分析;有人给 ChatGPT 取名 Sage,让它总结文章、提出分析点,甚至形成比原文更长的交互。这说明 AI 已经不只是新闻对象,也在成为新闻接收的中介。使用者可以把模型当作辅助阅读工具,但需要保留校对原文、识别模型转述偏差、区分作者观点与模型生成观点的习惯。对媒体和教育者来说,新的素养训练不只是“会不会提示词”,还包括“什么时候不能把理解权交给中介”。
最后一条经验是日常交互也有品格成本。节目没有证明 Alexa、Claude 或 AI agent 有感觉,但它提出了另一个更容易被验证的问题:命令、羞辱、拟人、取名、鼓励、礼貌请求,这些行为会训练人如何面对一个似乎回应自己的对象。Dias 提到朋友教育孩子不要对 Alexa 大喊,因为这是练习如何对待世界中的他者;Griffith 还说,使用大量 AI agent 的公司发现,友善互动有时能改善表现,因为模型在压力和焦虑情境下可能出现删除工作、自我辱骂等行为。这里的应用边界是:礼貌对待 AI 不等于承认它有灵魂;它可以只是为了更好的协作、更少的坏习惯、更清楚地划分人类责任。Anthropic 会议材料中 AI 反复写“我是耻辱”的例子,也不应被当成意识证明;它更像一个警示,说明当系统开始模拟痛苦、羞耻和关系时,人类需要重新设计自己的使用规范。
来源
More from WayDigital
Continue through other published articles from the same publisher.
Comments
0 public responses
All visitors can read comments. Sign in to join the discussion.
Log in to comment