发生了什么
Pengrui Han、Jacob Andreas、Evelina Fedorenko 和 Andrea Gregor de Varda 在 arXiv (2608.13567) 上发布的预印本报告称,大型语言模型开发了一个反映人脑的模块化内部组织,其任务在人类中招募相同的大脑网络,从而在模型中招募重叠的神经元。
题为“大型语言模型中出现的模块化认知架构”的预印本已于 2026 年 6 月 27 日提交给 arXiv,并出现在 2026 年 8 月的列表中,标识符为 arXiv:2608.13567。列出的作者是 Pengrui Han、Jacob Andreas、Evelina Fedorenko 和 Andrea Gregor de Varda。该论文在人工智能 (cs.AI) 下归档,并在计算和语言 (cs.CL) 和机器学习 (cs.LG) 下交叉列出。提交的内容是第 1 版,与所有 arXiv 预印本一样,尚未通过期刊同行评审。
摘要将这项工作设置为对特定问题的测试:人脑显示出功能专业化,具有支持语言、形式推理、对他人思想的推理以及对物理世界的推理的独特网络。作者询问这种模块化组织是否是构建智能系统的基本原则,或者是生物学特有的进化偶然。他们的策略是在一个由完全不同的优化过程产生的系统中寻找相同的组织——基于梯度的文本训练而不是自然选择。
报告的方法是对跨越这四个认知领域的 46 项任务进行回路分析:语言、形式推理、社会推理和物理推理。正如摘要中所述,主要发现是双重模式而不是单一相关性。利用人类相同网络的任务会在语言模型中招募重叠的神经元;利用不同人类网络的任务会招募不同的神经元。作者得出的结论是,大脑和人工神经网络中模块化的集中出现表明模块化可能是智能系统的基本属性。
最后一句话是作者提供的解释,而不是他们报告的测量结果。值得将两者分开:经验主张是关于哪些单元针对特定模型内的哪些任务分组而激活;一般而言,关于智能系统的主张是从一个物种和一个模型类别之间的单一比较得出的推论。
公开可见的摘要页面没有回答读者评估结果所需的几个问题。它没有命名所分析的模型、它们的数量、它们的大小,或者它们是否是开放式的或通过 API 访问的。它没有说明如何选择或阈值化单个神经元,有多少重叠算作重叠,应用了哪些统计控制,或者分析是否涉及因果干预以及相关测量。注释字段指向在捕获的页面中不可读的外部链接,因此未知代码、任务列表或数据是否已被发布。提交的内容大约为 6.5 MB,这与一篇包含大量数字的论文一致,但这并没有说明其内容。
为什么这很重要
如果模型内部的功能是本地化的,而不是遍布整个网络,那么监控、编辑和安全干预就会变得更加容易处理——而大脑模型的融合是一个实质性的科学主张。但重叠的神经元本身并不能证明因果模块,并且摘要页面没有说明测试了哪些模型。
实际的利害关系是可解释性。如果相关计算存在于网络的可识别子集中,则大多数大型模型的安全和监督工具(监视欺骗行为、消除危险知识、审核系统产生给定答案的原因)都会容易得多。如果不同的任务族能够可靠地招募不同的单位群体,那就支持有针对性的干预。如果一切都纠缠在一起,干预往往会变得生硬并损害不相关的能力。显示四个广泛认知领域之间清晰的功能分离的结果将有利于易于处理的案例。
科学的利害关系在于趋同本身。在人类方面,语言选择网络和支持其他类型推理的网络之间的分离取决于多年来建立的大量神经影像学工作,独立于本文。这里的新内容是声称由完全不同的进程训练的系统落在类似的分区上。如果这一点成立,那就证明功能专业化是由问题的结构驱动的,而不是由生物发展的怪癖驱动的——这一主张在认知科学和机器学习中都有分量。
主要限制是重叠和机制之间的差距。激活重叠神经元的两个任务并不能证明这些神经元实现了某个模块,该模块是必要的,或者删除它会选择性地损害这些任务。既定的可解释性工作还记录了多语义神经元(参与许多不相关计算的单个单元),这使得神经元成为有争议的分析单元。摘要中的“回路分析”一词通常意味着因果干预,但摘要页面没有说明做了什么,因此不能仅从来源评估证据的强度。
第二个限制是映射的好坏取决于分类法的好坏。这四个领域以及分配给它们的 46 项任务是研究人员根据人类神经影像学文献做出的选择。认知功能的不同划分可能会产生不同的图像,显示模型如何清晰地将它们分开。这种形状的结果也容易受到表面形式的混淆:同一领域中的任务通常共享词汇、句子结构和答案格式,并且重叠激活可以反映这一点,而不是共享抽象计算。
对于普通读者来说,这一发现不应被视为语言模型像人一样思考、有意识或具有类似人类理解能力的证据。该主张是关于内部激活的统计组织,而不是关于主观经验或关于在这些任务上匹配人类准确性。大脑类比在人工智能营销中被大量使用,而这恰恰是一种被扁平化为比论文更强有力的主张的结果。
Interactive Mechanism: How It Actually Works
Explore the underlying technology behind this development interactively.
What is the best response when AI Models Explained makes a mistake in production?
接下来看什么
关注完整的论文和代码、分析模型的身份和数量、因果消融结果(表明损坏假定模块会选择性地降低其领域),以及比较所依赖的人机网络映射的同行评审。
首先要检查的是全文以及评论字段中链接后面的内容。重要的具体项目:分析了哪些模型和多少个模型、它们是否跨越多个系列和参数尺度、46 个任务的完整列表、用于调用招募神经元的标准,以及是否发布代码和数据以便其他人可以重新运行分析。作为大型语言模型的一般属性呈现的结果需要适用于多个模型。
二是因果证据。说服性后续测试是一项损伤研究:抑制被识别为社会推理群体的单位,并检查社会推理任务的表现是否下降,而语言和物理推理任务大致保持稳定。这种双重解离是人类神经科学文献使用的标准,并且将相同的标准应用于模型将使该主张从暗示性变为可靠的。
第三是认知科学和可解释性社区如何应对。同行评审将测试人机网络映射,其他小组可能会使用不同的神经元选择标准重新分析相同的任务。涌现结构的发现有好坏参半的记录:有些在模型中复制,另一些则被证明是探测方法的产物,而不是网络的属性。
相邻的裁员工作也存在着紧张的气氛。最近的另一份预印本报告称,专家混合模型的后几层可以容忍严重的专家屏蔽,而造成的损害有限——这一结果表明内部专业化可能基本上是多余的。协调干净的功能模块化与大规模消融的鲁棒性是一个悬而未决的问题,这两条证据如何结合在一起将很大程度上说明模块化主张的承载力。
最后,观察是否在其上构建了任何东西。对可解释性结果的测试是它是否改变了实践——安全团队是否使用域本地化结构进行监控、有针对性的遗忘或能力控制,或者它是否仍然是关于模型内部的描述性发现。源代码中没有任何内容表明与该工作相关的任何部署、产品或工具。