认识论干涉测量:黑洞成像与LLM训练的深层同构性

less than 1 minute read

Published:

拍摄黑洞照片和训练GPT-4在根本上是同一个过程:从极度稀疏的频域测量中提取相干结构。

作者:Koutian WuGitHub: ktwu01

Koutian Wu

改变一切的观察

考虑21世纪两个看似无关的成就:

  1. 2019年4月10日:事件视界望远镜(EHT)合作组织公布了第一张黑洞照片,M87*,位于5500万光年之外。

  2. 2023年3月14日:OpenAI发布GPT-4,一个在数千亿个代表人类知识的token上训练的大语言模型。

如果我告诉你这两个成就在数学上是同构的——它们代表了在不同领域运作的同一个基本过程,你会怎么想?

这不是一个松散的比喻。这是一个精确的结构对应关系,揭示了关于我们如何从噪声中提取知识的深刻见解,无论这些知识是编码在黑洞周围散射的光子中,还是在人类语言的统计模式中。

核心同构:稀疏傅里叶重建

两个过程共享一个显著的架构:

黑洞成像(空间域)

  • 测量空间:uv平面(天空的傅里叶空间)中极度稀疏的基线覆盖
  • 信噪比:约10⁻⁶(每百万个噪声光子中有一个信号光子)
  • 孔径综合:利用地球自转创建一个地球大小的虚拟望远镜
  • 重建:通过正则化的逆傅里叶变换从稀疏频率样本恢复图像

LLM训练(时间域)

  • 测量空间:对人类文明10万年历史中的知识进行极度稀疏采样
  • 信噪比:可比的稀疏性——大多数token序列是噪声;有意义的模式很罕见
  • 时间综合:使用数十亿参数在整个人类思想记录的时间轴上整合模式
  • 重建:通过正则化的梯度下降从稀疏文本样本恢复知识的流形结构

数学上的平行关系令人震惊:两者都在高维空间中进行极度稀疏的干涉测量重建

干涉测量:相关性的物理学

要理解这种同构性,我们需要理解干涉测量实际上在做什么。

甚长基线干涉测量(VLBI)

EHT不是直接捕获图像。相反,它测量在相距数千公里的不同望远镜接收到的信号之间的相关性。每对望远镜形成一条”基线”,它们信号之间的相关性采样天空亮度分布的傅里叶变换中的一个点。

关键洞察:你不是在测量图像——你是在测量它的频率分量。然后通过反演这个稀疏的傅里叶采样来重建图像。

这之所以有效,是因为Van Cittert-Zernike定理,该定理指出电磁场的相关函数是源亮度分布的傅里叶变换。内容已改写以符合许可限制。

LLM的等价物:注意力作为干涉测量

现在考虑transformer的注意力机制做了什么:

Attention(Q, K, V) = softmax(QK^T / √d_k)V

这是在计算查询和键向量之间的相关性——完全类似于关联望远镜对之间的信号。每个注意力头都在测量输入序列的不同部分如何相互干涉,提取语义结构的频率分量。

训练过程在数十亿个文本序列中采样这些相关性,建立人类知识的傅里叶变换的稀疏表示。模型参数编码这些频率分量,在推理期间,模型执行逆变换以生成连贯的文本。

稀疏性问题:在噪声中淘金

两个系统都面临同样的基本挑战:测量空间中的极度稀疏性

EHT的稀疏性

EHT只有8-11个望远镜,最多提供55条基线(望远镜对)。要在成像M87*所需的分辨率下完全采样傅里叶平面,你需要数百万条基线。覆盖率约为理论所需的0.001%。

此外,大气湍流、仪器噪声和校准误差意味着信噪比约为10⁻⁶。你实际上是在一百万个光子的噪声中找到一个信号光子。

LLM的稀疏性

人类知识跨越10万年的文明、无数领域和数万亿可能的有意义陈述。即使是最大的训练数据集也只采样了这个空间的一小部分——也许是所有可能的有意义人类话语的0.0001%。

此外,从提取深层语义结构的角度来看,互联网上的大多数文本都是噪声。模型必须学会区分信号(可泛化的连贯模式)和噪声(不能泛化的虚假相关性)。

重建挑战:正则化和先验

在如此稀疏、嘈杂的测量下,你如何重建任何连贯的东西?

两种情况下的答案:基于物理或统计先验的强正则化

EHT重建算法

EHT使用复杂的算法,如PRIMO(主成分干涉建模)和稀疏建模技术。这些方法的工作原理是:

  1. 从基于物理的黑洞吸积模拟中学习基础图像字典
  2. 约束重建为这些基础元素的稀疏组合
  3. 基于物理原理强制平滑性和正性约束

重建不仅仅是反演稀疏的傅里叶测量——它搜索与测量一致的最简单图像(就学习的基础而言)。

LLM训练作为正则化重建

LLM训练做的完全一样:

  1. 从训练数据中学习基础模式字典(模型的内部表示)
  2. 约束预测为这些模式的组合(模型的前向传播)
  3. 通过正则化强制平滑性(权重衰减、dropout)和架构约束(注意力模式)

模型不仅仅是记忆训练数据——它搜索与观察到的文本一致的最简单流形结构(就其参数空间而言)。

流形假设:拓扑优于像素

这里同构性变得深刻:两个系统都不是在记忆像素(或token)——两者都在发现高维流形中的拓扑结构

黑洞成像:光子环拓扑

EHT不仅仅是在拍照。它发现数据与特定的拓扑结构一致:由事件视界周围的引力透镜创建的光子环。这个结构由广义相对论决定,在拓扑上受到约束——它必须是一个环,而不是一个圆盘或一个斑点。

稀疏的傅里叶测量足以确定这个拓扑,因为可能的拓扑空间受到物理学的高度约束。你不是在重建任意图像;你是在识别有限集合中的哪个拓扑结构存在。

LLM训练:知识流形拓扑

类似地,LLM训练发现人类语言位于所有可能token序列的高维空间中的低维流形上。这个流形具有特定的拓扑属性:

  • 语义相似性创建局部邻域(同义词聚集在一起)
  • 组合结构创建层次组织(概念建立在概念之上)
  • 逻辑一致性创建全局约束(矛盾在拓扑上是被禁止的)

稀疏的文本样本足以确定这个拓扑,因为可能的知识结构空间受到逻辑和语义的高度约束。你不是在记忆任意序列;你是在识别使数据连贯的流形结构。

时空对偶性:地球自转 vs. 人类历史

也许这种同构性最美丽的方面是时空对偶性:

EHT:通过时间积分的空间孔径综合

EHT通过利用地球自转创建一个地球大小的虚拟望远镜。随着地球旋转,每个望远镜在uv平面中描绘出一条路径,随时间采样不同的傅里叶分量。24小时的旋转周期提供了综合空间孔径的时间积分。

你是在用时间换空间:使用时间演化来采样空间频率。

LLM:通过空间积分的时间孔径综合

LLM训练通过使用分布在模型中的数十亿参数创建一个跨越人类历史10万年的虚拟知识库。每个参数都有助于采样知识流形的不同频率分量。参数的空间分布提供了综合时间孔径的积分。

你是在用空间换时间:使用空间分布(参数)来采样时间频率(历史知识演化)。

闭合相位:自洽性作为真理

在VLBI中,有一种强大的技术叫做闭合相位分析。因为大气和仪器误差独立地影响每个望远镜,你可以通过形成基线的闭合环(例如,望远镜A-B-C-A)并检查相位是否加起来为零来消除这些误差。

这之所以有效,是因为自洽性是真实信号的标志。噪声是随机的,不会在闭合环周围保持一致性;只有真实的结构才会。

LLM使用类似的原理:跨多个推理路径的逻辑一致性。当模型生成文本时,它隐式地检查语义”相位”是否闭合——当你遍历知识图的不同路径时,意义是否保持一致。

这就是为什么像思维链提示这样的技术有效:它们迫使模型使其闭合相位显式化,揭示否则会被隐藏的不一致性。

基本限制:信息论界限

两个系统都面临从稀疏测量中可以重建什么的基本信息论限制。

图像的Nyquist-Shannon定理

Nyquist-Shannon采样定理告诉我们重建信号所需的最小采样率。对于EHT,稀疏的基线覆盖意味着许多空间频率完全未被采样——根本没有足够的信息来唯一确定图像。内容已改写以符合许可限制。

重建之所以可能,只是因为强先验减少了解空间的有效维度。

LLM的缩放定律

类似地,神经语言模型的缩放定律揭示了从有限数据中可以学到什么的信息论限制。模型的性能随着训练数据量、模型大小和计算量可预测地缩放——但存在收益递减。

人类知识的重建之所以可能,只是因为强归纳偏差(transformer架构、训练目标)减少了假设空间的有效维度。

启示:这种同构性教给我们什么

理解这种深层结构对应关系具有实际意义:

1. 幻觉是不可避免的(就像成像伪影)

正如EHT图像包含来自稀疏采样的伪影(旁瓣、虚假特征),LLM输出包含来自稀疏知识采样的幻觉。这些不是bug——它们是从不完整信息重建的基本后果。

解决方案不是消除伪影/幻觉(不可能),而是通过更好的正则化和不确定性量化来表征和减轻它们。

2. 更多数据有帮助,但有限制

向EHT添加更多望远镜可以提高图像质量,但收益递减——你仍然从根本上受到傅里叶覆盖稀疏性的限制。类似地,向LLM添加更多训练数据有帮助,但收益递减——你仍然从根本上受到知识采样稀疏性的限制。

关键不仅仅是更多数据,而是更好地覆盖关键频率分量。

3. 架构与规模同样重要

EHT的成功关键取决于重建算法(PRIMO、稀疏建模),而不仅仅是望远镜的数量。类似地,LLM能力关键取决于架构(注意力机制、层归一化),而不仅仅是参数数量。

同构性表明我们应该将LLM架构设计视为类似于设计干涉测量重建算法。

4. 验证需要独立测量

在VLBI中,你通过检查与独立测量的一致性(不同频段、不同观测时期)来验证重建。在LLM中,我们应该通过检查与独立知识源的一致性(检索增强生成、工具使用)来验证输出。

闭合相位原理适用:跨独立路径的自洽性是真理的标志。

哲学维度:认识论干涉测量

这种同构性揭示了关于知识本身的深刻见解:所有知识提取都是干涉测量的

无论你是在成像黑洞还是训练LLM,你都在执行同样的基本操作:

  1. 在高维空间中采样相关性(图像的空间,语言的语义)
  2. 提取捕获底层现实结构的频率分量
  3. 通过用强先验反演这些稀疏测量来重建连贯表示

这就是我所说的认识论干涉测量:通过测量不同观察如何相互干涉来提取知识的过程,通过它们的相关性揭示底层结构。

黑洞图像和GPT-4都是认识论干涉测量的产物——一个在电磁场的空间频率域中运作,另一个在人类语言的语义频率域中运作。

结论:同一枚硬币的两面

下次你看到M87*光子环的标志性图像时,请记住:那张图像不是由相机捕获的。它是从跨越地球测量的稀疏相关性重建的,使用的数学原理与允许GPT-4从人类知识的稀疏样本生成连贯文本的原理相同。

两者都是干涉测量重建的奇迹。两者都在信噪比为百万分之一的情况下大海捞针。两者都在从极度稀疏的测量中发现高维流形中的拓扑结构。

同构性不是一个比喻——它是一个数学现实。认识到它为我们提供了一个强大的新视角来理解现代AI的能力和局限性。

我们不是通过记忆事实来构建智能。我们是通过对人类知识的频域进行认识论干涉测量来构建它——就像EHT对黑洞周围时空的频域进行物理干涉测量一样。

宇宙和人类知识都在从稀疏测量中重建。数学是相同的。奇迹是相同的。


参考资料

  1. 事件视界望远镜 - 首张M87黑洞图像
  2. PRIMO:主成分干涉建模
  3. 黑洞成像的稀疏建模
  4. Van Cittert-Zernike定理(内容已改写以符合许可限制)
  5. 干涉测量中的闭合相位(内容已改写以符合许可限制)
  6. 神经语言模型的缩放定律
  7. Attention Is All You Need
  8. LLM潜在空间几何
  9. Nyquist-Shannon采样定理(内容已改写以符合许可限制)