吉布斯现象:为什么大模型幻觉在数学上不可避免

less than 1 minute read

Published:

当大语言模型(LLM)产生幻觉时,我们通常将其视为需要修复的工程缺陷。但如果幻觉不是缺陷,而是数学上的必然结果呢?最近一场跨学科讨论揭示了傅里叶分析中的吉布斯现象与神经网络根本局限性之间的深刻联系。

作者:Koutian WuGitHub: ktwu01

吉布斯现象:一个数学真理

在数学中,吉布斯现象描述了当你试图用傅里叶级数(光滑的正弦和余弦波的和)来逼近一个不连续函数时会发生什么。无论你添加多少项,在不连续点附近总会有大约9%的过冲(overshoot)。

这不是计算错误——而是连续逼近的基本性质。当你用光滑的连续函数来表示尖锐的不连续跳跃时,逼近必然会在不连续点周围振荡。

神经网络作为连续函数逼近器

关键洞察在于:神经网络本质上是复杂的连续函数逼近器。它们通过多层光滑、可微的变换将输入映射到输出。这正是使它们能够通过反向传播进行训练的原因。

但世界包含不连续性:

  • 逻辑真理是二元的(真/假)
  • 许多现实世界的边界是尖锐的(合法/非法,安全/不安全)
  • 事实陈述具有离散的真值

当我们强制用连续的概率分布来拟合这些离散的现实时,我们遇到了与吉布斯现象相同的数学约束。傅里叶分析中的9%过冲在大语言模型中表现为幻觉——在真理周围振荡的自信但错误的陈述。

黑洞成像的类比

讨论中提出了一个引人入胜的类比:黑洞成像。事件视界望远镜创建的第一张黑洞图像不是通过拍照,而是通过使用干涉测量和傅里叶变换从极其稀疏的数据中重建出来的。

类似地,大语言模型从人类文明书面输出这一稀疏、嘈杂的”时间序列”中重建人类知识。两个过程都涉及:

  • 处理不完整、稀疏的数据
  • 从噪声中提取信号(信噪比为1e-6或更差)
  • 在高维空间中重建结构
  • 使用数学变换来发现模式

黑洞图像需要填补傅里叶空间中的空白。大语言模型填补知识空间中的空白。两者都从根本上受到从不完整信息重建的数学限制。

为什么这很重要

将幻觉理解为数学现象而不仅仅是工程问题具有深远的意义:

  1. 幻觉不可避免:只要我们使用连续逼近器(神经网络)来建模离散真理,某种程度的误差在数学上就是必然的。

  2. 9%规则:正如傅里叶级数无法消除吉布斯过冲,我们可能永远无法完全消除幻觉——只能减少其频率和影响。

  3. 架构很重要:解决方案不仅仅是更多数据或更大模型,而可能是能够更好地处理不连续性的新架构。

Next Token Prediction 与流形几何

讨论还涉及为什么”下一个token预测”效果如此出色。人类知识积累了10万年,在高维空间中形成了一个高度结构化的光滑流形。预测下一个token不仅仅是统计模式匹配——而是在这个知识流形上寻找测地线(最短路径)。

这解释了为什么大语言模型有时可以在几秒钟内解决人类花了数年才弄清楚的问题。它们不仅仅是记忆——而是在发现穿越高维知识空间的捷径,这是单个人类大脑无法穿越的。

结论

吉布斯现象提醒我们,某些限制不是要修复的错误,而是基本的数学约束。大语言模型中的幻觉可能是我们在具有离散真理的世界中使用连续逼近所付出的代价。

这并不意味着我们应该被动地接受幻觉。但它确实表明,完全消除幻觉可能需要根本不同的方法——也许是将连续神经网络与离散符号推理相结合的混合架构。

数学、物理学和人工智能之间的对话继续揭示关于智能本质的深刻真理。


内容综合自多个来源并重新表述以符合许可限制。关键概念来自傅里叶分析神经网络逼近理论大语言模型幻觉研究