五个数量级,「十万倍」可能还是保守的,第一性原理拆开看一眼文字 AI 与具身 AI 的数据鸿沟

less than 1 minute read

Published:

「十万倍」这个说法乍听像聊天里随手甩出去的量级,但如果把它放回语义信息熵和有效训练样本这两把尺子下面,它非但不夸张,反而可能是保守的。关键是你得把「原始物理比特」和「带语义的、可被学习的数据」分开看。

作者:Koutian WuGitHub: ktwu01

我是跟几位做机器人、做世界模型的朋友来回吵过这个数之后才敢写下来的。吵到最后大家反而更共识了一点,差的往往不是「谁采集得多」,而是「这一份数据里到底压缩了多少人类已经替你完成的抽象」。

信息压缩与符号抽象

文字是人类对物理世界做过极高倍率压缩之后的符号产物。一个 Token(粗算大约零点几个英文词)背后可以缠着一整条因果链。你读到「杯子掉在地上碎了」,六个字不等于六个物理事件,它把重力、刚体碰撞、脆性材料那一套都压在一句日常叙事里了,因为你的大脑早就帮人完成了从连续物理流到离散符号的那一步。

具身系统面对的是另一回事,摄像头帧、触觉压力曲线、关节角,全是高维传感器流。一段十秒的抓取,如果按 30Hz 取样,那是三百帧图像量级的高维堆积,看起来像数据很多,语义却还很薄。

所以从「描述世界的有效语义」这个层面讲,互联网堆出来的数十万亿级 Token,其实就是把人类文明几千年里反复验证过的逻辑映射摊在了一张表里。而具身侧像是 Open X-Embodiment 这种跨平台集合,放在今天仍然很像「教机器学走路」的婴儿期,覆盖度差五到六个数量级,我并不意外。

采样成本与数据经济学

再往下翻一层,第一性原理会把问题推向「每一份样本的到手成本」。

文字 AI 这边,数据源主要是存量互联网,书、代码、网页,获取方式偏被动爬取,边际成本几乎可以当成零,规模跟着带宽和存储往上堆就行。具身这边,要么真实世界交互,要么模拟器里的 rollout,本质是主动交互,硬件损耗、电费、人类监督把单价抬得很高。时间也没法像拷贝比特那样随便翻倍,你绕不开物理世界那一拍一拍的时钟。

把量级摊开对一下账。顶级 LLM 训练侧,公开讨论里常提到十几万亿 Token 这个量级,也就是大约 (1.5 \times 10^{13}) 这一档。具身领域即使把几家机构的数据拢在一起,「高质量、带动作标签、能直接进模仿学习或强化学习管线」的轨迹条数,往往在百万级 (10^6) 附近晃。

\[\frac{10^{13}}{10^6} = 10^7\]

这已经是一千万倍的台阶。你再扣一层,「一段轨迹里到底嵌了多少个 Token 级别的语义单元」,把倍数往回拉一点,落到「十万倍」(10^5) 这个口径上,反而是留给现实摩擦之后的保守讲法。我是这么跟自己的直觉对齐的。

维度灾难与状态空间

数学上还有一点很刺。文字模型主要在和离散序列打交道,词表几十万、序列一维往前推。具身则是在连续空间里滚,六自由度机械臂加上视觉、加上触觉反馈,状态空间几乎是无限维的。

这里就有一个听起来的矛盾。YouTube 这种视频原始流量,按 Exabyte 去算是碾压文字的。但问题不在「有没有像素」,在于「有没有动作、有没有意图、有没有可复用的监督」。真正能被拿去学策略、学动力学、学接触的,仍然是稀缺品。

这也是为什么当下很多路线是先用 LLM 或 VLM 当「大脑」,再用相对小得多的数据微调一个更像「小脑」的控制器。不是大家不想端到端大力出奇迹,是有效样本的供给曲线还没有开闸。

范式转移与地学这条支线

把上面三段合在一起,我现在的判断是,你的核验方向是对的,「文字在语义层的可用数据量大约比具身有效数据高几个数量级」,这句话可以站住。但要把转折也说出来。

如果世界模型真的能从大规模无标注视频里榨出一致的物理规律,让表征不再强依赖人类一条条标动作,那么具身侧有机会反过来吃回数据红利,因为物理世界的信息量,理论上确实是敞口的。那一刻,比较的主语会从「轨迹条数」换成「谁能从未标注流里还原可用的因果结构」。

我自己折腾 Earth Systems Model Bench 这类事的时候,脑子里会咯噔一下,跟这条线是同一类难。气象、水文、陆面过程,坦率讲,就是地球这个巨型实体的传感器流,一样是高维连续信号。怎么把这些东西压成模型吃得动的「语义 Token」,怎么让评测和交互别停在漂亮曲线而停在可操作的决策上,可能正是往回补那五个数量级差距时要啃的骨头。

如果你也想往 Foundation Model 怎么压缩物理世界的熵这条线继续推,我们可以从信息论里把它再摊开一层。


以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~

谢谢你看我的文章,我们,下次再见。