「图片地主」对「视频钥匙」对「实时百科」,多模态家底Meta、ByteDance和X怎么分
Published:
这题问到刀尖上了。如果把「高质量多模态训练数据」收窄到对 GPT-4V、Sora、Gemini、Emu 这类模型真有喂饭价值的图文或视频,短答其实很锋利,Meta(Facebook / Instagram)静态图片数量的库存对其他两家几乎是断层第一,ByteDance(TikTok / 抖音)在短视频也就是动态图片流上占最大优势,X(Twitter)绝对量级最小,但图文的贴脸相关性和实时信息密度是独一份。
我自己手里当然没有三家公司的内部账本,下面出现的 MAU、日投稿和媒体占比,都是在公开口径上加了一个「往回推」的估算模型,用来比轮廓不比精确会计。可轮廓够了,你已经能看出牌桌形状。
量级直觉,三家怎么叠起来
纯图片和视觉库存这一层,排名很清晰。Meta 是断层第一,ByteDance 第二,主打的是视频,视频按每秒三十到六十帧拆回去,本质是高冗余的图片序列,再加图文模式涨得飞快。X 第三,根子上还是文本平台,媒体文件比例相对低。
真要做量化,我会把高质量多模态定义成上文那段,对一个聊训练的工程师来说,这定义比「有多少人刷 App」管用。
Meta,视觉库房
Meta 基本上是全球最大的静态图像库房之一,Instagram 又是全球美学质量最高的图片库之一。Family of Apps 的月活三十亿加是公开常识量级,日上传这边,Instagram 保守也在一亿加照片或视频,Story 再叠一层只会更大,Facebook 日图片三五亿加是同一量级的口语估算,WhatsApp 每天传的照片是「数十亿张」这个量级,坦白讲端到端加密摆在那儿,不等于这些比特能直接进训练集,但公开面的 Facebook / Instagram 已经够把别人甩开半个身位。
往存量上拍脑袋,历史上积累的照片超过一千亿张这个「训练 Token 式」的比喻,在业内聊天里站得住。强项是社交场景、人脸、物体,Tag 和用户写的一两句说明常常贴在图边上看,对物体识别和图像生成(Meta Emu 那条线)是教科书级 feed。Llama 系列多模态追得快,SAM 这种分割大模型能打,背后不是玄学,是数据形状就这么友好。
ByteDance,动作和声音
字节的核心资产是视频。视频是带时间戳和音频的高密度图片序列。TikTok 加抖音再加头条,月活二十五亿加同样是公开量级里常听到的数。TikTok 日新视频口语估算在两千三百万到三千四百万之间,抖音千万量级同档。
高质量多模态这边,如果平均一条短视频十五秒、三十帧每秒,日新增的视觉帧百亿加是个不夸张的乘法。帧与帧之间冗余很大,可要训物理世界模型、Sora 那一类世界模拟器,时间轴上的冗余反而是信号的一部分。图文模式推着走,静态图总量仍追不上 Meta,斜率在。音频和画面锁得紧,动作捕捉的信息密度高,这是做人形动作理解和视频生成最馋的那口饭。
X,实时语境
X 体量最小,但新闻性和 Meme 文化这一条,更新最快、语义最拧。
月活五亿五到六亿是常见引用区间。总推文一天大约五亿条,媒体占比百分之十到十五晃,也就是五千万到七千五百万份媒体文件一天。
存量落在数百亿级,远小于 Meta 说的千亿级静态图库存。特点也很直白,信息密度高、美学不优先,截图、带字梗图、图表多,像素层面的「好看」不如 Instagram,语义层面的「这张图上在发生什么」往往更辣。
Grok 那条线强调实时,不是没道理的。X 的多模态更像在教模型读突发新闻和社会语境,不是教它画出一张能挂画廊的猫。
护城河,真壁垒在「能不能用」
说到训练,量比完了还得问一句,这牌能不能合法、合规、可规模化地喂进管线。
Meta 这边,公开面大,私有账号和版权纠纷仍在,但公开数据已经足够撑起很多论文里不好意思写全称的实践。ByteDance 这边,内容默认可传播的假设更强,跨境和合规是另一条故事线,训练目标侧更偏文生视频和动作。X 几乎是公开对话堆出来的,隐私阻力相对低,图文对齐经常是推文直接指着图骂,或夸,或编段子,相关性这一条上很能打。
美学上 Instagram 仍然是天花板参照,TikTok / 抖音滤镜和压制多,X 上压缩和截图多。训练目标也分叉,Emu、Llama Vision 往理解和生成静态视觉走,Doubao-Video 一类名字背后是世界模型和视频,Grok Vision 和 OCR、语境混在一起。
这张表不是谁赢谁输,是谁手里的曲面不一样。
收束三家
Meta 无可争议的图片地主。目标若是 Midjourney、Stable Diffusion 那种文生图,或者 GPT-4V 那种通用视觉理解,扎克伯格牌桌上最大的底牌之一,坦白讲就是 Instagram 这坨高质量的「人话贴图」。
ByteDance 握着通往物理世界模拟器的钥匙。AI 的下一幕如果是视频生成加机器人具身智能,时间、接触、因果比单帧美学更贵,字节的数据形状更贴那条硬路。
X 赢在认知层。体量小,但像一本被全人类实时改写的百科全书,多模态更多在喂「梗、讽刺、突发新闻图上到底发生了什么」,不是在喂美术馆。
顺着上面再聊一嘴截图里那段聊天。有人说 Visa 数据「质量更高」又「不敢随便用」,这话听着像八卦,其实踩在大数据和 AI 的一个硬常识上,金融交易是人类行为的 Ground Truth 之一。
社交媒体是表演,刷卡是现实。点赞、发帖常常带人设和 signaling,噪声大。支付是一笔一笔真金白银的偏好投票,愿意把钱花在哪,生活方式、阶层、爱好、下一步可能要干嘛,预测信号干净得多。相比图文要洗洗洗,交易记录时间、地点、商户、金额,结构化程度高到像是给表格预测模型量身定做的流水。
闭环里,Google 搜索偏意图,社交偏兴趣,Visa 偏结果。推荐、风控、宏观脉冲预测,Transaction Data 在叙事上确实是上帝视角,能串物理轨迹和消费能力变迁。
不敢随便用也不是谦虚,是监管和后果真的不一样。金融数据落在极度敏感的个人信息里,PCI DSS、GDPR 那一套不是摆设,泄露社交媒体可能只是骚扰量级往上走,支付数据一旦滥用,直接掐在财产安全和实名身份上。所以即便是在发卡网络内部,真要进 AI 训练,脱敏、差分隐私、权限审计会把流程拉得很长。护城河有时候就是门锁。
把话头拧回去。Visa 好,好在低噪声、高信度、贴真实行为。Google 好,好在 YouTube 那种广度加多模态的信息覆盖。一个是数字世界的深度,一个是信息世界的宽度。三家社交平台加支付网络,拼的不是同一个坐标轴,训练的人心里得先想清楚自己要学的到底是美学、物理、语境,还是资金流里的因果。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~
谢谢你看我的文章,我们,下次再见。
