压缩即智能:AI 时代的底层逻辑与商业突围

1- 压缩即智能:AI 时代的底层逻辑与商业突围

在人工智能的浪潮中,我们常常听到各种宏大的词汇:涌现、推理、AGI。但如果我们剥开大语言模型(LLM)复杂的神经网络外壳,探寻其最底层的数学本质,会发现一个令人反直觉却又无比优雅的真理。

这个真理不仅解释了 GPT 为什么会「思考」,更隐含了创业公司在巨头阴影下突围的唯一路径。

这一切,要从一个简单的问题开始:训练一个 GPT,到底在干什么?


1.1- 智能的数学本质:为什么「压缩」就是「理解」?

大多数人认为训练模型是在「学习语言规律」或「预测下一个词」。这些并没有错,但不够深刻。OpenAI 的研究员 Jack Rae 和时任首席科学家 Ilya Sutskever 给出了一个更本质的定义:训练大语言模型,本质上是在做无损压缩。

1.1.1- 文件夹理论与「找规律」

Ilya Sutskever 曾用一个极简的思想实验——「文件夹理论」,解开了无监督学习的谜题。

假设你有两个文件夹:

  • 文件夹 X:一堆没有标签的乱序图片(无监督数据)
  • 文件夹 Y:需要完成的任务(有标签数据),比如识别猫和狗

如果你用一个足够强大的压缩算法将这两个文件夹打包,算法为了节省空间,必须寻找 X 和 Y 之间的共同模式——比如「毛茸茸的边缘」「四条腿」的特征。

压缩的本质是消除冗余,而消除冗余的唯一方法是发现规律。

如果一张图全是随机噪点,它是无法被压缩的。反之,能被压缩的数据一定蕴含规律。当 GPT 试图预测「下一个词」时,它并不是在死记硬背,而是在寻找人类语言背后最简洁的生成规则(语法、逻辑、常识)。压缩率越高,意味着模型提炼的规律越本质,智能水平就越高。

1.1.2- 「简单即真理」的数学证明

这不仅仅是哲学上的「奥卡姆剃刀原则」(最简单的解释往往是正确的),它在 1964 年就被 Ray Solomonoff 变成了数学定理:预测一个数据集的最佳方式,就是找到该数据集的最小可执行压缩包。

让我们看一个震撼的现实案例:

Meta 的 Llama 65B 模型,在 5.6TB 的原始数据上训练。如果我们用这个模型来「压缩」这些数据,最终只需要约 400GB 的空间(包含模型生成代码和压缩后的数据流)。

这揭示了一个深刻的结论:真正的智能,不是参数量的堆叠,而是对世界信息描述的简化。

虽然 65B 的模型参数很多,但它能把庞大的 5.6TB 现实世界「折叠」进更小的空间。从信息论的角度看,它比小模型更「简单」,因为它提供了对世界更精准、更短的描述。


1.2- 从理论到觉醒:五道口的顿悟与「连续性」

这个抽象的数学概念,如何转化为商业上的认知地图?

ONE2X 的创始人王冠,曾是月之暗面(Moonshot AI)的产品负责人。在被 OpenAI 的产品迭代「碾压」了三次后,他意识到盲目做应用是徒劳的。直到在五道口的一场饭局上,月之暗面创始人杨植麟花三个小时给他推导了「压缩即智能」的公式,他才彻底顿悟。

1.2.1- 为什么「压缩」能产生「触类旁通」?

王冠发现,压缩不只是把文件变小,更重要的是它迫使数据之间建立「连续性」。

  • 传统软件(如 Excel)处理的是离散数据,格子与格子之间互不相干
  • 大模型处理的是语言、视频,它们像河流一样连续

当我们把「中文翻译」和「英文总结」这两个看似无关的任务,通过压缩强行挤压在同一个模型里时,模型为了寻找最小描述长度,会自动打通两者之间的逻辑壁垒。于是,AI 没学过「英文总结」,却突然会了。这种能力的「涌现」,本质上是压缩带来的知识融合。

1.2.2- 智能的第一性原理是数据

既然智能源于对数据的压缩,那么商业竞争的核心自然回归到数据本身。王冠将 AI 行业的发展划分为三个阶段:

  • 第一阶段(公域数据):拼全网数据的抓取和算力。这一阶段格局已定,基座模型公司胜出
  • 第二阶段(领域数据):拼医疗、金融等行业的历史积累。这一阶段利好传统行业巨头
  • 第三阶段(内生数据 Endogenous Data):这是创业公司唯一的机会

1.3- 商业实战与方法论:穿越 AI 的「诺基亚时刻」

什么是内生数据?就是世界上之前不存在、由你的产品机制产生的数据。

ChatGPT 出现前,世界上没有海量「通过对话解决问题」的数据;ONE2X 做视频生成,旨在创造一套描述视频制作的 DSL(领域特定语言)。

基于此,王冠提出了一套完整的 AI 时代产品方法论。

1.3.1- 重新定义产品架构:System 1 与 System 2

当下正处于 AI 的「诺基亚时刻」——我们还在用功能简陋的初代 AI 应用(像贪吃蛇),等待「iPhone 时刻」(多模态端到端成熟)的到来。在此期间,产品经理的核心不是画原型,而是设计智能的边界

  • System 1(基座模型):直觉、快思考,是大家共用的底座,不是壁垒
  • System 2(上下文/壳):逻辑、慢思考,这才是产品的核心

你需要构建一个「环境」(Environment),在这个环境里,用户的每一次操作、修改、反馈,不仅仅是消费内容,更是在标注数据。这些在物理世界中未曾被记录的隐性知识(比如剪辑师的审美判断、厨师对火候的感觉),通过你的产品变成了显性的「内生数据」,并回流到模型训练中,形成飞轮。

1.3.2- 商业模式的变革:从「流量」到「信任」

生成式 AI 将彻底改变互联网的底层逻辑:生成系统将取代推荐系统。

  • 过去:平台是中间商,分发流量,用户在海量内容中检索
  • 未来:产销一体,用户需求直接对接 AI 生成,没有库存,不需要检索

这意味着「推荐算法」这个中间商将消亡。在内容供给无限的时代,流量(注意力)不再稀缺,稀缺的是「信任」和「品味」(Taste)。未来的用户不再为流量买单,而是为创作者独特的「配方」买单。

1.3.3- 组织即环境:寻找北极星指标

如果公司是一个智能体,那么管理就是对齐「奖励函数」。ONE2X 采用全员远程、无 KPI 的「产品工作室」模式,试图构建一个让员工自驱的「环境」。

而衡量这个系统是否成功的北极星指标,不再是日活(DAU),而是**「系统的智慧程度」**。

怎么量化智慧?看 Token 的效率。就像做数学题,一眼看出答案的人比反复演算的人更聪明。如果你的系统能消耗更少的 Token 达到同样甚至更好的效果,说明它「压缩」得更好,更智能。


1.4- 尾声:寻找宇宙信息的最小描述长度

从 Ilya 的数学直觉,到 Solomonoff 的定理,再到王冠的商业实践,我们看到了一条清晰的脉络。

人类科技史,本质上就是一部压缩史。

  • N-gram:压缩了词的概率,带来了语音识别
  • RNN:压缩了句子的时序,带来了机器翻译
  • Transformer:压缩了整个互联网的文本,带来了 ChatGPT

每一次 AI 范式的跃迁,都是因为我们找到了一种更简洁的方式来描述这个世界。

对于今天的从业者而言,无论你是做模型架构,还是做上层应用,目标只有一个:寻找更优的压缩方式。

对于创业者,如果你能在产品中构建出一个独特的环境,捕捉到那些基座模型无法触及的「内生数据」,你就掌握了通往下一个时代的钥匙。因为在 AI 的世界里,谁能最简洁地描述未来,谁就拥有未来。

参考来源