Embedding模型技术选型

1. Embedding 模型的作用

Embedding 模型的作用是将文本、图像等数据转化为低维向量表示,以便于机器学习模型进行处理和分析,而生产任务对 Embedding 模型的选取至关重要。

Embedding 将文本映射为向量示意

1.1. 影响 Embedding 选型的因素

  • 下游任务类型:影响 Embedding 技术选型的首要因素,能抽象为常见算法任务的场合用通用的训练框架和策略就行。
  • 软硬件基础设施和算力水平:决定了能跑多大参数数量的模型、是否可以使用 GPU 等算力卡加速训练或推理计算、能否满足线上响应时间、并发量等要求。
  • 数据源和多模态场景:若使用场景涉及到多个模态的数据源,方案中必须对不同模态的 Embedding 进行对齐融合。
  • 特定行业和垂直领域的数据隔离:如果当前任务会遇到很多本行业特有的专业名词,且对任务结构影响较大,建议使用行业数据进行领域预训练得到行业 Embedding 模型。

1.2. Embedding 模型分类

Embedding 模型主要分为两类,分别是静态嵌入模型和动态嵌入模型。静态嵌入模型主要是 Transformer 架构出现之前的嵌入模型;动态嵌入模型主要指基于 Transformer 架构的嵌入模型,核心特性对比:

静态与动态嵌入模型核心特性对比

嵌入模型特性对比

1.2.1. 静态嵌入模型

  • Word2Vec:预测式模型,通过 Skip-gram 或 CBOW 架构学习词向量
  • GloVe:计数统计模型,利用全局词共现统计信息

1.2.2. 动态嵌入模型

  • BERT:基于 Transformer 的双向编码器,生成上下文相关的动态嵌入
  • BGE (BAAI General Embedding):北京智源研究院开发的通用嵌入模型
  • Nomic-embed-text:Nomic AI 开发的紧凑高效嵌入模型
  • Qwen3-Embedding:阿里巴巴通义千问 3 代嵌入模型

1.2.3. 多模态嵌入模型

  • CLIP:OpenAI 开发的对比语言-图像预训练模型

1.3. 技术选型决策树

Embedding 模型技术选型决策树

2. 部署建议

2.1. 生产环境考虑因素

生产环境考虑因素包括延迟要求、吞吐量、内存占用、更新频率等:

  1. 延迟要求:静态嵌入 < 小型动态模型 < 大型动态模型
  2. 吞吐量:与模型大小和计算复杂度成反比
  3. 内存占用:从几 MB(Word2Vec)到几 GB(大型 Transformer)
  4. 更新频率:静态模型更新简单,动态模型需要重新训练

2.2. 混合架构策略

对于大规模应用,建议采用分层架构:

  • 第一层:使用轻量级模型(如 Nomic-embed)进行初步筛选
  • 第二层:使用重排序模型(如 BGE-reranker)精细排序
  • 特殊场景:针对特定任务使用专门优化的 Embedding 模型

3. 附录

3.1. 嵌入模型的优势和劣势

嵌入模型优劣势对比表

如果您觉得这篇文章对您了解 Embedding 技术有帮助,欢迎关注我的公众号,查看更多精彩内容;点赞或赞赏表达您的鼓励!