四项视频生成技术,开源!

四项视频生成技术开源封面

1. 引言:多模态开源周收官

过去一周,智谱 GLM 先后开源了多模态模型家族:

从「眼睛看得见」的视觉理解模型GLM‑4.6V

到「手能动起来」的AutoGLM

再到「语音听得懂」的GLM‑ASR

与「话能说出口」的GLM‑TTS

从 GLM 团队组建的第一天起,我们就在试图回答那个根本问题“机器如何像人一样思考”。

我们希望让大模型逐步拥有人的世界知识、记忆能力、复杂推理能力,以及拥有多模态处理能力,最终实现 AGI。

在一周内,我们开源了覆盖视觉理解、设备操作、语音的多模态模型,从文本扩展到多模态,不断探寻智能上界。

在多模态开源周的收官之日,我们再开源四项面向视频生成的核心技术成果:SCAILRealVideoKaleidoSSVAE

它们对准当前视频生成领域的三大难点:精细化可控生成复杂时空结构建模,以及 大规模训练成本控制

  • SCAIL:影视级角色动画生成框架,实现 SOTA 姿态控制;
  • RealVideo:实时流式视频生成系统,仅 2-3 秒首响延迟;
  • Kaleido:多主体视频生成框架,一致性开源 SOTA;
  • SSVAE:频谱结构化变分自编码器 VAE,3 倍收敛加速。

希望通过开源这四项底层技术,为繁荣的视频生成技术社区、产品社区,提供一些工程方案与理论研究,方便社区直接复现与二次开发。

2. SCAIL:影视级复杂姿态控制角色动画

开源周谢幕之舞,来自 SCAIL 复杂姿态控制

姿态可控角色动画生成可以实现让一张照片根据指定动作运动。

然而,基于 2D 骨骼点的传统方法由于无法编码深度信息与遮挡关系,在处理复杂动作(如空翻、街舞)时,常导致肢体结构崩坏或违反物理规律。

进一步,由于姿态编码和姿态输入方式的限制,该技术始终难以实现多人复杂交互动作的生成,难以面对影视级专业需求。

我们与清华刘永进教授课题组合作提出了一套面向影视级标准的角色动画生成框架——SCAIL,通过识别角色动画中的关键瓶颈,即姿态表征与注入机制,解决了生成过程中的时空一致性问题,不仅在单人运动上取得了 SOTA 效果,更将角色动画应用场景扩展到复杂多人交互。

SCAIL 复杂姿态控制效果

  • 3D 一致性姿态表征(3D-Consistent Pose Representation):
    • SCAIL 摒弃了传统的 2D 关键点或带有身份信息的 SMPL Mesh 方案。我们通过利用 3D 关节点估计,并在 3D 空间中将其拓扑结构光栅化渲染为柱体骨骼。这种表征方式显式地编码了深度与遮挡关系,使模型能够区分肢体的前后空间位置,从而在复杂遮挡场景下保持结构完整,并且能够进行运动信息保持的增强和重定向。
  • 全上下文姿态注入(Full-Context Pose Injection):
    • 针对传统 ControlNet 或 Adapter 逐帧控制缺乏全局视野的问题,SCAIL 在 DiT 架构中设计了全上下文注入机制,并在序列维度上通过 Pose-Shifted RoPE(姿态偏移旋转位置编码)区分控制信号,迫使模型在生成每一帧时,不仅关注当前时刻,还能对整个动作序列进行时空推理。

SCAIL 模型架构图

SCAIL 的模型架构图

3. RealVideo:实时视频生成对话系统

基于 RealVideo 和 GLM-TTS 声音克隆,一张图片+三秒语音,即可与 AI 角色开启实时对话。

如今,生成式模型已在视听质量上取得惊人突破,但目前主流的视频生成模型往往延迟很高,需要等待 1 分钟以上,才能生成一个 5 秒左右长度的视频。

为了解决这一问题,我们研发了实时流式视频生成系统 RealVideo。

RealVideo 的核心突破在于将视频生成的首响延迟从数分钟大幅压缩到了 2 至 3 秒。

正如大家在演示视频中看到的,用户只需提供一张静态照片并提问,两三秒后,画面中的人物就能开始流畅、自然地进行回答。

这种低延迟的生成能力,支持输出长达数分钟的连续对话或演讲视频,让 AI 交互从单纯的文字或语音对话真正迈向了“实时视频对话”。

为了实现这一效果,RealVideo 在模型架构和工程链路上进行了以下三项关键改进:

  • 自回归模型对抗训练:
    • RealVideo 使用了 Self-forcing 的框架在双向视频生成模型作为教师模型的监督下可以很快的学习到自回归生成的模式,同时使用了对抗损失进行监督,将视频漂移的问题大幅减少。
  • 滑动注意力窗口与 Dynamic Sink RoPE:
    • 为了保证实时生成的延迟在可控的范围内,RealVideo 使用了滑动窗口的策略,当视频的整体长度大于 k 时会对之前帧的 kv cache 进行截断,从而保证了模型上下文窗口大小为常数,为无限长生成提供了可能。同时 Dynamic Sink RoPE 策略可以保证相对位置编码的训练-推理一致,防止人物形象出现漂移。
  • 流水线 Pipeline:
    • 我们针对大模型对话、文本转语音、视频生成、VAE 解码等多个流程搭建了一套流水线并行的管线,将 CPU、GPU 以及 API 的运行时间尽可能重叠从而极大地降低了首响延迟且提高了生成帧率。从而达到了实时对话的效果。

4. Kaleido:从数据构造到有效建模的多主体一致性生成框架

Kaleido 在多主体(如人物+物体)及受控背景下的生成效果

在多主体视频生成任务中,现有模型难以在保持多个参考形象一致性的同时,有效提取参考主体的真正身份特征。

常见问题是在生成视频中直接复制参考图像,将参考图中的背景和主体的姿态等信息误认为主体身份特征,导致生成的主体运动不够灵活、表现力不足。

Kaleido 针对多主体生成的挑战,提出了一套从数据构建到参考信息注入的完整解决方案,在开源模型中达到了 SOTA 表现。

Kaleido 多主体生成效果

  • Reference Rotary Positional Encoding(R-ROPE):
    • 为了在 DiT 架构中精确区分不同的参考图像与视频 Token,Kaleido 引入了 R-ROPE 机制。该机制对参考图像的 Token 进行独立的旋转位置编码,通过显式的空间位移,在注意力计算层面确立了不同主体与视频帧之间的清晰边界,有效解决了多主体特征混淆的问题。
  • Cross-Paired 数据构建管线:
    • 针对背景纠缠问题,我们构建了包含背景修复与运动增强的数据处理管线,合成了大量跨配对训练数据。这一策略强迫模型在训练时必须从参考图中解耦出主体特征,而非简单复制像素,从而大幅提升了背景解耦能力。

Kaleido 的模型架构图

Kaleido 的模型架构图

5. SSVAE:基于谱分析的视频 VAE 隐空间优化

视频生成模型的训练成本极高,而业界传统的视频 VAE 优化目标主要针对像素级重构质量。

但我们的研究发现,相比于重构质量,隐变量结构对扩散模型的收敛贡献更大。

SSVAE(Spectral-Structured VAE)从谱分析的第一性原理出发,揭示了影响扩散模型训练效率的关键统计特性,并据此优化 VAE 的训练目标。

  • 谱特性分析与正则化:
    • 我们通过大量实验发现,具有时空低频偏置和通道特征值的少模式偏置的隐空间分布,能显著加速扩散模型的训练。

SSVAE 谱特性分析
SSVAE 通道特征值分布

  • 训练效率提升:
    • 实验数据表明,使用 SSVAE 提取的 Latent 训练视频扩散模型,在达到相同生成质量的前提下,收敛速度提升了 3 倍。同时,SSVAE 仅需 1.3B 参数量的扩散模型即可在性能上超越基于 Wan 2.2 VAE 的 4B 参数量的扩散模型。

SSVAE 训练收敛速度对比

SSVAE 通过谱正则化,在训练收敛速度和 Video Reward 上相对于 Baseline 的显著提升,超越 Wan 2.2 VAE。

6. 开源资源

我们已经开源上述论文涉及的代码及模型权重(包括 SCAIL 的 1.3B/14B 模型、SSVAE 的推理代码及 Kaleido 的 Checkpoint)。

本次开源周收官,智能是且仅是我们唯一的产品,期待与开发者共同推进 AGI 的上界。

6.1. SCAIL-Preview

6.1.1. 代码

6.1.2. 模型

6.2. RealVideo

6.2.1. 代码

6.2.2. 模型

6.3. Kaleido

6.3.1. 代码

6.3.2. 模型

6.4. SSVAE

6.4.1. 代码

6.4.2. 模型