ポーズ駆動の人物アニメーションは、1枚の参照画像と駆動ポーズ列から対象人物の動画を合成する。ライブ配信、テレプレゼンス、バーチャルアバターのようなインタラクティブ用途にはリアルタイム生成が要るが、拡散ベースのシステムはクリップあたり数分から数時間を要し応答的な対話にならない。
LiveAnimateは140億パラメータの動画Diffusion Transformer上に構築され、2段階の学習パイプラインを採る。まずReference-Anchored Teacher-Forcing Adaptationで、事前学習した双方向DiTをブロック因果の自己回帰生成器に適応させ、次にBlock-wise Self-Forcing Distillationでサンプリング予算を3ステップに削る。
長い配信で見た目を保つため、Pose-Retrieval Sink Attention(PR-Sink)という有界のKVキャッシュ機構を導入する。最初の生成ブロックを恒久的に固定するStatic Sink、ポーズ検索で選ばれた過去ブロックを保持するDynamic Sink、3スロットのRolling Windowを組み合わせ、ポーズが再出現したときに系列全体を保持せず該当する見た目の文脈を復元する。Ulyssesの系列並列と演算子融合により、H100 2枚で19.63FPSのストリーミング推論を達成。3分間のベンチマークで、最初の30秒から最後の1分まで知覚品質と同一性がほぼ一定に保たれたとしている。