2026-09-23
Meta / Llama·国际
Muse Realtime Avatar
模态音频·图像·视频
Meta 音频驱动的实时数字人模型,基于因果 Diffusion Transformer 架构,通过自强迫分布匹配蒸馏将推理评估从 120 次减少到 2 次(60x 加速),支持 448x768 25fps 视频流式生成,端到端延迟约 870ms,真人双向盲测相对 Runway Characters 偏好度 78%:22%、相对 HeyGen LiveAvatar 偏好度 88%:12%。
音频驱动Diffusion Transformer448x768 25fps870ms 延迟60x 蒸馏加速
End-of-turn to first-byte latency 870ms