avatar-stream-latency

由发布引用自动生成

这个评测在官方模型发布中被引用了 1 场发布(来自Meta / Llama)。本页由这些发布引用自动生成:逐条列出每次引用的分数、协议与原文链接;完整的评测定义、数据集与指标介绍仍在补全,缺失的信息不会编造。

下面每张「发布」卡片记录了主流模型在该基准上的官方实测得分、评测协议与模型核心能力介绍。

模型发布引用时间轴

共收录 1 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-23 Meta / Llama·国际

Muse Realtime Avatar

模态音频·图像·视频

Meta 音频驱动的实时数字人模型,基于因果 Diffusion Transformer 架构,通过自强迫分布匹配蒸馏将推理评估从 120 次减少到 2 次(60x 加速),支持 448x768 25fps 视频流式生成,端到端延迟约 870ms,真人双向盲测相对 Runway Characters 偏好度 78%:22%、相对 HeyGen LiveAvatar 偏好度 88%:12%。

音频驱动Diffusion Transformer448x768 25fps870ms 延迟60x 蒸馏加速

查看模型变体与证据

End-of-turn to first-byte latency 870ms

来源

发现本页数据问题?欢迎在 GitHub 提 Issue。