DeepSeek-V3
DeepSeek · 2024-12-26 · 类别未确认
DeepSeek-V3
深度求索自研 MoE 架构大语言模型,首创多头潜在注意力(MLA)与 DeepSeek 稀疏注意力(DSA),以极高训练与推理效率成为全球开源基座代表作。
- 输入模态
- 文本
- 上下文
- 128K tokens
- 参数
- 671B (37B active)
- 价格(每百万 tokens)
- 输入 0.14 / 输出 0.28
本变体的评测证据
尚无对应评测记录。缺少证据不代表能力为零。
未关联到本页变体的记录
这些记录不会分配给任意模型参与选型。
归一化读数:不计算;样本及方差不完整,无法计算置信区间。