← 模型目录

DeepSeek-V3

DeepSeek · 2024-12-26 · 类别未确认

官方发布来源 · 按需求选型 · 查看覆盖缺口

DeepSeek-V3

深度求索自研 MoE 架构大语言模型,首创多头潜在注意力(MLA)与 DeepSeek 稀疏注意力(DSA),以极高训练与推理效率成为全球开源基座代表作。

输入模态
文本
上下文
128K tokens
参数
671B (37B active)
价格(每百万 tokens)
输入 0.14 / 输出 0.28

本变体的评测证据

尚无对应评测记录。缺少证据不代表能力为零。

未关联到本页变体的记录

这些记录不会分配给任意模型参与选型。

gsm8k 94.0 模型 未标明 · 版本 未说明 · 指标 未说明 · 单位 未说明 来源等级 A · vendor_reported · 核对日期 2026-08-28 · 距快照 37 天

归一化读数:不计算;样本及方差不完整,无法计算置信区间。

原文位置与完整协议

未提供原文定位

{}

迁移自 adoption[],定位与协议未核验。

打开官方来源