Gemini 3.8 Flash / Gemini 3.8 Flash Cyber
Google DeepMind / Gemini · 2026-09-02 · 类别未确认
官方发布来源 · 按需求选型 · 查看覆盖缺口 · 归档与转录记录
Gemini 3.8 Flash
Google DeepMind Flash 阶梯新一代工作主力模型,针对长时程软件工程与智能体工具循环调优;在 Terminal-Bench 2.1 达到 90.8%、SWE-Bench Pro 61.6%、SWE-Atlas 51.9%,支持按任务自定义思维等级。
- 输入模态
- 文本 / 图像 / 视频 / 音频
- 上下文
- 1M
- 参数
- 官方资料未说明
- 价格(每百万 tokens)
- USD 输入 0.75 / 输出 3.75 · 延续至 2026-12-31 的优惠定价,平价升级
本变体的评测证据
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: Benchmark Performance Highlights · table: Performance Comparison · row: Terminal-Bench 2.1
{
"harness": null,
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": null,
"aggregation": null,
"judge": null
}官方博客公布数值,较前代 Gemini 3.7 Flash 的 81.6% 提升 9.2pp。
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: Benchmark Performance Highlights · table: Performance Comparison · row: SWE-Bench Pro
{
"harness": null,
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": null,
"aggregation": null,
"judge": null
}官方博客公布数值,Gemini 3.7 Flash 为 60.4%。
归一化读数:不计算;样本及方差不完整,无法计算置信区间。
原文位置与完整协议
heading: Benchmark Performance Highlights · table: Performance Comparison · row: SWE-Atlas
{
"harness": null,
"tools": null,
"shots": null,
"reasoning_effort": null,
"temperature": null,
"top_p": null,
"token_budget": null,
"turn_limit": null,
"time_limit": null,
"run_count": null,
"aggregation": null,
"judge": null
}官方博客公布数值,Gemini 3.7 Flash 为 48.0%。
Gemini 3.8 Flash Cyber
Gemini 3.8 Flash 的网络安全防御专精版本,针对漏洞挖掘、复现与自动生成防御性补丁进行强化训练,通过 Fairwind 计划受控向合规防御者分发。
- 输入模态
- 文本 / 代码
- 上下文
- 1M
- 参数
- 官方资料未说明
- 价格(每百万 tokens)
- 无此口径报价;不等于免费
本变体的评测证据
尚无对应评测记录。缺少证据不代表能力为零。