GPT-6 Astra
OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。
抽象图形规则归纳,人类 ~76% vs AI 长期低位,AGI 试金石
抽象图形找规律——人类轻松、AI 抓瞎的经典。o3 高分引发轰动,但高算力口径有争议。
每任务学示例→推广;半私有评测集
共收录 14 场模型发布(收录 37 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20
OpenAI 首个将 Preparedness 框架推至 Critical 等级的旗舰前沿模型,在计算机直接操控、复杂多步长程自主 Agent、软件工程与零日(zero-day)漏洞挖掘上实现重大跃迁;在 ARC-AGI-3 和 ExploitBench 达到饱和得分。
本发布含 3 个变体,各变体规格见模型详情。
发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。
Anthropic 发布 Claude Opus 5,effort 分档 high/xhigh/max 并提供 Fast 模式;页面数值多为图表与对比性表述(含大量内部评测)。已收录 18 项评测覆盖前沿编码、Agent 操作与法律/健康/生物专业域:亮点 DeepSWE v1.1 68.8、BrowseComp 90.8。
Google 在 I/O 2026 发布 Gemini 3.5 首个模型 Gemini 3.5 Flash,定位「frontier intelligence with action」,并成为 Gemini 应用与 Search AI Mode 的默认模型。评测横跨终端智能体、多模态理解与抽象推理,亮点如 Terminal-Bench 2.1 76.2%、MCP Atlas 83.6%,页面并称输出速度约为其他前沿模型 4 倍。
本发布含 2 个变体,各变体规格见模型详情。
OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。
本发布含 4 个变体,各变体规格见模型详情。
OpenAI 将 GPT-5.4 定位为融合 GPT-5.3-Codex 编码谱系的新旗舰(ChatGPT 内 Thinking 模式,effort none/low/medium/high/xhigh,1M 上下文,原生计算机操作与工具搜索)。已收录 90 余项评测横跨知识工作、编码、计算机操作与长上下文:亮点 GDPval 83.0%、OSWorld-Verified 75.0%。
Google 将 Gemini 3.1 Pro 定位为「为最复杂任务打造的更聪明模型」,基于 Gemini 3 Pro,发布时为 preview(thinking 档 low/medium/high)。已收录 19 项评测横跨推理、代码、多模态与长上下文:亮点 GPQA 94.3%、SWE-bench Verified 80.6%。
Claude Opus 4.6 是 Anthropic 的旗舰模型,引入多档推理努力(low/medium/high/max)、自适应思考、上下文压缩与 1M 上下文 beta。评测覆盖代理编码/工具/搜索、法律与多语言问答:SWE-bench Verified 80.8、GPQA Diamond 91.3、ARC-AGI-2 68.8、BrowseComp 84.0。
Gemini 3 Flash 以「为速度打造的前沿智能」为定位发布,上线即为 Gemini 应用与搜索 AI Mode 默认模型(发布时为 preview)。已收录 25 项评测横跨推理、代码、多模态与 Agent:亮点 AIME 2025(带代码执行)99.7%、SWE-bench Verified 78%。
谷歌将 Gemini 3 Deep Think 定位为 Gemini 应用内面向 Google AI Ultra 订阅用户推出的增强推理模式,专攻挑战最先进模型的复杂数学、科学与逻辑问题。已收录评测为通用推理与抽象推理两项,HLE 41.0%(无工具)、ARC-AGI-2 45.1%(带代码执行)。
本发布含 3 个变体,各变体规格见模型详情。
Seed1.8 被发布文定位为通用化 Agentic 模型,覆盖 GUI/浏览器/移动操作、代理搜索、代理编码与经济价值领域任务,并提供三种思考模式。评测横跨代理、数学、STEM、知识、多模态与长视频等约 13 组:GAIA 87.4、BrowseComp-zh 81.3、AIME-25 94.3。
本发布含 2 个变体,各变体规格见模型详情。
Gemini 3 发布以「智能新纪元」为题呈现,Gemini 3 Pro 为旗舰型号(发布时 preview)。已收录评测横跨推理、代码、多模态与 Agent:亮点 LMArena 1501 Elo、AIME 2025(带代码执行)100%。
本发布含 2 个变体,各变体规格见模型详情。
Grok 4 是 xAI 具备原生工具调用与实时搜索的模型,官方称其为 HLE text-only 子集首个突破 50%(50.7%)的模型。评测集中于数学、科学与编码:AIME'25 91.7%(无工具)、HMMT 2025 90%、GPQA 87.5%、ARC-AGI-2 15.9%(闭源 SOTA)。
字节跳动火山引擎主力通用大模型,具备高性价比、低延迟响应与出色的中文上下文理解能力。
以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。
本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。