Artificial Analysis Intelligence Index

Artificial Analysis 的复合智能指数:九项评测加权平均(Agent 34% / 代码 24% / 科学推理 24% / 通用 18%)

基本信息

类别
偏好与排行
官网 / 数据集
https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index

30 秒看懂

复合分只用于横向总排名;单项能力归因必须回看成分评测,版本切换后历史分数不可直接比。

采用格局:证据账本中 6 次引用;第三方综合榜单叙事(对标 Arena 榜)

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 8 场模型发布(收录 9 项分值) · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-22 Xiaomi / 小米·国内

MiMo-V2.6-Pro / MiMo-V2.6-Flash / MiMo-V2.6-Pro-UltraSpeed

本发布含 3 个变体,各变体规格见模型详情。

小米将 MiMo-V2.6-Pro 定位为该系列迄今能力最强的原生全模态模型,面向长程任务、网络安全与科研。发布页收录的评测以编码、通用智能体和安全为主,附录表 DeepSWE v1.1 为 71.9,Terminal-Bench 2.1 为 89.9。

开源权重1.02T MoE1M 上下文原生全模态

查看模型变体与证据

MiMo-V2.6-Pro · v4.3 46.32
2026-08-26 Z.ai / 智谱 GLM·国内

GLM-5.3-Flash

参数320B-A18B MoE模态文本·图像·视频

GLM-5.3-Flash 以「Frontier Intelligence, Flash Cost」为定位发布,是 GLM-5 系列首个原生多模态模型(320B 总参/18B 激活,发布前以 ox-alpha 匿名测试)。已收录 16 项评测集中于终端编码、Agent 工具使用与视觉理解:亮点 Terminal-Bench 2.1 84.3、GDPval-AA v2 Elo 1773。

开源权重原生多模态高性价比编码与 Agent

查看模型变体与证据

v4.1.1 57
2026-08-26 OpenAI·国际

GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna

本发布含 3 个变体,各变体规格见模型详情。

发布文将 Sol 定位为 GPT-5.6 的旗舰档(medium/high/xhigh/max/ultra 五档努力级别)。36 项评测横跨智能体、编码、长上下文、科研医疗金融与安全,亮点为 BrowseComp 90.4% 与 Terminal-Bench 2.1 88.8%。

旗舰多档努力智能体安全防护

查看模型变体与证据

GPT-5.6 Sol · Artificial Analysis Intelligence Index 58.9
2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

Artificial Analysis Intelligence Index 56 (composite model intelligence)
2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

Artificial Analysis Intelligence Index 61
2026-04-23 OpenAI·国际

GPT-5.5 / GPT-5.5 Pro

本发布含 2 个变体,各变体规格见模型详情。

OpenAI 发布 GPT-5.5,提供 low/medium/high/xhigh 推理档(另有非推理模式)。评测横跨智能体编码、知识工作、长上下文与科学/网络安全,亮点如 Terminal-Bench 2.0 82.7%、ARC-AGI-2 85.0%。

智能体编码知识工作长上下文网络安全

查看模型变体与证据

GPT-5.5 · Artificial Analysis Intelligence Index 60.2claude-opus-4-7 · Artificial Analysis Intelligence Index 57.3
2026-03-18 MiniMax·国内

MiniMax-M2.7

模态文本

MiniMax 发布 M2.7「Early Echoes of Self-Evolution」,定位为首个深度参与自身进化的 M 系列模型,支持 Agent Teams、复杂 Skills 与动态工具搜索。评测集中在智能体与编码,亮点如 SWE-Bench Pro 56.2%、MLE-Bench Lite 66.6%。

开源权重智能体自我进化办公

查看模型变体与证据

Artificial Analysis panel (chart) 50
2025
2025-10-27 MiniMax·国内

MiniMax-M2

价格$0.3/$1.2 每百万 tokens · 页面同时给出人民币定价:输入 ¥2.1、输出 ¥8.4 每百万 tokens;另载限时免费试用至 2025-11-07模态文本

发布文以“简中之巧(Ingenious in Simplicity)”为题,将 M2 定位为 agent 优先的开源权重模型,价格约为 Claude Sonnet 的 8%、速度约 2 倍。9 项评测集中于智能体编码、工具调用与搜索,亮点为 GAIA(纯文本)75.7 与 τ²-Bench 77.2。

开源权重智能体优先高性价比

查看模型变体与证据

Intelligence Index v3.0 61

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。