Harvey LAB (Vals)

Harvey 法律智能体开源基准(Vals 运营榜单)

基本信息

类别
Agent 与环境
官网 / 数据集
https://x.ai/news/grok-4-6

30 秒看懂

Harvey 开源法律智能体基准(LAB):1,671 个任务、24+ 法律执业领域,采用 all-pass rubric 计分——任务内所有 rubric 项全过才计通过,故绝对分偏低是口径使然;任务集持续迭代,跨版本分数不宜直接对比。

采用格局:xAI Grok 4.6 引用;与 legal-agent-benchmark 同源(Harvey LAB)

评分协议

这个评测的官方统一评分协议还没收录到本页;各厂商实际使用的执行框架(harness)与推理档位(effort)已逐条写在下方引用卡里。

可比性提示:同一评测的分数是「实验配置」的产物:只要评测版本(variant)、执行框架(harness)、推理档位(reasoning effort)、工具、采样参数、运行次数或聚合方式有任何一项不同,数字就不能直接横向比较。下方各厂商的分数如未写明协议细节,请只当作方向参考。

模型发布采用时间轴

共收录 4 场模型发布 · 按发布时间倒序排列 · 数据更新于 2026-09-20

2026
2026-09-30 Google DeepMind / Gemini·国际

Gemini 4 Argon

价格$2/$10 每百万 tokens · 介绍期价格,缓存输入价比输入价低 95%;介绍期结束后为输入 $4、输出 $20

Google 的新前沿模型,面向真实软件工程、法律与金融等企业知识工作和网络安全防御,输出 token 上限提升到 1M。收录的 7 项评测以编码、智能体与安全为主,如 DeepSWE v1.1 77.9%、LVBench 91.7%;目前仅向可信网络防御者开放。

前沿模型网络安全防御1M 输出上限分阶段开放

查看模型变体与证据

Harvey's Legal Agent Benchmark 该来源尚无可读数值
2026-09-21 xAI / Grok·国际

Grok 4.7

参数2.1T上下文500K价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·代码·图像

xAI 发布的最新旗舰编码与知识工作模型,基于 2.1T 参数底座与长程强化学习,在 CursorBench 4.0 (46.3%)、DeepSWE v1.1 (71.0%) 与 Terminal-Bench 4.0 (38.0%) 等多小时自主长程任务上展现出更强的自我检验与 500K 上下文管理能力。

2.1T 参数500K 上下文长程自主任务强化自我检验

查看模型变体与证据

Harvey LAB (Vals) 19.6%
2026-08-13 Google DeepMind / Gemini·国际

Gemini 3.7 Flash

价格$0.75/$3.75 每百万 tokens · 促销价(原 3.6 Flash 半价),2026-12-31 到期;2027-01-01 起 $1.50/$7.50模态文本·图像·视频

Gemini 3.7 Flash 被定位为面向编码与代理的旗舰 workhorse 模型(most intelligent workhorse model for coding and agents)。评测聚焦编码与代理工作流并延伸到文档/视频理解:DeepSWE v1.1 65.3%、Terminal-bench 2.1 85.8%、WebDev Arena 1588 Elo、GDP.pdf 34.0%。

多模态代理编码文档理解

查看模型变体与证据

LAB-AA 90.7%
2026-08-12 xAI / Grok·国际

Grok 4.6

价格$2/$6 每百万 tokens · 另有 fast 变体,价格为标准价的 2 倍模态文本·图像

发布文称 Grok 4.6 在 Grok 4.5 基础上聚焦长时间运行的智能体与更具野心的交互和视觉任务。10 项评测覆盖智能体编码、知识与法律工作,亮点为 Artificial Analysis Intelligence Index 61(自述追平 GPT-5.6 Sol)与 GDPval-AA v2 1753 Elo。

长程智能体编码视觉任务

查看模型变体与证据

Vals harness 15.8%

数据缺口(本页暂未收录)

以上字段暂缺时,本页不虚构数字;后续会依据每一次发布的证据逐条补齐并标注来源。

复现入口

引用

本页数据更新于 2026-09-20,依据厂商发布材料真实抓取;发现数据问题欢迎在 GitHub 提 Issue。