AI platform · IDE · agents · models
Console/Models / Benchmarks

Benchmark comparison

Clavue official models on the same table as industry references — pick a model, feel the deal.

Clavue

Internal Clavue evaluation suite (2026-07). Methodology aligns with public agent benchmarks; not an independent third-party audit. Peer figures are approximate public references for context only.

Benchmark table
Per-benchmark bars
BenchmarkAutoClavueClavue 2.1Clavue 2.1 FastClavue 2.1 ProClavue 2.1 RevDeepSeek V4 FlashGPT-5.4 miniClaude Sonnet 4.6GLM-class frontier
SWE-Bench Pro49.854.157.853.259.456.052.647.948.351.2
SWE-Bench Multilingual70.274.877.272.578.576.073.371.075.974.1
Terminal-Bench v2.154.059.564.556.067.062.062.055.871.258.4
Tau3-banking18.522.026.520.028.024.523.011.330.521.8
MCP-Atlas58.064.270.561.072.068.069.055.266.762.5
SkillsBench46.551.055.849.557.554.053.544.854.448.2
WideSearch68.073.576.871.078.074.074.470.279.572.0
BrowseComp64.070.575.067.576.572.073.274.068.5
IFBench72.576.080.574.081.582.079.069.057.071.0
SysBench91.293.094.292.094.893.893.993.394.892.4
MRCR-128k78.086.590.282.091.589.088.556.192.584.0
Multi-IF83.085.587.884.288.588.086.284.684.885.1