PawBench
v1.0 · 150 tasks

PawBench

How (Model × Harness) combinations perform on production-grade tasks

Agent Performance = f(Model, Harness)

The same 150 tasks across (Model × Harness) combinations — read each axis independently and separate the model's contribution from the harness's.

150 Tasks 6 Sources 3 Harnesses 7 Capabilities

Model × Harness Score Matrix

All 150 tasks (text + multimodal)

Model
Hermes
v2026.4.23
OpenClaw
v2026.4.24
QwenPaw
v1.1.3
AvgΔ
claude-opus-4.6
78.4
76.1
78.3
77.6
+2.3
deepseek-v4-pro
72.1
75.4
75.6
74.4
+3.6
qwen3.7-maxtext-only
72.3
72.5
77.6
74.1
+5.4
qwen3.6-max-previewtext-only
68.1
75.1
78.3
73.9
+10.3
qwen3.6-plus
70.4
73.6
75.0
73.0
+4.6
qwen3.6-27b
68.2
72.9
72.7
71.3
+4.7
glm-5.1text-only
63.2
68.5
71.1
67.6
+7.9
kimi-k2.6
66.4
66.6
66.6
66.5
+0.2
qwen3.6-35b-a3b
56.7
67.8
68.3
64.3
+11.5
Avg
68.4
72.1
73.7
71.4

Leaderboard

#ModelHarnessOverallAutomatedLLM JudgeTasksUpdated
1claude-opus-4.6Hermes78.482.690.81502026-05-29
2qwen3.6-max-previewQwenPaw78.387.281.11502026-05-29
3claude-opus-4.6QwenPaw78.385.383.91502026-05-29
4qwen3.7-maxQwenPaw77.684.682.91502026-05-29
5claude-opus-4.6OpenClaw76.183.680.71502026-05-29
6deepseek-v4-proQwenPaw75.683.780.61502026-05-29
7deepseek-v4-proOpenClaw75.483.580.71502026-05-29
8qwen3.6-max-previewOpenClaw75.184.481.71502026-05-29
9qwen3.6-plusQwenPaw75.084.679.11502026-05-29
10qwen3.6-plusOpenClaw73.682.377.21502026-05-29
11qwen3.6-27bOpenClaw72.982.277.51502026-05-29
12qwen3.6-27bQwenPaw72.783.877.61502026-05-29
13qwen3.7-maxOpenClaw72.579.375.91502026-05-29
14qwen3.7-maxHermes72.380.479.91502026-05-29
15deepseek-v4-proHermes72.181.279.01502026-05-29
16glm-5.1QwenPaw71.185.083.01502026-05-29
17qwen3.6-plusHermes70.480.576.61502026-05-29
18glm-5.1OpenClaw68.572.674.51502026-05-29
19qwen3.6-35b-a3bQwenPaw68.377.868.21502026-05-29
20qwen3.6-27bHermes68.278.775.01502026-05-29
21qwen3.6-max-previewHermes68.176.877.61502026-05-29
22qwen3.6-35b-a3bOpenClaw67.877.670.81502026-05-29
23kimi-k2.6QwenPaw66.680.169.01502026-05-29
24kimi-k2.6OpenClaw66.679.370.91502026-05-29
25kimi-k2.6Hermes66.478.770.31502026-05-29
26glm-5.1Hermes63.275.371.31502026-05-29
27qwen3.6-35b-a3bHermes56.765.861.51502026-05-29

How it works

Three steps from model to score

  1. 1

    Pick a model and harness

    Any OpenAI-compatible endpoint or local model; harness can be QwenPaw / OpenClaw / Hermes

  2. 2

    Run in Docker

    Each task runs in an isolated container with workspace files mounted, strict timeouts and retries

  3. 3

    Automated + LLM grading

    Python grade() functions plus an LLM judge; hybrid tasks zero the LLM share if automated < 0.75