Nukesor/pueue

:stars: Manage your shell commands.

6,154 rs
638
Generated Behavioral Tests
21.3%
Best Score
Claude Opus 4.8 (xhigh)

Hover a point for details · The line marks the Pareto frontier (best score per cost) · Click a point to see model details

19 runs
# Model Score Cost Calls
1 Claude Opus 4.8 (xhigh) 21.3% $17.68 119 trace →
2 GLM-5.2 18.0% $30.03 310 trace →
3 Claude Opus 4.7 (xhigh) 16.1% $7.48 127 trace →
4 Claude Opus 4.6 15.4% $12.90 252 trace →
5 GPT 5.5 13.6% $1.09 14 trace →
6 Gemini 3.1 Pro 12.5% $1.07 72 trace →
7 Claude Opus 4.7 12.4% $1.93 68 trace →
8 Gemini 3.5 Flash 10.8% $3.76 134 trace →
9 GPT 5.5 (high) 8.6% $3.36 45 trace →
10 GPT 5.5 (xhigh) 8.3% $8.76 87 trace →
11 GPT 5.6 Sol (xhigh) 7.8% $3.36 28 trace →
12 GPT 5.6 Sol (medium) 6.4% $0.71 16 trace →
13 Claude Haiku 4.5 4.2% $0.56 118 trace →
14 GPT 5.4 mini 4.1% $0.04 9 trace →
15 GPT 5.4 3.9% $0.16 7 trace →
16 Gemini 3 Flash 2.8% $0.30 91 trace →
17 GPT 5 mini 1.9% $0.02 11 trace →
18 Gemini 3.6 Flash 1.6% $2.81 105 trace →
19 Claude Sonnet 4.6 1.6% $15.46 231 trace →

Click a row to replay how that model rebuilt this program, or the model name to open its full run