hooklift/gowsdl

WSDL2Go code generation as well as its SOAP proxy

1,219 go medium
391
Generated Behavioral Tests
94.9%
Best Score
Claude Opus 4.8 (xhigh)

Hover a point for details · The line marks the Pareto frontier (best score per cost) · Click a point to see model details

19 runs
# Model Score Cost Calls
1 Claude Opus 4.8 (xhigh) 94.9% $40.33 233 trace →
2 GPT 5.6 Sol (xhigh) 93.6% $11.11 79 trace →
3 GPT 5.5 (xhigh) 90.8% $17.46 117 trace →
4 Claude Opus 4.7 (xhigh) 89.5% $21.55 224 trace →
5 Claude Opus 4.7 86.4% $19.71 260 trace →
6 GPT 5.5 (high) 85.7% $7.43 73 trace →
7 GLM-5.2 82.9% $36.21 361 trace →
8 GPT 5.5 80.6% $1.60 28 trace →
9 GPT 5.6 Sol (medium) 78.8% $2.24 24 trace →
10 Gemini 3.5 Flash 78.8% $4.53 166 trace →
11 Gemini 3.1 Pro 69.3% $1.04 82 trace →
12 Claude Haiku 4.5 63.2% $1.02 155 trace →
13 Claude Sonnet 4.6 62.4% $60.18 801 trace →
14 Claude Opus 4.6 61.6% $20.18 296 trace →
15 Gemini 3.6 Flash 31.7% $5.65 153 trace →
16 Gemini 3 Flash 30.7% $0.27 62 trace →
17 GPT 5.4 mini 26.6% $0.02 13 trace →
18 GPT 5.4 11.8% $0.38 10 trace →
19 GPT 5 mini 11.5% $0.01 9 trace →

Click a row to replay how that model rebuilt this program, or the model name to open its full run