Epistates/treemd

A (TUI/CLI) markdown navigator with tree-based structural navigation.

603 rs medium
1,569
Generated Behavioral Tests
66.7%
Best Score
GPT 5.6 Sol (xhigh)

Hover a point for details · The line marks the Pareto frontier (best score per cost) · Click a point to see model details

19 runs
# Model Score Cost Calls
1 GPT 5.6 Sol (xhigh) 66.7% $6.81 43 trace →
2 GPT 5.5 (xhigh) 58.9% $7.32 69 trace →
3 GLM-5.2 58.3% $20.81 239 trace →
4 Claude Opus 4.8 (xhigh) 57.4% $20.09 151 trace →
5 Claude Opus 4.6 55.1% $20.28 431 trace →
6 Claude Sonnet 4.6 53.3% $29.34 585 trace →
7 GPT 5.5 (high) 49.1% $3.31 33 trace →
8 GPT 5.6 Sol (medium) 46.7% $1.02 18 trace →
9 Claude Opus 4.7 45.4% $2.54 66 trace →
10 GPT 5.5 45.3% $1.62 20 trace →
11 Gemini 3.6 Flash 45.1% $4.51 137 trace →
12 Gemini 3.5 Flash 45.1% $6.72 243 trace →
13 Gemini 3.1 Pro 35.6% $2.30 130 trace →
14 Claude Haiku 4.5 32.4% $0.86 144 trace →
15 GPT 5.4 31.9% $0.21 7 trace →
16 Gemini 3 Flash 27.5% $0.31 117 trace →
17 GPT 5 mini 21.7% $0.07 34 trace →
18 GPT 5.4 mini 14.6% $0.04 14 trace →
19 Claude Opus 4.7 (xhigh) 1.5% $5.66 147 trace →

Click a row to replay how that model rebuilt this program, or the model name to open its full run