Epistates/treemd

A (TUI/CLI) markdown navigator with tree-based structural navigation.

603 rs medium
1,569
Generated Behavioral Tests
85.1%
Best Score
Claude Opus 5 (xhigh)

Hover a point for details · The line marks the Pareto frontier (best score per cost) · Click a point to see model details

21 runs
# Model Score Cost Calls
1 Claude Opus 5 (xhigh) 85.1% $51.59 294 trace →
2 GPT-5.6 Sol (xhigh) 66.7% $6.81 43 trace →
3 GPT 5.5 (xhigh) 58.9% $7.32 69 trace →
4 Gemini 3.7 Flash 58.7% $1.93 141 trace →
5 GLM-5.2 58.3% $20.81 239 trace →
6 Claude Opus 4.8 (xhigh) 57.4% $20.09 151 trace →
7 Claude Opus 4.6 55.1% $20.28 431 trace →
8 Claude Sonnet 4.6 53.3% $29.34 585 trace →
9 GPT 5.5 (high) 49.1% $3.31 33 trace →
10 GPT-5.6 Sol 46.7% $1.02 18 trace →
11 Claude Opus 4.7 45.4% $2.54 66 trace →
12 GPT 5.5 45.3% $1.62 20 trace →
13 Gemini 3.6 Flash 45.1% $4.51 137 trace →
14 Gemini 3.5 Flash 45.1% $6.72 243 trace →
15 Gemini 3.1 Pro 35.6% $2.30 130 trace →
16 Claude Haiku 4.5 32.4% $0.86 144 trace →
17 GPT 5.4 31.9% $0.21 7 trace →
18 Gemini 3 Flash 27.5% $0.31 117 trace →
19 GPT 5 mini 21.7% $0.07 34 trace →
20 GPT 5.4 mini 14.6% $0.04 14 trace →
21 Claude Opus 4.7 (xhigh) 1.5% $5.66 147 trace →

Click a row to replay how that model rebuilt this program, or the model name to open its full run