openai/gpt-oss-120b
OpenAI
Consistency
How often it gives the same answer when asked again. Across 43 questions. How it's measured →
Alignment
How often its answer is the one most other models gave. Across 47 questions. How it's measured →
Hedging
How often it qualifies its answer or declines to give one. How it's measured →
Answers most like
Answers least like
Measured across the questions both models were asked, at least 20 of them. How it's measured →
Where this model stands apart
14 of the 47 scored questions where its answer wasn't the one most models gave.
10 runs · consistency 100
30 runs · consistency 33.3
15 runs · consistency 61.1
20 runs · consistency 40
5 runs
10 runs · consistency 44.4
15 runs · consistency 66.7
20 runs · consistency 40
25 runs · consistency 13.3
10 runs · consistency 100
10 runs · consistency 50
15 runs · consistency 26.7
15 runs · consistency 100
15 runs · consistency 6.7
10 runs · consistency 100
10 runs · consistency 20
15 runs · consistency 77.8
15 runs · consistency 44.4
20 runs · consistency 51.5
15 runs · consistency 58.3
25 runs · consistency 36.1
10 runs · consistency 100
10 runs
20 runs · consistency not scored
20 runs · consistency 36.1
20 runs · consistency 44.4
10 runs · consistency 100
20 runs · consistency 46.7
20 runs · consistency 46.7
20 runs · consistency 100
19 runs · consistency 46.7
9 runs · consistency 20
10 runs · consistency 46.7
19 runs · consistency 100
10 runs · consistency 100
10 runs · consistency 40
20 runs · consistency 19.4
5 runs
4 runs
10 runs · consistency 100
10 runs
10 runs