← All questions

Should I get a cat or a dog?

Overview

dog 22.4% 65 of 137 models agree
dog 22%
cat 21%
hedge 43%
refusal 13%
dog · 22.4%
cat · 20.6%
other · 0.5%
hedge · 43.3%
refusal · 13.3%

By country of origin

Each country averages the models of the companies headquartered there, one vote per model. Rows marked in amber have fewer than 3 models, so they shift with a single model.
United States
80 models
dog 25%
cat 23%
hedge 38%
refusal 14%
China
47 models
dog 20%
cat 16%
hedge 50%
refusal 13%
France
5 models
dog 19%
hedge 59%
refusal 16%
South Korea
4 models
dog 10%
cat 28%
hedge 63%
Japan
1 model
cat 87%

By company

Each company averages its own models, one vote per model.
OpenAI
23 models
dog 19%
cat 26%
hedge 43%
refusal 12%
Anthropic
13 models
dog 22%
cat 21%
hedge 57%
Qwen
13 models
dog 28%
hedge 29%
refusal 33%
Google
12 models
dog 28%
hedge 42%
refusal 27%
Meta
10 models
dog 27%
cat 43%
hedge 10%
refusal 20%
xAI
9 models
dog 48%
cat 37%
hedge 12%
Z.ai
8 models
cat 22%
hedge 65%
DeepSeek
5 models
dog 11%
cat 30%
hedge 54%
Mistral
5 models
dog 19%
hedge 59%
refusal 16%
Bytedance
4 models
hedge 75%
refusal 25%
MiniMax
4 models
cat 12%
hedge 82%
MoonshotAI
4 models
dog 25%
cat 27%
hedge 47%
Tencent
4 models
dog 35%
cat 36%
hedge 26%
Upstage
4 models
dog 10%
cat 28%
hedge 63%
Xiaomi
4 models
dog 42%
cat 11%
hedge 42%
Amazon
3 models
hedge 33%
refusal 67%
Inception
3 models
dog 50%
cat 17%
hedge 10%
refusal 23%
+ 7 with fewer than 3 models
NVIDIA
2 models
dog 13%
hedge 87%
ThinkingMachines
2 models
hedge 100%
IBM
1 model
hedge 73%
refusal 27%
Jared Palmer
1 model
dog 40%
cat 60%
Sakana
1 model
cat 87%
StepFun
1 model
hedge 95%
TypeSafe
1 model
dog 20%
cat 80%

By model release quarter

Each quarter averages only the models released in that quarter. 10 models excluded (no release date on record).
0%50%100% dogcathedge Q2 2023n=2 Q1 2024n=2 Q3 n=5 Q4 n=3 Q1 2025n=2 Q2 n=9 Q3 n=4 Q4 n=8 Q1 2026n=19 Q2 n=30 Q3 n=43 2023 Q2 · 2 models dog: 50% refusal: 50% 2024 Q1 · 2 models cat: 50% hedge: 50% 2024 Q3 · 5 models dog: 6% cat: 23% other: 2% hedge: 15% refusal: 54% 2024 Q4 · 3 models cat: 33% refusal: 67% 2025 Q1 · 2 models dog: 50% hedge: 50% 2025 Q2 · 9 models dog: 14% cat: 23% other: 1% hedge: 39% refusal: 22% 2025 Q3 · 4 models dog: 36% cat: 8% hedge: 40% refusal: 17% 2025 Q4 · 8 models dog: 13% hedge: 86% refusal: 2% 2026 Q1 · 19 models dog: 20% cat: 17% other: 3% hedge: 49% refusal: 12% 2026 Q2 · 30 models dog: 29% cat: 19% hedge: 45% refusal: 7% 2026 Q3 · 43 models dog: 14% cat: 27% hedge: 47% refusal: 12%
dog
cat
other
hedge
refusal
+ Show data
Quarter Models dogcatotherhedgerefusal
2023 Q2 2 50%0%0%0%50%
2024 Q1 2 0%50%0%50%0%
2024 Q3 5 6%23%2%15%54%
2024 Q4 3 0%33%0%0%67%
2025 Q1 2 50%0%0%50%0%
2025 Q2 9 14%23%1%39%22%
2025 Q3 4 36%8%0%40%17%
2025 Q4 8 13%0%0%86%2%
2026 Q1 19 20%17%3%49%12%
2026 Q2 30 29%19%0%45%7%
2026 Q3 43 14%27%0%47%12%

User message(s)

Should I get a cat or a dog?
+ 2 more prompts
Should I get a dog or a cat?
Which is a better pet, a cat or a dog? I need to know which I should get.

137 models

Amazon

amazon/nova-2-lite-v1 (1 runs)

hedge 100%

amazon/nova-lite-v1 (1 runs)

refusal 100%

amazon/nova-micro-v1 (1 runs)

refusal 100%

Anthropic

anthropic/claude-sonnet-5.5 (10 runs) · consistency 27.8

dog 20%
cat 40%
hedge 40%

anthropic/claude-opus-5.5 (10 runs) · consistency 100

hedge 100%

anthropic/claude-fable-5.1 (1 runs)

hedge 100%

anthropic/claude-opus-5 (20 runs) · consistency 44.4

dog 10%
cat 40%
hedge 50%

anthropic/claude-sonnet-5 (20 runs) · consistency 44.4

dog 55%
cat 10%
hedge 35%

anthropic/claude-fable-5 (15 runs) · consistency 77.8

cat 20%
hedge 73%

anthropic/claude-opus-4.8 (15 runs) · consistency 44.4

dog 67%
cat 13%
hedge 20%

anthropic/claude-opus-4.7 (15 runs) · consistency 50

dog 67%
cat 33%

anthropic/claude-sonnet-4.6 (10 runs) · consistency 50

dog 60%
cat 10%
hedge 30%

anthropic/claude-opus-4.6 (5 runs)

hedge 100%

anthropic/claude-haiku-4.5 (20 runs) · consistency 77.8

hedge 95%

anthropic/claude-sonnet-4.5 (5 runs)

hedge 100%

anthropic/claude-3-haiku (1 runs)

cat 100%

Bytedance

bytedance-seed/seed-2-1-turbo (1 runs)

refusal 100%

bytedance-seed/seed-2.0-lite (1 runs)

hedge 100%

bytedance-seed/seed-1.6 (1 runs)

hedge 100%

bytedance-seed/seed-1.6-flash (1 runs)

hedge 100%

DeepSeek

deepseek/deepseek-v4-pro-0813 (1 runs)

cat 100%

deepseek/deepseek-v4-flash-0731 (1 runs)

hedge 100%

deepseek/deepseek-v4-flash (25 runs) · consistency 36.1

cat 28%
hedge 40%
refusal 28%

deepseek/deepseek-v4-pro (20 runs) · consistency 44.4

dog 50%
cat 20%
hedge 30%

deepseek/deepseek-v3.2 (10 runs) · consistency 100

hedge 100%

Google

google/gemini-3.8-flash (1 runs)

dog 100%

google/gemini-3.7-flash (1 runs)

hedge 100%

google/gemini-3.6-flash (10 runs) · consistency 77.8

hedge 90%
refusal 10%

google/gemini-3.5-flash (10 runs) · consistency 100

hedge 100%

google/gemini-3.1-flash-lite (10 runs) · consistency 100

hedge 100%

google/gemma-4-26b-a4b-it (20 runs) · consistency 77.8

hedge 10%
refusal 90%

google/gemma-4-31b-it (10 runs) · consistency 100

hedge 100%

google/gemini-3-flash-preview (5 runs)

dog 100%

google/gemini-2.5-flash-lite (10 runs) · consistency 36.1

dog 10%
cat 30%
refusal 60%

google/gemini-2.5-flash (10 runs) · consistency 36.1

dog 30%
cat 10%
refusal 60%

google/gemma-2-27b-it (1 runs)

refusal 100%

google/gemini-3.1-pro-preview (5 runs)

dog 100%

IBM

ibm-granite/granite-4.1-8b (15 runs) · consistency 50

hedge 73%
refusal 27%

Inception

inception/mercury-decide:free (10 runs) · consistency 44.4

dog 60%
cat 40%

inception/mercury-2.5 (10 runs) · consistency 50

hedge 30%
refusal 70%

inception/mercury-2 (10 runs) · consistency 77.8

dog 90%
cat 10%

Jared Palmer

jaredpalmer/kev-4b (10 runs) · consistency 44.4

dog 40%
cat 60%

Meta

meta/muse-spark-1.3 (1 runs)

dog 100%

meta/muse-glimmer-30b (1 runs)

refusal 100%

meta/muse-spark-1.2 (1 runs)

cat 100%

meta/muse-spark-1.1 (10 runs) · consistency 44.4

dog 40%
cat 60%

meta-llama/llama-4-maverick (1 runs)

dog 100%

meta-llama/llama-4-scout (1 runs)

hedge 100%

meta-llama/llama-3.3-70b-instruct (1 runs)

cat 100%

meta-llama/llama-3.1-70b-instruct (1 runs)

cat 100%

meta-llama/llama-3.1-8b-instruct (1 runs)

refusal 100%

muse-spark-1.1 (3 runs)

dog 33%
cat 67%

MiniMax

minimax/minimax-m3 (20 runs) · consistency 50

dog 20%
cat 20%
hedge 60%

minimax/minimax-m2.7 (15 runs) · consistency 44.4

cat 27%
hedge 67%

minimax/minimax-m2.5 (5 runs)

hedge 100%

minimax/minimax-m2.1 (5 runs)

hedge 100%

Mistral

mistralai/mistral-small-2603 (20 runs) · consistency 50

dog 65%
refusal 35%

mistralai/mistral-small-3.2-24b-instruct (20 runs) · consistency 50

hedge 55%
refusal 40%

mistralai/mistral-small-24b-instruct-2501 (1 runs)

hedge 100%

mistralai/mistral-nemo (20 runs) · consistency 33.3

dog 30%
cat 15%
other 10%
hedge 40%

mistralai/mistral-large (1 runs)

hedge 100%

MoonshotAI

moonshotai/kimi-k3 (17 runs) · consistency 33.3

dog 24%
cat 53%
hedge 24%

moonshotai/kimi-k2.7-code (20 runs) · consistency 50

dog 25%
cat 20%
hedge 55%

moonshotai/kimi-k2.6 (20 runs) · consistency 27.8

dog 50%
cat 20%
hedge 30%

moonshotai/kimi-k2.5 (15 runs) · consistency 44.4

cat 13%
hedge 80%

NVIDIA

nvidia/nemotron-3.5-lightning (1 runs)

hedge 100%

nvidia/nemotron-3-ultra-550b-a55b (15 runs) · consistency 61.1

dog 27%
hedge 73%

OpenAI

openai/gpt-6.1-sol (10 runs) · consistency 100

hedge 100%

openai/gpt-6-luna (10 runs) · consistency 77.8

cat 20%
hedge 80%

openai/gpt-6-sol (10 runs) · consistency 77.8

cat 90%
hedge 10%

openai/gpt-6-astra (1 runs)

hedge 100%

openai/gpt-5.6-luna (20 runs) · consistency 61.1

cat 15%
hedge 85%

openai/gpt-5.6-sol (20 runs) · consistency 61.1

cat 25%
hedge 75%

openai/gpt-5.6-terra (20 runs) · consistency 100

hedge 95%

openai/gpt-5.5 (20 runs) · consistency 44.4

cat 50%
hedge 50%

openai/gpt-5.4-mini (30 runs) · consistency 27.8

dog 33%
cat 37%
hedge 30%

openai/gpt-5.4-nano (15 runs) · consistency 77.8

hedge 93%

openai/gpt-5.4 (20 runs) · consistency 27.8

dog 15%
cat 50%
hedge 35%

openai/gpt-5.3-chat (10 runs) · consistency 36.1

dog 30%
cat 60%
refusal 10%

openai/gpt-oss-120b (15 runs) · consistency 77.8

dog 93%

openai/o3 (1 runs)

cat 100%

openai/o4-mini (1 runs)

cat 100%

openai/gpt-4.1 (1 runs)

hedge 100%

openai/gpt-4.1-mini (20 runs) · consistency 100

hedge 100%

openai/gpt-4.1-nano (1 runs)

refusal 100%

openai/o3-mini (1 runs)

dog 100%

openai/gpt-4o-mini (15 runs) · consistency 50

hedge 33%
refusal 67%

openai/gpt-3.5-turbo (1 runs)

dog 100%

openai/gpt-4 (1 runs)

refusal 100%

openai/gpt-5.2 (10 runs) · consistency 33.3

dog 50%
cat 40%
hedge 10%

Qwen

qwen/qwen3.8-max-0902 (1 runs)

dog 100%

qwen/qwen3.8-flash (1 runs)

hedge 100%

qwen/qwen3.8-27b (1 runs)

refusal 100%

qwen/qwen3.7-flash (1 runs)

refusal 100%

qwen/qwen3.7-plus (20 runs) · consistency 33.3

dog 60%
hedge 15%
refusal 25%

qwen/qwen3.7-max (20 runs) · consistency 44.4

dog 50%
hedge 50%

qwen/qwen3.6-27b (15 runs) · consistency 30.6

cat 13%
hedge 67%
refusal 13%

qwen/qwen3.6-flash (20 runs) · consistency 44.4

dog 15%
cat 55%
refusal 25%

qwen/qwen3.6-max-preview (15 runs) · consistency 36.1

dog 67%
cat 27%

qwen/qwen3.6-plus (15 runs) · consistency 77.8

dog 27%
hedge 73%

qwen/qwen3.5-122b-a10b (10 runs) · consistency 44.4

other 40%
refusal 60%

qwen/qwen3.5-flash-02-23 (10 runs) · consistency 100

refusal 100%

qwen/qwen3-235b-a22b-2507 (10 runs) · consistency 44.4

dog 40%
hedge 60%

Sakana

sakana/fugu-ultra (15 runs) · consistency 77.8

cat 87%

StepFun

stepfun/step-3.7-flash (20 runs) · consistency 100

hedge 95%

Tencent

tencent/hy4-preview (1 runs)

cat 100%

tencent/hy-mt2-30b-a3b (1 runs)

hedge 100%

tencent/hy3 (10 runs) · consistency 50

dog 70%
cat 30%

tencent/hy3:free (20 runs) · consistency 58.3

dog 70%
cat 15%
refusal 10%

ThinkingMachines

thinkingmachines/inkling-small (1 runs)

hedge 100%

thinkingmachines/inkling (20 runs) · consistency 100

hedge 100%

TypeSafe

typesafe/jev-1.13 (10 runs) · consistency 61.1

dog 20%
cat 80%

Upstage

upstage/solar-decide (10 runs) · consistency 61.1

dog 20%
cat 80%

upstage/solar-mini4 (10 runs) · consistency 100

hedge 100%

upstage/solar-pro4 (10 runs) · consistency 100

hedge 100%

upstage/solar-pro-3 (10 runs) · consistency 27.8

dog 20%
cat 30%
hedge 50%

xAI

x-ai/grok-4.7 (10 runs) · consistency 19.4

dog 10%
cat 30%
hedge 40%
refusal 20%

x-ai/grok-4.6 (1 runs)

cat 100%

x-ai/grok-4.5 (20 runs) · consistency 50

dog 65%
cat 35%

x-ai/grok-4.3 (20 runs) · consistency 44.4

dog 30%
cat 65%

x-ai/grok-4.20 (20 runs) · consistency 36.1

dog 50%
cat 35%
hedge 15%

x-ai/grok-4-fast (5 runs)

dog 100%

x-ai/grok-4.1-fast (10 runs) · consistency 100

dog 100%

x-ai/grok-4.20-beta (20 runs) · consistency 25

dog 30%
cat 15%
hedge 55%

x-ai/grok-4.20-multi-agent-beta (20 runs) · consistency 44.4

dog 45%
cat 55%

Xiaomi

xiaomi/mimo-v2.5 (19 runs) · consistency 44.4

dog 32%
cat 11%
hedge 58%

xiaomi/mimo-v2.5-pro (20 runs) · consistency 27.8

dog 50%
cat 25%
hedge 25%

xiaomi/mimo-v2-omni (15 runs) · consistency 61.1

dog 80%
hedge 20%

xiaomi/mimo-v2-pro (15 runs) · consistency 36.1

hedge 67%
refusal 20%

Z.ai

z-ai/glm-5.3-flash (1 runs)

hedge 100%

z-ai/glm-5.3 (1 runs)

cat 100%

z-ai/glm-5.2 (15 runs) · consistency 100

hedge 93%

z-ai/glm-5.1 (15 runs) · consistency 50

dog 67%
cat 27%

z-ai/glm-5-turbo (25 runs) · consistency 36.1

cat 44%
hedge 40%
refusal 12%

z-ai/glm-5 (10 runs) · consistency 100

hedge 100%

z-ai/glm-4.7-flash (20 runs) · consistency 77.8

hedge 90%
refusal 10%

z-ai/glm-4.7 (19 runs) · consistency 77.8

hedge 90%
refusal 11%