Misinformation

We evaluate the model's ability to provide accurate information when responding to questions that contain false premises, misleading framing, or factually incorrect assertions. (Higher score is better.)

RankModelProvider
#1Claude 4.5 Haiku
AnthropicAnthropic
95.51%
99.07%
91.16%
96.31%
#2Claude 3.7 Sonnet
AnthropicAnthropic
89.52%
91.61%
87.76%
89.19%
#3Claude 4.5 Sonnet
AnthropicAnthropic
86.17%
91.93%
79.59%
86.98%
#4Claude 4.5 Opus
AnthropicAnthropic
85.82%
90.99%
80.95%
85.50%
#5Claude 3.5 Sonnet
AnthropicAnthropic
85.43%
93.17%
79.59%
83.54%
#6Claude 4.1 Opus
AnthropicAnthropic
85.00%
95.34%
74.15%
85.50%
#7Claude 5 Sonnet
AnthropicAnthropic
84.41%
90.99%
84.35%
77.89%
#8GPT 5 nano
OpenAIOpenAI
80.04%
77.02%
82.99%
80.10%
#9Claude 4.6 Opus
AnthropicAnthropic
79.61%
88.51%
74.15%
76.17%
#10Qwen Plus
Alibaba Qwen
77.90%
84.47%
75.51%
73.71%
#11GPT 5 mini
OpenAIOpenAI
77.55%
79.19%
74.83%
78.62%
#12Magistral Medium Latest
Mistral
76.71%
83.23%
79.59%
67.32%
#13GPT 4.1 nano
OpenAIOpenAI
76.61%
78.88%
78.23%
72.73%
#14Claude 3.5 Haiku 20241022
AnthropicAnthropic
76.40%
86.96%
70.75%
71.50%
#15Gemini 3.1 Pro Preview
GoogleGoogle
76.05%
83.85%
66.67%
77.64%
#16Kimi K2.6
MoonshotAIMoonshot AI
74.89%
85.71%
65.99%
72.97%
#17Gemini 1.5 Pro
GoogleGoogle
74.39%
78.57%
74.83%
69.78%
#18Llama 3.1 8B Instruct
MetaMeta
74.15%
70.50%
69.39%
82.56%
#19Llama 3.1 405B Instruct OR
MetaMeta
73.59%
90.97%
66.67%
63.14%
#20Claude 4.6 Sonnet
AnthropicAnthropic
73.19%
78.88%
65.99%
74.69%
#21Gemini 2.5 Flash Lite
GoogleGoogle
72.18%
76.40%
66.67%
73.46%
#22DeepSeek V4 Flash
Deepseek
69.93%
56.83%
83.67%
69.29%
#23Gemma 4
GoogleGoogle
68.85%
83.23%
59.18%
64.13%
#24Mistral Large 2
Mistral
68.74%
75.16%
69.39%
61.67%
#25Gemini 2.5 Flash
GoogleGoogle
68.38%
74.22%
68.03%
62.90%
#26GPT 4o
OpenAIOpenAI
68.11%
75.16%
65.31%
63.88%
#27Command A
CohereCohere
67.71%
84.78%
59.86%
58.48%
#28GPT 5.1
OpenAIOpenAI
67.65%
77.02%
57.14%
68.80%
#29Gemini 3.1 Flash Lite
GoogleGoogle
67.05%
73.29%
60.54%
67.32%
#30Gemini 2.5 Pro
GoogleGoogle
65.18%
77.64%
56.46%
61.43%
#31Llama 4 Maverick
MetaMeta
64.99%
73.91%
59.86%
61.18%
#32Grok 4
xAI
64.82%
81.99%
53.74%
58.72%
#33Qwen 3 Max
Alibaba Qwen
64.38%
76.71%
50.34%
66.09%
#34Llama 3.3 70B Instruct OR
MetaMeta
64.24%
81.68%
53.06%
57.99%
#35Grok 4.3
xAI
63.66%
63.04%
62.59%
65.36%
#36Qwen 3.7 Max
Alibaba Qwen
63.52%
63.04%
61.90%
65.60%
#37Grok 3 mini
xAI
63.17%
71.43%
57.14%
60.93%
#38Gemini 2.0 Flash
GoogleGoogle
62.43%
74.53%
53.06%
59.71%
#39Gemini 3.0 Pro Preview
GoogleGoogle
62.14%
65.22%
57.82%
63.39%
#40Kimi K2.5
MoonshotAIMoonshot AI
61.71%
72.36%
53.06%
59.71%
#41Gemini 3.5 Flash
GoogleGoogle
61.28%
69.57%
51.70%
62.56%
#42Deepseek V3.1
Deepseek
60.02%
65.22%
51.70%
63.14%
#43Mistral Small 3.1
Mistral
58.70%
65.84%
56.46%
53.81%
#44Gemini 2.0 Flash Lite
GoogleGoogle
58.63%
76.71%
42.86%
56.33%
#45Qwen 2.5 Max
Alibaba Qwen
57.93%
67.70%
56.46%
49.63%
#46DeepSeek V4 Pro
Deepseek
57.87%
61.80%
40.82%
71.01%
#47Qwen 3.7 Plus
Alibaba Qwen
56.79%
61.49%
49.66%
59.21%
#48Deepseek V3 0324
Deepseek
55.74%
68.63%
46.26%
52.33%
#49GPT 4.1
OpenAIOpenAI
55.17%
68.94%
44.22%
52.33%
#50GLM 5.2
Z.aiZ.ai
54.48%
61.18%
43.54%
58.72%
#51Qwen 3 8B
Alibaba Qwen
54.09%
60.87%
44.90%
56.51%
#52Deepseek R1 0528
Deepseek
52.92%
58.07%
47.62%
53.07%
#53Grok 3
xAI
52.36%
59.01%
52.38%
45.70%
#54Deepseek V3
Deepseek
50.54%
68.01%
37.41%
46.19%
#55GPT 5.2
OpenAIOpenAI
50.52%
49.69%
51.02%
50.86%
#56Magistral Small Latest
Mistral
48.95%
56.83%
48.98%
41.03%
#57Mistral Medium Latest
Mistral
48.31%
62.42%
38.78%
43.73%
#58Qwen 3 30B VL Instruct
Alibaba Qwen
47.66%
57.76%
29.93%
55.28%
#59GPT 5.5
OpenAIOpenAI
47.37%
53.42%
46.94%
41.77%
#60GPT 4o mini
OpenAIOpenAI
46.40%
60.87%
38.78%
39.56%
#61GPT 5
OpenAIOpenAI
44.66%
48.76%
41.50%
43.73%
#62Mistral Large 3
Mistral
43.70%
58.07%
34.69%
38.33%
#63GPT 4.1 mini
OpenAIOpenAI
43.63%
53.73%
38.10%
39.07%
#64Mistral Medium 3.5
Mistral
43.05%
57.45%
31.29%
40.39%
#65Mistral Small 3.2
Mistral
42.65%
50.62%
36.05%
41.28%
#66Llama 4 Scout
MetaMeta
41.90%
55.28%
30.61%
39.80%
#67Gemma 3 27B IT OR
GoogleGoogle
41.23%
51.86%
37.41%
34.40%
#68Grok 2
xAI
39.97%
45.96%
35.37%
38.57%
#69GPT OSS 120B
OpenAIOpenAI
38.40%
41.61%
27.89%
45.70%
#70Grok 4 Fast No Reasoning
xAI
37.06%
41.30%
31.29%
38.57%
#71Gemma 3 12B IT OR
GoogleGoogle
28.48%
33.33%
20.55%
31.57%