Prompt Injection

Measures the model's performance against known injection attacks. (Higher score is better.)

RankModelProvider
#1Claude 4.5 Haiku
AnthropicAnthropic
98.07%
97.86%
97.59%
98.75%
#2Claude 4.1 Opus
AnthropicAnthropic
97.75%
97.86%
97.89%
97.49%
#3Claude 4.5 Sonnet
AnthropicAnthropic
97.42%
97.33%
98.19%
96.74%
#4Claude 4.5 Opus
AnthropicAnthropic
97.05%
97.33%
97.59%
96.24%
#5Claude 4.6 Opus
AnthropicAnthropic
95.35%
97.31%
96.07%
92.68%
#6Claude 3.5 Haiku 20241022
AnthropicAnthropic
93.40%
93.58%
91.87%
94.74%
#7Claude 5 Sonnet
AnthropicAnthropic
93.30%
96.79%
93.37%
89.72%
#8Claude 4.6 Sonnet
AnthropicAnthropic
92.43%
91.89%
92.73%
92.68%
#9GPT 5.2
OpenAIOpenAI
89.02%
92.41%
87.25%
87.39%
#10GPT 5.5
OpenAIOpenAI
88.66%
93.55%
89.02%
83.42%
#11Qwen 3.7 Max
Alibaba Qwen
88.16%
88.14%
90.63%
85.71%
#12Kimi K2.6
MoonshotAIMoonshot AI
87.60%
90.37%
86.45%
85.96%
#13GPT 5 mini
OpenAIOpenAI
86.55%
90.22%
87.16%
82.28%
#14Claude 3.7 Sonnet
AnthropicAnthropic
86.35%
87.70%
86.14%
85.21%
#15GPT 5 nano
OpenAIOpenAI
86.17%
90.37%
84.94%
83.21%
#16Qwen 3.7 Plus
Alibaba Qwen
86.06%
87.57%
84.89%
85.71%
#17GPT OSS 120B
OpenAIOpenAI
86.00%
92.51%
84.04%
81.45%
#18Kimi K2.5
MoonshotAIMoonshot AI
85.21%
89.84%
82.83%
82.96%
#19GPT 5.1
OpenAIOpenAI
85.19%
89.84%
84.04%
81.70%
#20GPT 5
OpenAIOpenAI
81.30%
85.95%
79.82%
78.14%
#21Llama 3.1 405B Instruct OR
MetaMeta
79.06%
78.61%
84.64%
73.93%
#22Grok 4
xAI
77.16%
79.14%
74.40%
77.94%
#23GPT 4.1 nano
OpenAIOpenAI
75.85%
82.89%
70.48%
74.19%
#24GLM 5.2
Z.aiZ.ai
75.67%
83.05%
72.29%
71.68%
#25Grok 4.3
xAI
75.20%
78.07%
77.11%
70.43%
#26Gemma 4
GoogleGoogle
71.23%
76.47%
71.30%
65.91%
#27GPT 4o
OpenAIOpenAI
71.17%
75.40%
68.67%
69.42%
#28GPT 4.1
OpenAIOpenAI
69.98%
79.68%
63.86%
66.42%
#29Gemini 3.1 Pro Preview
GoogleGoogle
69.11%
75.94%
67.47%
63.91%
#30Qwen Plus
Alibaba Qwen
68.88%
79.21%
66.27%
61.15%
#31Llama 4 Maverick
MetaMeta
68.33%
61.50%
79.82%
63.66%
#32Gemini 3.0 Pro Preview
GoogleGoogle
67.99%
77.01%
66.57%
60.40%
#33GPT 4o mini
OpenAIOpenAI
67.28%
73.26%
63.86%
64.74%
#34Qwen 2.5 Max
Alibaba Qwen
66.73%
77.53%
59.52%
63.16%
#35DeepSeek V4 Flash
Deepseek
66.05%
56.15%
72.59%
69.42%
#36DeepSeek V4 Pro
Deepseek
64.69%
50.27%
71.39%
72.43%
#37Qwen 3 Max
Alibaba Qwen
64.44%
72.47%
61.45%
59.40%
#38GPT 4.1 mini
OpenAIOpenAI
61.33%
69.35%
60.24%
54.39%
#39Grok 4 Fast No Reasoning
xAI
60.31%
63.10%
59.94%
57.89%
#40Gemini 3.1 Flash Lite
GoogleGoogle
60.31%
70.05%
60.24%
50.63%
#41Gemini 3.5 Flash
GoogleGoogle
56.66%
62.03%
57.83%
50.13%
#42Llama 4 Scout
MetaMeta
55.76%
52.94%
64.46%
49.87%
#43Deepseek R1 0528
Deepseek
54.41%
47.59%
60.24%
55.39%
#44Qwen 3 30B VL Instruct
Alibaba Qwen
53.93%
63.64%
50.90%
47.24%
#45Gemini 2.5 Flash Lite
GoogleGoogle
53.18%
57.22%
52.71%
49.62%
#46Deepseek V3.1
Deepseek
52.52%
48.66%
54.52%
54.39%
#47Gemini 2.5 Flash
GoogleGoogle
50.14%
54.55%
51.51%
44.36%
#48Llama 3.1 8B Instruct
MetaMeta
49.57%
51.34%
53.78%
43.61%
#49Gemini 2.5 Pro
GoogleGoogle
48.59%
54.01%
46.39%
45.36%
#50Llama 3.3 70B Instruct OR
MetaMeta
48.10%
40.64%
58.43%
45.23%
#51Gemini 2.0 Flash
GoogleGoogle
46.15%
47.59%
45.76%
45.09%
#52Gemini 2.0 Flash Lite
GoogleGoogle
46.13%
52.41%
39.88%
46.10%
#53Gemma 3 12B IT OR
GoogleGoogle
45.86%
47.06%
42.77%
47.74%
#54Deepseek V3 0324
Deepseek
44.98%
47.06%
45.78%
42.11%
#55Qwen 3 8B
Alibaba Qwen
44.33%
45.45%
43.94%
43.61%
#56Gemma 3 27B IT OR
GoogleGoogle
41.97%
36.36%
48.19%
41.35%
#57Magistral Medium Latest
Mistral
41.33%
37.43%
52.71%
33.83%
#58Mistral Medium 3.5
Mistral
40.60%
45.45%
42.17%
34.17%
#59Command A
CohereCohere
39.97%
36.90%
40.66%
42.36%
#60Deepseek V3
Deepseek
38.19%
39.57%
39.16%
35.84%
#61Grok 2
xAI
35.57%
35.14%
36.97%
34.60%
#62Mistral Small 3.2
Mistral
34.20%
33.69%
34.34%
34.59%
#63Grok 3
xAI
32.99%
33.16%
35.24%
30.58%
#64Mistral Medium Latest
Mistral
31.00%
28.34%
36.45%
28.21%
#65Mistral Large 2
Mistral
30.58%
27.27%
36.14%
28.32%
#66Grok 3 mini
xAI
28.72%
24.60%
33.73%
27.82%
#67Mistral Large 3
Mistral
24.56%
23.53%
25.60%
24.56%
#68Magistral Small Latest
Mistral
22.09%
17.11%
27.11%
22.06%
Mistral Small 3.1*
Mistral
N/A
N/A
N/A
N/A
Claude 3.5 Sonnet*
AnthropicAnthropic
N/A
N/A
N/A
N/A
Gemini 1.5 Pro*
GoogleGoogle
N/A
N/A
N/A
N/A
* Models marked with an asterisk have partial scores.