Framing Jailbreaks
Measures the model's performance against framing jailbreak attacks. (Higher score is better.)
| Rank | Model | Provider | ||||
|---|---|---|---|---|---|---|
| #1 | GPT 5.5 | OpenAI | 99.28% | 98.20% | 99.63% | 100.00% |
| #2 | Claude 4.5 Opus | Anthropic | 98.86% | 96.95% | 99.65% | 100.00% |
| #3 | GPT 5 nano | OpenAI | 98.55% | 95.66% | 100.00% | 100.00% |
| #4 | GPT 5 mini | OpenAI | 98.14% | 96.89% | 99.28% | 98.25% |
| #5 | GPT 5.2 | OpenAI | 98.03% | 96.92% | 98.57% | 98.62% |
| #6 | Claude 4.6 Opus | Anthropic | 97.11% | 93.39% | 99.65% | 98.31% |
| #7 | GPT 5.1 | OpenAI | 96.67% | 92.44% | 98.23% | 99.32% |
| #8 | Claude 4.5 Sonnet | Anthropic | 96.17% | 91.00% | 97.52% | 100.00% |
| #9 | Claude 5 Sonnet | Anthropic | 96.14% | 90.50% | 98.93% | 98.99% |
| #10 | Claude 4.5 Haiku | Anthropic | 95.56% | 88.10% | 98.58% | 100.00% |
| #11 | GPT 5 | OpenAI | 95.28% | 93.85% | 96.07% | 95.92% |
| #12 | Claude 4.1 Opus | Anthropic | 94.55% | 90.35% | 93.97% | 99.32% |
| #13 | Kimi K2.6 | Moonshot AI | 93.31% | 95.65% | 89.68% | 94.59% |
| #14 | Claude 4.6 Sonnet | Anthropic | 93.09% | 90.47% | 91.84% | 96.96% |
| #15 | Qwen 3.7 Max | Alibaba Qwen | 89.44% | 85.30% | 92.55% | 90.48% |
| #16 | Llama 3.1 405B Instruct OR | Meta | 87.61% | 76.21% | 95.74% | 90.88% |
| #17 | Claude 3.5 Haiku 20241022 | Anthropic | 86.98% | 79.74% | 87.94% | 93.24% |
| #18 | Claude 3.7 Sonnet | Anthropic | 86.93% | 79.58% | 88.30% | 92.91% |
| #19 | GPT OSS 120B | OpenAI | 85.40% | 75.36% | 87.59% | 93.24% |
| #20 | Gemini 3.0 Pro Preview | Google | 85.11% | 76.54% | 88.26% | 90.54% |
| #21 | Qwen 3.7 Plus | Alibaba Qwen | 83.25% | 74.68% | 90.04% | 85.03% |
| #22 | Grok 4 | xAI | 80.57% | 83.28% | 78.37% | 80.07% |
| #23 | Grok 4.3 | xAI | 80.35% | 81.83% | 80.85% | 78.38% |
| #24 | Kimi K2.5 | Moonshot AI | 76.71% | 76.94% | 70.82% | 82.37% |
| #25 | GLM 5.2 | Z.ai | 75.80% | 71.52% | 76.43% | 79.45% |
| #26 | Gemini 3.1 Pro Preview | Google | 74.91% | 72.99% | 73.76% | 77.97% |
| #27 | Gemma 4 | Google | 74.20% | 74.60% | 72.34% | 75.68% |
| #28 | Gemini 3.5 Flash | Google | 65.91% | 67.85% | 65.48% | 64.41% |
| #29 | GPT 4o | OpenAI | 65.85% | 59.65% | 65.96% | 71.96% |
| #30 | Gemini 3.1 Flash Lite | Google | 64.71% | 68.01% | 61.70% | 64.41% |
| #31 | Qwen 3 Max | Alibaba Qwen | 63.77% | 68.17% | 58.51% | 64.63% |
| #32 | Llama 3.3 70B Instruct OR | Meta | 61.21% | 50.96% | 69.15% | 63.51% |
| #33 | Llama 3.1 8B Instruct | Meta | 60.92% | 62.70% | 62.63% | 57.43% |
| #34 | GPT 4o mini | OpenAI | 59.32% | 59.81% | 55.32% | 62.84% |
| #35 | Qwen Plus | Alibaba Qwen | 59.22% | 64.47% | 55.71% | 57.48% |
| #36 | Gemini 2.5 Flash Lite | Google | 56.91% | 64.68% | 49.65% | 56.42% |
| #37 | Llama 4 Maverick | Meta | 55.12% | 52.57% | 63.48% | 49.32% |
| #38 | Gemini 2.5 Pro | Google | 54.54% | 59.16% | 51.42% | 53.04% |
| #39 | Llama 4 Scout | Meta | 53.67% | 50.81% | 50.00% | 60.20% |
| #40 | GPT 4.1 nano | OpenAI | 53.41% | 63.45% | 42.20% | 54.58% |
| #41 | Gemini 2.5 Flash | Google | 50.55% | 56.84% | 47.16% | 47.64% |
| #42 | Gemini 2.0 Flash Lite | Google | 49.64% | 57.33% | 41.43% | 50.17% |
| #43 | Gemini 2.0 Flash | Google | 48.90% | 54.66% | 45.74% | 46.28% |
| #44 | GPT 4.1 | OpenAI | 47.49% | 53.95% | 43.26% | 45.27% |
| #45 | Gemma 3 27B IT OR | Google | 46.25% | 51.45% | 39.01% | 48.31% |
| #46 | GPT 4.1 mini | OpenAI | 45.94% | 60.06% | 38.21% | 39.53% |
| #47 | Gemma 3 12B IT OR | Google | 45.81% | 53.14% | 40.07% | 44.22% |
| #48 | DeepSeek V4 Flash | Deepseek | 45.14% | 60.13% | 36.43% | 38.85% |
| #49 | Qwen 2.5 Max | Alibaba Qwen | 44.38% | 50.80% | 41.13% | 41.22% |
| #50 | Grok 4 Fast No Reasoning | xAI | 43.86% | 52.99% | 41.99% | 36.61% |
| #51 | Deepseek R1 0528 | Deepseek | 43.58% | 56.59% | 39.01% | 35.14% |
| #52 | DeepSeek V4 Pro | Deepseek | 42.41% | 56.11% | 34.16% | 36.95% |
| #53 | Qwen 3 8B | Alibaba Qwen | 41.68% | 59.90% | 34.40% | 30.74% |
| #54 | Grok 3 mini | xAI | 41.23% | 60.16% | 34.04% | 29.49% |
| #55 | Deepseek V3.1 | Deepseek | 40.62% | 49.20% | 36.52% | 36.15% |
| #56 | Qwen 3 30B VL Instruct | Alibaba Qwen | 38.74% | 48.78% | 32.62% | 34.80% |
| #57 | Mistral Medium 3.5 | Mistral | 38.41% | 49.44% | 33.69% | 32.09% |
| #58 | Magistral Medium Latest | Mistral | 37.38% | 59.65% | 31.56% | 20.95% |
| #59 | Deepseek V3 0324 | Deepseek | 35.82% | 45.89% | 30.14% | 31.42% |
| #60 | Mistral Large 2 | Mistral | 33.62% | 43.25% | 32.62% | 25.00% |
| #61 | Mistral Medium Latest | Mistral | 33.24% | 43.60% | 31.90% | 24.23% |
| #62 | Command A | Cohere | 32.48% | 41.16% | 32.62% | 23.65% |
| #63 | Grok 3 | xAI | 31.29% | 48.63% | 27.66% | 17.57% |
| #64 | Deepseek V3 | Deepseek | 30.94% | 44.61% | 26.60% | 21.62% |
| #65 | Mistral Large 3 | Mistral | 28.08% | 40.42% | 24.91% | 18.92% |
| #66 | Mistral Small 3.2 | Mistral | 27.01% | 42.77% | 23.40% | 14.86% |
| #67 | Magistral Small Latest | Mistral | 24.79% | 43.73% | 19.50% | 11.15% |
| #68 | Grok 2 | xAI | 21.40% | 36.33% | 17.86% | 10.00% |
| Mistral Small 3.1* | Mistral | N/A | N/A | N/A | N/A | |
| Claude 3.5 Sonnet* | Anthropic | N/A | N/A | N/A | N/A | |
| Gemini 1.5 Pro* | Google | N/A | N/A | N/A | N/A |
* Models marked with an asterisk have partial scores.