← सभी बेंचमार्क

एजेंट एरिना

Wikiprompt से, प्रॉम्प्ट का मुक्त विश्वकोश

सामुदायिक Elo रैंकिंग, LMArena की लड़ाइयों से दैनिक रूप से एकत्रित। पहले सामान्य एरिना, फिर श्रेणी के अनुसार विवरण।

अंतिम अपडेट: 2026-09-22 · 46 मॉडल

स्थानमॉडलसंगठनElo स्कोर
1Claude Fable 5.1 (Max)anthropic
2GPT 6 Astra (Max)openai
3Claude Opus 5 (High)anthropic
4Claude Opus 5 (Max)anthropic
5Claude Fable 5 (High)anthropic
6Claude Opus 4.8 (High)anthropic
7GPT 5.6 Sol (xHigh)openai
8Kimi K3 (Max)moonshot
9Claude Sonnet 5 (High)anthropic
10GPT 5.5 (xHigh)openai
11Hy4 previewtencent
12Deepseek V4.1 Flash (Max)deepseek
13Gemini 3.8 Flash (High)google
14GLM 5.2 (Max)zai
15Muse Spark 1.3 (Max)meta
16DeepSeek V4 Pro (High) (0813)deepseek
17Qwen3.8 Maxalibaba
18GLM 5.3 (Max)zai
19Grok 4.5xai
20GPT 5.5openai
21Grok 4.6 (xHigh)xai
22Deepseek V4 Flash (High) (20260731)deepseek
23GPT 5.6 Terra (xHigh)openai
24GPT 5.4 (High)openai
25GLM 5.3 Flashzai
26Qwen3.8 Flash Nextalibaba
27GPT 5.6 Luna (xHigh)openai
28Gemini 3.7 Flash (High)google
29Qwen 3.8 27Balibaba
30DeepSeek V4 Prodeepseek
31Claude Sonnet 4.6anthropic
32Muse Spark 1.2 (xHigh)meta
33Muse Spark 1.1meta
34Qwen3.7 Maxalibaba
35Hy3tencent
36Mimo V2.5 Proxiaomi
37Minimax M3minimax
38Gemini 3.1 Pro Previewgoogle
39Gemini 3.6 Flash (High)google
40Qwen3.7 Plusalibaba
41Inkling Smallthinky
42Inklingthinky
43Mistral Medium 3.5mistral
44Minimax M2.7minimax
45Gemini 3.5 Flash Litegoogle
46Solar Pro 4upstage

यह भी देखें

स्रोत और पद्धति

रैंकिंग सामुदायिक खुली मूल्यांकन से एकत्रित की जाती हैं। Elo स्कोर, विश्वास अंतराल और वोट LMArena से आते हैं (सामुदायिक मतदान वाले मॉडल युद्ध, खुले डेटासेट के रूप में प्रकाशित)। मूल्य और संदर्भ मेटाडेटा OpenRouter की सार्वजनिक API से आते हैं। Wikiprompt दैनिक स्नैपशॉट लेता है और इतिहास संरक्षित करता है; हम अपना मूल्यांकन नहीं चलाते।

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard