Blog›Guides

एलएलएम बेंचमार्क स्नैपशॉट: सप्ताह 13 सितंबर, 2026

पाँच लीडरबोर्ड पर साप्ताहिक फोटो: क्लॉड फेबल 5.1 टेक्स्ट, लाइवबेंच और बेंचएलएम में शीर्ष पर है; GPT-5 एडर कोडिंग का ताज बरकरार रखता है; GPT-6 एस्ट्रा वेबडेव में हावी है। शीर्ष पर स्थिरता, अनुशासन के अनुसार विभाजित।

एलएलएम बेंचमार्क स्नैपशॉट: सप्ताह 13 सितंबर, 2026

एलएलएम लीडरबोर्ड का साप्ताहिक फोटो आ गया है: स्नैपशॉट 2026-09-13, पांच स्वतंत्र स्रोतों से। इस हफ्ते की मुख्य बात है शीर्ष पर स्थिरता और अनुशासन के हिसाब से तीन-तरफा विभाजन।

स्रोत के अनुसार नेता

  • LMArena टेक्स्ट: Claude Fable 5.1 (मैक्स) 1510 Elo पर #1 पर है, साथ में Claude Opus 5 वेरिएंट #2 और #3 पर - एक पूरी तरह से Anthropic की तिकड़ी।
  • LiveBench: Claude Fable 5.1 (मैक्स एफर्ट) 83.78 पर आगे है, Fable 5 और GPT-6 Astra (83.05) से आगे। पिछले हफ्ते जैसा ही नेता।
  • BenchLM: Claude Fable 5.1 84.61 पर GPT-6 Astra (84.08) से आगे - पांचों बोर्डों में सबसे कम अंतर।
  • Aider पॉलीग्लॉट (कोडिंग): GPT-5 (हाई) 88.0 पर कोडिंग का ताज बरकरार रखता है, साथ में GPT-5 मीडियम और o3-pro पीछे। Anthropic इस टॉप 3 में जगह नहीं बना पाता।
  • LMArena वेबडेव: GPT-6 Astra (मैक्स) 1800 Elo पर हावी है, Fable 5.1 से 42 अंक आगे।
  • पिछले हफ्ते के मुकाबले क्या बदला

    शीर्ष पर बहुत कम बदलाव है, और यही कहानी है: एक ही दो परिवारों ने अब लगातार दो हफ्तों से बोर्डों को बांटा है। Anthropic के पास सामान्य टेक्स्ट और मिश्रित-कार्य बेंचमार्क हैं (टेक्स्ट अखाड़ा, LiveBench, BenchLM); OpenAI के पास डेवलपर बोर्ड हैं (Aider कोडिंग, वेबडेव अखाड़ा)। अगर आप लीडरबोर्ड के आधार पर मॉडल चुनते हैं, तो जवाब अब वास्तव में इस बात पर निर्भर करता है कि कौन सा लीडरबोर्ड।

    स्रोतों के असहमत होने का कोण

    एक "सर्वश्रेष्ठ मॉडल" का दावा एक तीन-तरफा विभाजन छुपाता है: Fable 5.1 तीन बोर्डों पर #1 है, GPT-6 Astra एक पर, GPT-5 एक पर। यही कारण है कि हम सभी पांचों का रोजाना स्नैपशॉट लेते हैं - हर बोर्ड एक अलग कौशल मापता है, और रसीदें रिकॉर्ड पर रहती हैं।

    पूरी तालिकाएं /benchmarks पर देखें, या इतिहास में समय के साथ तुलना करें।

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot