Blog›Benchmarks

एलएलएम बेंचमार्क स्नैपशॉट, 22 सितंबर, 2026: शीर्ष पर एक जमी हुई सप्ताह

इस सप्ताह LiveBench, BenchLM, Aider और LMArena में कोई भी शीर्ष-3 स्थान नहीं बदला। असली हलचल बोर्ड से बाहर थी: Jev और Laya निर्णय मॉडल ने एक ऐसी श्रेणी खोली जिसे अभी तक कोई बेंचमार्क नहीं मापता।

एलएलएम बेंचमार्क स्नैपशॉट, 22 सितंबर, 2026: शीर्ष पर एक जमी हुई सप्ताह

एलएलएम बेंचमार्क स्नैपशॉट, 22 सितंबर, 2026: शीर्ष पर एक स्थिर सप्ताह

हर हफ्ते हम प्रमुख एलएलएम लीडरबोर्ड की तस्वीर लेते हैं और रसीदें /benchmarks/history पर रखते हैं। इस हफ्ते की तस्वीर, 22 सितंबर, उल्लेखनीय है क्योंकि जो नहीं हुआ: हमारे द्वारा ट्रैक किए जाने वाले सभी पांच स्रोतों में, एक भी शीर्ष-3 स्थान नहीं बदला।

स्रोत के अनुसार नेता

  • LiveBench (समग्र): क्लॉड फेबल 5.1 (अधिकतम प्रयास) 83.78 पर पहले स्थान पर है, फेबल 5 (83.38) और GPT-6 एस्ट्रा मैक्स (83.05) से आगे। तीन मॉडल 0.73 अंकों के भीतर।
  • BenchLM (समग्र): क्लॉड फेबल 5.1 84.58 पर, GPT-6 एस्ट्रा 83.79 पर, क्लॉड ओपस 5 81.87 पर।
  • Aider पॉलीग्लॉट (कोडिंग): GPT-5 (उच्च) अपना 88.0 बनाए रखता है, GPT-5 (मध्यम) 86.7 पर और o3-pro 84.9 पर। OpenAI अभी भी इस बोर्ड का मालिक है।
  • LMArena टेक्स्ट एलो: क्लॉड फेबल 5.1 मैक्स 1507.6 पर, दो ओपस 5 वेरिएंट 1505 पर इसके गले लगे हुए - 2.6-एलो का अंतर, प्रभावी रूप से एक टाई।
  • LMArena वेबडेव एलो: GPT-6 एस्ट्रा मैक्स 1800.3 पर, फेबल 5.1 मैक्स (1758) से आराम से आगे - एकमात्र बोर्ड जहां अंतर व्यापक है।
  • स्रोत अभी भी असहमत हैं

    असहमति का पैटर्न जो हम हर हफ्ते उजागर करते हैं, कायम है: एंथ्रोपिक तीन बोर्डों पर सामान्य-उद्देश्य वाले टेक्स्ट में आगे है, ओपनएआई कोडिंग (एडर) और वेबडेव (LMArena) में निर्णायक रूप से आगे है। यदि आप "लीडरबोर्ड" द्वारा एक मॉडल चुनते हैं, तो उत्तर पूरी तरह से इस बात पर निर्भर करता है कि कौन सा लीडरबोर्ड आपके वर्कलोड से मेल खाता है।

    कार्रवाई लीडरबोर्ड से बाहर थी

    शीर्ष पर एक स्थिर सप्ताह का मतलब शांत सप्ताह नहीं है। सबसे चर्चित लॉन्च चैट मॉडल बिल्कुल नहीं थे: टाइपसेफ का जेव और भारत के कॉन्वे इनोवेशन्स का ओपन-सोर्स, अपाचे 2.0 लाया ने "सिस्टम वन" निर्णय-मॉडल श्रेणी खोली - उत्पन्न टेक्स्ट के बजाय कैलिब्रेटेड संभावनाओं के साथ टाइप किए गए उत्तर। उपरोक्त कोई भी बोर्ड अभी तक उस तरह के मॉडल को नहीं मापता, जो अपने आप में देखने लायक एक अंतर है: बेंचमार्क इकोसिस्टम लेखन और कोडिंग को मापता है, जबकि उत्पादन एआई का एक बढ़ता हिस्सा तेज़ वर्गीकरण है। हमारी तुलना: लाया बनाम जेव।

    पूरा स्नैपशॉट /benchmarks/snapshot/2026-09-22 पर देखें, या लाइव बोर्ड /benchmarks पर देखें।

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot