BlogGuides

Wikiprompt LLM 벤치마크 소개: 라이브 리더보드, 증거 포함

Wikiprompt는 이제 10개 아레나에서 LLM 리더보드를 추적하며, 매일 스냅샷을 저장하여 순위 변동이 기록에 남도록 합니다. LMArena와 OpenRouter에서 소스를 가져오며, Wikipedia 참조처럼 인용되고, 7개 언어로 제공됩니다.

Wikiprompt LLM 벤치마크 소개: 라이브 리더보드, 증거 포함

Wikiprompt LLM 벤치마크 소개: 라이브 리더보드, 증거 포함

Wikiprompt에 이제 벤치마크 섹션이 있습니다: wikiprompt.org/benchmarks. 대규모 언어 모델과 생성형 AI를 위한 라이브 리더보드로, 텍스트, 웹 개발, 비전, 텍스트-이미지, 이미지 편집, 텍스트-비디오, 비디오 편집, 검색, 에이전트, 문서의 10개 분야를 다룹니다. 무료, 7개 언어 지원, 매일 업데이트됩니다.

왜 또 다른 리더보드 사이트인가?

벤치마크 수치는 조용히 움직이기 때문입니다. 모델이 3계단 오르고, 점수가 재계산되고, 어제의 1위가 4위로 밀려나도, 보통 어떤 변화가 있었는지 기록이 없습니다. 우리는 벤치마크를 위키백과가 문서를 다루는 방식으로 취급합니다: 매일 Wikiprompt는 순위의 전체 스냅샷을 저장하고, 페이지는 이전 스냅샷 대비 최근 변경 사항을 보여줍니다. 기록은 남습니다.

두 번째 이유는 출처입니다. 우리의 표는 위키백과 참조처럼 모든 숫자가 어디서 왔는지 인용합니다:

  • Elo 등급, 신뢰 구간, 투표 수는 크라우드소싱된 모델 간 대결인 LMArena에서 제공되며, 공개 데이터셋으로 게시됩니다.
  • 가격, 컨텍스트 창, 지식 컷오프는 공개 OpenRouter API에서 제공됩니다.
  • 우리는 독점 평가를 실행하지 않으며 점수를 편집하지 않습니다. 우리는 공개된 커뮤니티 주도 데이터를 집계하고, 인용하고, 증거를 보관합니다.

    지금 분야별 현황

    오늘의 스냅샷에서 바로 가져온 몇 가지 현재 선두 주자:

  • 텍스트: claude-opus-4-6-high가 약 45,000개 이상의 커뮤니티 투표에서 Elo 약 1527로 선두를 달립니다.
  • 텍스트-이미지: gpt-image-2 (medium)가 약 69,000표로 분야 1위; 이미지 편집에서도 약 200,000표로 선두입니다.
  • 텍스트-비디오: gemini-omni-flash가 1위를 차지합니다.
  • 비디오 편집: dreamina-seedance-2.5가 이길 모델입니다.
  • 검색: claude-opus-4-6-search가 112,000표 이상에서 선두입니다.
  • 이것들은 바뀔 것입니다. 그것이 핵심입니다: 바뀌면, 그 움직임은 사라지는 대신 최근 변경 사항 섹션에 나타납니다.

    프롬프트 백과사전과의 연결

    Wikiprompt는 이미 모델별로 태그된 수만 개의 프롬프트를 카탈로그화하고 있습니다. 벤치마크 섹션은 순환을 완성합니다: 어떤 모델이 분야에서 선두인지 확인한 다음, 해당 모델의 실제 프롬프트로 이동하여 활용하세요. 최고의 GPT 이미지 프롬프트나노 바나나 제품군 비교 같은 모델 가이드가 순위 옆에 있습니다.

    여기의 다른 모든 것처럼 공개

    벤치마크 페이지는 Wikiprompt의 나머지 부분과 동일한 원칙을 따릅니다: 컴파일은 CC BY-SA, 출처는 공개 데이터셋과 공개 API, 전체 프롬프트 카탈로그는 단일 파일로 다운로드 가능합니다. 벤치마크 데이터 자체가 필요하면, 우리가 인용한 출처가 한 번의 클릭으로 접근 가능합니다.

    현재 순위를 wikiprompt.org/benchmarks에서 확인하세요. 다음 주에는 다르게 보일 것이며, 정확히 어떻게 바뀌었는지 볼 수 있을 것입니다.

    Tags
    benchmarks·leaderboard·lmarena·llm·rankings·announcement