BlogGuides

55,000개의 실제 AI 프롬프트에 대한 미세 조정

Wikiprompt의 공개 데이터셋은 55,000개 이상의 실제 인간이 작성한 프롬프트와 출력 및 품질 신호를 제공하며, 이는 합성 코퍼스와는 다른 종류의 훈련 데이터입니다.

55,000개의 실제 AI 프롬프트에 대한 미세 조정

55,000개의 실제 AI 프롬프트에 대한 파인튜닝

파인튜닝과 평가에 사용되는 대부분의 프롬프트 데이터셋은 합성 데이터입니다. 다른 모델이 생성하고, 세 번째 모델이 필터링하며, 네 번째 모델이 점수를 매깁니다. 이 파이프라인은 저렴하고 확장 가능하지만, 데이터가 인간의 의도와는 전혀 닿지 않았다는 뜻이기도 합니다. 아무도 실제로 그 출력을 필요로 하지 않았습니다. 아무도 실제 작업을 완수하려 하지 않았습니다.

Wikiprompt 뒤의 데이터셋은 정반대 종류의 산출물입니다. 이는 실제 사람들이 작성하고, 공개적으로 게시했으며, 공유할 가치가 있다고 생각할 만한 결과물을 만드는 데 사용한 55,000개 이상의 프롬프트입니다: 초상화, 마케팅 헤드라인, 코드 조각, 수업 계획 등. "모델을 훈련시키기 위해 작성된" 것과 "무언가를 완수하기 위해 작성된" 것 사이의 그 간격이, LLM을 구축하거나 평가하는 경우 이 데이터가 다시 살펴볼 가치가 있는 이유의 전부입니다.

실제 프롬프트가 합성 프롬프트와 다른 신호를 전달하는 이유

합성 프롬프트 코퍼스는 생성 모델이 그럴듯하다고 여기는 지시문 주변에 모여 있습니다: 문법적으로 깔끔하고, 주제 전반에 고르게 분포되어 있으며, 누군가 분류 체계를 설계하고 모델에게 그것을 채우라고 요청했기 때문입니다. 실제 프롬프트는 더 지저분하며, 그 지저분함이 정보입니다. 사람들은 과소 지정하고, 과다 지정하며, 제약 조건을 이상한 순서로 연결하고, 설명 대신 고유 명사로 스타일을 참조합니다. 벤치마크에서 단순히 잘 작동하는 모델이 아니라 진정으로 유용한 모델을 훈련시키는 경우, 실제 요청의 분포는 모델이 프로덕션에서 실제로 직면하게 될 것에 더 가깝습니다.

여기에는 여러분에게 유리하게 작용하는 선택 효과도 있습니다. 이 데이터셋의 모든 레코드는 누군가가 공개할 만큼 충분히 잘 작동했기 때문에 게시한 프롬프트입니다. 이는 "사람들이 입력하는 프롬프트"의 무작위 표본과는 같지 않지만, 파인튜닝이나 퓨샷 검색의 경우 논쟁의 여지 없이 더 나은 표본입니다: 좋은 결과를 만들어냈다는 증거와 짝을 이룬 프롬프트 말입니다.

덤프에 실제로 무엇이 들어 있는가

/dataset/prompts를 가져오면 각 레코드가 다음을 제공합니다:

  • content: 실제 프롬프트 텍스트, 훈련 예시에 넣을 내용.
  • model: 프롬프트가 대상으로 하거나 실행된 AI 모델(GPT Image, Midjourney, Claude, Nano Banana, Kling 등). 하나를 가정하는 대신 대상 모델별로 분할할 수 있습니다.
  • categorytags: 주제 조건부 샘플링이나 층화 분할을 위한 대략적 및 세부 라벨.
  • metadata: media_type, aspect_ratio, style을 포함한 구조화된 필드와, 인간 편집자가 출력을 평가한 경우 창의성, 유용성, 기술적 실행과 같은 측면을 다루는 품질 평가.
  • media: 프롬프트를 생성한 실제 출력(이미지 또는 비디오 URL). 이는 실험실 밖에서 얻을 수 있는 가장 확실한 근거 자료에 가깝습니다.
  • authororiginal_source: 원본 게시물로의 출처 추적.
  • 마지막 그룹, 즉 미디어와 메타데이터와 품질 평가의 조합은 합성 데이터셋이 구조적으로 가질 수 없는 것입니다. 생성된 프롬프트 코퍼스는 프롬프트가 무엇을 말하는지 알려줄 수 있습니다. 그러나 독립적인 인간 판단으로부터 그것이 만들어낸 것이 실제로 좋았는지는 알려줄 수 없습니다. Wikiprompt의 편집 계층은 의미 있는 레코드 일부에 정확히 그 판단이 첨부되어 있음을 의미하며, 이는 보상 모델이나 LLM-as-judge 보정 세트를 위한 약한 라벨로 사용할 수 있게 하며, 단순한 지시 튜닝 입력으로만 사용되는 것이 아닙니다.

    이 기념비적인 벽돌 건축 사진 같은 프롬프트를 보세요: 가치는 텍스트만이 아니라, 텍스트가 실제로 생성한 이미지와 나란히 있는 것입니다. 이를 통해 후보 모델이 동일한 지시문에서 그와 유사한 것을 그럴듯하게 생성할 수 있는지 확인할 수 있습니다. 이 무협 검녀 탕카 구성이나 이 당나라 초상화 프롬프트 같은 양식화된 작품도 마찬가지입니다: 각각은 구체적이고 의견이 담긴 지시문을 구체적인 시각적 결과와 짝지으며, 이는 다른 방식으로는 대규모로 확보하기 어려운 (지시문, 출력) 쌍의 정확한 종류입니다.

    실제 사용을 위한 필터링 및 구조화

    원시 덤프는 설계상 필터링되지 않았습니다(Wikiprompt 자체의 중재 외에는: 활성 상태이고 깨끗한 프롬프트만 내보내집니다). 따라서 파인튜닝을 적용하기 전에 무엇을 최적화할지 결정하고 그에 따라 필터링하세요:

  • 대상 모델별, model 필드를 사용하여, 모델별 어댑터를 구축 중이고 예를 들어 Midjourney 스타일 구문이 Claude 프롬프트 세트에 섞이는 것을 원하지 않는 경우.
  • 카테고리별, 전체 카탈로그 대신 도메인별 조각(creative, coding, marketing, research 및 다섯 개 더)을 원하는 경우. UI에서 창의적 프롬프트를 탐색하면 필터링을 적용하기 전에 카테고리가 실제로 무엇을 포함하는지 빠르게 확인할 수 있습니다.
  • 품질 평가별, 보상 신호가 목표이지 원시 범위가 아닌 경우, 메타데이터 점수가 낮은 레코드를 제외하거나 가중치를 낮춥니다.
  • 최신성별(`created_at`/`updated_at`), 이전 세대 도구의 패턴보다 현재 모델 능력을 반영하는 프롬프트가 중요한 경우.
  • 기계적으로, 페이지네이션은 키셋 기반입니다: 각 응답에는 next URL이 포함되며, next가 null로 돌아올 때까지 이를 따라갑니다. 페이지당 최대 500개 레코드:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    모든 것을 가져오는 최소한의 루프는 Python에서 다음과 같습니다:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    records = []

    while url:

    resp = requests.get(url).json()

    records.extend(resp["records"])

    url = resp.get("next")

    print(len(records), "records")

    API 키가 필요 없고, CORS가 활성화되어 있으며, 엣지 캐싱이 적용되어 있어 전체 카탈로그 크롤링이 빠르고 누군가의 오리진 서버에 부담을 주지 않습니다. 대량 가져오기 대신 대화형 액세스를 원한다면 동일한 카탈로그를 검색 API를 통해 쿼리할 수 있으며, 훈련 파이프라인 대신 에이전트에 연결하는 경우 MCP 서버도 있습니다.

    출처 표시는 선택 사항이 아니며, 라이선스도 아닙니다

    이 데이터가 무엇인지 정확히 하세요. Wikiprompt는 공개 게시물을 집계합니다. 기본 콘텐츠에 대한 공식 라이선스를 보유하거나 부여하지 않으며, 이 덤프도 마찬가지입니다. 모든 프롬프트에는 원본 게시물을 가리키는 original_source와 작성자를 명명하는 author 필드가 있습니다. 이 데이터로 파인튜닝하는 경우, 집계자로 Wikiprompt를 인정하고 재배포하거나 직접 인용하는 모든 것에 대해 원저작자에 대한 출처 표시를 보존하는 모델 카드를 제공하세요. 이는 낮은 기준이며, 올바른 기준입니다: 이 데이터셋은 수천 명의 사람들이 자신의 작업을 공개적으로 공유하기로 선택했기 때문에 존재하며, 이를 자유롭게 떠다니는 훈련 폐기물로 취급하는 것은 이런 종류의 데이터를 생산하는 생태계가 더 이상 존재하지 않게 되는 방식입니다.

    실제지만 지저분한 것이 합성적이지만 깨끗한 것보다 여러분의 사용 사례에 더 나은지 결정하는 경우, 정직한 답변은 무엇을 위해 훈련하는지에 달려 있다는 것입니다. 모델이 사람들이 요청하는 것의 실제 분포를 처리해야 하고, 결과가 좋았는지에 대한 독립적인 판단도 함께 필요하다면, 이는 동일한 레코드에서 둘 다 얻을 수 있는 몇 안 되는 공개 코퍼스 중 하나입니다.

    Tags
    open-data·dataset·fine-tuning·machine-learning·ai-prompts·training-data·api