BlogGuides

55,000개의 AI 프롬프트 다운로드 방법 (무료, 스크래핑 없음)

# 공개 데이터셋 엔드포인트를 통한 전체 Wikprompt 카탈로그 가져오기 단계별 가이드 공개 데이터셋 엔드포인트를 통해 전체 Wikprompt 카탈로그를 가져오는 방법을 단계별로 설명합니다. 키셋 페이지네이션 커서를 따라가며 더 이상 남은 항목이 없을 때까지 진행하며, 스크래핑은 필요하지 않습니다. ## 1. 시작하기 먼저, 데이터셋 엔드포인트의 기본 URL을 확인하세요. 이 URL은 [공식 문서](https://example.com/docs)에서 찾을 수 있습니다. ## 2. 첫 번째 요청 보내기 첫 번째 요청은 커서

55,000개의 AI 프롬프트 다운로드 방법 (무료, 스크래핑 없음)

55,000개의 AI 프롬프트를 다운로드하는 방법 (무료, 스크래핑 없음)

트위터 스레드를 스크래핑하거나, Discord 서버를 스크린샷하거나, 헤드리스 브라우저로 웹사이트 HTML을 페이지네이션하여 프롬프트 데이터셋을 구축하려고 시도해 본 적이 있다면, 그 방법이 얼마나 취약한지 이미 알고 있을 것입니다. 선택자가 바뀌고, 속도 제한이 걸리고, 수집한 "프롬프트"의 절반은 실제 프롬프트가 아니라 프롬프트에 대한 답글인 경우가 많습니다.

Wikiprompt가 그 모든 필요성을 제거했습니다. 이미지, 비디오, 텍스트 생성을 아우르는 55,000개 이상의 큐레이션된 AI 프롬프트 카탈로그 - Midjourney, GPT Image, Veo, Kling, Nano Banana, Claude 같은 모델용 - 가 이제 curl로 페이지를 넘길 수 있는 일반 JSON 데이터셋으로 제공됩니다. API 키도, 로그인도, 스크래핑도 필요 없습니다. 이 글은 "데이터가 필요하다"에서 55,000개 레코드가 담긴 로컬 파일까지 가는 가장 빠른 경로입니다.

1단계: 매니페스트 확인

레코드를 가져오기 전에 매니페스트를 확인하여 스크립트가 무엇을 다루는지 알 수 있게 하세요:

curl "https://www.wikiprompt.org/dataset"

이 명령은 데이터셋을 설명하는 작은 JSON 문서를 반환합니다: total_prompts (현재 수, 55,000+), record_fields (아래 스키마), 그리고 pagination 방식. 이 엔드포인트를 총 수의 진실 공급원으로 취급하고, 파이프라인에 숫자를 하드코딩하지 마세요.

2단계: 첫 페이지 가져오기

실제 레코드는 /dataset/prompts에 있습니다. 페이지네이션은 키셋 기반(페이지 번호가 아닌 커서)이라 200페이지에서도 빠르고 안정적으로 유지됩니다. 기본 페이지 크기는 200개 레코드이며, 한 번에 최대 500개까지 요청할 수 있습니다:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

응답은 레코드 목록과 next 필드가 포함된 JSON 객체입니다. next는 방금 받은 마지막 레코드를 가리키는 after 커서를 담은 전체 URL로, 그대로 가져올 수 있습니다. 페이지를 더 넘길 것이 없으면 nextnull입니다. 이 단일 필드가 전체 루프 조건입니다.

3단계: `next`가 null이 될 때까지 따라가기

다음은 Python으로 작성된 전체 페이지네이션 루프입니다. 모든 레코드를 로컬 파일에 쓰고 스스로 멈춥니다:

import json

import time

import urllib.request

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

out = open("wikiprompt_dataset.jsonl", "w")

count = 0

while url:

with urllib.request.urlopen(url) as resp:

data = json.loads(resp.read())

for record in data["records"]:

out.write(json.dumps(record) + "\n")

count += 1

url = data.get("next")

time.sleep(0.2)

out.close()

print(f"Downloaded {count} prompts")

Node에서 동일한 루프, 그것이 당신의 스택이라면:

let url = "https://www.wikiprompt.org/dataset/prompts?limit=500";

const fs = require("fs");

const out = fs.createWriteStream("wikiprompt_dataset.jsonl");

let count = 0;

while (url) {

const res = await fetch(url);

const data = await res.json();

for (const record of data.records) {

out.write(JSON.stringify(record) + "\n");

count++;

}

url = data.next;

}

console.log(Downloaded ${count} prompts);

둘 중 하나를 실행하고 기다리세요. 모든 응답은 엣지 캐시되고 CORS가 활성화되어 있으므로 (Access-Control-Allow-Origin: *), 서버, 브라우저 콘솔, 노트북, 서버리스 함수에서 특별한 헤더 없이 작동합니다. 일반 연결에서 limit=500으로 55,000개 이상의 레코드를 모두 가져오는 데는 2분 미만이 걸립니다.

레코드당 실제로 얻는 것

데이터셋의 각 JSON 객체는 동일한 형태를 가지며, 이것이 일회성 탐색 이상의 용도로 유용하게 만듭니다:

  • slugurl, wikiprompt.org에서 해당 프롬프트의 정식 페이지
  • titledescription
  • content, 모델에 복사할 실제 프롬프트 텍스트
  • category (creative, marketing, personal, productivity, coding, education, business, research, other) 및 tags
  • media, 프롬프트가 시각적 출력을 생성한 경우 이미지 또는 비디오 URL
  • model, 프롬프트가 작성되었거나 생성된 AI 모델
  • metadata, 미디어 유형, 종횡비, 스타일 및 품질 평가를 포함한 구조화된 블록
  • authororiginal_source, 프롬프트가 나온 원본 트윗 또는 게시물로의 링크
  • created_atupdated_at
  • content 필드가 핵심입니다: 요약이 아닌 바로 사용 가능한 프롬프트 텍스트이며, 이것이 대부분의 스크래핑된 데이터셋이 잘못하는 부분입니다.

    먼저 볼 몇 가지 레코드

    스키마를 맹신하지 말고 실제 항목 몇 개를 열어보세요. Titan: Engineering Blueprint of a Transforming Robot은 전체 메타데이터 블록이 있는 상세한 이미지 프롬프트의 좋은 예입니다. Data Physicalization은 더 개념적이고 디자인 중심의 프롬프트에 categorytags가 어떻게 할당되는지 보여줍니다. 그리고 Pastel Fantasy Portrait of a Young Woman은 메타데이터의 style 필드와 비교할 가치가 있는 간결한 스타일 중심 프롬프트입니다. 이 세 개의 slug를 로컬 JSONL 파일에서 추출하면 55,000개 전체를 신뢰하기 전에 파서를 빠르게 검증할 수 있습니다.

    다운로드보다 쿼리가 더 선호된다면

    대량 데이터셋은 모든 것을 로컬에서 한 번에 원할 때 사용합니다. 일부만 필요하다면, 검색 API가 주문형 쿼리에 JSON으로 응답하고, MCP 서버는 동일한 카탈로그를 Claude 및 기타 에이전트용 도구로 노출하며, llms.txt는 크롤러에게 사이트 맵을 제공합니다. 데이터셋 내보내기와 이러한 실시간 엔드포인트는 동일한 기반 데이터를 공유하므로, 나중에 전환해도 비용이 들지 않습니다.

    재사용 시 한 가지 규칙

    Wikiprompt는 원저자가 게시한 공개 게시물에서 프롬프트를 집계하며, 저작권 보유자가 아닙니다. 이 데이터셋을 기반으로 무언가를 게시한다면, wikiprompt.org와 사용한 특정 레코드의 original_source 링크를 크레딧으로 표시하세요. 이것이 이 모든 것에 첨부된 유일한 조건입니다.

    다운로드하고, 페이지를 넘기고, 무언가를 만드세요. 매니페스트와 next 커서만 기억하면 됩니다.

    Tags
    open-data·dataset·ai-prompts·api·download·pagination