BlogGuides

왜 우리는 전체 프롬프트 카탈로그를 오픈했는가

Wikipedia는 전체 덤프를 공개하는 것이 아카이브를 덜 필수적이게 만드는 것이 아니라 오히려 더 필수적으로 만든다는 것을 증명했습니다. 우리는 55,000개 이상의 프롬프트 카탈로그에 동일한 논리를 적용했으며, 원저작자에 대한 귀속이 그것이 작동하게 만드는 핵심 조건입니다.

왜 우리는 전체 프롬프트 카탈로그를 오픈했는가

왜 우리는 전체 프롬프트 카탈로그를 공개했는가

매주 누군가가 wikiprompt.org에서 프롬프트를 긁어 가는 스크래퍼를 작성합니다. 우리는 로그에서 이를 볼 수 있습니다. /category/creative에 대한 요청 버스트, 그 다음 /category/coding, 사이트의 모든 페이지를 사람이 "다음"을 천 번 클릭하는 것처럼 훑어 나가지만, 그것은 스크립트이고 결코 지루해하지 않습니다. 우리는 이것을 차단할 성가신 일로 취급하곤 했습니다. 그런데 우리는 더 나은 질문을 스스로에게 던졌습니다. 왜 우리는 사람들이 이런 짓을 하도록 만들고 있는가?

우리가 인정한 후의 답변은 칭찬할 만한 것이 아니었습니다. 우리는 55,000개 이상의 큐레이션된 프롬프트를 보유하고 있었고, 이는 사람들이 실제로 AI 모델과 어떻게 대화하는지 연구하는 누구에게나 유용한 원자재였습니다. 그리고 한 번에 하나 이상을 얻을 수 있는 공식적인 방법은 2004년처럼 웹사이트를 클릭하는 것뿐이었습니다. 그것이 열린 지식이 작동해야 하는 방식이 아닙니다. 그리고 우리는 열린 지식이 어떤 모습이어야 하는지 정확히 알고 있습니다. 왜냐하면 그 최고의 예가 2001년부터 존재해 왔기 때문입니다.

Wikipedia 모델을 진지하게 받아들이기

Wikipedia는 브라우저에서 한 번에 하나씩 기사를 읽을 수 있게만 하지 않습니다. 전체 백과사전의 전체 데이터베이스 덤프를 정기적으로, 무료로, 계정 없이 게시합니다. 누구나 전체를 다운로드하여 무언가를 할 수 있습니다. 검색 엔진을 구축하거나, 모델을 훈련하거나, 인터넷이 없는 곳에서 오프라인 미러를 실행하거나, 10년간의 편집을 통해 기사가 어떻게 변했는지 연구할 수 있습니다. Wikipedia는 이것을 마지못해 하지 않았습니다. 덤프가 *바로* 사명이기 때문에 그렇게 한 것입니다. 스크래핑 방지 프론트엔드 뒤에만 존재하는 백과사전은 페이지 하단에 어떤 라이선스가 인쇄되어 있든 실제로는 열려 있지 않습니다.

아무도 계획하지 않았지만 모두가 혜택을 받는 부수 효과: 덤프가 존재하기 때문에 누구도 규모에 맞게 콘텐츠를 얻기 위해 Wikipedia를 스크래핑할 필요가 없습니다. 그렇지 않으면 라이브 사이트를 강타했을 스크래핑 트래픽이 대신 정적 파일에 흡수되고, Wikipedia는 인용하는 것이 인용하지 않는 것보다 쉽기 때문에 당연히 모든 곳에서 인용됩니다. 개방성은 Wikipedia의 표준 출처로서의 지위를 약화시키지 않았습니다. 오히려 공고히 했습니다.

우리는 프롬프트도 같은 이유로 같은 대우를 받을 자격이 있다고 생각합니다. 좋은 프롬프트는 블로그 게시물이 콘텐츠인 방식의 "콘텐츠"가 아닙니다. 그것은 기법이며, 작은 응용 기술 조각이며, 보통 시행착오를 통해 만들어지고 누군가가 자신이 알아낸 것에서 다른 사람들이 혜택을 받기를 원해서 공유됩니다. 그것은 독점 지적 재산보다 Wikipedia 기사에 훨씬 더 가깝습니다. 선사시대 생물 군주 초상화 또는 건축적 계단에서 연출된 사설 초상화는 이미지 모델과 대화하는 방법에 대한 누군가의 발견이며, 다음 사람이 처음부터 다시 발견할 필요가 없도록 기록된 것입니다. 그것을 폐쇄된 정원, 로그인 벽 또는 "API 액세스는 문의하세요" 양식 뒤에 가두는 것은 콘텐츠의 목적과 정반대입니다.

집단 지식은 한 번에 하나의 요청으로 확장되지 않습니다

우리가 피하고 싶었던 특정 실패 모드가 있습니다. 실제 프롬프트 텍스트가 지불할 때까지 숨겨져 있는 프롬프트 마켓플레이스, 또는 좋은 내용이 외부인이 검색할 수 없는 Discord 서버에 사는 커뮤니티 같은 것들입니다. 그 모델은 단일 거래 시점에 가치를 포착하는 데 최적화되어 있습니다. 우리는 그것들이 더 큰 상을 놓친다고 생각합니다. 그 상은 좋은 프롬프트가 어떻게 구축되는지 알고 싶을 때 사람들이 기본적으로 찾는 장소가 되는 것입니다. Wikipedia가 사실에 대해 기본적으로 찾는 장소가 된 것처럼 말입니다. 콘텐츠가 규모에 맞게 연구되고, 제대로 인덱싱되며, 그 위에 구축될 수 없다면 그런 참조 지점이 될 수 없습니다.

그래서 데이터셋은 덤프가 작동해야 하는 방식으로 작동합니다. API 키가 없고, 협상할 속도 제한 계층이 없으며, CORS는 완전히 열려 있고, 에지에서 충분히 하드하게 캐시되어 과도한 사용이 우리의 잠을 방해하지 않습니다. https://www.wikiprompt.org/dataset을 치면 total_prompts와 페이지네이션 체계가 있는 매니페스트를 얻습니다. `/dataset/prompts`를 치면 카탈로그 자체를 JSON으로 얻으며, 키셋 커서로 페이지네이션되고 페이지당 최대 500개 레코드입니다:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

각 응답의 next URL을 null이 반환될 때까지 따라가면 전체 카탈로그를 훑은 것입니다. 모든 레코드는 slug, url, title, description, content(프롬프트 텍스트 자체), category, tags, media, model, 구조화된 metadata, author, original_source 및 타임스탬프를 담고 있으며, 크리에이티브와 코딩부터 마케팅, 연구 및 교육까지 다양한 카테고리에 걸쳐 있습니다. 벌크 다운로드보다 쿼리를 선호한다면 검색 API와 정적 사본을 가져오는 대신 라이브로 카탈로그에 접근하려는 에이전트를 위한 MCP 서버도 있습니다.

개방성은 익명성과 같지 않습니다

기술적 접근만큼 중요한 부분이 여기 있습니다. 이 중 어느 것도 우리가 출처를 지울 수 있는 것이 아닙니다. 카탈로그의 모든 프롬프트는 공개적으로 게시한 실제 사람에게 거슬러 올라갑니다. 비에 젖은 패배한 백색 뱀 영혼이 Twitter에 공유되었든, 서브레딧 스레드에 던져진 기법이든 말입니다. original_source는 장식용 필드가 아닙니다. 그것은 거래의 나머지 절반입니다. 우리는 우리가 보유하지 않은 공식 라이선스를 주장하지 않으며, 프롬프트가 우리가 원하는 대로 재라이선스할 수 있는 우리의 것인 척하지 않습니다. 우리는 분명히 요청합니다. 이 데이터셋으로 무언가를 구축한다면, 집계자로 wikiprompt.org를, 출처로 원저작자를 속성으로 표시해 주십시오. 그것은 Wikipedia가 기사를 재사용하는 모든 사람과 맺는 것과 같은 거래입니다. 지식을 가져가되, 출처를 붙이십시오.

Wikipedia의 덤프는 Wikipedia를 덜 필수적으로 만들지 않았습니다. 그것을 인프라로 만들었습니다. 우리는 wikiprompt.org가 사람들이 조용히 스크래퍼를 돌리는 사이트보다 모두가 이미 사본을 가지고 있는 지루하고 신뢰할 수 있는 장소가 되기를 바랍니다. 개방성은 결코 여기서 위험이 아니었습니다. 폐쇄된 정원이 위험이었습니다.

Tags
open-data·dataset·manifesto·wikipedia·attribution·ai-prompts·open-knowledge