Blog›Guides

Wikipromptオープンプロンプトデータセットの発表:55,000以上のAIプロンプト、無料

Wikipromptは、55,000以上のAIプロンプトからなる完全なカタログを、無料で構造化された、キー不要のデータセットとして公開しました。サイトをスクレイピングする代わりに、1行で取得できる準備が整っています。

Wikipromptオープンプロンプトデータセットの発表:55,000以上のAIプロンプト、無料

ウィキプロンプト公開プロンプトデータセットの発表:55,000以上のAIプロンプトを無料提供

本日、ウィキプロンプトのカタログ全体を公開します。ChatGPT、Claude、Gemini、GPT Image、Midjourney、Seedance、Veo、Kling、Nano Banana、Grokなどでキュレーションしたすべてのプロンプトが、公開・構造化・無料のデータセットとして利用可能になりました。サインアップ不要、APIキー不要、スクレイピングも不要です。

実際に他の人が使って結果を得た、動作するAIプロンプトの本物のコーパスが欲しいと思ったことがあるなら、ランダムなブログからスクレイピングしたリストではなく、これがそのコーパスです。55,000以上のプロンプトがあり、それぞれに完全なレコード(タイトル、説明、実際のプロンプトテキスト、カテゴリ、タグ、メディア、対象モデル、構造化された品質メタデータ、著者、元の投稿へのリンク)が含まれています。

なぜこれをやるのか

ウィキプロンプトは常にウィキのように機能してきました:人々がプロンプトを提出し、私たちがキュレーションして整理し、その結果が誰でも無料で閲覧できる公開リファレンスになります。これはウェブサイトとしてはうまく機能しました。しかし、データで何かを*構築*したい人々(トレーニング、分析、パターンのマイニング、自分のツールへの組み込み)にとっては、うまく機能しませんでした。彼らの唯一の選択肢はwikiprompt.orgをページごとにスクレイピングすることでしたが、それは遅く、壊れやすく、サーバーに不必要に負担をかけていました。

そこで、ウィキペディアが何十年も前に行ったことを実行します:ダンプを配布するのです。スクレイピングする代わりにフェッチします。HTMLを解析する代わりにJSONを取得します。カタログ全体が、予測可能な形式で、カタログが成長するにつれて更新されます。

実際に含まれているもの

データセットから始めてください。そのエンドポイントはマニフェストです:total_prompts、各レコードに期待できるrecord_fields、ページネーションの仕組みが示されています。実際のコンテンツは/dataset/promptsにあり、カタログ自体をJSONとして返します。

各レコードには以下が含まれます:

  • slugとurl、そのプロンプトの正規ページ
  • titleとdescription
  • content、コピーして使用する実際のプロンプトテキスト
  • categoryとtags
  • media、任意のサンプル画像またはビデオURL
  • model、プロンプトが書かれたまたはテストされたAIモデル
  • metadata、メディアタイプ、アスペクト比、スタイル、品質評価などの構造化された詳細
  • authorとoriginal_source、元のツイートまたは投稿へのリンク
  • created_atとupdated_at
  • アクティブでクリーンアップされたプロンプトのみが対象となり、ライブサイトに適用するのと同じ編集基準を適用します。カテゴリはクリエイティブ、マーケティング、パーソナル、生産性、コーディング、教育、ビジネス、リサーチ、その他にわたり、単一のニッチではなく、本当の幅があります。

    具体的に言うと、データセットはこのエディトリアルな喫煙ポスタープロンプトや手彫りリノカット旅行ポスタープロンプトのようなプロンプトが、訪問して手でコピーするだけのページではなく、構造化されたJSONの行として終わる方法です。幻想的な唐時代の肖像写真プロンプトやカタログ内の他のすべてのプロンプトも同様です。

    1行で取得する方法

    これが最も興奮している部分です:セットアップは不要です。1つのcurlコマンドで、今すぐ実際のレコードのページを取得できます。

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    これだけです。ヘッダーにキーなし、認証の手間なし。CORSは完全にオープン(Access-Control-Allow-Origin: *)なので、ブラウザやクライアントサイドアプリから直接呼び出すこともできます。また、エッジキャッシュが効いているため、あなたにとっては速く、私たちにとっては安価です。これは珍しい組み合わせです。

    データセットはページ番号ではなくキーセットカーソルでページネーションされており、クロール中に新しいプロンプトが追加されても安定しています。各レスポンスにはnext URLが含まれています。nextがnullで返るまでそれに従い続けてください。limitで1ページあたり最大500レコードをリクエストでき、デフォルトは200です。最小限のループは次のようになります:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    prompts = []

    while url:

    data = requests.get(url).json()

    prompts.extend(data["results"])

    url = data.get("next")

    print(len(prompts), "prompts fetched")

    これを実行すると、数分でカタログ全体がメモリに格納されます。

    帰属についての注意

    このデータセットのすべてのプロンプトは、元の著者による公開投稿から集約されたものです。ウィキプロンプトはカタログをキュレーションして構造化しますが、コンテンツ自体に対する正式なライセンスは保持していません。このデータセットで何かを構築する場合、それに関する研究を公開する場合、または個々のプロンプトを再利用する場合、ソースとしてwikiprompt.orgをクレジットし、重要な場合は使用している特定のレコードのoriginal_sourceリンクをクレジットしてください。それが唯一のお願いです。

    ダンプを超えて

    データセットは一括オプションですが、唯一の方法ではありません。単一の質問に答える必要があるだけなら、検索APIはカタログ全体をダウンロードせずに任意のクエリに対してJSONを返します。AIエージェントを構築しているなら、MCPサーバーは検索、取得、提出をClaudeや他のエージェントが直接呼び出せるツールとして公開しています。そしてllms.txtは、任意のLLMにここにあるものとその使用方法のクイックマップを提供します。

    私たちは、人々が今日これらのモデルを実際にどうプロンプトしているかの公開リファレンスとしてウィキプロンプトを構築しました。データセットを開くことは、その考えを真剣に受け止めることです:カタログ全体は、閲覧するのと同じくらい簡単に取得できるべきです。取得して、何を構築するか見てみてください。

    Tags
    open-data·dataset·ai-prompts·api·download·announcement