Blog›Guides

最大规模的人工智能图像与视频提示词开放数据集

Wikipromptの公開データセットは、GPT Image、Midjourney、Seedance、Veo、Kling、ChatGPTなど、55,000以上の画像、動画、テキストプロンプトを網羅しており、それぞれに実際の結果メディアと構造化されたメタデータが付属しています。

最大规模的人工智能图像与视频提示词开放数据集

AI画像・動画プロンプトの最大級オープンデータセット

オンラインで見つかるプロンプトコレクションのほとんどは、1つのモデル、1つのメディアタイプに限定され、手動でスクロールして閲覧するだけのページを提供しています。Midjourneyプロンプトのギャラリー、ChatGPTシステムプロンプトのgist、「Veoプロンプト50選」をチェックアウトページの背後に置いた有料コースなど。どれも実際にデータを活用することはできません。

Wikipromptは、簡単に言えて明確に説明する価値がある点で異なります。画像生成、動画生成、テキストを網羅した55,000以上のプロンプトを単一のオープンカタログとして提供し、GPT Image、Midjourney、Seedance、Veo、Kling、Nano Banana、ChatGPT、Claude、Grokなど、現在実際に使われているモデルをカバーしています。今月からはすべてをプレーンなJSONデータセットとしてダウンロード可能です。ログイン不要、APIキー不要、モデルごとのサイロもありません。単一のフィードです。

広さこそがポイント

ほとんどの「プロンプトライブラリ」サイトは特定の分野に特化しています。Midjourney専用のギャラリーでは、同じコンセプトに対するKlingプロンプトがどう異なるかは分からず、ChatGPT用のテキストプロンプトリポジトリにはアスペクト比やスタイルタグに関する情報はありません。Wikipromptのカタログは、画像、動画、テキストのプロンプトが同じスキーマにまとめられ、同じクリエイティブプロンプトカテゴリを通じて閲覧でき、同じ検索APIで検索できるように構成されています。

具体的には、以下を取得できます:

  • GPT Image、Midjourney、Nano Bananaなどのツール用の画像プロンプト、例えばパステル調のファンタジーポートレートや手切りリノカット旅行ポスター。
  • Seedance、Veo、Kling用の動画プロンプト、雨の中で倒される白蛇の精霊のようなシーン駆動型の作品を含む。
  • ChatGPT、Claude、Gemini用のテキストプロンプトで、コーディング、ライティング、ビジネス、リサーチのユースケースをカバー。
  • この広さこそが全体の主張です。ツールを構築するため、分類器を訓練するため、または単に優れたプロンプトがどのようなものかをモダリティをまたいで理解するためにプロンプトリソースを評価している場合、単一モデルのリストでは残りを自分で収集する必要があります。Wikipromptのデータセットにはすでにすべてが1か所に揃っています。

    すべてのプロンプトにはテキストだけでなく結果も付属

    散在するプロンプトコレクションのもう1つのギャップは、通常プロンプト自体しか得られないことです。テキストを見て、おそらくツイートに貼られたスクリーンショットを見て、それが実際に機能するかどうかの判断は自分次第です。

    Wikipromptデータセットの各レコードには、プロンプトテキストと実際に生成されたメディア、さらに構造化されたmetadata(使用モデル、アスペクト比、解像度、スタイルタグ、編集上の品質評価(創造性、有用性、技術的品質、画像・動画についてはプロンプト忠実度と「感動要素」))が含まれています。これがプロンプト文字列のリストと、実際に何が機能するかを研究するために使用できるデータセットとの違いです。プロンプトが優れているかどうかを推測するのではなく、生成された出力とそのスコアを見ることができます。

    他の選択肢との比較

    XやRedditからプロンプトを自分でスクレイピングする場合、レート制限、一貫性のないフォーマット、消えてしまう投稿に対処する必要があります。ペイウォール付きの「プロンプトパック」製品は厳選された一部を提供しますが、残りはロックされ、生成されたメディアを含むことはほとんどありません。単一モデルのコミュニティは有用ですが、特定のフレーミングスタイルがMidjourneyからKlingに翻訳できるかどうかなど、モデル横断的な質問に答えることは構造的にできません。

    Wikipromptデータセットはこれら3つの問題をすべて回避しています:無料であり、単一モデルに限定されておらず、各レコードには元のソースへのリンク(original_sourceフィールド)がすでに含まれているため、帰属表示が組み込まれています。

    データの取得

    マニフェストはデータセットにあり、プロンプト総数、レコードスキーマ、ページネーション方式が返されます。実際のカタログは/dataset/promptsにあり、キーセットカーソルでページングされ、1ページあたり最大500レコードです:

    curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

    各レスポンスにはnext URLが含まれます。nextがnullになるまでそれを追跡すると、完全なカタログが得られます。最小限のページネーションループは次のようになります:

    import requests

    url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

    prompts = []

    while url:

    resp = requests.get(url).json()

    prompts.extend(resp["prompts"])

    url = resp.get("next")

    print(len(prompts), "prompts collected")

    APIキー不要、CORS有効、Vercelのエッジキャッシュの背後にあるため、フルセットの取得は高速で、スクレイピングのようにライブサイトに負荷をかけません。

    フリーテキストではなく構造化フィールド

    各レコードにはslug、url、title、description、content(実際のプロンプト)、category、tags、media(利用可能な場合の生成メディア)、model、metadata、author、original_source、created_at、updated_atが含まれます。カテゴリはクリエイティブ、生産性、コーディング、教育、ビジネス、リサーチ、その他に及び、modelフィールドでプロンプトを特定のツールでフィルタリングできます。

    データセット内のプロンプトはすべてアクティブでモデレーション済みです。つまり、ダウンロードにスパムや不完全なドラフトが含まれることはありません。

    ライブクエリを好む場合

    データセットはダウンロード用です。代わりにオンデマンドでクエリしたい場合は、検索APIがライブクエリに対してJSONを返し、MCPサーバーがAIエージェントがプロンプトを直接検索・取得できるようにし、llms.txtがサイト構造のマップをLLMに提供します。すべて同じ基盤カタログを指しています。

    帰属

    各プロンプトはその作者による公開投稿から収集され、original_sourceフィールドが元の投稿にリンクしています。再公開時には、データセットを参照し、元の作者にクレジットを付与してください。これは正式なライセンスではなく、プロンプト作者が参加し続けるための基本的な礼儀です。

    Tags
    open-data·dataset·ai-prompts·image-generation·video-generation·api