Blog›Guides

55,000のプロンプトが明らかにする、人々のAIの使い方

Wikipromptの公開データセットを分析することで学べること:どのモデルが主流か、画像・動画・テキストのプロンプトがどう異なるか、そしてコーパス上で独自の分析を実行する方法。

55,000のプロンプトが明らかにする、人々のAIの使い方

55,000件のプロンプトが明かす、人々のAI活用法

Wikiprompt上のすべてのプロンプトは、誰かが実際のモデルに対して行った本物のリクエストから始まり、共有する価値があると判断されたものです。それが55,000件以上に達すると、単なる例のリストではなく、コーパス(コーパス)になります。つまり、人々が特定の成果を求めてAIとどう会話しているかのおおまかな国勢調査です。私たちはデータセットを構築し、誰でもそのコーパス全体を取得して自分自身でパターンを探せるようにしました。私たちの要約をそのまま信じる必要はありません。

この投稿はその要約ですが、招待状としての位置づけです。以下のすべては出発点となる仮説であり、盲信してほしい発見ではありません。データは/dataset/promptsにあり、無料で、約10行のコードで取得できます。

レコードに実際に含まれるもの

ダンプ内の各エントリには、slug、url、title、description、content(プロンプト本文)、category、tags、media、model、アスペクト比やスタイルなどの構造化フィールドを持つmetadataオブジェクト、author、original_source、そして両方のタイムスタンプが含まれています。これだけで、ライブサイトに触れずに3種類の分析が可能です。contentとtitleのテキスト分析、category/tags/model/metadataのカテゴリ分析、そしてカタログの存続期間中に表現やモデル選択がどう変化したかを見たい場合はcreated_atの時系列分析です。

モデルの状況

modelフィールドでレコードをグループ化すると、何が最新で何が過大評価されているかではなく、人々が実際に手を伸ばしているもののリーダーボードに近いものが得られます。画像・動画生成モデル(Midjourney、GPT Image、Seedance、Veo、Kling、Nano Banana)は、テキスト・推論モデル(Claude、GPT、Gemini、Grok)と同じテーブルに並びます。なぜならWikipromptは「チャットプロンプト」と「画像プロンプト」を別製品として分離していないからです。これ自体が探求する価値があります。特定のモデルはカテゴリの広がりが狭いか広いか。特定のモデルはmetadata内の特定のスタイルに集中するか。metadata.modelとmetadata.styleフィールドは、プロンプトテキストを正規表現で検索しなくても答えられるように存在しています。

画像、動画、テキストは均等に分かれていない

metadata.media_typeは各レコードを画像、動画、テキストにタグ付けし、その3つの比率自体が、現在どこで興味深いプロンプトエンジニアリングが起きているかのシグナルです。テキストプロンプト(システムプロンプト、ペルソナ、構造化テンプレート)は長く、骨組みが多い傾向があります。画像プロンプトは1〜2文に密集した視覚語彙に依存します。動画プロンプトは最も新しく最も少ない部分で、カメラワーク、持続時間、ペースが明示されたショットリストのように読めます。「プロンプティング」というスキルがモダリティ間でどう異なるかを理解しようとしているなら、他のことをする前にmedia_typeでダンプをフィルタリングすれば、3つの異なる分野を平均化するのを避けられます。

カテゴリとスタイル、実例付き

カタログはすべてを9つのカテゴリ(クリエイティブ、マーケティング、パーソナル、生産性、コーディング、教育、ビジネス、リサーチ、その他)にグループ化しており、クリエイティブはスタイル語彙が機能している良い例です。ミニマリストな白黒エディトリアル喫煙ポスターを見てください。プロンプトは、形容詞を積み重ねるのではなく、抑制、ネガティブスペース、名前付きの写真伝統で多くの作業を行っています。それを先史時代の生物の主権者ポートレートと比較すると、ジャンル混合言語(威厳ある、神話的、主権者)に依存してモデルから特定のトーンを強制しています。あるいは若い女性のパステルファンタジーポートレートは、ほぼ完全に色と照明の説明です。3つのプロンプト、画像モデルから具体性を得るための3つのまったく異なる戦略、そしてすべてが同じcategory: creativeバケットにあります。タグとmetadata.styleは、「クリエイティブ」をトップレベルカテゴリだけが示すものより細かく分割できるフィールドです。

探す価値のある表現パターン

いくつかの点は、逸話的に信じるのではなく、完全なコーパスに対してテストする価値があります。特定の冒頭構文(命令動詞、「あなたは...」、場面設定節)がメタデータ内のquality/assessmentスコアと相関するか。特定の名前付きモデルを対象とするプロンプトが、モデル非依存のものと異なる語彙を使うか。タグの共起が、ラベルが異なっても互いに似た動作をするカテゴリ(たとえばマーケティングとビジネスのプロンプトは多くのタグを共有する傾向があります)を明らかにするか。これにはn-gramのカウントとフィールドによるグループ化以上のものは必要ありません。pandasやスプレッドシートでゆっくりした午後を過ごせば、何か本物が見つかる種類のデータセットです。

自分で取得する

データセットのマニフェストは、単一レコードを取得する前に総数、レコード形状、ページネーションの仕組みを教えてくれます。実際のデータはキーセットページネーションで、1ページ最大500レコードです:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

各レスポンスにはnext URLが含まれ、nextがnullを返すまでそれを追跡します。最小限のループは次のようになります:

import requests

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

records = []

while url:

res = requests.get(url).json()

records.extend(res["records"])

url = res.get("next")

print(len(records), "prompts pulled")

APIキー不要、CORS有効、全体がエッジキャッシュの背後にあるため、完全な取得は高速でサーバーに負担をかけません。一括ダウンロードよりクエリを好むなら、検索APIがアドホックな検索をカバーし、llms.txtが機械可読なすべてを1か所に文書化しています。

帰属、そして私たちが見たいもの

すべてのレコードはoriginal_sourceを通じて実際の作者に遡るため、このデータから生まれる分析、チャート、レポートはwikiprompt.orgとそれが集約する元のクリエイターの両方にクレジットを付けるべきです。私たちは基盤となるプロンプトに対して正式なライセンスを保持していません。私たちはカタログであり、著作権者ではありません。データセットはその条件で提供されています。自由に探索し、帰属をお願いします。

コーパスで何か興味深いことを実行した場合、モデル採用チャートからスタイル分類学、プロンプト長と品質スコアの相関研究まで、私たちはそれを見たいと思っています。55,000件のプロンプトは、人々が現在実際にAIをどう使っているかについて本物のことを言うのに十分なシグナルであり、正直な答えは、私たち自身もすべての分析を実行していないということです。

Tags
open-data·dataset·ai-prompts·data-analysis·api·prompt-engineering