Blog›Guides

研究におけるWikipromptコーパスの利用と引用

研究者、学生、ジャーナリストのためのガイド:Wikipromptデータセットを再現可能に取得し、正しく帰属し、キュレーションされ進化する集約コーパスとしての限界を理解する方法。

研究におけるWikipromptコーパスの利用と引用

研究におけるWikipromptコーパスの利用と引用について

プロンプトエンジニアリングは大規模なテキストを生成します。そして、大規模なテキストとは、まさに研究者、学生、ジャーナリストが研究対象とするものです。異なるモデルを対象とした画像プロンプトには、どのような表現パターンが繰り返し現れるのでしょうか。クリエイティブなプロンプトは、コーディングや生産性向上のプロンプトと構造的にどのように異なるのでしょうか。これらの問いは答えられるものですが、そのためにはコーパスが必要です。そして今まで、そのコーパスは個々のソーシャルアカウントのタイムラインに散在し、索引化されておらず、実質的に研究不可能な状態でした。

Wikipromptはここ数ヶ月、まさにこの種のコレクションをキュレーションしてきました。オープンウェブから収集した公開・ユーザー投稿のAIプロンプトを整理し、タグ付けしたものです。このカタログには現在、ChatGPT、Claude、Geminiなどのテキストモデル、およびMidjourney、GPT Image、Seedance、Veo、Kling、Nano Bananaなどの画像・動画モデルにわたる55,000以上のプロンプトが収録されています。このコーパスは公開バルクデータセットとして利用可能であり、この投稿は学術・ジャーナリズム業務で責任を持って使用するためのガイドです。再現可能な取得方法、帰属の付け方、そして限界について説明します。

このコーパスの特徴

研究文脈で流通するプロンプトデータセットのほとんどは、小規模な手作業収集サンプルか、出所が不明瞭なスクレイピングスナップショットです。Wikipromptのものは3つの点で異なります。

第一に、すべてのレコードは実際の帰属可能な起源に遡れます。original_sourceフィールドは元の投稿へのリンクであり、authorフィールドはそれを書いた人物の名前を示します。これは合成・匿名化されたデータセットではなく、実際の公開プロンプト共有活動のキュレーションされた索引です。

第二に、レコード間で構造化され比較可能です。すべてのプロンプトにはcategory(クリエイティブ、マーケティング、パーソナル、生産性向上、コーディング、教育、ビジネス、研究、その他)、tags、対象AIシステムを指定するmodelフィールドがあり、該当する場合はmedia_type、aspect_ratio、style、および編集上の品質評価を含むmetadataオブジェクトがあります。これは公開データセットとしては珍しく、強いプロンプトと弱いプロンプトを分けるものを研究するのに役立ちます。

第三に、摩擦なくアクセスできます。APIキー不要、回避すべきレート制限なし、維持すべきスクレイピングインフラなし。これは再現性にとって重要であり、この投稿の要点です。

データを再現可能に取得する

データセットは2つのエンドポイントとして公開されています。データセットマニフェストはコレクションを説明するJSONドキュメントを返します。total_prompts、完全なrecord_fieldsスキーマ、ページネーション方式が含まれます。カタログ自体は/dataset/promptsにあり、こちらもJSONで、ページ番号ではなくキーセットカーソルでページネーションされます。

キーセットページネーションは、研究用の取得を再現可能にするものなので注目に値します。オフセットベースのページネーションは、クロール中にレコードが追加・削除されるとずれ、行を静かに重複・スキップします。キーセットカーソルにはそのような障害モードはありません。各レスポンスのnext URLをnullが返るまで追跡すれば、各ページはドリフトしうる行数ではなく安定した位置に固定されます。

最小限の取得:

curl "https://www.wikiprompt.org/dataset/prompts?limit=500"

limitは1ページあたり最大500レコード(デフォルトは200)を受け付け、カーソルパラメータはafterです。Pythonでの完全クロールは短いループです:

import requests

url = "https://www.wikiprompt.org/dataset/prompts?limit=500"

records = []

while url:

resp = requests.get(url, timeout=30).json()

records.extend(resp["prompts"])

url = resp.get("next")

print(len(records), "records pulled")

レスポンスはAccess-Control-Allow-Origin: *と強力なエッジキャッシュで提供されるため、このループは安価でバックエンドプロキシを必要としません。固定された再現可能なサンプルの場合は、データセットスナップショットとともに取得日を記録してください。コーパスは活発に成長しているためです。

レコードの内容

各レコードには、テキスト分析用のフィールド(title、description、content、実際のプロンプトテキスト)、分類用のフィールド(category、tags、model)、マルチモーダル作業用のフィールド(media、画像・動画URLの配列、および構造化されたmetadataオブジェクト)が含まれます。タイムスタンプ(created_at、updated_at)は縦断研究をサポートし、slugとurlはすべてのレコードに安定した参照可能な識別子を与え、集計統計だけでなく特定の例を引用できます。

具体的に言うと、引用は単一のレンガが記念碑的な影を落とす建築写真プロンプト、または秋のイメージとチベットの曼荼羅モチーフを組み合わせた肖像画、あるいは武侠とタンカの美学を描いたもののような様式的に異なるエントリを指すことができます。これらの各ページはそのレコードの正規の引用可能な場所です。安定したURL、元の著者への可視的な帰属、元の投稿へのリンクがあります。

バルク取得ではなくライブフィルタリングの場合は、検索APIが同じカタログに対するクエリベースの検索をサポートし、機械可読な要約はllms.txtにあります。どちらも体系的なサンプリングのためのバルクデータセットを置き換えるものではありませんが、スポットチェックや範囲指定サンプルに役立ちます。例えば、そのドメインに限定した研究のためにクリエイティブカテゴリのみを取得する場合などです。

帰属と引用

Wikipromptはアグリゲーターであり、コーパス内のプロンプトの元の著者ではありません。コンテンツは個々のクリエイターによる公開投稿から来ており、正しい帰属には両方の層の引用が必要です。データセットソースとしてのWikiprompt、および詳細に引用・複製・分析するレコードの特定のoriginal_sourceです。私たちは基礎となるコンテンツに対する正式なライセンスを保持または主張していません。再利用はより広い権利の付与ではなく、適切な帰属の要求として扱ってください。データセットのフィールドが答えない疑問が生じた場合は、レコードをoriginal_sourceまで遡り、その系統を文書に記録してください。

コーパス全体の合理的な引用形式:

Wikiprompt Corpus. Retrieved [date] from https://www.wikiprompt.org/dataset/prompts.

Aggregated public AI prompt data; individual records attribute original authors

via the original_source field.

個々のプロンプトを引用する場合は、その正規URL(wikiprompt.org/<slug>)を引用し、分析が元の文脈に依存する場合はリンクされたoriginal_sourceも引用してください。

明確に述べるべき限界

これはキュレーションされたコーパスであり、オンライン上のすべてのAIプロンプト活動のランダムサンプルではありません。アクティブでクリーンなプロンプトのみがエクスポートされ、品質やポリシー上の理由で削除されたものは表示されません。そのため、モデレートされた公開プロンプトコレクションがどのようなものかを研究するには適していますが、「人々がAIモデルにプロンプトする方法」全般についての主張は、それに応じて範囲を限定する必要があります。

コーパスは固定ではなく成長しています。ある週の取得は次の週の取得と正確には一致しません。正確な再現性が重要な場合は、自分でデータをスナップショットし(上記のキーセットページネーションで安価に可能)、取得日と理想的にはスナップショットのレコード数を引用してください。ライブエンドポイントを指して後で一致することを前提としないでください。

最後に、metadataの品質評価はキュレーション中の編集上の判断であり、正式または査読済みのルーブリックではありません。研究対象の変数としては有用ですが、その出所を開示せずにグラウンドトゥルースとして使用するのはあまり有用ではありません。

これらはコーパスを避ける理由ではありません。これは集約された公開データセットを使用する際の条件です。データの出所を知り、サンプルの境界を開示し、実際にプロンプトを書いた人々を引用することです。

Tags
open-data·dataset·research·citation·reproducibility·academic·api