合成データとは、人工的に生成されたデータのことで、通常はモデルやシミュレーションによって作られ、現実世界の出来事や人間が制作したコンテンツから収集されるものではない。機械学習システムの訓練、微調整、または評価に使用される。現代の大規模言語モデルの文脈では、合成データは通常、既存のAIモデルによって生成されたテキスト、コード、または対話を指し、多くの場合フィルタリングを経て、別のモデルの訓練データとして使用される。この慣行は、より強力なモデルの出力がより弱いモデルを教える場合、蒸留の一形態として説明されることがある。
合成データの重要性は2020年代半ばにかけて高まり、主要な研究所が研究者らが「データの壁」と呼ぶものに直面した。これは、インターネット上で容易に入手可能な高品質な人間生成テキストの成長が鈍化する現象であり、モデル生成データが、継続的なスケーリングのために人間生成テキストを補完する重要な要素となった。
用途
合成データはAI開発においていくつかの目的に役立つ。希少なカテゴリのデータを拡張できる。例えば、稀な言語の追加例、数学やコードなどの専門領域、または人間から大規模に収集するにはコストがかかる多ターン対話の生成などである。これは人間のフィードバックからの強化学習パイプラインやその後継において広く使用され、モデルまたはモデルのアンサンブルが候補応答を生成し、それをランク付けまたはフィルタリングして訓練シグナルを作成する。合成データはまた、推論モデルの訓練において中心的な役割を果たす。数学やプログラミングなどの検証可能な領域では、モデル自身が生成した解を自動的にチェックし、正しいものを訓練例として再利用できる。これは、DeepSeek-R1などのシステムの背後にある強化学習手法の中心となるアプローチである。テキスト以外にも、合成データはコンピュータビジョンやロボティクスで広く使用され、シミュレートされた環境が、物理的に収集するにはコストがかかるラベル付き画像や相互作用データを生成する。
モデル崩壊の議論
2023年頃から始まった一連の研究は、モデル崩壊についての懸念を提起した。これは、モデルが以前のモデルによって生成されたデータで繰り返し無差別に訓練された場合に発生する可能性があるモデル品質の劣化であり、各世代が誤りを増幅し、元の人間生成分布からの稀だが重要なパターンのカバレッジを失うという理論に基づく。その後の研究と業界の実践は、モデル崩壊が主に合成データが不注意に使用され、品質フィルタリングや実データとの混合がない場合に現実のリスクとなること、そして慎重にキュレーションまたは検証された合成データ、特に検証可能な領域では、同じ劣化を示さず、モデル品質を大幅に向上させ得ることを示唆した。2025年までに、ほとんどのフロンティア研究所は、合成データを避けるのではなく、キュレーションされた大量の合成データを訓練の標準的な一部として使用した。
品質と検証
合成データは、それを生成したモデルのバイアス、誤り、文体の癖を継承し、増幅する可能性があるため、実務者は一般的にフィルタリング手順を適用する。例えば、別の、多くの場合より有能なモデルやルールベースのチェッカーを使用して、生成された例を訓練セットに含める前に品質をスコアリングまたは検証する。実行可能なコードやチェック可能な数学など、正しさを自動的に検証できる領域は、低品質の例をアルゴリズム的にフィルタリングできるため、合成データ生成に特に適していると考えられている。一方、オープンエンドな創造的または事実に基づくテキストは自動検証が難しく、それを訓練したモデルを静かに劣化させるリスクが大きい。