Falconは、アブダビの技術革新研究所(TII)によって開発されたオープンソースの大規模言語モデルのファミリーである。2023年3月に初めてリリースされたFalconモデルは、デコーダーのみのアーキテクチャに基づいて構築され、高品質なウェブデータでトレーニングされており、効率性と性能を重視している。Falconシリーズには、1Bから180Bパラメータまでのさまざまなサイズのモデルが含まれており、最大のモデルは、一部の同時代のモデルと比較して推論中に必要な計算リソースが少なくながら、標準的なベンチマークで競争力のある結果を達成している。
Falconモデルは、マルチクエリ・アテンション(MQA)とフラッシュ・アテンションを使用していることで注目されており、これによりメモリ帯域幅が削減され、デコーディングが高速化される。それらは、公開ウェブテキストの大規模なフィルタリングされたコーパスであるFalcon RefinedWebデータセットでトレーニングされている。Falconモデルは寛容なライセンスの下でリリースされており、小型モデルはApache 2.0ライセンス、大型モデルは商用利用を制限するカスタムライセンスが適用されている。これらのモデルはオープンソースコミュニティで広く採用されており、さまざまなファインチューニングされた変種の基盤として機能してきた。
アーキテクチャとトレーニング
Falconモデルは、標準的なトランスフォーマー・デコーダーアーキテクチャを採用しているが、いくつかの最適化が施されている。回転位置埋め込みと、大型モデルに対するマルチクエリ・アテンションの組み合わせを使用しており、これによりクエリヘッド全体でキーとバリューのヘッドを共有し、メモリ使用量を削減して推論速度を向上させている。トレーニングデータは、Falcon精製ウェブデータセットから取得されており、これはCommon Crawlからフィルタリングされた数十億のトークンで構成され、一部のモデルには追加のキュレーションされたソースが含まれている。トレーニングプロセスでは、AdamWオプティマイザーとコサイン学習率スケジュールが使用され、ほとんどのモデルで最大シーケンス長は2048トークンである。
最大のFalconモデルであるFalcon-180Bは、384GPUを使用して3.5兆トークンでトレーニングされ、推論、コーディング、一般知識タスクで強いパフォーマンスを示す。そのサイズにもかかわらず、Falcon-180Bは効率性を重視して設計されており、マルチクエリ・アテンションを通じて推論中に使用されるパラメータ数を削減することに焦点を当てている。
モデルの変種とリリース
Falconモデルは、いくつかのサイズと構成でリリースされている。2023年3月の初回リリースには、Falcon-1BとFalcon-7Bが含まれ、どちらもApache 2.0ライセンス下にある。2023年5月には、当時のOpen LLM LeaderboardでトップとなったFalcon-40Bがリリースされた。その後、2023年9月にはFalcon-180Bが公開されたが、これは研究および非商用目的での自由な使用を許可するが商用展開を制限するカスタムライセンスが適用された。また、Falcon-3BやFalcon-11Bなどのより小型のバリエーションもリリースされており、11Bモデルは異なるアテンションメカニズム(マルチクエリ・アテンション)を使用し、顕著な効率性を達成している。
すべてのFalconモデルは、[stylesheet]] Hugging Faceハブで利用可能であり、v-LLMやTensorRT-LLMを含むさまざまな推論フレームワークに統合されている。これらのモデルは、指示追従やチャットアプリケーション向けにもファインチューニングされており、Falcon-7B-InstructやFalcon-40B-Instructなどの公式バリアントが提供。
されている。
パフォーマンスとベンチマーク
Falconモデルは、さまざまなベンチマークで競争力のある性能を示している。例えば、Falcon-40Bは、MMLU(大規模マルチタスク言語理解)ベンチマークで60.4%のスコアを達成し、既存の多くのオープンソースモデルを上回った。Falcon-180Bはさらにこれらの結果を改善し、MMLUで70.4%、Hellaで68.2%を達成し、いくつかのタスクではPaLM-2 Largeなどのプロプライエタリモデルに匹敵。コーディングのベンチマークでは、Falcon-180BはHumanEvalで19.3%のpass@1スコアを達成しており、これは他の大規模モデルと競争力がある。
Falconモデルの効率性は、主要なセリングポイントである。マルチクエリ・アテンションの使用は、メモリフットプリントを削減し、推論を高速化するため、シングルGPUでの展開に適している。例えば、Falcon-40Bは量子化を使用すれば単一のA100 GPUで実行可能で、Falcon-180Bは複数のGPUを必要とするが、それでも有利な性能対リソース比を提供する。
影響とエコシステム
Falconモデルは、オープンソースのAI環境に大きな影響を与えている。これらは、指示チューニングやチャットモデルを含む多数のファインチューニングされたバリアントのベースモデルとして使用されるおり、ハビジョンフェイス、デュプリケート、AWSセージメーカーなどのプラットフォームに組み込まれている。Falcon-40BとFalcon-180Bのリリースは、効率的な大規模モデル設計のさらなる革新を促し、その後のLlama 2やMistralなどのモデルに影響を与えた。Falconモデルは、自然言語処理やコンピュータービジョンに関する研究を含む、TIIのより広範なAI研究への取り組みの一部である。
小型のFalconモデルに対する寛容なライセンスは、研究や商用アプリケーションでの広範な採用を促し、大型モデルは学術研究や産業のパイロットプロジェクトに使用されている。Falconファミリーは、オープンソースの大規模言語の開発における重要な参照点である。