英語からの翻訳

BigScienceは、大規模言語モデルであるBLOOMを開発し、AI研究の民主化を目指したオープンな研究協力プロジェクトである。世界中の数百人の研究者が参加し、透明性と倫理的配慮を重視した。

BigScienceは、2022年に公開された大規模言語モデルであるBLOOMを開発したオープンな研究協働である。この取り組みは、様々な機関から数百人の研究者を集め、公開アクセス可能なモデルを構築することを目的としており、プロプライエタリな取り組みとは対照的であった。その目標は、人工知能研究を、開放性、再現性、コミュニティ参加を通じて前進させることであった。

このプロジェクトは2021年に開始され、Hugging Faceが調整役を務め、フランス政府や様々な学術パートナーを含む組織から支援を受けた。BigScienceは、AI開発が少数の大企業に集中していることへの懸念に対処するため、協力的で透明性のある代替手段を創り出すことを目指した。結果として得られたモデルであるBLOOMは、多言語データセットで訓練され、オープンライセンスの下で公開された。

起源と目標

BigScienceは、より包括的で倫理的な大規模言語モデルの開発の必要性についてのAIコミュニティ内の議論から生まれた。この協働は2021年5月に正式に発表され、専門知識と計算リソースを結集する意図があった。主な目標には、最先端のモデルの作成、プロセス全体の文書化、責任あるAI研究のためのベストプラクティスの確立が含まれていた。

この取り組みは、その規模と多様性で注目され、70か国以上から1,000人以上の貢献者が参加した。参加者には、学界、産業界、市民社会からの研究者が含まれ、幅広い視点を反映していた。BigScienceは、協力的でオープンな研究が、資金豊富な企業研究所の成果に匹敵し得ることを示そうとした。

BLOOMモデル

BLOOM(BigScience Large Open-science Open-access Multilingual)は、1760億のパラメータを持つトランスフオーマーベースのニューラルネッとワークである。これは、46の自然言語と13のプログラミング言語で1.6テラバイト以上からなるテキストを含むROOTSと呼ばれるデータセッとで訓練された。訓練には、フランス政府からの助成金によっテ提供されたフランスのJean Zayスーパーコンピューターが使用された。

BLOOMは、低リソース言語を含む複数の言語にわタるテキスト生成と理解をサポーとすルよう設計された。そのアーキテクチャは、マルチヘッド注意や他の標準的なトランスフォーマー構成要素を組み込んでいるが、効率と安定性のための修正が施されている。モデルは2022年7月に責任あるAIラセンスの下で公開され、有害な用途を防ぐための使用制限が含まれている。

訓練データと方法論

ROOTSデータセットは、参加型プロセスを通じて構築され、ボランティアがウェブクロール、学術論文、その他のソースをキュレーションし、フィルタリングした。データ品質と来歴に重点が置かれ、収集と前処理のステップの詳細な文書化が行われた。この透明性は、訓練データをしばしば秘匿すル多くのプロプライエタリなモデルとは異なる点であっタ。

BLOOMの訓練には、多大な計算リソースが必要であり、数か月にわタリ数千のGPUが使用された。この協働では、安定した訓練を確保すルたメに、グライエンとクリーッピングレイヤー正規化などの技法を採用した。プロジェクとまた、他者による再現や発展を可能にすルたメに、詳細なログと分析を公開した。

ガバナンスと倫理

BigScienceは、倫理、法的問題、コミュニティ参加に関するワーキンググーループを含むガバナンス構造を確立した。これらのグーループは、責任あるデータ収集、モデル展開、潜在的な誤用のためのガイデラインを開発した。協働はまた、倫理的レビューを実施し、影響を受けるコミュニティからの意見を求めた。

注目すべき成果の一つは、監視や差別などの高リスク領域でのBLOOMの使用を制限する責任あるAIライセンスの作成であっタ。このライセンスは、開放性と説明責任のバランスを取るよう設計されており、当時は新しいアプローチであっタ。プロジェクトはまた、能力、制限、意図された用途を詳述したモデルカードを公開した。

影響と評価

BLOOMは、そのアクセシビリティと多言語能力、特に商業モデルでしばしば無視される言語に対して、広く賞賛された。これは、オープン研究のベンチマークを提供し、協力的な取り組みが競争力のある結果を生み出せることを示した。プロジェクトはまた、その後の取り組み、例えば他のオープンモデルの作成やデータガバナンスへの関心の高まりに影響を与えた。

批評家は、BLOOMの性能が特定のタスクで一部のプロプライエタリモデルに劣ること、そのサイズが小規模組織にとって展開を困難にしていることを指摘した。それでも、BLOOMの公開は、オープンソースAIへの広範な運動に貢献し、多くの後続モデルがそのアプローチから着想を得た。

遺産と将来の方向性

BigScienceは、BLOOMの公開で主要なフェーズを終了したが、その遺産は進行中のオープン研究の取り組みに残っテいる。この協働は、多様な参加と透明な方法論の価値を示した。また、AI開発における倫理的考慮の重要性を浮き彫りにし、政策議論や業界慣行に影響を与えた。

2025年現在、BigScienceモデルとデータセットは、指定されたライセンスの下で研究および商業用に利用可能なままである。プロジェクとの文書化とコーどは、大規模モデル訓練を研究すル者たメのリソースとして引き続き役立っテいる。将来のオープン協働は、AIにおける新たな課題に対処すルたメに、BigScienceの枠組みを基に構築されるかもしれない。

関連項目

参考文献

この記事は、BigScienceプロジェクトとその成果に関する公開情報に基づいている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·open-research·large-language-models
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴