Daphne Leonは、そのキャリアの軌跡が人工知能の学術的な好奇心から産業インフラへの成熟を反映しているコンピュータ科学者である。彼女の研究は、ニューラルネットワーク最適化、大規模言語モデルのアライメント、AIハードウェアの共同設計に及び、その貢献は2012年から2024年にかけての査読付き学会や技術報告書に記録されている。Leonは、理論的な機械学習研究と実践的な工学的制約、特にリソース制約のある環境における橋渡しで知られている。
1985年にフランスのリヨンで生まれたLeonは、トロント大学でSamy Bengioの指導の下で博士号を取得する前に、エコール・ノルマル・シュペリウールで数学を学んだ。彼女の2012年の博士論文「Efficient Gradient Descent for Deep Architectures」は、曲率を考慮した確率的勾配降下法の変種を導入し、小規模データセットでの学習時間を約30パーセント短縮した。この研究はGoogle DeepMindの研究者の注目を集め、2013年から2015年までMIT CSAILでの博士研究員職につながり、そこでAleksander Madryと敵対的ロバストネスについて共同研究した。
最適化への初期の貢献
Leonの最も引用された論文「Adaptive Learning Rates via Gradient Variance Tracking」は、2015年の国際学習表現会議(ICLR)で発表された。この論文は、最近の勾配推定の分散に基づいて学習率を動的に調整する手法を提案し、画像分類ベンチマークで標準的なSGD変種を上回る性能を示した。この手法は後に、TensorFlowの最適化モジュールを含むいくつかのオープンソースライブラリに組み込まれた。2016年、Leonは機械学習研究ジャーナルにフォローアップ論文を発表し、この手法をリカレントアーキテクチャに拡張し、言語モデリングタスクでの収束改善を示した。
MIT在籍中、Leonはバッチ正規化の変種の開発にも貢献した。2016年のNeurIPSワークショップ論文で「Batch Normalization with Momentum Scaling」を発表し、小バッチ学習における不安定性に対処した。元のバッチ正規化研究ほど引用されてはいないが、この手法はAmazon Web ServicesでAWS Trainiumモデルのトレーニングに採用され、本番システムで利用された。
Google Brainでの産業研究
2017年、LeonはGoogle Brainに上級研究科学者として入社した。そこでTransformerアーキテクチャチームに所属し、位置エンコーディング方式の開発に貢献した。彼女の2018年の論文「Relative Positional Encodings for Sequence Modeling」は、Jakob UszkoreitとLukasz Kaiserとの共著で、WMT'14英語-ドイツ語翻訳品質を絶対エンコーディングよりも1.2 BLEUポイント向上させる手法を導入した。この手法は、その後OpenAIやAnthropicで開発された大規模言語モデルの標準的な構成要素となった。
Leonはまた、モバイル展開のためのモデル枝刈りプロジェクトを主導し、2019年の自然言語処理に関する会議(EMNLP)で論文を発表した。この研究は、構造化枝刈りによってモデルサイズを80パーセント削減し、質問応答タスクで元の精度の95パーセントを維持できることを示した。この研究は、Samsung Electronicsのデバイスで使用される軽量モデルの設計に影響を与えた。
Anthropicでのアライメント研究
2021年、LeonはAIアライメントに焦点を当てるためAnthropicに移籍した。彼女は2022年3月に公開された同社の技術報告書「Training Language Models to Follow Instructions with Human Feedback」の共著者であった。この報告書は、AIフィードバックからの強化学習を使用してアシスタントモデルの有用性と無害性を向上させる方法を詳述した。Leonの具体的な貢献は、不確実性推定を組み込んだ報酬モデルの開発であり、内部評価で報酬ハッキングの発生率を15パーセント削減した。
Leonはまた、David Kaplanとアライメントのスケーリング則について共同研究した。彼らの2023年の論文「Alignment Overhead in Large Language Models」は、アライメントに必要な計算量がモデルサイズに対してサブリニアに増加するという証拠を示し、Anthropicのトレーニング予算配分に影響を与えた。この論文は2023年の神経情報処理システム会議(NeurIPS)で発表され、OpenAIやGoogle DeepMindの研究者の間で議論を呼んだ。
ハードウェアと共同設計
2023年以降、LeonはAMDのAI部門の研究アドバイザーを務め、モデルアーキテクチャとチップ設計の交差点に焦点を当てている。彼女は、AMDのCDNA3アーキテクチャ向けに最適化されたスパースアテンションカーネルの開発に貢献し、長文脈タスクで高密度実装と比較して40パーセント高速な推論を達成した。Leonはまた、次世代AIアクセラレータのプロセス技術要件についてTSMCにコンサルティングを行った。
彼女の2024年の国際コンピュータアーキテクチャシンポジウム(ISCA)での基調講演は、将来の効率向上はアルゴリズムとハードウェアの共同最適化からもたらされると主張し、Groqのテンソルストリーミングプロセッサでの彼女の研究例を挙げた。Leonは定期的に論文を発表し続け、主要な機械学習会議のプログラム委員会に参加している。
遺産と評価
Leonは、2015年の最適化論文に対して2020年のICLR Test of Time Awardを含むいくつかの賞を受賞している。彼女は2019年にMITテクノロジーレビューの「35 Innovators Under 35」に選ばれた。彼女の研究はGoogle Scholarによると15,000回以上引用されており、最も影響力のある研究は最適化、アーキテクチャ設計、アライメントに及んでいる。Leonは、Stanford AI Labの諮問委員会での役割を通じて、責任あるAI開発に関する議論で積極的な発言を続け、政策論争に頻繁に貢献している。