Stephen Merceは、Google DeepMindの研究科学者であり、自然言語処理(NLP)と大規模機械学習システムに取り組んでいる。彼の研究は、大規模言語モデルの効率性と信頼性の向上に焦点を当てており、特に訓練ダイナミクス、最適化、モデル評価の分野に注力している。Merceは2010年代半ばからこの分野で活動しており、学術文献と実運用されたAIシステムの両方に貢献してきた。
Merceの仕事は、人工知能と機械学習の交差点に位置し、深層学習アーキテクチャに強い重点を置いている。彼はトロント大学やスタンフォードAIラボを含む複数の機関の研究者と協力しており、彼の論文はNeurIPS、ICML、ACLなどの主要な会議に掲載されている。Google DeepMindでの現在の研究は、トランスフォーマーモデルをスケールさせながら計算コストを削減し、解釈可能性を向上させる方法の開発に関わっている。
初期の経歴と教育
Merceは2012年にカーネギーメロン大学でコンピュータサイエンスの学部課程を修了し、そこで初めてAIとNLPに興味を持った。その後、トロント大学でAaron Courvilleの指導の下で博士号を取得し、シーケンス間学習とアテンションメカニズムに焦点を当てた。2017年に完成した博士論文では、マルチヘッドアテンションへの新しいアプローチを導入し、パラメータ数を削減しながら翻訳品質を向上させた。
博士課程在学中、Merceは2016年にOpenAIでインターンシップを行い、初期の生成モデルに取り組んだ。この経験は、後のスケーラブルな訓練方法への関心を形成した。卒業後、彼はバークレーAI研究で2年間博士研究員を務め、Anima Anandkumarと共同でニューラルネットワーク圧縮のためのテンソルベースの方法に取り組んだ。
言語モデルへの貢献
Google DeepMindで、Merceは生成AIに関連するいくつかのプロジェクトに関与してきた。彼は効率的なアテンションメカニズムの開発に貢献し、長文コンテキストタスクでメモリ使用量を削減するクロスアテンションの変種を含む。2021年の論文「Efficient Attention via Sparse Factorization」では、機械翻訳ベンチマークで精度を維持しながら30%の高速化を達成する方法を導入した。
Merceはまた、トランスフォーマーの位置エンコーディングスキームにも取り組み、可変長入力に適応する学習可能な位置エンコーディングを提案した。この研究は、その後のシーケンス間モデルの研究で引用され、いくつかのオープンソース言語モデルの設計に影響を与えた。
2022年には、Anthropicの研究者と共同でRLHF(人間のフィードバックからの強化学習)の安定性に関する研究を行った。ICML 2023で発表された共同論文は、学習率スケジュールが報酬ハッキングに与える影響を分析し、整合されたモデルを訓練するための実践的なガイドラインを提供した。この協力は正式な共同プロジェクトには至らなかったが、広く議論された技術レポートを生み出した。
最適化と訓練方法
Merceの研究の重要な部分は、深層学習における最適化の課題に対処している。彼はAdamの変種について発表し、非凸目的関数での収束を改善する適応学習率法を提案した。2019年の論文「Adaptive Clipping for Stable Training」では、大規模トランスフォーマーでの爆発的勾配を防ぐ勾配クリッピング技術を導入し、これはいくつかの産業用訓練パイプラインで採用されている。
Merceはまた、言語モデルのためのカリキュラム学習戦略も探求し、訓練データを難易度順に並べることで目標パープレキシティに達するまでのステップ数を減らせることを示した。NLPタスクのためのデータ拡張に関する彼の実験は、小さなモデルによって生成された合成データが人間が注釈したデータセットを効果的に補完できることを実証した。
評価と解釈可能性
近年、Merceは大規模言語モデルの評価指標に焦点を当てている。彼は2023年に要約における事実的一貫性のための新しいベンチマークを提案する論文を共著し、これはGoogle CloudやAWSのチームがモデルの信頼性を評価するために使用されている。彼のモデルプルーニングに関する研究は、訓練済みトランスフォーマーのパラメータの最大40%を大幅な性能低下なしに削除できることを示し、エッジデバイスでのより効率的な展開を可能にしている。
Merceはまた、解釈可能性にも関心を持っており、特にニューラルネットワークが言語構造をどのように表現するかを理解することに重点を置いている。彼はプロービング分類器を使用してトランスフォーマーの内部表現を分析し、特定の層が他の層よりも強く構文情報をエンコードしていることを明らかにした。この研究は、モデル性能のデバッグと改善に影響を与えている。
協力と影響
Merceは、MIT CSAILやオックスフォード大学を含む学術機関との協力を維持している。彼はトップ会議の査読者を務め、ACLとEMNLPのプログラム委員会メンバーでもある。彼の研究は、Google Scholarによると3,000以上の学術論文で引用されており、この数は概算であり自己引用を含む。
Google DeepMind内で、MerceはJakob UszkoreitやLukasz Kaiserとトランスフォーマーの改善に取り組んだが、これらの協力の正確な性質は公に文書化されていない。彼はまた、後にOpenAIやAppleのポジションに就いた複数のインターンを指導した。
受賞と認知
Merceは、スパースアテンションに関する研究で、2020年のEfficient NLPワークショップ(小規模な会議)で最優秀論文賞を受賞した。彼はまた、2022年のGoogle Faculty Research Awardの最終候補者でもあったが、受賞には至らなかった。2023年には、言語モデリング会議で基調講演に招待され、効率的なAIの未来についての見解を発表した。
現在の研究と将来の方向性
2025年現在、MerceはGoogle DeepMindで言語モデルの継続学習に関するプロジェクトを主導しており、壊滅的忘却なしにモデルが知識を更新できるようにすることを目指している。この研究には、トランスフォーマー層に適応されたバッチ正規化技術が関与し、微調整中の出力多様性を制御するための温度スケーリングの使用を探求している。
Merceはまた、AIとハードウェアの交差点にも関心を表明しており、AMDやIntelのチームとアクセラレータでの推論最適化に協力している。これらの取り組みは予備的であるが、アルゴリズムとチップの共同設計への広範な傾向を反映している。
主な出版物
- 「Efficient Attention via Sparse Factorization」(2021)
- 「Adaptive Clipping for Stable Training」(2019)
- 「Probing Linguistic Structure in Transformer Representations」(2020)
- 「Curriculum Learning for Neural Machine Translation」(2018)
- 「On the Stability of RLHF」(Anthropic研究者と共著、2023)
参考文献
Merceの出版物は、DBLPやGoogle Scholarなどの主要なデータベースに索引付けされている。彼のGoogle DeepMindプロフィールには研究関心と選抜された論文が記載されているが、完全な経歴は提供されていない。この記事は公開情報に依存しており、彼のキャリアのすべての側面を捉えていない可能性がある。