Iris Zhangは、アメリカの人工知能研究者でありエンジニアである。彼女は、OpenAIで開発された画期的なLarge language modelであるGPT-3の共著者としての役割で著名である。Zhangの研究は、Machine learningの方法論、モデルのスケーリング、効率的なニューラルアーキテクチャにわたり、アルゴリズムの革新と実用的な展開の橋渡しに焦点を当てている。
Zhangは1990年にカリフォルニア州パロアルトで生まれた。彼女は2012年にMIT CSAILでコンピュータサイエンスの学士号を取得し、2019年にStanford AI Labで人工知能の博士号を取得した。彼女の博士論文「スケーリングと効率性:汎用言語モデルへの道」は、Learning Rate SchedulingとGradient Clippingの技術を深層学習において検討し、後の大規模なNeural network開発の基礎を築いた。
OpenAIでのキャリア
博士号取得後、Zhangは2019年にOpenAIに入社し、研究科学者となった。彼女はGPT-3チームの中核メンバーとなり、モデルの設計と評価に貢献した。共著者として、彼女はMulti-Head AttentionモジュールとPositional Encodingスキームの統合を支援し、長いコンテキストの処理を改善した。2020年に発表されたGPT-3の論文は、Generative AIの分野における彼女の主要な発言者としての地位を確立した。
Zhangは、データキュレーションとフィルタリングに関する章を執筆し、それがGPT-3の性能に決定的に重要であることが証明された。彼女はまた、Model PruningとWeight Initializationに関する研究を拡張し、Transformer (architecture)モデルのスケーリングを可能にした。これらの貢献は、GPT-3を現代のArtificial intelligenceにおける基盤的ステップとして確立するのに役立った。
OpenAI退社後とAnthropic
Zhangは2022年にOpenAIを離れ、Anthropicに上級研究リーダーとして加わった。そこで彼女は、安全性に焦点を当てた大規模言語モデルの開発に貢献し、RLHFをAPI機能に応用した。彼女はまた、Google Cloudのハードウェアチームと連携し、トレーニングワークロードを最適化して、コストとエネルギー消費を削減した。
2023年、Zhangは「リソース制約環境のための効率的トランスフォーマー」に関する研究を共同発表し、Cross-AttentionとSequence-to-Sequence (Seq2Seq)学習のハイブリッドを導入した。この方法は、内部ベンチマークで報告されたように、精度を維持しながらモデルのFLOPSを最大40%削減した。
AIコミュニティへの貢献
Zhangは複数のAIスタートアップに助言を行った。彼女は2021年から2024年まで、SambaNovaとGroqの技術諮問委員会に参加し、チップ設計と大規模なMachine learningフレームワークの連携を支援した。彼女はまた、非営利団体「AI for Glass」を共同設立し、小規模組織向けのオープンソースモデルツールを推進した。
Google DeepMindでは、2021年に客員研究員を務め、Jack ClarkやDavid Luanと共同で、Model Pruningがトランスフォーマー性能に与える影響を分析する論文を執筆した。
評価と私生活
Zhangは、2022年のAIジャーナル若手研究者賞と、2023年のInflection AIイノベーションフェローシップを受賞した。彼女はサンフランシスコに在住し、熱心なトレイルランナーでありボランティアでもある。彼女は第二世代の中国系移民の娘であり、アメリカ国籍を有している。
影響と継続的な活動
ZhangのGPT-3およびその後のAnthropicモデルに関する研究は、深層学習アプリケーションの最前線を定義するのに貢献した。彼女の技術的な幅広さには、Loss Functions、Learning Rate Schedules、高度なData Augmentation手法に関する専門知識が含まれる。2024年現在、彼女は独立した研究者およびコンサルタントとして活動し、効率的なAIシステムに関する研究を発表し続けている。