Amy Zhangは、人工知能の研究者であり、人間中心のAI、強化学習、解釈可能性に焦点を当てています。彼女はワシントン大学の助教授であり、Meta AI(旧Facebook AI Research)の研究科学者でもあります。彼女の研究は、AIシステムをより透明で、対話的で、人間の価値観に沿ったものにすることを目指しており、しばしば機械学習と認知科学や人間とコンピュータの相互作用からの洞察を組み合わせています。
Zhangは、カリフォルニア大学バークレー校でコンピュータサイエンスの博士号を取得し、Pieter Abbeelの指導を受けました。彼女の博士研究では、人間のフィードバックから学習する方法と、強化学習をよりサンプル効率的にする方法を開発しました。また、Google Brainとモントリオール学習アルゴリズム研究所(MILA)で客員研究者として過ごしました。博士号取得前には、ウォータールー大学でコンピュータサイエンスの学士号を取得しています。
強化学習と人間のフィードバック
Zhangの初期の研究は強化学習に焦点を当てており、特にエージェントがスパースな報酬やデモンストレーションから学習する方法に注目しました。彼女は、模倣学習と報酬形成を組み合わせたアルゴリズムの開発に貢献し、少数の人間の例から複雑な行動を学習できるようにしました。注目すべきプロジェクトの1つである「Learning by Playing」では、教師なし探索を使用して下流タスクに再利用可能なスキルを学習することで、スパース報酬タスクを解決する方法を導入しました。
彼女の研究の中心的なテーマは、AIトレーニングを導くための人間のフィードバックの使用です。彼女は、明示的な報酬ではなく軌跡のペア比較からモデルが学習する、選好ベースの強化学習の技術に取り組んできました。このアプローチは、ロボット工学や対話システムなど、報酬関数の設計が難しい領域で特に有用です。この分野での彼女の研究は広く引用され、現代の大規模言語モデルのトレーニングにおける重要な要素であるRLHFに関するその後の研究に影響を与えました。
解釈可能性と透明性
Zhangはまた、機械学習における解釈可能性への重要な貢献も行っています。彼女は、ニューラルネットワークが学習した内容を視覚化して理解する方法を開発し、特に強化学習エージェントの文脈で活用しました。彼女の「saliency maps」と「concept activation vectors」に関する研究は、研究者がモデルの決定に最も影響を与える入力の特徴を特定するのに役立ちます。この研究ラインは、医療や自動運転などの高リスクなアプリケーションでAIシステムへの信頼を構築するために重要です。
広く引用された論文で、Zhangと同僚は「TCAV」(Testing with Concept Activation Vectors)を導入しました。これは、「縞模様」や「斑点」などの概念がモデルの予測にどれだけ貢献するかを定量化する技術です。この方法により、ユーザーは単純な特徴帰属を超えて、人間が理解できる用語でモデルの推論を調べることができます。この研究は、Google DeepMindやOpenAIの業界チームによってモデル監査に採用されています。
人間中心のAI
Zhangの研究アジェンダは明確に人間中心です。彼女は、人々と自然に対話し、フィードバックから学習できるAIシステムを設計しています。彼女は、ユーザーが自然言語で間違いを修正したり、望ましい行動を示したりすることで、AIアシスタントをより役立つものにする方法を探求してきました。これには、モデルがユーザー入力に基づいて時間とともに改善する対話学習や、AIの目的を人間の好みに合わせる作業が含まれます。
彼女のプロジェクトの1つである「Reward Learning from Human Preferences」は、非専門家のユーザーからのフィードバックを受け取ることでロボットがタスクを学習できることを実証しました。ユーザー研究では、参加者が単純なはい/いいえのフィードバックを提供することで、シミュレートされたロボットにナビゲーションとオブジェクト操作を教えました。結果は、ロボットが最小限の人間の労力で効果的に学習できることを示し、カスタマイズ可能なAIへの実用的な道筋を示唆しています。
学術的なキャリアと教育
Zhangは2021年にワシントン大学のPaul G. Allen School of Computer Science & Engineeringで助教授として着任しました。彼女は人間中心のAIラボを率いており、大学院生やポスドクを指導しています。彼女の教育には、強化学習や、機械学習における公平性、説明責任、透明性に関するコースが含まれます。彼女は、2023年のUW College of Engineering Outstanding Teaching Awardを含む、いくつかの教育賞を受賞しています。
MIT CSAILやStanford AI Labでは、彼女は研究に関する招待講演を行っています。また、UW Center for an Informed Publicの関連教員でもあり、誤情報やアルゴリズムバイアスを含むAIの社会的影響を研究しています。
業界での経験
学術的な任命の前に、Zhangは2020年から2021年までMeta AIで研究科学者として働きました。Metaでは、彼女は強化学習の専門知識を応用してレコメンデーションシステムを改善し、有害なコンテンツを検出するツールを開発しました。また、Anthropicのチームと安全性研究で協力し、スケーラブルな監視に関する初期の研究に貢献しました。
Zhangはまた、Google BrainやBerkeley AI Research(BAIR)で研究インターンとしても活動しました。これらの経験は、AI研究が製品や政策にどのように変換されるかについての幅広い視点を彼女に与えました。
受賞と認知
Zhangはその研究に対していくつかの栄誉を受けています。2022年には、AI2050イニシアチブによってAIの新星に選ばれました。2023年には、「Interactive and Interpretable Reinforcement Learning」プロジェクトでNSF CAREER Awardを受賞しました。彼女の論文は、国際機械学習会議(ICML)や神経情報処理システム会議(NeurIPS)などの主要会議で最優秀論文賞を受賞しています。また、2024年にはコンピュータサイエンスのスローン研究フェローシップも受賞しています。
主な出版物
Zhangは、トップクラスの会議で40以上の論文を発表しています。彼女の最も引用された作品のいくつかは以下の通りです:
- 「TCAV: Relative Concept Importance Testing」(ICML 2018)- 概念ベースの解釈可能性の方法を導入。
- 「Learning by Playing: Solving Sparse Reward Tasks from Scratch」(ICML 2018)- 探索のための自己対戦のカリキュラムを提案。
- 「Reward Learning from Human Preferences」(NeurIPS 2019)- 実用的な選好ベースのRLを実証。
- 「Interactive Learning from Policy-Dependent Human Feedback」(ICML 2020)- エージェントが改善するにつれてフィードバックがどのように変化するかを研究。
彼女の研究は、国立科学財団、海軍研究局、および民間財団からの助成金によって支援されています。
今後の方向性
Zhangの現在の研究は、大規模言語モデルをより解釈可能で制御可能にすることに焦点を当てています。彼女は、モデルから正直な不確実性を引き出す方法や、再トレーニングなしでユーザーがモデルの動作を操縦できるようにする方法を調査しています。また、複数のAIシステムが相互作用するマルチエージェント強化学習にも関心があり、そのようなシステムが安全で人間の目標に沿ったものであることを保証することに取り組んでいます。
2025年現在、Zhangはワシントン大学で教育と研究を続けています。彼女の貢献は、技術的な機械学習と人間のニーズの間のギャップを埋める、人間中心のAIという新興分野の形成に役立っています。