ポール・クリスティアーノ

英語からの翻訳

ポール・クリスティアーノは、アメリカのAI安全性研究者であり、後に人間のフィードバックからの強化学習となる技術を共同開発し、その後、アライメント研究センターを設立した。

ポール・クリスティアーノは、RLHFとなる技術の共同開発で知られ、非営利のアライメント研究組織であるAlignment Research Centerを設立した、AIアライメント分野のアメリカ人研究者である。

初期の経歴とRLHF

クリスティアーノはOpenAIの初期に研究者として勤務し、2017年には「Deep Reinforcement Learning from Human Preferences」という論文の共著者となった。この論文は、モデルの出力に対する人間の比較から報酬モデルを訓練し、その報酬モデルに対して方策を最適化するという中核的手法を導入した。このアプローチは、後に言語モデルへと拡張・適用されRLHFとして知られるようになり、チャット指向モデルを人間の意図に合わせる主要な技術となった。最も顕著な例は、ChatGPTとその指示追従型の前身であるInstructGPTの訓練における活用である。

Alignment Research Center

2021年、クリスティアーノはOpenAIを離れ、AIAI alignmentの理論的研究に焦点を当てた非営利団体であるAlignment Research Center(ARC)を設立した。これには、モデルから「潜在知識を引き出す」研究や、モデルがその出力に現れない能力や意図を持つかどうかを評価する方法の研究が含まれる。ARCはまた、フロンティアモデルの初期の正式な導入前能力評価を構築・実施したことでも知られ、GPT-4などのリリースに先立ち、OpenAIやAnthropicなどの研究所と連携して実施された危険能力テストもその一環である。

米国AI安全研究所

2024年、クリスティアーノは米国AI安全研究所(米国国立標準技術研究所内に設置)の安全性重視の評価業務を率いる役職に任命された。この役職は、2023年11月にブレッチリー・パークで始まった国際AI安全サミットのプロセスに先立ち、フロンティアモデルを評価する政府機関の中に、技術的アライメント研究と密接に関連する研究者を置くものであった。この任命は、独立性と政府の評価能力をめぐる疑問から、AI安全コミュニティのさまざまな部分で支持と批判の両方を集めた。

影響

クリスティアーノは、AI safety分野において、長期的なAIリスクに関する抽象的な懸念を具体的で実証可能な研究プログラムに変換した研究者の一人として広く認識されており、Nick Bostromのような人物に関連するより哲学的な研究と、2022年以降にリリースされたほぼすべての主要なチャット指向モデルで使用される応用訓練技術との橋渡しを行った。

カテゴリ:ai-safety·alignment·industry
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴