ヒューマン・イン・ザ・ループ(HITL)は、人工知能における設計パラダイムであり、人間のオペレーターが機械学習モデルのトレーニング、評価、または運用に参加する。このアプローチは、自動化システムが曖昧さを完全に解決できない場合、エラーが高コストな場合、または出力が人間の価値観や規制に準拠しなければならない場合に使用される。
HITLワークフローは典型的にはフィードバックサイクルを含む。モデルが予測を生成し、人間がそれをレビューまたは修正し、修正がモデルの次のトレーニング反復に組み込まれる。このサイクルはデータラベリングから最終的な意思決定まで様々な段階に適用でき、多くの現代の大規模言語モデルパイプラインの主要な構成要素となっている。
方法とワークフロー
一般的な方法の1つはアクティブラーニングで、モデルがパフォーマンスを最も向上させる可能性のある例を特定し、それらの例のラベルを人間のアノテーターに要求する。これにより、ランダムサンプリングと比較して必要なラベル数が削減される。インタラクティブ機械学習はこれを拡張し、ユーザーがリアルタイムで出力を修正できるようにし、修正は追加のトレーニングデータとなる。生成モデルについては、オープンAIとアンソロピックが人間のフィードバックからの強化学習(RLHF)を使用してモデル行動をユーザー意図に整合させている。RLHFでは、人間の評価者がモデル応答を比較しランク付けし、これらのランキングが報酬モデルを訓練し、その報酬モデルが強化学習を介して微調整を導く。関連する技術であるReinforcement Learning from AI Feedback (RLAIF)は、AIシステムがフィードバックを生成するために使用され、人間の監視の必要性を減らすが完全には排除しないが。
HITLは深層学習とニューラルネットワークのトレーニングとも交差する。例えば、Transformer (architecture)モデルは初期の教師ありデザインの前段階の後に人間の嗜好で微調整されることが多い。一部のシステムはHITLをカリキュラム学習と組み合わせ、タスクを易から難に順序立て、人間のフィードバックは最も難しい例に集中させる。
適用分野
自動運転では、WaymoとTeslaが、車両の認識システムが確信を持って解決できないエッジケースを処理するためにリモートオペレーターとセーフティドライバーを採用している。これらの人間の介入は記録され、以降のモデルバージョーの改善に使用される。ヘルスケアでは、Intuitive Surgicalのda Vinciシステムが外科医にロボット器具の制御を可能にし、AI支援診断ツールは医師が肺がん関連の所見を確認または上書きすることを多々に求められる。コンテンツモデレーションがプラットフォームは、警告を審査するためにHITLを使用し、特にヘイト表現や誤情報などの微妙な問題でガスを挙げる。
クラウドプロバイダーは管理されたHITLサービスを提供する:Amazon Web Services Amazon SageMaker Ground Truth とGoogle CloudのAIプラットフォームのデータラベル付けにより、顧客は人間のアノテーターでカスタムデータセットを構築できます、Microsoft Azureは同様のラベル付けサービスを提供する。これらのサービスはクラウドソーシングプラットフォームと統合されており、生成AIアプリケーションのモデルの訓練に使用できる。
歴史と研究結果
人間が自動システムを監督するという概念は、20世紀半ばの制御理論と人間要因工学に遡ります。1960年代に、ゼロックスの研究者たちはインタラクティブコンピューティングを探求し、後のmixingの研究は、人間が例と修正を通じて機械学習を導く方法を調査した。2000年代にはAmazonのAmazonはのMechanical Turkなどのクラウドソーシングプラットフォームが登場し、大規模な人間によるアノテーションを経済的実行可能性を高めるた。インタラクティブ機械学習に関する学術研究は、複数の機関の革新的な研究で2000年代に拡大した。
課題と限界
HITLは多大なコストと遅延をもたらす。人間のアノテーションは高く、レビューに必要な時間はリアルタイムで機能のアプリケーションを遅延させる可能性がある。アノテーターのメモリは分析は一般的であり、人間の判断のバイアスがモデルに組み込まれることがある。Aleksander Madryらの研究により、人間のフィードバックは特にタスクが主観的または判断者客が対抗的な入力を受け取る影響を受けた場合に不正確になることが示されている。これらの問題に対処するため、実践者はデータ再増価を使用してサンプル例を作ることで、モデルのプルーニングを使用してモデルを簡素化し、人間のレビューを必要とする決定の数を減らす。ハイステークス領域では、規制の枠組みが自動化された決定のための人間の介入を求めることが増えているが、実際の実用は依然として未解決の課題が残っている。
将来の展望
AIシステムがより賢くなるにつれて、人間の役割は、例のラベリングから、高レベルのアライメントと監査へシフトしている。 Googleディープマインドは大規模な監視を研究し、小規模なモデルが大規模なモデルの評価を支援している。OpenAIとアンソロピックは人間のフィードバックのモデル開発における入方法を提言した。HITLとTransformerアーキテクチャおよびニューラルネットワークトレーニングの統合は、人間の労力を削減しながら信頼性維持と公正性を保ちつつ正確性を重視した研究領域である。