Equalized odds(等化オッズ)は、機械学習の分類システムにおける公平性を評価・強制するための基準である。形式的には、予測子 \(\hat{Y}\) が、保護属性 \(A\)(人種、性別、年齢など)と正解ラベル \(Y\) に関して、すべてのグループ \(a, b\) とすべての結果 \(y \in \{0,1\}\) について \(P(\hat{Y} = 1 | A = a, Y = y) = P(\hat{Y} = 1 | A = b, Y = y)\) を満たすとき、等化オッズを満たすとされる。平易に言えば、分類器は実際の結果に条件付けられた上で、すべての保護グループにわたって同じ真陽性率(再現率)と偽陽性率を持たなければならない。この概念は、2016年のMoritz Hardt、Eric Price、Nathan Srebroによる論文で導入され、ラベル分布を無視する単純なデモグラフィック・パリティ(人口統計学的均等性)の概念に対する代替案として提案された。
等化オッズは、真のラベルに条件付けずにグループ間の予測率の均等のみを要求するデモグラフィック・パリティとしばしば対比される。\(Y\) に条件付けることで、等化オッズは誤差が均等に分布すべきという考えを捉えることを目指す。すなわち、どのグループの有資格者も同じ確率で陽性に分類されるべきであり、無資格者も同じ確率で誤って受け入れられるべきである。これにより、等化オッズは、雇用、融資、刑事司法、医療などの高いリスクを伴う領域で特に重要となる。これらの領域では、誤差率の格差が体系的な偏見を永続させる可能性がある。
形式的定義と構成要素
等化オッズの条件は、等機会(equal opportunity)と等化偽陽性率という2つの別々の等式制約に分解できる。同じ研究で導入された等機会基準は、グループ間で真陽性率が等しいこと、すなわち \(P(\hat{Y} = 1 | A = a, Y = 1) = P(\hat{Y} = 1 | A = b, Y = 1)\) を要求する。これにより、陽性に分類されるべき個人のうち、すべてのグループが同じ割合で正しい予測を受けることが保証される。2番目の構成要素である等化偽陽性率は、\(P(\hat{Y} = 1 | A = a, Y = 0) = P(\hat{Y} = 1 | A = b, Y = 0)\) を要求し、どのグループに対しても陰性の結果が過剰に予測されないことを保証する。
両方の条件が同時に成立するとき、分類器は等化オッズを満たすとされる。実際には、グループ間で基本率が異なる場合、両方の等式制約を達成することは不可能であり、2つの構成要素の間にトレードオフが生じる。一部の応用では、特に偽陰性よりも偽陽性の影響が小さい場合に、等機会のみに要件を緩和することがある。
機械学習システムにおける実装
等化オッズの強制には、多くの場合、後処理または処理中(in-processing)の手法が必要となる。一般的な後処理アプローチは、公平性制約なしで分類器を訓練し、その後、提案されたスコアに基づいて各グループごとに決定閾値を個別に調整するものである。Hardt、Price、Srebroは、真のラベルとグループ所属にアクセスできる場合、全体の損失を最小化しながら等化オッズを満たすように閾値を最適に調整できることを示した。ただし、この方法はラベル付きデータを必要とし、完全に制約のない設定には拡張できない場合がある。
処理中手法は、訓練中に公平性制約を損失関数に直接組み込む。例えば、グループ間の誤差率の差を測定するペナルティ項を追加したり、分類器の出力からグループ所属を予測しようとする識別器を用いた敵対的訓練を使用したりする。これらのアプローチは、勾配ベースの最適化が微分可能な公平性ペナルティに対応できる現代のDeep learningパイプラインでよく使用される。そこでは、Adam (Optimizer)やStochastic Gradient Descent Variantsが用いられる。
最近の研究では、等化オッズをより複雑なモデル、例えばNeural networkアーキテクチャやGenerative AIシステムに拡張している。しかし、多クラスや回帰設定で等化オッズを測定することは依然として困難であり、バイナリ定義は直接一般化されない。研究者は多変量拡張やグループ条件付きキャリブレーション指標を提案しているが、単一の標準は支配的ではない。
他の公平性概念との関係
等化オッズは、統計的公平性基準のより広いファミリーの中に位置づけられる。デモグラフィック・パリティ(統計的パリティとも呼ばれる)は、\(P(\hat{Y} = 1 | A = a) = P(\hat{Y} = 1 | A = b)\) を要求し、全体的な予測率を制約するという点でより強いが、誤差率が異なっていても満たされ得る。一方、キャリブレーションは、任意の予測確率 \(p\) について、真の結果確率がすべてのグループで \(p\) であることを要求し、等化オッズとは関連するが含意しない。
Jon Kleinberg、Sendhil Mullainathan、Manish Raghavan(2016)による画期的な不可能性結果は、基本率が異なる場合、分類器が完全でない限り、キャリブレーション、等化オッズ、デモグラフィック・パリティを同時に満たすことはできないことを示した。このトレードオフは、特定の応用にどの公平性指標が最も適切かについての議論を促している。等化オッズは、誤差のコストが非対称な設定、例えば状態を見逃すこと(偽陰性)が偽陽性よりも有害な医療診断などで好まれることが多い。
批判と限界
等化オッズに対する批判の1つは、正解ラベル \(Y\) が偏りがないことを前提としている点である。歴史的なラベル自体が差別によって汚染されている場合、等化オッズは既存の格差を是正するのではなく永続させる可能性がある。例えば、逮捕記録が特定のコミュニティを過小評価している場合、これらのラベルで等化オッズを用いて訓練された分類器は、依然としてそれらのグループに不利益をもたらす可能性がある。この問題は、慎重なデータ収集とラベル監査の重要性を浮き彫りにする。
もう1つの限界は、等化オッズが個人レベルの誤差の結果を考慮せず、グループレベルの率のみを考慮することである。2つのグループが同一の真陽性率と偽陽性率を持っていても、リソース配分や社会的文脈の違いにより、それらの誤差の下流への影響は大きく異なる可能性がある。さらに、バイナリ結果設定は、閾値が固定されていないランキングやスコアリングの文脈を捉えていない。
応用と現在の研究
等化オッズは、信用スコアリング、再犯予測(COMPASなどのツール)、アルゴリズム採用などの分野で応用されている。Google DeepMindやUniversity of Oxfordのグループを含む企業や研究機関は、実世界のシステムに公平性制約を組み込むことを探求している。例えば、公平な分類モデルは、人種グループ間で偽陰性率の差が観察された患者再入院予測のために医療でテストされている。
現代の研究は、ノイズの多いラベル、欠落したグループ情報、連続的な保護属性に対応するために、厳格な等化オッズ要件を緩和することに焦点を当てている。Large language model出力における公平性も新たに登場しているが、テキスト生成の等化オッズを測定することは簡単ではない。2020年代半ばの時点で、普遍的な公平性指標に関するコンセンサスは存在しないが、等化オッズはアルゴリズム的公平性の文献における基礎的な概念であり、Stanford AI LabやMIT CSAILなどの機関のコースで教えられている。
関連項目
- デモグラフィック・パリティ(提供されたスラッグにないため省略)
- アルゴリズム的公平性(提供されたスラッグにないため省略)
(注:関連項目セクションは、関連するスラッグがないため省略。)
参考文献
- Hardt, M., Price, E., Srebro, N. (2016). Equality of Opportunity in Supervised Learning.
- Kleinberg, J., Mullainathan, S., Raghavan, M. (2016). Inherent Trade-Offs in the Fair Determination of Risk Scores.