生物学的基盤
血漿は、全身のアポトーシスおよびネクローシス細胞から放出された核酸の混合物を含む。がん患者では、このcfDNAの一部は腫瘍細胞に由来し、体細胞変異、コピー数異常、および異常なメチル化パターンを有する。ctDNAの濃度は、腫瘍量、血管分布、および代謝回転率によって異なる。さらに、腫瘍は、がん胎児性抗原(CEA)やがん抗原125(CA-125)などの特定のタンパク質および糖タンパク質を分泌するが、これらは血清バイオマーカーとして長年使用されてきたものの、感度と特異度は限られている。
最近の研究は、cfDNA断片のサイズと末端モチーフの分析であるフラグメントミクスに焦点を当てている。腫瘍由来の断片は、正常なcfDNAと比較して短く、異なる末端配列を示す傾向がある。機械学習モデルは、これらの微妙なパターンを利用して、がんサンプルと非がんサンプルを識別できる。CpG島を標的とするものなどのメチル化ベースのアプローチは、がんゲノムがプロモーター領域で広範な低メチル化と焦点性の高メチル化を示すことが多いため、もう一つの情報層を提供する。
機械学習アプローチ
血漿データからがん可能性を推定するには、通常、教師あり学習が用いられる。モデルは、既知のがん症例と健常対照のコホートで訓練され、入力特徴はシーケンシングまたはプロテオミクスアッセイから導出される。一般的なアルゴリズムには、ロジスティック回帰、ランダムフォレスト、勾配ブースティングなどがあるが、深層学習法が注目を集めている。ニューラルネットワーク、特に残差ネットワークや、画像状メチル化マップ用のU-Net変種は、複雑な非線形関係を捉えることができる。
特徴量エンジニアリングは重要である。生のシーケンシングデータは、変異アレル頻度、メチル化ベータ値、断片サイズ分布、コピー数プロファイルなどの特徴量に変換される。主成分分析などの次元削減手法は、訓練前にしばしば適用される。モデルは0から1の間の確率スコアを出力し、感度と特異度のバランスを取るために閾値が選択される。較正は、スコアが真の可能性を反映することを保証するために不可欠であり、しばしば等張回帰またはプラットスケーリングによって達成される。
訓練には、大規模で適切に注釈が付けられたデータセットが必要である。The Cancer Genome Atlas(TCGA)などの公開リソースはゲノムおよび臨床データを提供するが、血漿ベースのデータセットはより希少である。GRAIL(現在はIlluminaの一部)を含むいくつかの企業が、臨床試験から独自のデータセットを生成している。この分野でのAIの使用は、解釈可能性に関する疑問を提起しており、SHAP値などの説明可能なAI手法を用いて、どの特徴が可能性スコアを駆動するかを特定する研究につながっている。
臨床応用
主な応用はがんの早期発見である。MCEDテストは、治療がより効果的な段階でがんを特定することを目的としている。例えば、GRAILが開発したGalleriテストは、標的メチル化分析と機械学習分類器を使用して、50種類以上のがんを検出する。PATHFINDER試験では、このテストは99.5%の特異度と43.1%の陽性適中率を示し、陽性結果のうち43.1%ががんであると確認された。このテストはまた、組織由来の予測も高精度で行い、その後の診断的ワークアップを導いた。
スクリーニングに加えて、血漿中のがん可能性は、最小残存病変(MRD)モニタリングに使用される。治癒目的の手術後、連続した血漿サンプルがctDNAについて分析され、上昇する可能性スコアは再発を示す。このアプローチは、再発を画像診断より数ヶ月早く検出することが示されている。転移環境では、スコアは治療反応を反映し、ctDNAレベルの低下は腫瘍縮小と相関する。
この概念はまた、遺伝性がん症候群を有する無症状の個人におけるリスク層別化にも情報を提供する。BRCA1またはBRCA2変異の保因者にとって、血漿ベースのテストは既存のサーベイランスプロトコルを補完する可能性があるが、臨床的有用性の証拠はまだ出始めている。
課題と限界
いくつかの課題が広範な採用を妨げている。早期がん、特にctDNAレベルがしばしば検出限界を下回るステージIの疾患に対する感度は、依然として最適ではない。不確定な潜在能のクローン性造血(CHIP)は、血液細胞の変異が腫瘍由来シグナルと誤認されるため、偽陽性を生じる可能性がある。これを軽減するために、アッセイはしばしば白血球を並行してシーケンシングし、バックグラウンド変異を差し引く。
コストは大きな障壁である。cfDNAの全ゲノムシーケンシングは高価であり、分析に必要な計算インフラは substantial である。償還方針は進化しているが、多くのテストはまだ保険でカバーされていない。規制承認は管轄区域によって異なり、米国ではFDAが一部のMCEDテストに画期的デバイス指定を付与しているが、完全な承認には死亡率の利益を示す前向き臨床試験が必要である。
解釈可能性とバイアスも懸念事項である。主にヨーロッパ系祖先の集団で訓練されたモデルは、他の集団では性能が低い可能性があり、格差につながる。訓練コホートを多様化し、民族を超えてテストを検証するための取り組みが進行中である。
将来の方向性
研究は、血漿ベースの可能性スコアと、AI分析画像や電子健康記録などの他のデータモダリティとの統合を探求している。マルチモーダルモデルは、精度を向上させ、より個別化されたリスク評価を提供する可能性がある。大規模言語モデルを使用して臨床ノートを解析し、関連する特徴を抽出することは、新興分野である。
ナノポアプラットフォームなどのシーケンシング技術の進歩は、コストとターンアラウンドタイムを削減する可能性がある。AWS Trainiumや他の専門ハードウェアは、臨床環境でのモデル推論を加速する可能性がある。さらに、標準化された参照物質とベンチマーキングフレームワークの開発は、異なるテストの比較を容易にする。
血漿ベースの可能性スコアががん死亡率を減らす上での臨床的有用性を確立するためには、縦断研究が必要である。英国のNHS-Galleri試験は、14万人の参加者を登録し、決定的な証拠を提供すると期待されている。成功すれば、血漿中のがん可能性は予防医療の日常的な構成要素になる可能性がある。