日本語版
最新ニュース
世界

高次元オミクスデータを用いた癌生存予測のための新しい非ネガティブベイジアンスタッキングモデリング手法 | BMC 医学研究方法論

経路ベースの生存スタッキング戦略n 人の被験者の右打ち切り生存データが三つ組 {(yi, δi, xi)} で構成されていると仮定します (i = 1, 2, …, n)。 観察された生存時間 yi = min(ti, ci) を示します。ここで、ti と ci はそれぞれイベント時間と打ち切り時間です。 δi = I(tiy| バツ)。 この研究では、ゲノミクスデータを使用してがん患者の生存を予測することを目的としています。提案するサバイバルスタッキング手法は、複数のベース学習器(サブモデル)とスーパー学習器(メタモデル)からなる2層の学習構造です。 図を参照してください。 1 フレームワークフローについては。図1提案された生存スタッキング モデルのアルゴリズム フロー プロット。 CV: 相互検証済みまず、ゲノミクス データを各経路の遺伝子を含む J サブデータに変換します。 次に、最初の層で、サブモデルがサブデータごとに独立してトレーニングされます。…

高次元オミクスデータを用いた癌生存予測のための新しい非ネガティブベイジアンスタッキングモデリング手法 |  BMC 医学研究方法論

1714716969
2024-05-03 05:51:09

経路ベースの生存スタッキング戦略

n 人の被験者の右打ち切り生存データが三つ組 {(yi, δi, xi)} で構成されていると仮定します (i = 1, 2, …, n)。 観察された生存時間 yi = min(ti, ci) を示します。ここで、ti と ci はそれぞれイベント時間と打ち切り時間です。 δi = I(ti< ci) indicates the occurrence of events. The goal is to estimate the survival function of the event-time random variable Y that depends on p covariates x, i.e. S(y| x) = P(Y >y| バツ)。 この研究では、ゲノミクスデータを使用してがん患者の生存を予測することを目的としています。

提案するサバイバルスタッキング手法は、複数のベース学習器(サブモデル)とスーパー学習器(メタモデル)からなる2層の学習構造です。 図を参照してください。 1 フレームワークフローについては。

図1

提案された生存スタッキング モデルのアルゴリズム フロー プロット。 CV: 相互検証済み

まず、ゲノミクス データを各経路の遺伝子を含む J サブデータに変換します。 次に、最初の層で、サブモデルがサブデータごとに独立してトレーニングされます。 結果として得られるサブモデルは、経路の予測能力を表します。 過学習を軽減するために、サブモデルに基づいて相互検証された生存予測を計算します。 具体的には、各経路で、元のデータのサンプルが、(大まかに)等しいサイズの K 個のサブセット(分割)にランダムに分割されます。 k 番目のフォールドは検証データ V(k) として使用され、残りのフォールドはトレーニング データ T(−k)、k = 1、2、…、K として使用されます。トレーニング データでは、ペナルティ Cox モデルは次のようになります。サブモデルの適合に使用され、ベースライン ハザード h0−k(y−k) はブレスロウ法で推定できます。 次に、検証データ内の線形予測子 (lpk) が、近似されたサブモデルによって推定されます。 V(k) の推定生存確率 ({hat{S}}^kleft({y}^k|boldsymbol{x}right)) は、lpk と h0−k(y) を使用して計算できます。 −k)、つまり

$${hat{S}}^kleft({y}^k|boldsymbol{x}right)={e}^{-{H}^{-k}left({y}^ {-k}right)}$$

(1)

ここで ({H}^{-k}left({y}^{-k}right)={H}_0^{-k}left({y}^{-k}right) {e}^{lp^k}) の倍、({H}_0^{-k}left({y}^{-k}right)) は累積ベースライン ハザード、つまり h0 の積分です。 −k(y−k)。 このプロセスはすべての K フォールドに対して繰り返され、すべてのケースの CV 予測生存確率が得られます。 J のサブモデルの場合、J 個の予測 ({{hat{S}}_j}^{CV}left(y|boldsymbol{x}right)=sum_{k=1}^K を取得できます。 {{hat{S}}_j}^kleft({y}^k|boldsymbol{x}right),kern0.5em j=1,2,dots, J)。 2 番目の層は、スーパー学習器を使用して、一連の時点にわたる J サブモデルの CV 生存予測を適合させます。 結果として得られる係数は、J 個のサブモデルの推定重み ({hat{w}}_j) です。 予測生存関数 (hat{S}left(y|boldsymbol{x}right)) は、J 個のサブモデル ({hat{S}}_jleft) の予測を組み合わせることで推定できます。 (y|boldsymbol{x}right)) (元のデータに再適合) 重み ({hat{w}}_j) を使用します。

重みを推定する方法 ({hat{w}}_j)

線形結合アプローチ

通常、予測生存関数 (hat{S}left(y|boldsymbol{x}right)) は、次のように与えられる J 個の候補サブモデルの予測の線形結合です。

$$hat{S}left(y|boldsymbol{x}right)=sum_{j=1}^J{hat{w}}_j{hat{S}}_jleft(y |boldsymbol{x}right)$$

(2)

IBS 損失を最小限に抑えることで重み (hat{w}) を最適化します。 AUC ベースの損失などの他の損失関数は、有利な代替手段となるはずです。 [22]。 IBS は、一連の時点 y1、…、ys にわたる確率と観察されたイベントの間の二乗距離を測定します。 [23]、次のように書くことができます。

$$textrm{IBS}=sum_{r=1}^ssum_{iin Rleft({y}_rright)}{left{{Z}_ileft({y} _rright)-sum_{j=1}^J{hat{w}}_j{{hat{S}}_j}^{(CV)}left({y}_r|{boldsymbol{ x}}_iright)right}}^2$$

(3)

ここで、R(yr) は、yr の時点でまだリスクがある患者を表します、Zi(yr) = I(yi > yr)。 IBS を最小化することで (hat{w}) を推定できます。 一般に、推定された重み ({hat{w}}_j) は、分散が低くなり予測が向上するために非負に制約されます。 この制約は、R 関数 solnp で実装できる拡張ラグランジュ法に基づく非線形最適化アルゴリズムを使用することで実現できます。 [24]。 時間セット y1、…、ys の選択に関しては、Andrew Wey が提唱したように、観測されたイベント分布の 9 つの等間隔の分位数を使用します。 [19]。

ベイジアン組み合わせアプローチ

IBS ソリューションに加えて、サブモデルの生存予測を共変量として扱い、時間依存ステータス Zi(yr) (各時点での死亡は 0、生存は 1) をバイナリ結果として扱うとします。 、予測生存率は次のように表すことができます。

$$E左[hat{S}left(y|boldsymbol{x}right)right]={h}^{-1}左[{w}_0+sum_{j=1}^J{hat{w}}_j{hat{S}}_jleft(y|boldsymbol{x}right)right]$$

(4)

これは一般化線形モデル (GLM) です。 h は、期待される予測生存確率が 0 ~ 1 になるようにするためのシグモイド関数などのリンク関数です。

非負のなげなわ (nLasso)

式の進歩 (4)上記の GLM に l1 ペナルティ項を追加できることにより、solnp では非現実的な多数のサブモデル(高次元シナリオでの)の処理など、サバイバル スタッキングの使用法を拡張できることです。

Lasso が係数に先立った DE を備えたベイジアン階層モデルと同等であることはよく知られています。 [25]、この研究では非負として認定された係数を使用して、

$${w}_jmid ssim DEleft({w}_j|0,sright)=frac{1}{2s}mathit{exp}left(-frac{w_j} {s}right),kern0.5em {w}_jge 0$$

(5)

ここで、スケール s は収縮の程度を制御します。 スケールが小さくなると収縮が強くなり、wj の推定値がゼロに近づきます。 nLasso で当てはめた重みは次のように与えられます。

$$hat{boldsymbol{w}}=mathit{arg}underset{boldsymbol{w},{w}_jge 0}{max}left{mathit{log} left(lleft(boldsymbol{w}right)right)-sum_{j=1}^Jfrac{{hat{w}}_j}{s}right}$$

(6)

上記の重みは、R の glmnet パッケージを使用する巡回座標降下アルゴリズムによって推定できます。w が負でないという制限は、glmnet パッケージを使用すると便利に実行できます。

非ネガティブスパイクアンドスラブなげなわ (nsslasso)

以前の非負のスパイクとスラブの混合 DE の前に、非負の DE をさらに拡張しました(補足図)。 1)、

$${w}_jmid {s}_jsim DEleft({w}_j|0,{s}_jright)=frac{1}{2{s}_j}mathit{exp }left(-frac{w_j}{s_j}right),kern0.5em {w}_jge 0$$

(7)

ここで、sj = (1 − γj)s0 + γjs1 は合計スケール パラメーターと呼ばれます。 γj は二項分布に従う指標 (γj ∈ {0, 1}) です。 s0 と s1 (s1 > s0 > 0) は、それぞれスパイクとスラブの分布のスケール パラメーターです。 s1 は、強い効果の経路に弱い圧縮を適用し、通常はより大きな値 (s1 = 1 など) に固定されます。 一方、s0 は、弱い効果の経路に強力な圧縮を与え (またはゼロに圧縮することさえ)、相互検証によって事前定義された候補値のセットから選択された柔軟な小さい値です。 通常、スパイクとスラブの投げ縄は投げ縄よりも適応力が高くなります。 [26]。 重みは EM 座標降下アルゴリズムによって推定できます。 [26] R の glmnet パッケージと BhGLM パッケージを使用します。重みが負でないように制限することは、glmnet パッケージでも実行できます。

人工ニューラルネットワーク

ANN が分類器として機能し、入力データに制限された (負ではない) 重みを与えることができることを考慮すると、ANN をスーパー学習器として使用できます。 ANN は、バックプロパゲーション アルゴリズムと勾配降下アルゴリズムを使用して、重みを反復的に推定します。

モデルの性能評価

原則として、生存スタッキング モデルは、特定の時間における二項分類問題です。 [21]。 ここでは、Robert Tibshirani 氏が推奨する、時間依存性の AUC と時間依存性のブリエ スコア (BS) を採用しました。これは、任意の時点のリスク セット内のオブジェクトの AUC と BS を計算します。 [21]。 時間依存の AUC は、特定の時点での異なる結果を区別するモデルの能力を調べるために使用されます。 時間依存 BS は、特定の時点でのキャリブレーション パフォーマンスを測定するために使用されます: (textrm{BS}(y)=frac{1}{n}sum_{i=1}^n{left( {Z}_i(y)-hat{S}left(y|boldsymbol{x}right)right)}^2)。 3 つの評価時点、つまりテスト データの合計観察時間の 25、50、および 75% 分位点を選択しました。

競合統計手法

私たちが提案した生存スタッキング モデルでは、Lasso Cox を使用して経路ベースのサブモデルを構築しました。 サブモデルを結合するには、solnp (R 関数 solnp で実装)、nLasso/nsslasso (glmnet および BhGLM パッケージで実装)、および ANN (Python (3.7) の TensorFlow ライブラリ (2.3.0) を使用して実装) を使用しました。 kernel_constraint = non_neg()) をスーパー学習器として使用することで、重みを非負に制限できます。 ANNのフィッティングプロセスは補足図を参照してください。 2 & 3。 時点については、観測されたイベント分布の 9 つの等間隔の分位数、つまり {0, 0.125, 0.25, 0.375, 0.5, 0.625, 0.75, 0.875, 1} を使用しました。 私たちは、提案した手法のパフォーマンスを、広く使用されている Lasso Cox 回帰 (glmnet) などのいくつかの既存の単一モデル アプローチと比較しました。 [27] およびグループ構造を組み込んだ拡張機能: グループ スパイク アンド スラブ投げ縄 (gsslasso) (BhGLM) [28]、オーバーラップ グループ Lasso (grlasso)、オーバーラップ グループ cMCP、およびオーバーラップ グループのスムーズにクリップされた絶対偏差 (grSCAD) (grpregOverlap) [29]。 これらの手法のパフォーマンスは、シミュレートされたデータと現実世界のデータを使用して評価されました。 すべての単一モデル メソッドは、デフォルト パラメーターを使用して実行されます。 すべての分析は、Dale T7920 INTEL Windows 10 Gold 5117 CPU @ 2.00GHz 上の R (4.1.3) ソフトウェアを使用して実行されました。

#高次元オミクスデータを用いた癌生存予測のための新しい非ネガティブベイジアンスタッキングモデリング手法 #BMC #医学研究方法論

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。