日本語版
最新ニュース
世界

ライフスタイルが真菌病原体のゲノムサイズと遺伝子含有量を形成する

病原性および IA とゲノム形質との関連性は、次の 3 つのアプローチを使用して推定されました。 (i) BayesTraits v3 に実装された可逆ジャンプ MCMC 離散進化モデル (ペイゲルとミード、2006 年)、(ii) R パッケージ phylolm v2.6.5 の phyloglm() 関数を使用した系統発生的ロジスティック回帰 (ホーとアネ、2014)、(iii) scikit-learn Python v3 パッケージを使用したランダム フォレスト分類。病原性関連性の試験では、10 サブセット内で個別に分析も実行されました。各サブセットは、5 つのゲノム サイズ ビン (20 ~ 70 Mbp、10 Mbp ステップ) からサンプリングされた同数の病原体と非病原体 (n=190,190)…

ライフスタイルが真菌病原体のゲノムサイズと遺伝子含有量を形成する

1765911268
2025-12-16 17:54:00

病原性および IA とゲノム形質との関連性は、次の 3 つのアプローチを使用して推定されました。 (i) BayesTraits v3 に実装された可逆ジャンプ MCMC 離散進化モデル (ペイゲルとミード、2006 年)、(ii) R パッケージ phylolm v2.6.5 の phyloglm() 関数を使用した系統発生的ロジスティック回帰 (ホーとアネ、2014)、(iii) scikit-learn Python v3 パッケージを使用したランダム フォレスト分類。病原性関連性の試験では、10 サブセット内で個別に分析も実行されました。各サブセットは、5 つのゲノム サイズ ビン (20 ~ 70 Mbp、10 Mbp ステップ) からサンプリングされた同数の病原体と非病原体 (n=190,190) で構成されていました。

BayesTraits は、2 つの形質間の 8 つの可能な遷移速度 (一度に 1 つの形質のみの遷移) をモデル化することにより、バイナリ形質のペアの共進化をテストします。我々は、病原性またはIAと各ゲノム形質の共進化をモデル化しました。ゲノム形質は、その中央値 (中央値を下回る場合は 0、中央値を上回る場合は 1) に基づいてバイナリ形質に変換され、形質の増加はその形質のサイズの増加を示し、形質の損失は形質のサイズの減少を示します。各ゲノム形質について、2 つのモデル (1 つは 2 つの形質の独立した進化、もう 1 つは依存進化) を比較しました。さらに、一部の遷移速度が一方向でより頻繁であるかどうか (形質の増加と損失) をテストするために、反対側の遷移に等しい変化速度を設定し (たとえば、病原体のゲノム サイズの増加速度が病原体のゲノム サイズの損失速度と等しくなるように設定)、対数ベイズ係数を使用してそれらを依存モデルと比較する 4 つのモデルを実行しました。すべての重要な移行変化(他方の存在下での一方の形質の獲得または喪失)に基づいて、ゲノム形質が病原性/IA(病原体/IA の形質の獲得、または非病原体/非 IA の形質の喪失)と正の関連があるかどうかを決定しました。最後に、我々はまた、依存モデルを、共進化的移行が系統発生全体にわたって変化することを許容される共分散モデルと比較した(ヴェンディッティら、2011)。対数ベイズ係数が 4 を超えた場合にモデルが選択されました。各モデルは、一貫性をチェックするために、2100 万回の反復、100 万回のバーンイン、および 1000 回の間引きについて 3 回実行されました。

R の phyloglm() 関数と「logistic_MPLE」メソッド、btol オプション (検索スペース制限) を 30 に設定、および 1000 の独立したブートストラップ複製を使用して、系統発生的ロジスティック回帰を使用して、各ゲノム形質を病原性/IA に適合させました。 Benjamini-Hochberg 補正が適用された p-価値観。一部のゲノム形質のスケールが調整されました。リピートありとなしのアセンブリサイズは 10 Mbp 単位、遺伝子数は 1000 遺伝子単位、イントロンの長さと遺伝子間長は 1 kb 単位、エクソンの長さは 100 bp 単位、tRNA、擬似 tRNA、エフェクターの数は 100 遺伝子単位で使用されました。

病原体と IA 種を予測するための機械学習分類器をトレーニングするために、5 つの分類器 (KNeighbors、SVC、DecisionTree、RandomForest、および GradientBoosting) の精度をテストしました。いずれの場合も、ランダム化グリッド検索と 5 重相互検証がトレイン データ (80%) に対して実行され、バランスの取れた精度スコアが取得されました。スコアは、テスト データセットとトレーニング データセットにランダムに分割された 10 回にわたって平均されました。データが欠落している種は除外され、SVC による分類のためにデータが再スケール (0 から 1 の間) されました。ランダム フォレスト モデルは最高のスコアの 1 つを示したので、このモデルを使用してデータセット全体をトレーニングし、最も重要な特徴を決定しました。重要な特徴は、平均不純物減少法を使用して決定されました。最終モデルでは、最もバランスのとれた精度スコアを与えるデータ分割からのハイパーパラメーターを使用しました。データセット内のサンプルは系統発生関係によって依存しているため、種ごとに各ノードまでの距離を追加の特徴として含めることによって、モデルに対する系統発生の影響も決定しました。最も重要な特徴の上位 5 つにノード距離が含まれていないことがわかりました。

ゲノムサイズの祖先の再構築は、R パッケージ phytools v2.4–4 の fastAnc 関数を使用して実行されました (レベル、2012) ggtree v3.15.0 R パッケージ (ゆうさん、2020年) 連続オプションを使用します。選択された祖先ノードのライフスタイル特性を推定するために、BayesTraits v3 に実装された進化の離散モデルが上記と同じパラメーターで使用されました。

IA クレードと非 IA クレード間のエクソン長とエクソン数の関連性をテストするために、OrthoFinder (上記) で見つかった 38 個の 1 対 1 オルソログについてこれらの特徴を取得しました。対応のあるマン・ホイットニー U 検定を使用して、2 つの分岐群ペアについて IA 種全体の平均値を非 IA 種の平均値と比較しました。

長いエクソン遺伝子が短いエクソン遺伝子と比較して欠失する可能性が高いか低いかを判断するために、さまざまなクレードのメンバーにわたる遺伝子ファミリーの存在を調べました。すべてのクレードのメンバーに見られる遺伝子ファミリーは、欠失される可能性が低い遺伝子を表しますが、クレードの少数のメンバーのみに存在する遺伝子ファミリーは、より頻繁に欠失される遺伝子を表します。次に、R の MASS v7.3–61 パッケージの glm.nb() 関数を使用して負の二項一般化線形モデルをフィッティングすることにより、エクソンの長さと数の観点から一般的な遺伝子ファミリーと希少な遺伝子ファミリーの特徴を比較しました (ヴェナブレスとリプリー、2002)。

#ライフスタイルが真菌病原体のゲノムサイズと遺伝子含有量を形成する

執筆者について: nipponese

Nipponese News編集部は、国内外のニュースを日本語で分かりやすくお届けします。