1728249902
2024-05-29 15:40:00
のコメント欄には、 デニス・ミンジャーの投稿 (2010 年 7 月 16 日)この記事では、中国研究のデータの一部について説明しています (同じトピックに関する以前の投稿のフォローアップとして) で、デニス自身が分析に使用したデータを投稿しました。このデータは中国研究からのものです。そこで私はそのデータを調べ、WarpPLS を使用していくつかの多変量解析を行うことにしました (warppls.com)。
まず、動物性タンパク質の摂取が総コレステロールに対する中間的な影響を介して結腸直腸がんを引き起こすという仮定をテストするという目的との関係を調査するモデルを構築しました。私は、いくつかの常識的な関係を含む複数の関係を同時に調査するために、さまざまな仮説的な関連を使用してモデルを構築しました。探索的な多変量解析では、常識的な関係を含めることは通常良いアイデアです。
モデルと結果を以下のグラフに示します。 (クリックすると拡大します。ズームインするには「CRTL」と「+」キーを使用し、ズームアウトするには「CRTL」と「-」キーを使用します。) 矢印は変数間の因果関係を調べます。変数は楕円の中に表示されます。意味各変数の値は次のとおりです: aprotein = 動物性タンパク質の消費量; pprotein = 植物性タンパク質の消費量; crcancer = 結腸直腸がん。
パス係数 (ベータ係数として示される) は関係の強さを反映します。これらは、多変量関係を考慮する (各変数の競合する効果を制御する) ことを除いて、標準的な一変量 (またはピアソン) 相関係数に似ています。負のベータは、関係が負であることを意味します。つまり、変数の増加は、その変数が指す変数の減少に関連付けられます。
P 値は、関係の統計的有意性を示します。 0.05 未満の P は、有意な関係 (その関係が本物である可能性が 95 パーセント以上) を意味します。 R 二乗値は、特定の変数の説明された分散のパーセンテージを反映します。値が大きいほど、モデルはデータとよりよく適合します。変数名の下にある「(R)1i」は無視してください。これは単に、各変数が単一の指標 (または単一の尺度、つまり変数が潜在変数ではない) を通じて測定されることを意味します。
P 値は、ジャックナイフと呼ばれるリサンプリングの形式であるノンパラメトリック手法を使用して計算されていることに注意してください。この手法では、データが正規分布しているという前提を満たす必要はありません。データを確認したところ、正規分布しているようには見えないので、これは良いことです。 それでは、上記のモデルは何を教えてくれるでしょうか?それは次のことを教えてくれます。
– 動物性タンパク質の摂取量が増加すると、結腸直腸がんは減少しますが、統計的に有意ではありません (ベータ=-0.13; P=0.11)。
– 動物性タンパク質の摂取量が増加すると、植物性タンパク質の摂取量は大幅に減少します (ベータ=-0.19; P
– 植物性タンパク質の摂取量が増えると、結腸直腸がんが大幅に増加する (ベータ=0.30; P=0.03)。 P が 0.05 より低いため、これは統計的に有意です。
– 動物性たんぱく質の摂取量が増えると、総コレステロールが大幅に増加します (ベータ=0.20; それらの全体的な増加はおそらく健全でしょう。
– 植物性タンパク質の摂取量が増えると、総コレステロールが大幅に減少します (ベータ=-0.23; P=0.02)。植物性タンパク質の摂取は動物性タンパク質の摂取と負の相関があるため、ここでも驚くべきことではありません。そして後者は総コレステロールを増加させる傾向があります。
– 総コレステロールが増加すると、大腸がんが大幅に増加する (ベータ=0.45; ここで大きな驚きがあります!
なぜビッグサプライズなのか 総コレステロールと結腸直腸がんの間には明らかに強い関係があるのでしょうか?その理由は、 意味がありませんというのは、動物性タンパク質の摂取は総コレステロールを増加させるようであり(これは通常増加することがわかっています)、それでも動物性タンパク質の摂取は結腸直腸がんを減少させるようであるからです。
多変量解析でこのような問題が発生する場合、通常は、他の変数と重要な関係を持つ変数がモデルに組み込まれていないことが原因です。言い換えると、 モデルは不完全ですしたがって、無意味な結果になります。前にも言ったように 以前の投稿で、関連係数によって暗示される変数間の関係も意味をなす必要があります。
さて、デニスは次のように指摘しました。 ここで欠けている変数はおそらく住血吸虫症感染症です。彼女が提供したデータセットには、欠損値がいくつかあったにもかかわらず (その変数のデータの約 28% が欠損していました)、その変数が含まれていたため、意味があると思われる方法でモデルに追加しました。新しいモデルは下のグラフに示されています。モデルでは、住血吸虫 = 住血吸虫症感染症です。
では、この新しい、より完全なモデルは何を教えてくれるでしょうか?以前のモデルが教えてくれたことのいくつかを教えてくれますが、より意味のある新しいこともいくつか教えてくれます。このモデルは、特に結腸直腸癌に対する全体的な影響に関して、前のモデルよりもはるかによくデータに適合していることに注意してください。これは、その変数の高い R 二乗値 (R 二乗 = 0.73) によって示されています。最も注目すべきは、 この新しいモデルは次のことを示しています。
– 住血吸虫症の感染が増加すると、結腸直腸がんが大幅に増加します (ベータ=0.83; ここで。
– 住血吸虫症感染は、動物性タンパク質の消費量、植物性タンパク質の消費量、総コレステロールなどの変数とは有意な関係がありません。 この感染は植物や動物の食物中に通常は存在しない虫によって引き起こされ、感染自体は総コレステロールの大幅な増加を期待できるような異常と特に関連していないため、これは理にかなっています。
– 動物性タンパク質の摂取は結腸直腸がんと有意な関係はありません。 ここでのベータは非常に低く、負です (ベータ = -0.03)。
– 植物性タンパク質の摂取は結腸直腸がんと有意な関係はありません。 この関連性のベータ値は正で自明ではありません (ベータ = 0.15) が、P 値が高すぎる (P = 0.20) ため、このデータセットのコンテキスト内で偶然を無視できません。特定の植物性食品 (小麦ベースの食品など) に関するデータを含む、よりターゲットを絞ったデータセットでは、異なる結果が得られる可能性があります。より重要な関連性が得られる場合もあれば、それほど重要でない場合もあります。
以下は、住血吸虫症感染と結腸直腸癌との関係を示すプロットです。値は標準化されており、横軸のゼロがデータセット内の住血吸虫症感染数の平均であることを意味します。プロットの形状は、標準化されていないデータの場合と同じです。ご覧のとおり、データ ポイントは線に非常に近く、これは非常に強い線形関連性を示唆しています。
要約すると、この多変量解析は、デニスが言ったことのほぼすべてを正当化します。 彼女の2010年7月16日の投稿で。このことは、小麦消費と結腸直腸がんとの関係の可能性(以前は単変量解析で明らかになった)に関して、早計に結論を急ぐことについてのデニス氏の警告を裏付けるものでもある。それらの結論が間違っているというわけではありません。彼らはおそらく正しいかもしれない。
この多変量分析は、中国研究データの品質に関するキャンベル博士の主張も裏付けています。私が分析したデータはすでに郡ごとにグループ化されているため、サンプルサイズ (65 件) P値に疑問を投げかけるほど高くはなかった。 (そうは言っても、サンプルが小さいと、統計的検出力が低い、誤差によるバイアスが生じる可能性が高まるなど、それ自体の問題が生じます。) この記事でまとめた結果は、過去の実証研究に照らしても理にかなっています。
これは非常に優れたデータです。適切に分析する必要があるデータです。
#住血吸虫症が支配的であることを示唆する多変量解析