この方法論の実際の問題への実際の応用を説明するために、著者は、2024年1月30日に別の雑誌に掲載されたアカデミックペーパーに適用されたRコードを抽出しました。 [2]。この研究では、米国のNHANESのデータを利用して、4つの特定のポリフルオロアルキル物質(PFA)への曝露とパルフルオロオクタン酸(PFOA)、パーフルオロオクタンスルホン酸(PFOS)、パーフルオロヘキサンスルホン酸(PFHxS)、およびPFHXXS)、およびPFHXXS)との間の潜在的なリンクを調査しました。酸(PFNA) – – およびさまざまな癌タイプ。ロジスティック回帰分析が採用され、潜在的な交絡因子を調整するために指示された非環式グラフが使用されました。結果は、いくつかのがんの有意なオッズ比(OR)を示していました。PFHXS(LN(PFHXS))の自然対数の1ユニットの増加に対して、脳腫瘍は8.16でした。食道癌は、LN(PFOA)で5.10のORを示しました(95%CI 1.18–17.34)、LN(PFOS)で3.97(95%CI 1.24–11.42)。黒色腫には、LN(PFOA)で1.65のORがあり(95%CI 1.07–2.58)、LN(PFHXS)(95%CI 1.07–2.25)で1.55でした。前立腺がんのORは、LN(PFOS)で1.21(95%CI 1.00–1.48)、LN(PFNA)で1.27(95%CI 1.00–1.62)でした。肺がんは、LN(PFOS)で2.62のORを示しました(95%CI 1.24–5.83)およびLN(PFNA)で2.38(95%CI 1.00–5.52)。この研究は、PFA暴露に関連して脳、食道、および黒色腫癌にさらなる研究が焦点を当てるべきであることを示唆しています。これらはこの文脈で広く研究されていないからです。
詳細な方法と結果は、この既に公開された論文に記載されています。このペーパーでは、データベースの構築とRコードを使用した分析に焦点を当てます。 Rコード全体は、「r codes.docx」ファイルまたはパーツARからパートFRファイルへのRコードファイルに添付されています。
r US NHANESデータセットから分析データベースを構築するコード
分析データセットを構築するRコードは、次の段落で提供されています。各部品の説明は、#hashtagを使用して提供されます。
#最初の部分は、この分析のために基本的なデータベースを構築することです。
#このセクションは、血液サンプルを使用して測定されたPFASSの血清濃度で参加者を募集します。 2003年から2004年にかけて、PFASSの血清濃度はL24PFC_C.XPTデータファイルに含まれています。 2005〜2006年から2011年から2012年までのサイクルまで、PFASの血清濃度はPFC_D.XPTからPFC_G.XPTデータファイルに含まれています。 2013〜2014年から2017年から2018年のサイクルまで、PFASの血清濃度はPFAS_H.XPTからPFAS_J.XPTデータファイルに含まれています。
#2013–2014、2015–2016、および2017–2018サイクルのために、PFOAおよびPFOSの線形および分岐異性体の血清濃度が提供されます。したがって、PFOAおよびPFOSの血清濃度をそれぞれ線形PFOAおよび線形PFOSの血清濃度に置き換えました。
#特定のRコードは補足資料Aで提供されます。
#各参加者の年齢、性別、民族性を得るには、人口統計データが必要です。腎疾患(MDRD)Eq。 [4]。教育レベルも余剰交絡因子として含める必要がありました。したがって、これらのデータデモデータファイルを組み合わせました。
#特定のRコードは補足資料Bで提供されます。
#Body測定データは、各参加者のボディマス指数(BMI)を取得するために必要です。したがって、BMXデータファイルを組み合わせました。
#特定のRコードは補足資料Cで提供されます。
#特定のRコードは補足資料Dで提供されます。
#Standard生化学プロファイルは、各参加者の血清クレアチニン濃度(MG/DL)を抽出してEGFRを計算するために必要です。
#特定のRコードは、補足資料Eで提供されています。
各参加者のタバコの喫煙状況を測定するには、#Serumコチニン濃度が必要です。血清コチニンは、自己報告よりも喫煙状態のより信頼性の高い尺度になる可能性があります [5]。喫煙はPFASの両方の血清濃度に影響を与える可能性があるため [6] 癌の発生率、私たちは交絡因子として血清コチニンを含めました。
#特定のRコードは、補足資料Fで提供されます。
#parity履歴は、追加の交絡因子として含める必要があります。したがって、RHQデータファイルを組み合わせました。
#特定のRコードは、補足資料Gで提供されます。
#各組み合わせデータを統合するには、rおよび ‘by =“ seqn”’引数で ‘left_join’関数を使用しました。この引数は、回答者のシーケンス番号(US NHANESの識別番号のタイプ)に基づいてデータを組み合わせます。
#特定のRコードは、補足資料Hで提供されます。
# 次のコードは、MDRD Eqを使用したEGFRの計算用です。 [4]。
#特定のRコードは補足資料Iで提供されます。
#これらのコードは、各調査サイクルで使用される変数名を統一するためのものです。 AからDまでの大文字は、AからDに変換されました。
#特定のRコードは補足資料Jで提供されています。
R調査時間の10年以内に診断時間の制限を伴うメイン分析(ロジスティック回帰)のコード
#この部分では、胃、脳、子宮、肝臓、結腸直腸、乳房、前立腺など、あらゆる種類の癌の例で使用されたのと同じ分析を実施しました。膀胱がんのコードを例として説明します。別の癌の場合、「(I in数)」の数のみをその癌の数に変更する必要があります。各癌のコード番号は、補足資料Kで提供されています。https://wwwn.cdc.gov/nchs/nhanes/2017-2018/mcq_j.htm#mcq230a)。
#変数 ‘MCQ230A、MCQ230B、およびMCQ230C’は、参加者が過去に診断された1番目、2番目、および3番目の癌を参照しています。 MCQ230A、MCQ230B、またはMCQ230Cが前者のコードに示されている数である場合、(I数)の場合、新しい変数「MCQ230ABC」が1を返します(この場合、10は膀胱がんです。) 10ではなく、MCQ230ABCは0を返します。ただし、変数MCQ230A、MCQ230B、およびMCQ230Cには、変数MCQ220の変数よりも多くの欠損値があります。したがって、MCQ220への反応が0(癌の歴史はない)の場合、MCQ230ABCに0を適用しました。
#特定のRコードは、補足資料Lで提供されています。
#がん診断の年齢は、各波に応じて異なる変数としてコード化されました。 2015年から2016年のサイクルまで、膀胱癌が最初に診断された年齢はMCQ240Aとしてコード化されました。しかし、2017年から2018年のサイクルでは、膀胱癌が最初に診断された年齢は、MCQ240A、MCQ240B、またはMCQ240Cのいずれかとコード化されました。 (MCQ240A、MCQ240B、およびMCQ240Cは、それぞれ第1、2番目、および第3の癌の年齢が診断されたことを示しました。)したがって、次のコードを使用しました。参加者が調査時間まで膀胱癌と診断され、診断時間が調査時間の10年以内になった場合、可変MCQ230ABCは1としてコード化されました。これら2つの基準が同時に満たされていない場合、参加者は0としてコード化されています。
#特定のRコードは補足資料Mで提供されます。
#この部分は、独立変数が各PFAS血清濃度の対数である場合のロジスティック回帰であり、従属変数は、調査時間の10年以内に参加者が膀胱癌と診断された場合です。 BMI、年齢、性別、および血清コチニン濃度を交絡因子として方程式に挿入しました。
#特定のRコードは、補足資料Nで提供されています。
R調査時間の10年以内に診断時間の制限を伴うメイン分析(ロジスティック回帰)のコード、教育レベルとパリティのために調整
#基本フレームは宗派と同じでした。 2.2追加の調整された変数(DMDEDUC2およびRHQ160)を除く。
#特定のRコードは、補足資料Oで提供されます。
R診断時間の制限なしにメイン分析(ロジスティック回帰)のコード
#基本フレームは宗派と同じでした。 2.2調査時間の10年以内に診断時間の制限のための部品の除去を除きます。
#Rコードを実行する便利さのために、継続的な5つの数値が変数として使用されました 私 1つずつ。たとえば、rコードの最初のチャンクは、変数として10、11、12、13、および14を挿入しました 私 1つずつ。
#特定のRコードは補足資料Pで提供されます。
r線形仮定チェック用のコード
#特定のRコードは、補足資料で提供されていますq。
R記述分析用のRコード
#以下のRコードは、記述分析用です。
#特定のRコードは補足資料Rで提供されます。
1737717041
#がん疫学研究のための米国国民健康栄養調査NHANESデータセットに基づくがん患者のデータベースの構築 #BMC医学研究方法論
2025-01-24 10:57:00