1707446980
2024-02-09 02:39:07
データ
私たちは、2020年10月1日から2021年5月10日までに行われた症例調査の電話記録742,807件を分析しました。私たちの研究では、確認された症例には、PCRまたは抗原検査によって特定された症例が含まれています。 さらに、州および領土疫学者評議会 (CSTE) の基準と一致しています。 [25]、可能性の高い事件の仕様を満たす個人も、事件調査の対象となります。 このアプローチにより、当社の分析は、確認された症例と感染の可能性が高い症例の両方を含む、広範囲にわたる新型コロナウイルス感染症(COVID-19)症例を確実に網羅することができます。 これらのデータは、2021 年 5 月 10 日にアクセスされました。主要な事件調査情報には、初発事件の生年月日、自宅の所在地の郵便番号、電話の時間、電話インタビューが完了したかどうかが含まれます。 接触追跡情報を収集する前に、接触追跡者と参加者との間の電話でインフォームドコンセントが得られ、接触追跡記録に記録されました。 未成年の参加者の場合は、親または保護者からインフォームドコンセントを得ました。 この研究でのこのデータセットの使用は、コロンビア大学治験審査委員会 (IRB) AAT2182 によって承認されました。
Trace チームが行った最初の電話は「未遂」として記録されました。 発端のケースが電話に応答した場合、やり取りは「連絡が取れた」として記録されます。 面接の必須ステップがすべて完了した場合、電話は「完了」とマークされます。 試行または到達として記録されたが完了していないインタラクションは、その日の後半の通話試行のキューに戻されました。 人物への連絡が 3 回失敗した後、この事件は特別捜査のキューに送られ、そこでコミュニティ活動チームが電話、電子メール、または直接のいずれかでその人物に連絡を取るよう努めました。 [26]。 地域活動チームによる家庭訪問が試みられる前に、情報収集者は他のデータベースを検索して、追加の連絡先情報が見つかるかどうかを確認しました。 18 歳未満の個人の事件調査は親または保護者によって完了されていることに注意してください。 さらに、トレースは老人ホームや長期介護施設に居住している個人へのインタビューを行っていません。
この分析では、総人口規模、黒人住民の割合、ヒスパニック系住民の割合、世帯年収の中央値、学士号を取得した住民の割合、平均世帯人数など、郵便番号レベルでいくつかの変数を使用しました。 これらの共変量は、ニューヨーク市郵便番号地域全体の人口統計および社会経済的変動を表すために選択されました。 データは 5 年間の American Community Survey (ACS) から収集されました。 [27]。 2021 年 5 月 10 日に、R パッケージ tinycensus (27) を使用して、これらの変数の 2020 年の推定値をダウンロードしました。
回帰モデル
各事件の調査で入手可能な情報には、初発事件の年齢、自宅の所在地の郵便番号、電話がかかってきた時刻などが含まれていました。 追加の説明変数を提供するために、いくつかの郵便番号レベルの特性を含めました。 これらの郵便番号レベルの変数は、各インデックスケースの正確な状態を必ずしも反映しているわけではありませんが、個人の考えられる人口統計学的および社会経済的状態を表しており、郵便番号地域全体で完了率が異なる可能性があります。 ((年齢le 24 歳 (若者))、(24 歳 歳) の 3 つの年齢グループを定義しました。< agele 65 years old (young adults)), and (age > 65 歳 (高齢者))、4 つの通話時間間隔 ((午前 9 時 le T<午後 12 時)、(午後 12 時le T<午後 3 時)、(午後 3 時le T<午後 6 時)、および (午後 6 時le Tle 午後 9 時))。 対数二項回帰モデルは、各症例調査 (i) のバイナリ完了ステータスに適合し、インデックス症例が存在する郵便番号地域 ({l}_{i}) の人口統計および社会経済的条件を制御しました。 具体的には、モデルは次の方程式で記述されます。
$$logleft({p}_{i}right)={beta }_{0}+{beta }_{1}times %Black 居住者left({l}_{i }right)+{beta }_{2}times %Hispanic Residentleft({l}_{i}right)+ {beta }_{3}times Median 世帯 収入 left({l}_{i}right)+{beta }_{4}time %bachelo{r}{prime}sdegreeleft({l}_{i}right)+ {beta }_{5}times mean世帯sizeleft({l}_{i}right)+{beta }_{6}times ag{e}_{seniorleft(i right)}+{beta }_{7}times ag{e}_{youthleft(iright)}+{beta }_{8}times call time left(午前 9 時 le {T}_{i}<12 pmright)+{beta }_{9}times call time left(3 pmle {T}_{i}<6 pmright)+{ beta }_{10}times call time left(6 pmle {T}_{i}le 9 pmright)+{varepsilon }_{i}。 (1)$$
ここで、({p}_{i}) は事件調査 (i) の完了確率、({beta }_{0}) は切片、({varepsilon }_{ i}) はエラー項です。 電話の通話時間には暗黙の参照 (12 pmle T<3 pm) を使用したことに注意してください。 連続説明変数は、変数のさまざまなスケール (例: 世帯収入に対する人口の割合) に対応するために回帰モデルを実行する前に標準化されました (平均 0、分散 1)。
予測モデル
回帰モデルは説明変数の効果を解釈するのに適していますが、実際のアプリケーションでは予測に限界があることがよくあります。 私たちはランダム フォレスト モデルを実験してアプローチを補完しました。 この決定は、特に通話の最適な時刻を予測するための、より実用的で予測的なツールの必要性によって推進されました。 回帰モデルは貴重な洞察を提供しましたが、多くの場合、限られた範囲の通話時間を推奨していました。 いくつかの機械学習アプローチを試した結果、ランダム フォレスト モデルは、より広範囲で均等に分布した通話時間帯を特定するのにうまく機能し、データの非線形の複雑さをより効果的に捕捉できることがわかりました。
ランダムフォレストモデルを使用しました [28] 電話がかかってきた時間帯に応じて、事件捜査の最高完了率を予測します。 利用可能な個人レベル変数が限られているため、各事件調査の完了ステータスを予測することは困難です。 そこで、予測対象を、郵便番号地域ごとに一定期間内に特定の年齢層を対象に実施した事件調査の平均完了率に切り替えました。 3 つの年齢グループ ((年齢le 24 歳)、(24 歳 歳) を定義しました。 < agele 65 years old), and (age>65 歳))、および 4 つの通話時間間隔 ((午前 9 時レ T<午後 12 時)、(午後 12 時レ T<午後 3 時)、(午後 3 時レ T<午後 6 時)、および (午後 6 時 le Tle 午後 9 時))。 予測ターゲットは、すべての ZIP-age-call 時間グループの平均完了率 ({y}_{zip,age,call time}) として設定されました。 年齢層と通話時間間隔に加えて、郵便番号レベルの人口統計変数と社会経済変数を式に含めました。 (1) ランダム フォレスト モデルの予測子としてのインデックス ケースの場合。
症例調査コールの 80% をトレーニング データとしてランダムに選択し、残りの 20% をサンプル外検証用に保持しました。 選択したレコードの 80% を使用して、平均完了率の RMSE (二乗平均平方根誤差) を最小限に抑えることを目的として、10 倍交差検証を使用してランダム フォレスト モデルをトレーニングしました。 最適化されたランダム フォレストは 500 のデシジョン ツリーで構成され、それぞれにランダムに選択された 1 つの予測子が含まれます。 デシジョン ツリー内のノードは、新しく作成された各ノードに少なくとも 5 つのサンプルが含まれるという制約の下で、分散規則 (つまり、分割サンプルの分散の合計を最小化する予測値のカットポイントの選択) を使用して分割されました。 回帰ツリーやエラスティックネット線形回帰などの他の機械学習アプローチもテストされました。 ランダム フォレスト モデルは、同様の RMSE で優れたパフォーマンスを示しましたが、予測誤差の点ではより低い変動 (つまり、より堅牢な予測) を示しました。 その結果、ランダムフォレストモデルの結果を主な知見として提示しました。
すべてのトレーニング データ間で変数をランダムに並べ替えた後、RMSE によって測定される予測精度の低下を調べることにより、ランダム フォレスト モデルにおける各変数の重要性を定量化しました。 20 回の独立した並べ替え (モンテカルロ反復) を実行し、劣化の分布を取得しました。重要な変数の並べ替えは、RMSE の大幅な増加につながります。
反事実の実験
完了率の潜在的な向上を評価するために、ランダム予測モデルを使用した反事実実験を実施しました。 データをトレーニング セットとテスト セットに分割しました。 症例調査コールの 80% はトレーニング データとして使用され、残りの 20% はサンプル外検証のために保持されました。 まず、トレーニング データを使用してランダム フォレスト モデルをトレーニングしました。 次に、テスト データとして、4 つのタイム スロットで順列を作成しました。これは、各個人が異なるタイム スロットで 4 回複製されたことを意味します。 その結果、個々の呼び出しごとに 3 つの事実に反する行が作成されました。 トレーニング済みのランダム フォレスト モデルを使用して、これらの反事実的な行の完了率を予測しました。 その結果、各行はモデルが予測した完了率を受け取りました。 モデルが予測した完了率が最も高かった通話時間を、モデルが予測した最良の通話時間として扱いました。 次に、実際のテスト データ (追加された反事実行をすべて削除) を 2 つのグループに分類しました。最初のグループは、実際の通話時間が予測された時間帯と一致した個人で構成されていました。 2 番目のグループは、実際の通話時間が予測された時間帯と一致しない個人で構成されていました。 各グループの完了率を計算し、2 つのグループの結果を比較しました。
#ニューヨーク市における新型コロナウイルス感染症COVID19接触追跡調査の完了率を評価 #BMC公衆衛生