ヒト細胞アトラスを構築するためにデータを収集すること自体が困難ですが、そのようなデータの統合、調査、利用にはさらなる課題が伴います。このコレクション内の研究によって開発された複数の機械学習ベースのアプローチは、これらの課題を克服し、HCA データの有用性を高めるのに役立ちます。
セルタイプの注釈
細胞型アノテーションは、HCA によって生成される単一細胞データセットの大部分を構成する単一細胞 RNA シーケンス データを分析する際の中核的なステップです。深層学習モデルである scTab は、組織間細胞タイプのアノテーションのために開発されました。 PopV は、投票スキームを利用して、アノテーションのないデータセット上の 8 つの統合されたセルタイプ アノテーション方法からの予測を比較します。このパイプラインは、さまざまなメソッド間で高いコンセンサスでアノテーションが付けられたセル タイプだけでなく、コンセンサスが低いセル タイプも識別します。これは、これらのセルのアノテーションが不確実であり、さらなる手動検査が必要になる可能性があることを示唆しています。
自然遺伝学: PopV による細胞型ラベルのコンセンサス予測
ネイチャーコミュニケーションズ: scTab: 組織間の単一細胞アノテーション モデルのスケーリング
細胞類似性検索
従来、新しいデータセット内のセルを検索するには、科学者はまず名前または署名によってセルを定義し、それらのセルが存在すると思われるデータセットを選択する必要がありました。 メトリクス学習ベースの基礎モデルである SCimilarity は、異なるアプローチを採用しています。特定の細胞または細胞集団と同様のプロファイルを持つ他の細胞がどこで見つかるかを尋ねることによって。既存のセル アノテーション ツールとは異なり、SCimilarity では検索前にセル タイプを事前定義する必要がありません。代わりに、発現プロファイル間の類似性に基づいて類似した細胞を検索します。
自然: 類似したヒト細胞のスケーラブルな検索のための細胞アトラス基盤モデル
#アトラスの初稿に向けて