人工知能と従来のバイオインフォマティクス手法を組み合わせ、単一細胞マルチオミクスデータを体系的に解析します。
本研究は、人工知能技術と従来のバイオインフォマティクス手法を組み合わせ、単一細胞マルチオミクスデータの体系的解析に取り組む。対象とするのは、単一細胞トランスクリプトーム、エピゲノム、空間トランスクリプトームなど多様なオミクスであり、解析アルゴリズムの最適化、オミクス統合モデルの開発、汎用的な計算パイプラインの構築に重点を置く。このアプローチにより、複雑な生物過程の多層的理解や疾患研究に向けて、より堅牢かつ効率的な計算ツールを提供することを目指す。
単一細胞技術の登場により、生命科学研究は細胞レベルで生物システムの複雑性を解明できるようになった。scRNA-seq は遺伝子発現プロファイルを解析し、scATAC-seq はクロマチン開放状態を捉えて転写制御の可能性を推定し、空間トランスクリプトミクスは分子情報と組織内の空間的文脈を同時に保持する。これらの先端的手法は、細胞異質性、発生軌跡、組織微小環境の探索に新たな視点を提供する。しかし、単一細胞データは一般に高次元かつスパースであり、ノイズも多く、さらに組学間には大きな差異が存在するため、従来の解析手法では十分に対応できない。こうした課題に対して、人工知能と深層学習の導入は不可欠であり、複雑な潜在特徴の自動抽出、ノイズやバッチ効果の軽減、異なるオミクス間の統一的表現空間の構築を可能にする。このアプローチにより、細胞タイプの同定、発生過程の再構成、遺伝子制御ネットワークの推定、組織空間構造の解明が推進され、生物学および精密医療に新たな計算パラダイムを提供する。
類似した scRNA-seq サンプルを繰り返し用いて細胞タイプを判別する作業は、膨大な時間と労力を要する。参照データセットの注釈情報を効率的にクエリデータセットへ転移することで、細胞タイプ認識における革新的な戦略が可能となり、その技術基盤として高次元特徴抽出に優れる深層学習が重要な役割を果たす。本研究では、多層特徴抽出モデル(図1)を提案する。このモデルは Multi-head Attention 機構を導入し、複雑な細胞間関係を捉えることで、差異の小さい細胞タイプの識別精度を大幅に向上させる。また、多層の全結合層と非線形活性化モジュールを組み合わせることで、深層かつ非線形的な特徴学習を強化する。本手法により、参照データセットと同一実験条件下で取得された新規サンプルの高精度な自動注釈が可能となるだけでなく、手動注釈に対しても信頼性の高い補助情報を提供し、細胞タイプ認識の効率と一貫性を向上させることができる。

マルチオミクス統合の核心は、異なるオミクスデータを統一的な低次元埋め込み空間に写像し、情報表現の効率化と下流解析の包括性を実現することである。しかし、オミクス間における著しい異質性やデータ非対応性は、長年にわたり大きな課題となってきた。この課題に対して、本研究では scRNA-seq と scATAC-seq を対象とした統合計算フレームワーク(図2)を提案する。本フレームワークは、二つの独立した変分オートエンコーダ(VAE)とグラフオートエンコーダ(GAE)を用いて各オミクスの特徴抽出とデータ再構成を行い、さらに生成対向ネットワーク(GAN)を導入することでオミクス間の分布差を効果的に緩和し、潜在空間での一貫性のある整合を実現する。この枠組みにより、細胞ラベルのクロスオミクス転移、データモダリティの変換、遺伝子制御ネットワークの推定など、複数の機能を統合的に実行することが可能となる。

単一細胞RNAシーケンス(scRNA-seq)は、細胞の異質性を高分解能かつ高スループットで解析可能な技術であり、細胞タイプや状態の詳細な同定が可能である。しかし、空間情報を欠いているため、細胞の組織内での配置や相互作用の解析には限界がある。一方、空間トランスクリプトミクス(ST)は遺伝子発現の空間分布情報を保持しているが、分解能や検出可能な遺伝子数に限界がある。両者を統合的に解析することで、それぞれの技術の利点を活かし、より精密な組織空間マップの構築が可能となる。深層学習を用いて単一細胞データと空間データ間の共有潜在表現を学習し、細胞特性と空間的位置の対応関係を構築する。それにより、単一細胞レベルに近い分解能で空間組織マップの再構築を目指す。また、説明可能な解析を取り入れることで、データに内在する生物学的なパターンを逆方向から探索し、細胞間の空間的な配置や相互作用を解明する。これにより、組織発生や疾患の進行に関わる空間的分子メカニズムの理解を深めることを目指す。
