体外受精(IVF)における胚盤胞の評価では、内細胞塊(ICM)、栄養外胚葉(TE)、胚盤胞腔、透明帯(ZP)という異なる組織を正確に区分することが、着床能力の評価に直結します。これらの領域をコンピュータで自動的に切り分ける技術は「セグメンテーション」と呼ばれ、胚培養士による形態評価を支援する画像解析AIの土台となっています。
ただし、この自動セグメンテーションには根本的な制約があります。AIモデルの学習には大量の手作業アノテーション(専門家が画像上に組織の境界を描き込んだ正解データ)が必要ですが、これは胚培養士の専門知識に依存する時間のかかる作業であり、評価者間でのばらつきも避けられません。近年は少量のラベル付きデータと大量のラベルなしデータを組み合わせて学習する「半教師あり学習(SSL)」が有力な解決策とされてきましたが、胚盤胞画像特有の透明性やHoffman位相差(HMC)光学系による境界の不明瞭さ、深度による見かけの大きさの違い(スケール混乱)、ラベルなしデータの活用不足といった課題が残されていました。
こうした課題に対し、組織どうしの入れ子構造(ZPの中にTE、その内側に胚盤胞腔、さらにICMという階層関係)そのものを手がかりにする新しい手法が、PLOS One誌2026年8月号(21(8): e0355053、DOI: 10.1371/journal.pone.0355053)に報告されました。トポロジー(位相構造)誘導型の二頭構造ネットワーク「TGDBN」と名付けられたこの手法は、わずかなラベル付きデータからでも、組織の境界を高精度に描き出すことを目指しています。
方法──249枚の胚盤胞画像を、どう学習させたか
検証には、公開されている胚盤胞顕微鏡画像データセットが用いられました。Hoffman位相差(HMC)光学系で撮影された高解像度画像249枚に、ICMと胚盤胞腔の手動アノテーション(Pacific Center for Reproductive Medicineによる)が付与されています。このうち190枚を学習用、9枚を検証用、50枚をテスト用に割り当て、半教師あり学習の設定として学習データの10%または50%のみにラベルを与え、残りはラベルなしデータとして扱いました。
提案手法のTGDBNは、1つの共通エンコーダから2つの出力ヘッドに分岐する単一モデル構造を採っています。一方はピクセル単位で組織カテゴリーを予測する「セグメンテーションヘッド」、もう一方は構造的な手がかりを生成する「トポロジー誘導ヘッド」です。後者にはさらに2つの工夫が組み込まれています。1つ目はDICE(Decoder Intra-Class Enhancement)モジュールで、デコーダの終盤3層の特徴を組織カテゴリーごとに分割したうえで、境界があいまいで低コントラストな「見分けにくい領域」を重点的に強調します。2つ目はMSFA(Multi-Scale Feature Aggregation)モジュールで、複数の解像度の特徴を統合し、各ピクセルが最寄りの組織境界までどれだけ近いかを示す「構造ガイドマップ」を生成します。これら2つのモジュールが連動することで、ラベルなし画像に対しても組織の階層的な位置関係(トポロジー)を守った予測を促す仕組みになっています。
評価指標には、ICMセグメンテーションについてAccuracy(正解率)、Recall(再現率)、Dice係数、Jaccard係数の4つが用いられ、バックボーンにはU-Netが採用されました。手法の汎化性を検証するため、胚盤胞とは異なる医療画像として、左心房の3D MRIデータセット(100症例)でも同様の評価が行われています。
ラベルはわずか10%──それでも11手法中トップの精度
ICMの二値分割タスクにおいて、学習データのわずか10%にしかラベルを与えなかった条件でも、TGDBNはAccuracy 97.62%、Recall 92.49%、Dice係数91.78%、Jaccard係数86.33%を達成し、比較対象となった11種類の既存半教師あり学習手法の中で最も高い成績を収めました。学習データを100%ラベル付けした「完全教師あり」条件での上限値(Dice係数95.00%)と比べても、その差はわずか3ポイント程度にとどまっています。ラベル付き画像を50%に増やした条件では、Accuracy 98.28%、Dice係数94.01%、Jaccard係数89.78%まで性能が向上し、完全教師ありの水準にさらに近づきました。
定性的な可視化結果でも、TGDBNの予測マスクは正解ラベルとよく一致しており、他の半教師あり手法に見られがちな断片的で不連続な誤分割が抑えられていたと報告されています。特に低コントラストで小さな領域における境界の描出精度が、既存手法との差を生む要因になっていました。
二つの工夫の効果──どちらが欠けても精度は伸び悩む
各モジュールの寄与を切り分けるアブレーション試験も行われています。両モジュールを取り除いた基本モデル(ベースラインB)ではDice係数87.59%にとどまりましたが、DICEモジュールのみを追加すると91.15%、MSFAモジュールのみを追加すると91.21%まで改善しました。そして両モジュールを組み合わせた完全版のTGDBNでは、Dice係数91.78%まで到達しています。単独の改善幅がおよそ3〜4ポイントであるのに対し、組み合わせによってさらに上積みが得られたことは、境界の強調(DICE)と多スケール統合による構造ガイド生成(MSFA)が、互いに補完的な役割を果たしていることを示唆しています。
胚盤胞に限らない──心臓のMRIでも通用した汎化性
胚盤胞は、ZPの内側にTE、その内側に胚盤胞腔とICMが入れ子状に存在するという特徴的な構造を持ちますが、同様に階層的な構造を持つ他の医療画像でもTGDBNが通用するかを検証するため、左心房の3D MRIデータセット(100症例、V-Netをバックボーンとして使用)でも比較が行われました。その結果、ラベル付きデータが10%の条件でDice係数89.47%、20%の条件で92.32%を記録し、いずれも比較対象手法の中で最高値でした。完全教師あり条件での上限値(Dice係数93.60%)との差は、20%ラベルの時点で1.3ポイント程度まで縮まっています。この結果は、TGDBNが胚盤胞画像に特化した手法ではなく、入れ子構造や層状構造を持つ医療画像に広く応用できる可能性があることを示しています。
臨床的意味・日本への含意
日本の生殖医療の現場では、体外受精治療において胚盤胞のグレーディングが移植胚選択の重要な判断材料となっており、胚培養士による形態評価の質と再現性が治療成績に影響し得ることが知られています。画像解析AIによる自動セグメンテーションは、この評価を補助し、施設間・評価者間のばらつきを減らす手段として期待されていますが、実用化にあたっては大量の手作業アノテーションという高いコストが障壁になってきました。今回の研究が示したように、ラベル付きデータが1割程度であっても実用的な精度に近づけるのであれば、AI開発に必要なアノテーション負担を大きく下げられる可能性があります。臨床現場では、こうした技術は最終的に胚培養士の判断を置き換えるものではなく、評価を支援し、記録を標準化するツールとして位置づけられることが想定されます。
研究の強みと限界
本研究の強みは、公開データセットを用いて11種類もの既存半教師あり学習手法と直接比較した点、そしてアブレーション試験によって提案した2つのモジュールそれぞれの寄与を定量的に示した点、さらに胚盤胞とは異なる医療画像(左心房MRI)でも同様の優位性を確認し、手法の汎化性を検証した点にあります。
一方で限界もあります。使用された胚盤胞データセットは249枚と規模が限られており、単一の光学系(HMC位相差顕微鏡)・単一の提供元によるものであるため、異なる撮影条件や機種、施設のデータでの再現性は今後の検証課題です。また、本研究はセグメンテーションの精度(正解マスクとの一致度)を評価したものであり、実際の妊娠率や着床率、生児出生率といった臨床アウトカムとの関連は検討されていません。時系列変化を追うタイムラプス動画像ではなく静止画像を対象としている点、そして2000エポックにわたる学習に要する計算資源の大きさも、実運用に向けては考慮が必要な点として著者らも言及しています。
おわりに
本研究は、胚盤胞の主要な組織構造が持つ入れ子状のトポロジーを明示的な学習信号として取り込むことで、少量のラベル付きデータからでも高精度なセグメンテーションを実現できることを示しました。ラベル付きデータが10%という条件でも、完全教師あり学習に近い水準の精度が得られたことは、医療画像アノテーションのコストという半教師あり学習研究全体の課題に対する一つの解決策を提示するものです。今後は、より多様な撮影条件やタイムラプス画像への拡張、そして実際の臨床アウトカムとの関連を検証する研究が期待されます。
参考文献
1. Li Y, Wang H, Hu J, Zhang J. 『TGDBN: Topology-guided dual-backbone network for semi-supervised blastocyst segmentation in assisted reproductive technology』PLOS One 2026;21(8):e0355053. doi:10.1371/journal.pone.0355053
