卵管性不妊は女性不妊の25〜35%を占め、生殖年齢にあるカップルのおよそ15%が何らかの不妊を経験するとされています。卵管の通過性と子宮腔の形態を評価する検査として第一選択とされているのが、子宮卵管造影(HSG)です。米国だけでも年間およそ50万件のHSGが実施されており、頻用される検査である一方、その読影には相応の熟練が求められます。
蛍光透視下の画像はコントラストが低く、疎通・部分的な狭窄・完全閉塞を見分けることは容易ではありません。卵管閉塞に対するHSGの感度は読影者の経験によって65〜93%、特異度は83〜99%と幅があることが報告されており、施設や地域によって診断の質にばらつきが生じやすいという課題があります。
こうした背景から、深層学習を用いた画像分類の応用が医療画像の各分野で進められています。今回、YOLO11という物体検出・分類アーキテクチャを用いてHSG画像の卵管疎通状態を自動分類する試みが、Scientific Reports誌(2026年)に掲載されました。臨床現場で実際に使われている装置に付随する解析ツールではなく、研究段階のモデルを対象に、その分類精度と限界を検証した内容です(doi:10.1038/s41598-026-62943-z)。
方法──892枚のHSG画像を、4つのモデルで分類した
対象は、Mendeley Dataリポジトリで公開されている、不妊症評価を受けた患者由来の実臨床HSG画像892枚です。3名の専門医(board-certified radiologist)が、それぞれの画像を「両側疎通」「両側閉塞」「片側疎通」「両側部分疎通」の4カテゴリーに分類してラベル付けしました。データは訓練用662枚、検証用146枚、テスト用84枚に分割されています。
画像はいずれも224×224ピクセルに標準化され、訓練時にはコントラストの揺らぎや患者の体位差を模した色調・回転・反転などの水増し処理(データオーグメンテーション)が施されました。検証・テスト時にはこうした加工は行われていません。
分類モデルとしては、比較的新しいYOLO11の小型版(YOLO11s、パラメータ数約540万)を主軸に、旧世代のYOLOv8n(約140万パラメータ)、画像認識で広く使われるResNet50(約2,560万パラメータ)、軽量アーキテクチャのEfficientNetB0(約530万パラメータ)の計4モデルが同一条件下で訓練・比較されました。
正答率76%、パラメータ数はResNet50の5分の1以下
テストデータ84枚における全体の正答率(Top-1accuracy)は、YOLO11sが76.0%で、旧世代のYOLOv8n(67.12%)を8.88ポイント上回りました。EfficientNetB0(76.19%)とはほぼ同水準で、ResNet50(75.0%)をも上回る結果でしたが、YOLO11sのパラメータ数はResNet50のおよそ5分の1(540万 vs 2,560万)にとどまっています。
1枚あたりの推論速度はYOLO11sが19.98ミリ秒で、リアルタイム処理の目安とされる30ミリ秒/枚を十分に下回る速さでした。モデルサイズの小ささと処理速度の速さは、将来的に画像取得直後の現場での活用を見据えた際の利点といえます。
「片側疎通」は9割超の再現率、「両側閉塞」は0%
ただし、全体の正答率だけでは見えてこない偏りが、クラスごとの成績には明確に表れていました。訓練データ662枚のうち66.1%(441枚)を占めていた「片側疎通」については、F1スコア(適合率と再現率を統合した指標)0.83、再現率(見逃しの少なさを示す指標)0.96という高い成績でした。訓練データの14.6%(121枚)を占めた「両側部分疎通」もF1スコア0.84と良好でした。
一方、訓練データにおいてそれぞれ6.0%(40枚)、9.1%(60枚)しか含まれていなかった「両側疎通」と「両側閉塞」については、F1スコアがいずれも0.00という結果でした。テストセットに含まれていた両側閉塞6例、両側疎通8例は、すべてが誤って「片側疎通」と分類されていたことが、混同行列の解析で示されています。
両側閉塞は両方の卵管が閉塞している状態を指し、体外受精(IVF)への移行など治療方針に直結する重要な所見です。この所見を見逃す(偽陰性となる)ことは、妊娠の見込みが低い人工授精(IUI)を漫然と継続させ、適切なIVFへの紹介を遅らせるリスクにつながりうると論文は指摘しています。
原因は「データの偏り」──損失関数を変えても解決せず
この偏りの主因として挙げられているのが、訓練データにおけるクラス間の不均衡です。片側疎通が66%を占める一方、両側疎通はわずか6%しかなく、モデルが多数派クラスへと予測を偏らせる「事前確率」を学習してしまったと考えられています。
査読者からの指摘を受け、逆頻度に基づいてクラスごとに重みづけした損失関数(class-weighted loss)を用いてYOLO11sを再訓練する追加実験も行われました。しかし、全体の正答率はむしろ71.43%に低下し、両側閉塞・両側疎通のF1スコアは依然として0.00のままでした。この結果は、少数派クラスの成績の低さが損失関数の選び方の問題ではなく、テストデータそのものの少なさ(両側閉塞6例、両側疎通8例)に起因する根本的なデータ不足の問題であることを示唆しています。論文は、SMOTEのような過剰サンプリング手法や、生成的敵対ネットワーク(GAN)を用いた合成画像の活用など、データ収集・拡張の側からの対策を今後の課題として挙げています。
臨床的な位置づけ──「第二の読み手」としての可能性
論文は、現時点でのモデルは放射線科医の判断に代わるものではなく、あくまで「第二の読み手」あるいはトリアージ(優先度付け)支援ツールとして位置づけられるべきだとしています。モデルの確信度が85%を下回る場合や、少数派クラス(両側疎通・両側閉塞)が予測された場合には、必ず医師による確認を経る運用が想定されています。
日本の生殖医療現場では、HSGの読影は依然として医師の経験に依存する部分が大きく、施設間で読影の質に差が生じうる状況があります。今回の研究が示すように、頻度の高い「片側疎通」の検出において高い再現率を示すAIツールは、見落としを減らすスクリーニング補助として一定の価値を持つ可能性があります。一方で、治療方針に直結する「両側閉塞」の判定精度が実用に耐えないことは、当面のあいだ医師による最終確認が不可欠であることを裏づける結果でもあります。
研究の強みと限界
本研究の強みは、3名の専門医によってラベル付けされた実臨床データを用い、比較的新しいYOLO11アーキテクチャをHSG画像分類に初めて体系的に適用した点、そして複数のベースラインモデルとの比較を通じてクラス不均衡という課題を定量的に示した点にあります。
一方で限界も少なくありません。第一に、データは単一の公開データセット、単一の透視装置・撮影プロトコルに由来しており、他の装置や患者集団への一般化には追加の検証が必要です。第二に、テストデータが84枚と小規模で、とりわけ両側閉塞(6例)と両側疎通(8例)は症例数が極めて少なく、F1スコア0.00という結果は分類の完全な失敗を反映しているものの、実臨床での性能を精密に見積もるものではありません。第三に、後方視的な研究であり、実際の臨床ワークフローにおける前向きの検証は行われていません。第四に、比較対象は4つのアーキテクチャに限られており、Vision Transformerなど他の手法や、不均衡データに特化した訓練戦略は検証されていません。
おわりに
今回の研究は、HSG画像の卵管疎通状態をYOLO11で自動分類する初めての体系的な検証として、76%という正答率と、パラメータ数の少なさゆえの効率性を示しました。一方で、治療方針に直結する少数派クラスの分類性能はほぼゼロにとどまり、現時点でのモデルは監督なしでの臨床使用には適さないことも同時に示されています。データの不均衡という課題は損失関数の調整だけでは解消されず、より大規模で均衡のとれた多施設データセットの構築や、前向きの臨床検証が今後の焦点になるとされています。
参考文献
1. Jawaid N, Brohi IA, Ali NI, Korejo IA, Emran NA, Warsi A. YOLO11-based deep learning system for automated tubal patency classification in hysterosalpingography: a comparative study for clinical decision support. Sci Rep 2026. doi:10.1038/s41598-026-62943-z.
