AIはART妊娠を予測できるか──20研究を統合した現在地

体外受精(IVF)や顕微授精(ICSI)などの生殖補助医療(ART)が広く行われるようになった一方、1回の治療周期でどの程度の確率で妊娠・出産に至るかを事前に見積もることは、患者にとっても医療者にとっても重要な課題です。世界保健機関(WHO)の推計では成人の6人に1人が生涯のいずれかの時期に不妊を経験するとされ、ART治療は多くの家庭にとって重要な選択肢になっている一方、1周期あたりの生産率は依然として限定的で、施設間・個人間のばらつきも大きいことが知られています。

従来の妊娠予測モデルは回帰分析を中心に、あらかじめ定めた少数の変数を用いるものが主流で、胚の形態情報や画像データ、複雑な相互作用までは十分に捉えきれないという限界がありました。近年は機械学習(ML)による予測モデルの開発が相次いでいますが、実際にどの程度の精度でART後の妊娠・出産を予測できるのかを体系的に検証した研究は限られていました。この空白を埋める目的で行われたのが、Journal of Assisted Reproduction and Genetics誌に2026年に掲載された系統的レビュー・診断精度メタ解析です(DOI:10.1007/s10815-026-03988-x)。PROSPEROに事前登録された上で(登録番号CRD420251108846)、9つのデータベースを横断的に検索し、機械学習モデルによるART妊娠・出産予測の診断精度と方法論的な質を統合的に評価しています。

方法──9つのデータベースを横断し、20研究を精査した

PubMed、Embase、Cochrane Library、IEEE Xplore、MEDLINE、ClinicalTrials.gov、CNKI、Wanfang、VIPの9データベースを対象に、開設時から2026年7月までの文献が検索され、PRISMA2020声明とコクラン診断精度レビューハンドブックに準拠して実施されています。最終的に2241件が抽出され、重複除去・スクリーニングと179件の全文評価を経て、20研究が組み入れ基準を満たしました。このうち完全な2×2データ(真陽性・偽陰性・偽陽性・真陰性)を報告していた14研究が診断精度メタ解析の対象です。20研究は2020〜2026年に発表され、アジア・欧州・北米・オーストラリア・ロシアなど世界各地で実施されましたが、多くが後方視的・単施設の研究で、前方視的研究はわずか2件、外部検証を報告していた研究も少数にとどまりました。

感度73.7%、特異度78.9%――『当たる』とはどこまで言えるか

14研究を対象とした診断精度メタ解析の結果、機械学習モデルの統合感度は0.737(95% CI、0.662〜0.799)、統合特異度は0.789(95% CI、0.709〜0.851)でした。感度73.7%は、実際に妊娠・出産に至った周期のうち、モデルが『陽性』と正しく判定できた割合が7割強にとどまることを意味し、裏を返せば成功する周期のおよそ4件に1件は『見込みが低い』と誤って分類される計算です。特異度78.9%についても、実際には妊娠・出産に至らなかった周期のうち5件に1件はモデルによって誤って『見込みがある』と判定されていたことになります。研究間のばらつきを示すI²統計量は感度97.7%、特異度99.0%(いずれもp<0.0001)と極めて高く、対象集団や施設によって成績が大きく異なっていたことがうかがえます。

感度と特異度のトレードオフを踏まえた統合診断オッズ比(DOR)は10.49(95% CI、6.28〜17.53)でした。DORは妊娠・出産に至った群でモデルが陽性となるオッズが、至らなかった群と比べて何倍かを示す値で、10.49という数字は成功した周期のオッズがおよそ10倍高いことを意味します。ばらつきは大きいものの(I²=96.2%、p<0.0001)、95%信頼区間の下限は1を大きく上回り、有意性そのものは比較的一貫していました。要約ROC曲線(SROC曲線)もROC空間の左上寄りに位置し、おおむね良好な判別能を示す一方、予測区間の幅は広く、臨床現場ごとの不確実性の大きさも示されていました。

臨床妊娠と生産で差はなし、アルゴリズムの種類でも優劣つかず

アウトカムの種類・アルゴリズム・研究デザイン・施設の種類・検証方法という5つの観点から探索的サブグループ解析が行われています。臨床妊娠(8研究)の統合DORは11.09、生産(6研究)は10.63で有意差なし(p=0.936)。アルゴリズム別ではアンサンブル学習9.47、深層学習6.03、従来型機械学習24.27で、数字上は従来型機械学習が高く見えますが対象研究が2件と少なく信頼区間も極めて広いため優劣は判断できません(p=0.553)。施設の種類(単施設11.62 対 多施設8.76、p=0.556)、検証方法(内部検証12.42 対 外部検証6.09、p=0.109)でも有意差はなく、外部検証の方が点推定値が低い傾向は、モデルが施設内のデータで最適化されている可能性を示唆します。唯一有意差が出たのは研究デザイン別(後方視的9.27 対 前方視的200.00、p=0.0009)ですが、前方視的群はわずか1研究で信頼区間も極端に広く、この結果から前方視的研究の優位性を結論づけることはできないと、論文中でも慎重な解釈が求められています。

20研究のうち『低リスク』はわずか1本――方法論の質という課題

論文はPROBASTを用いて、対象・予測因子・アウトカム・解析の4領域、12項目にわたり各研究の質を評価しています。20研究中、全体としてバイアスリスクが『低い』と判定されたのはわずか1研究(5.0%)で、『高い』が8研究(40.0%)、『不明』が11研究(55.0%)を占めました。特にアウトカム評価の領域は低リスクが2研究のみで、評価手順や追跡期間の記載が不明瞭な研究が目立ちました。出版バイアスはDeeksのファネルプロット検定で有意な非対称性は認められませんでしたが(p>0.05)、対象が14研究と少なく検出力自体が限られている点には留意が必要です。

臨床現場への示唆――『補助ツール』としての機械学習

臨床現場では、機械学習モデルの位置づけをどう捉えるかが今回の結果から改めて問われます。感度73.7%・特異度78.9%という成績は、単独の診断ツールとして意思決定を委ねるには不十分な水準であり、論文でも『臨床家の判断や共同意思決定を補完する補助的な意思決定支援ツール』として位置づけるべきだと指摘されています。頭蓋内動脈瘤の破裂リスク予測など他領域の機械学習モデルと比較しても同程度のDORにとどまり、ART分野に限らず機械学習による予測モデル全般に共通する現状ともいえます。

日本では、胚の形態評価や患者背景をもとにした妊娠・出産の見込みの説明が診療の一部として行われていますが、今回の結果はAIによる予測スコアを『決定的な根拠』として扱うことへの慎重さを裏付けるものです。内部検証を行った研究の方が外部検証を行った研究よりDORが高い傾向にあったことは、単一施設で最適化されたモデルを他施設にそのまま適用すると期待した精度が得られない可能性を示唆しており、国内複数施設を横断した外部検証を伴う研究が、今後の実装判断において重要な材料になると考えられます。

研究の強みと限界

この系統的レビューの強みは、9つのデータベースを横断した網羅的な検索と、PRISMA2020声明・コクラン診断精度レビューハンドブックに準拠した厳密な手順、PROBASTによる体系的な質評価を組み合わせている点にあります。一方で、完全な2×2データを報告していたのは20研究中14研究にとどまり、主要な解析のほぼすべてで研究間の異質性が高く、その要因を研究レベルの共変量だけでは十分に説明できませんでした。対象研究の多くが後方視的・単施設研究で一般化可能性にも限界があり、較正(キャリブレーション)や正味の利益、実装環境に関する報告も不十分で、臨床的有用性を深く評価することはできなかったとされています。

おわりに

今回のメタ解析は、機械学習モデルがART後の妊娠・出産をおおむね中程度の精度で予測できる一方、その精度は臨床判断を単独で代替できる水準には達していないことを定量的に示しました。研究間の異質性の大きさ、後方視的・単施設研究への偏り、外部検証の乏しさ、方法論的な質の課題(20研究中、低リスクと判定されたのは1研究のみ)は、いずれもこの分野が抱える構造的な課題として浮かび上がっています。論文は、今後の研究がTRIPOD+AIおよびPROBASTに準拠した透明性の高い報告、較正と臨床的有用性の評価、前方視的な多施設外部検証を優先すべきだと結論づけています。機械学習モデルがART診療に組み込まれる段階に至るには、こうした知見の蓄積が今後の鍵になると考えられます。

参考文献

1. Li B, Liu H, Yu F, et al. Machine learning-enabled prediction of ART pregnancy outcomes: a systematic review and meta-analysis. J Assist Reprod Genet. 2026. doi:10.1007/s10815-026-03988-x

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です