生殖年齢が上がるにつれ、体外受精(IVF)で得られる胚の染色体異常(異数性)の頻度は高まる。異数性のある胚は着床不全や流産、先天異常のリスクと関連するため、着床前遺伝学的検査(PGT-A)によって染色体数の正常な胚(正数性胚)を選んで移植する取り組みが広がっている。ただしPGT-Aは胚盤胞の一部組織を採取する侵襲的な検査であり、コストや技術的な負担、実施できる施設の限界も指摘されてきた。
そこで近年注目されているのが、胚の静止画像や培養中の動画(タイムラプス)を人工知能(AI)で解析し、染色体異常のリスクを推定するツールである。市販のAI胚評価システムはすでに複数存在するが、それぞれ異なる訓練データやアルゴリズムに基づいており、多くは染色体正数性そのものではなく着床能や胚盤胞の質を予測する目的で作られている。これらの市販AIが実際にどの程度染色体異常のリスクを見分けられるのか、複数のAIを使った場合に同じ胚を『良い胚』として選ぶのか――という問いは、十分に検証されてこなかった。
この問いに答えるため、Reproductive BioMedicine Online誌(2026年)に、6種類の市販AI胚評価アルゴリズムを、1000個のPGT-A済み胚盤胞を対象に一斉に比較検証した研究が報告された(doi:10.1016/j.rbmo.2026.105865)。スペイン・IVIRMA Valenciaで実施されたこの研究は、複数の市販AIを同一データセットで直接比較した数少ない大規模検証として位置づけられる。
方法──1000個の胚を、6つの市販AIで採点した
2022年1月から2023年12月にかけてIVIRMA Valenciaで実施された顕微授精(ICSI)周期のうち、PGT-Aの結果と完全なタイムラプスデータがそろった周期が解析対象となった。最終的に273人の患者による273周期から得られた1000個の胚盤胞が組み入れられ(1周期あたり2〜14個)、そのうち129個(26周期)は卵子提供周期由来、871個(247周期)は自己卵子周期由来だった。
胚は受精後3日目にレーザーによるアシステッドハッチングを施行し、ASEBIR(スペイン生殖生物学会)分類でグレードA〜Cの胚盤胞をday 5(平均116時間)またはday 6(平均140時間)に生検した。栄養外胚葉細胞を5〜8個採取し、次世代シーケンシングによる標的PGT-Aで染色体を解析。モザイク率50%未満は正数性、50%以上は異数性として二値の判定に用いた。
評価対象は匿名化された6種類の市販AI(論文中ではA〜Fと表記)。うち3つは胚盤胞の静止画1枚を解析する静止画像型(A:Life Whisperer Genetics、B:Life Whisperer Viability、E:Hera)、残り3つはタイムラプス動画から発生の時間経過(形態動態)を解析する動画型(C:KIDScore D5、D:iDAScore、F:EmbryoAid)である。染色体正数性の予測を目的として開発されたのはAlgorithm Aのみで、残る5つは主に着床能や生存能力の予測を目的としたものだった。
各AIのスコアと染色体正数性の関連は、卵子年齢・パートナー年齢・体格指数(BMI)・卵子の由来(提供卵子か自己卵子か)・生検日(day5/6)・ASEBIRグレードで調整した多変量ロジスティック回帰、およびROC曲線のAUC(曲線下面積)によって評価された。さらに各AI内でのスコア四分位ごとの正数性割合、そしてAI間での胚の順位の一致度がKendallのτ-b係数で検討された。
AUC 0.71〜0.74──6つのAIは、驚くほど『横並び』だった
1000個のうち正数性胚は487個(48.7%)、異数性胚は513個(51.3%)だった。卵子提供周期の正数性率は76.7%(129個中)、自己卵子周期では44.5%(871個中)と、卵子の由来による差は大きかった。
6つのAIはいずれも、正数性胚に対して異数性胚より有意に高いスコアを付けていた(すべてP<0.001)。多変量ロジスティック回帰でも、スコアが高いほど正数性である確率が高いという関連が全アルゴリズムで確認された(調整オッズ比1.12〜1.38、いずれもP<0.001)。
判別能を示すAUCは、Algorithm B(Life Whisperer Viability)の0.726からAlgorithm D(iDAScore)の0.742まで、6つとも0.73前後に収まり、95%信頼区間も互いに重なり合っていた。動画型アルゴリズム(C・D・F)の平均AUCは0.733、静止画像型(A・B・E)の平均AUCは0.730とその差はごくわずかで、タイムラプスによる形態動態情報が静止画に対して明確に優れているとは言えなかった。
比較対象として従来の形態評価(ASEBIRグレード)だけを用いた場合のAUCは0.613(95% CI 0.578〜0.648)にとどまり、6つのAIのAUC(0.726〜0.742)を下回った。グレードAとグレードCの比較では調整オッズ比7.142(約7倍)とグレード自体は正数性と強く関連していたが、個々の胚を判別する能力ではAIの方が優れていた。ただしAUC 0.73前後は『良好』というより『中程度』の判別能であり、正数性胚と異数性胚のスコア分布には大きな重なりがあった。この重なりは、AIスコア単独では個々の胚が正数性か異数性かを確実に見分けられないことを意味している。
同じ胚でも、AIが変われば順位は食い違う
判別能そのものは6つのAIでほぼ横並びだったが、同じ胚に対する評価の『順位』まで一致していたわけではない。AI間で胚の順位付けがどれだけ一致するかをKendallのτ-b係数で調べたところ、最も低い組み合わせ(Algorithm AとC)で0.242、最も高い組み合わせ(Algorithm BとF)でも0.459にとどまった(いずれもP<0.001)。研究チームの基準では、τ-b値0.3未満は『弱い一致』、0.3〜0.5は『中程度の一致』とされており、6つのAIの組み合わせはすべて弱い〜中程度の一致にとどまり、強い一致(τ-b>0.5)を示す組み合わせは1つもなかった。
実際の順位を比較すると、差はより明確になる。6つすべてが『上位5位以内』とした胚は1つもなく、『上位10位以内』で全アルゴリズムが一致した胚もわずか1個だった。『上位25位以内』まで広げても共通して選ばれた胚は36個にとどまり、そのうち正数性だったのは30個(83.3%)。逆に『下位10位以内』で一致した胚も1個のみ、『下位25位以内』で共通した18個のうち異数性は13個(72.2%)だった。AIによる上位・下位の評価は正数性・異数性の傾向をある程度反映してはいるものの、どのAIを使うかで実際に優先される胚はしばしば異なっていた。
なお、同一メーカーが開発した複数アルゴリズム間では比較的高い一致度がみられ、設計思想や訓練データに共通点がある可能性が示唆された。一方、6つのAIの出力を組み合わせた複合モデルを試みた探索的解析では、個々のアルゴリズム単独の性能を上回る改善は見られなかった。
移植後の妊娠転帰は、AIスコアでは予測できなかった
正数性と判定された487個の胚のうち207個が実際に移植された。全体の着床率(移植後5週の妊娠嚢確認)は51.2%、生児獲得率は40.1%、流産率は13.0%だった。移植胚をAIスコアの四分位別に比較しても、いずれのアルゴリズムでも着床率・生児獲得率・流産率に統計学的に有意な差は見られなかった。正数性胚のみに限定したROC解析でも、着床の成否を判別するAUCは0.48〜0.55と、判別能はほぼないに等しい水準だった。
これは、AIスコアが染色体正数性とはある程度関連する一方で、正数性が確認された胚の中でどの胚が着床・出産に至るかという予後予測にはほとんど寄与しないことを示している。研究チームは、正数性胚という集団内ではもともと生物学的なばらつきが小さいこと(いわゆる天井効果)を反映していると考察している。
臨床的意味・日本への含意
日本では、体外受精の胚移植において形態評価が広く用いられている一方、PGT-Aの実施には一定の制約があり、施設や周期によっては利用できない場合も少なくない。こうした状況で、AIによる胚評価は、遺伝学的検査を実施できない場面での胚の優先順位づけを補助する手段として位置づけられる可能性がある。
ただし今回の結果が示すのは、AIスコアが『正数性である確率が高い胚』をある程度絞り込めるという点であって、個々の胚について正数性か異数性かを診断できるわけではないという点である。臨床現場では、AIスコアを『この胚なら必ず正常』と読み替えるのではなく、複数の候補胚がある場合の優先順位づけを補助する参考情報の一つとして扱う必要がある。どのAIを採用するかによって優先される胚が変わりうることから、使用するアルゴリズムの選定や、訓練データ・検証結果の透明性も臨床導入の際の論点となる。
研究の強みと限界
この研究の強みは、単一施設内で標準化された条件のもと、1000個という大規模なPGT-A済み胚盤胞を用い、6種類の市販AIを同一データセットで直接比較した点にある。従来、個々のAIの性能は別々の研究・データセットで報告されることが多く、AI間の直接比較は限られていた。
一方で限界もある。後ろ向き・単一施設の研究であり、施設ごとに異なる培養条件や患者背景の影響は考慮されておらず、他施設への一般化には注意が必要である。外部データセットによる検証を伴わない単一データセットでの評価であり、過学習の可能性も否定できない。Algorithm A以外は正数性予測ではなく着床能・生存能力の予測を目的に開発されたもので、今回用いた『メーカー推奨の閾値』による分類指標は正数性の判別用に設計されたものではない。さらにAI間の順位一致度は中程度にとどまり、臨床判断が使用するアルゴリズムによって左右されうることを意味している。市販AIの多くはアルゴリズムの詳細や訓練データが非公開である点も、再現性の検証を難しくしている。
おわりに
今回の検討は、1000個のPGT-A済み胚盤胞を用いて6種類の市販AIの染色体正数性に対する判別能を直接比較したものである。いずれもAUC 0.73前後という『中程度』で横並びの判別能を示し、従来の形態評価(AUC 0.613)を上回った一方、単独で正数性・異数性を確実に見分けられる水準には至らなかった。AI間の胚順位の一致度は中程度にとどまり、使用するアルゴリズムによって優先される胚が異なりうることも示された。正数性胚に限定した移植後の着床・出産・流産といった転帰については、いずれのAIスコアも予測力を示さなかった。
今後は、複数施設・前向きデザインによる外部検証に加え、AIによる形態動態情報とcfDNAによる非侵襲的遺伝学的検査、培養液のメタボローム解析など異なる種類の情報を組み合わせた統合的なアプローチが、単独のAIが抱える性能の天井を超えられるかが、今後の検討課題として位置づけられている。
参考文献
1. Giménez-Rodríguez, C., Caparrós López-Battú, B., Bori, L., Bellver, J., Remohí, J.A., Meseguer, M.『Head-to-head comparison of six commercial artificial intelligence algorithms for embryo ploidy risk stratification in 1000 PGT-A-tested blastocysts』Reprod Biomed Online 2026;53(4):105865. doi:10.1016/j.rbmo.2026.105865.
2. Bamford, T., Barrie, A., Montgomery, S., et al.『Morphological and morphokinetic associations with aneuploidy: a systematic review and meta-analysis』Hum Reprod Update 2022;28:656-686.
3. Diakiw, S.M., Hall, J.M.M., VerMilyea, M.D., et al.『Development of an artificial intelligence model for predicting the likelihood of human embryo euploidy based on blastocyst images from multiple imaging systems during IVF』Hum Reprod 2022;37:1746-1759.
4. Zaninovic, N., Sierra, J.T., Malmsten, J.E., Rosenwaks, Z.『Embryo ranking agreement between embryologists and artificial intelligence algorithms』F S Sci 2024;5:50-57.
