「多いほど良い」は本当か──黄体ホルモンの用量としきい値に投げかけられた疑問

ホルモン補充周期での凍結融解胚移植(HRT-FET)では、着床と妊娠の維持を助けるために黄体ホルモン(プロゲステロン)の補充が広く行われています。近年は、経腟プロゲステロン製剤の投与量や、移植当日の血中プロゲステロン濃度が着床率や生児獲得率にどう関わるかを検証し、「最適な用量」や「望ましい血中濃度のしきい値」を示そうとする研究が増えています。個別化された黄体期サポートを実現する手がかりとして、臨床的な関心は高い領域です。

一方で、後ろ向き(観察的)に集められたデータから「この用量が良い」「この数値を超えると成績が良い」といった結論を導く際には、統計学的な落とし穴が少なくありません。2026年に発表された、日本人患者を対象とした後ろ向き研究は、黄体ホルモンの用量と移植当日の血中濃度が高いほど、着床率や生児獲得率を含む生殖予後が良好であったと結論づけました。

この結論の妥当性を方法論の観点から検証した批評論文が、同じReproductive Medicine and Biology誌に2026年に掲載されています(DOI: 10.1002/rmb2.70088)。研究デザインのどこに注意が必要とされたのか、丁寧に読み解きます。

方法──何を、どう比較した研究だったのか

批評の対象となった研究は、2017年から2022年にかけて実施された後ろ向きコホート研究です。患者は、製品の情報提供を受けたうえで、自身が使用する経腟プロゲステロン製剤を選択していました。日本国内では現在4種類の経腟プロゲステロン製剤が使用可能ですが、この研究で解析されたのは3種類の用量レジメン、P(90)、P(300)、P(800)のみで、残る1製剤(P600)は解析対象から除外されており、その理由は明示されていません。

移植当日の血中プロゲステロン濃度は、製剤ごとに定められたタイミングで単回測定されていました。具体的には、ある製剤群では投与から6時間後、別の製剤群では投与直後に採血が行われています。得られたデータをもとにROC解析が行われ、Youden indexにより13.1 ng/mLという「至適カットオフ値」が導かれました。

予測精度AUC 0.54──「ほぼコイントス」という指摘

批評論文がまず問題視したのは、この13.1 ng/mLという数値がどれほど臨床的な判断に使えるかという点です。ROC解析で得られた血中プロゲステロン濃度のAUC(曲線下面積)は0.54(95% CI 0.51〜0.58)にとどまりました。AUCは0.5でランダムな予測(コインを投げるのと同程度の的中率)、1.0で完全な予測に相当する指標であり、0.54という値は偶然による判別をわずかに上回る程度に過ぎないと指摘されています。統計的に有意な関連があることと、臨床現場で意味のある予測力を持つことは、必ずしもイコールではないというのが、批評の核心にある論点です。

さらに、このカットオフ値は同一のデータセットの中で算出(derive)と評価(evaluate)の両方が行われていました。同じデータから「境目」を決め、その境目で対象を2群に分けて比較する手法は、データに最も都合よく当てはまる数値を選び出してしまう「オーバーフィッティング(過剰適合)」を招きやすく、外部のデータセットや、リサンプリングなどの内部検証を経ない限り、この13.1 ng/mLという値が別の集団でも再現されるかどうかは分からないとされています。

なぜ「用量」だけを比べられないのか──剤形という壁

用量そのものの比較にも、慎重さが求められると指摘されています。解析対象となった3つのレジメンは、用量が異なるだけでなく、ゲル剤、腟錠、カプセル剤という異なる剤形でもありました。剤形が違えば吸収動態(薬物動態)も異なるため、P(90)とP(300)、P(800)のあいだで観察された差が、用量そのものの効果なのか、剤形固有の薬物動態や投与回数、採血タイミング、患者の服薬遵守(アドヒアランス)の違いによるものなのかを、切り分けることは容易ではありません。

加えて、血中プロゲステロン濃度は日内変動や個人差が大きいことが知られているにもかかわらず、測定は単回のみでした。プロゲステロンは自宅で自己投与されており、実際の投与時刻を診療の中で正確に確認することは難しいため、想定されたタイミングからのずれが、測定値やしきい値による群分けに影響した可能性も残ります。

見えない交絡因子──2022年の保険適用という時代背景

研究期間は2017年から2022年に及びますが、この間の2022年4月に、日本では生殖補助医療(ART)が公的医療保険の適用対象となりました。この制度変更は、患者がどの治療にアクセスしやすくなるか、どの製剤を選好するか、臨床現場での治療パターンにまで影響しうる出来事です。実際、論文中でも時期によって使用される製剤の傾向に変化が見られたことが示されていますが、暦年や保険適用の前後という時間的な要因は、追加の共変量や感度分析として考慮されていなかったと指摘されています。

治療法の選択が患者自身に委ねられていた(ランダムに割り付けられていない)ことに加え、多変量回帰モデルに含める共変量が、明確な因果推論の枠組み(有向非巡回グラフなど)に基づいて選ばれた形跡がない点も、あわせて指摘されています。重要な交絡因子が見落とされていないか、あるいは調整すべきでない変数まで調整されていないかが不明なままでは、観察された関連を「プロゲステロンの効果」と因果的に解釈することには限界があるとされています。

臨床的意味・日本への含意

日本では、ホルモン補充周期での凍結胚移植において、複数の経腟プロゲステロン製剤が選択可能であり、用量や血中濃度をどう扱うかは、日々の黄体期管理に直結する実務的な関心事です。臨床現場では、こうした観察研究で示された「用量が多いほど良い」「血中濃度がこの値を超えれば良好」といった単純化されたメッセージが、そのまま治療方針に取り入れられるリスクがあります。今回の批評が示すように、記述的な比較・予測モデル・因果推論という異なる目的が整理されないまま提示された数値は、臨床判断の根拠としては慎重に扱う必要があると考えられます。特定の血中濃度をターゲットに用量を調整するという発想自体は理解しやすいものですが、その根拠となる閾値の妥当性は、追試や前向き研究による検証を経て初めて確立されるものです。

研究の強みと限界

批評の対象となった研究の強みは、日常診療で得られたリアルワールドデータをもとに、経腟プロゲステロン製剤の用量と血中濃度、生殖予後の関係という臨床上重要な問いに取り組んだ点にあります。一方で、今回の批評論文が指摘するように、研究目的(記述・予測・因果)が明確に切り分けられていない点、非ランダムな治療割り付け、交絡因子調整の枠組みの欠如、保険制度変更という時代背景への未対応、一部製剤の除外理由の不明確さ、単回測定という限界、そして同一データセットでの閾値の導出と評価という方法論上の課題が、結論の一般化可能性を制約しています。なお、この批評論文の著者らは元論文の対象となった製剤とは異なる製薬会社の従業員であり、研究資金も同社から提供されている点は、論文中に利益相反として開示されています。

おわりに

今回取り上げた批評論文は、黄体期サポートの個別化という重要な臨床課題に一石を投じた元論文に対し、記述的知見と予測・因果的主張を区別すること、そして観察データから導かれた「しきい値」を過大評価しないことの重要性を、あらためて示すものといえます。血中プロゲステロン濃度のAUCが0.54にとどまったという事実は、現時点でこの指標を用量調整の唯一の判断材料とすることの限界を物語っています。批評論文の結論が述べるとおり、現段階のデータは仮説を生み出す段階(探索的)にあり、特定の血中濃度しきい値や用量に基づく臨床戦略を支持する確証的なエビデンスとまではいえません。標準化されたプロゲステロンモニタリングと独立した検証コホートを備えた前向き研究の蓄積が、今後の課題として残されています。

参考文献

1. Sekiguchi, M., A. Ito, Y. Katagiri, et al. 『Micronized Vaginal Progesterone Dose and Serum Progesterone Thresholds Determine Reproductive Outcomes in Frozen–Thawed Embryo Transfer With Hormone Replacement Therapy』Reproductive Medicine and Biology 25 (2026): e70039.

2. Wu, I.-H., J.-E. Schwarze, C. Helwig, T. D’Hooghe, and I. Schellschmidt. 『Clinical Appraisal of “Micronized Vaginal Progesterone Dose and Serum Progesterone Thresholds Determine Reproductive Outcomes in Frozen–Thawed Embryo Transfer With Hormone Replacement Therapy”』Reproductive Medicine and Biology 25 (2026): e70088. doi:10.1002/rmb2.70088.

3. Mansournia, M. A., and M. Nazemipour. 『Recommendations for Accurate Reporting in Medical Research Statistics』Lancet 403, no. 10427 (2024): 611–612. doi:10.1016/S0140-6736(24)00139-9.

4. Schwarze, J. E., P. W. G. Tennant, K. Barnhart, et al. 『Recommendation to Improve the Rigor and Impact of Nonrandomized Studies of Interventions in Fertility Treatment Research』Fertility and Sterility 124, no. 4 (2025): 749–758. doi:10.1016/j.fertnstert.2025.05.168.

5. Kuroda, K., S. C. Jwa, H. Shirasawa, M. Harada, Y. Osuga, and M. Yamada. 『Nationwide Survey on the Transition of Treatment Protocols After the Introduction of Insurance Coverage for Assisted Reproductive Technology in Japan: The IZANAMI Project』Journal of Obstetrics and Gynaecology Research 51, no. 2 (2025): e16234. doi:10.1111/jog.16234.

6. Shiba, R., M. Kinutani, S. Okano, R. Kawano, and Y. Kikkawa. 『Efficacy of Four Vaginal Progesterones for Luteal Phase Support in Frozen-Thawed Embryo Transfer Cycles: A Randomized Clinical Trial』Reproductive Medicine and Biology 19, no. 1 (2019): 42–49. doi:10.1002/rmb2.12300.

凍結の“腕前”を、機械に譲れるか──胚培養士のわざを試す臨床試験

体外受精・胚移植において、胚や卵子を凍結保存する技術は生殖補助医療(ART)の根幹を支えています。中でも急速冷却によってガラス化させる「ガラス化保存(ビトリフィケーション)」法は、細胞内に氷結晶ができるのを防ぎ、融解後の高い生存率と良好な妊娠成績をもたらすことから、緩慢凍結法に代わる標準的な手法として世界的に定着しています。

ただし、この技術の成否は依然として胚培養士の手技に大きく依存しています。代表的な手法であるCryotop法では、濃度の異なる複数の凍結保護剤(CPA)溶液に、胚を決められた時間内で順に浸していく必要があり、多段階かつ労働集約的な作業です。手技の熟練度によって結果にばらつきが生じやすく、標準化を難しくしてきました。半自動化システムの開発も進んできましたが、既存の装置は検査室への組み込みや処理能力の面で課題を抱え、普及は限定的でした。

こうした背景のもと、ハイドロゲルを用いた新しい半自動ガラス化保存システム(Biorocks社、中国)の臨床的な有効性と安全性を検証するための研究計画が、BMJ Open誌(2026年)に発表されました(doi:10.1136/bmjopen-2025-114988)。この論文はまだ結果を報告するものではなく、これから実施される多施設共同無作為化比較試験(RCT)と、出産までを追う延長追跡研究の設計そのものを示すプロトコル論文です。何を、どう調べようとしているのかを読み解きます。

“手作業のわざ”を、ジェルとタイマーに置き換える

このシステムは、標準的なART作業台に組み込める小型の装置と、基質、最大3本の容器を保持するホルダー、Cryotopと同サイズで胚を1個収める容器(オープンシステム)、そして凍結保護剤をハイドロゲルとして保持するチップの、5つの要素から構成されます。従来の液体状のCPAを用いる方式と異なり、胚は先に容器へ載せられ、その後にCPAへ曝露される仕組みになっており、CPA曝露後に胚を別の容器へ移し替える工程そのものが不要になります。CPAの負荷は自動で、あらかじめ設定された時間どおりに進みます。

胚盤胞の場合、平衡化用ゲルへの曝露はおよそ14分、ガラス化用ゲルへの曝露はおよそ60秒とされ、その後容器は液体窒素に直接投入されます。冷却速度は毎分およそ3万1900℃、昇温速度は毎分およそ2万4700℃に達し、1台の装置は4つの独立したチャンネルを持ち、最大12本の容器を同時に処理できます。人の手技に依存してきた工程を、ゲルとタイマーによる自動制御に置き換えることが、このシステムの狙いです。

176人を2群に分け、“劣らないか”を確かめる

検証の枠組みは、多施設共同・並行群間・1対1割り付けの無作為化比較試験です。中国の4施設(南京鼓楼医院、空軍軍医大学第二付属医院、深圳市妇幼保健院、広東省妇幼保健院)で、20歳から39歳、BMI 18〜30、体外受精‐胚移植(IVF-ET)または顕微授精(ICSI)の適応があり、培養5日目または6日目にガードナー分類でステージ3以上かつ内細胞塊・栄養外胚葉のグレードがC以外の良好胚盤胞が得られた女性176人(各群88人)が組み入れられます。参加者は新しい半自動システム群と、Cryotop法(Kitazato社、日本)を用いる対照群のいずれかに無作為に割り付けられます。

主要評価項目は、融解後の胚盤胞生存率です。融解1〜2時間後に細胞の75%以上が保たれているか、あるいは胚盤胞が再拡張していれば「生存」と判定されます。この試験は優越性ではなく非劣性を検証する設計で、両群の生存率を97%と仮定したうえで、非劣性マージンは-10%に設定されました。2012年のAlphaコンセンサスが示す許容下限(80%)とベンチマーク(95%)を踏まえた数値です。Farrington-Manning法を用いたサンプルサイズ計算では、片側有意水準0.025、検出力80%の条件で1群あたり78人が必要と算出され、脱落率10%を見込んで合計176人(各群88人)という目標症例数が設定されました。

生存率だけでなく、着床・妊娠、出産まで追う

副次評価項目には、移植5±1週での着床率・臨床妊娠率、10+1週での継続妊娠率、早期流産率に加え、術者による装置性能の主観評価(優・良・不良)が含まれます。安全性については、装置の不具合率や、装置に関連する有害事象・重篤な有害事象の発生率が集計されます。

さらに、親試験(ChiCTR2400093517)の追跡を完了した参加者のうち、改めて同意した人を対象に、出産までを観察する多施設共同前向き延長追跡研究(ChiCTR2500109209)が計画されています。出生後42日までの生児出生率や、母体・新生児それぞれの有害事象が探索的に評価される予定です。

バイアスを減らす工夫として、参加者本人は割り付けを知らされない一方、胚培養士や技師は装置の違い上、盲検化が困難なため、主要評価項目の判定は標準化された顕微鏡画像を用い、割り付けを知らない別の評価者が行う設計になっています。保存された胚盤胞画像の中央判定も予定されています。解析対象集団はintention-to-treat原則に基づくFull Analysis Set、主要な逸脱例を除いたPer-Protocol Set、安全性解析用のSafety Setの3種類が定義され、群間比較にはχ²検定やFisherの正確検定、施設差を調整するCochran-Mantel-Haenszel検定などが用いられます。主要評価項目の欠測データは、最も保守的な「最悪値代入」で扱われる方針です。

臨床現場への含意

日本では、Cryotop法自体がKitazato社(日本)によって開発され、世界的なガラス化保存のゴールドスタンダードとして広く使われてきた経緯があります。その意味で、日本の生殖医療の現場は、今回比較対象となっている手技そのものの発祥地でもあります。胚培養士の育成には長い訓練期間が必要とされる一方、生殖医療へのニーズは拡大を続けており、手技の均質化と省力化を両立できる技術への関心は高まっています。今回の試験が示すのは結果ではなく設計段階であるため、臨床現場が判断材料とできるのは、あくまで今後公表される生存率や妊娠成績のデータが出そろってからということになります。

研究の強みと限界

強みとして、複数施設を横断した無作為化比較試験であり、主要評価項目の判定を盲検化した評価者が担う設計になっている点、非劣性マージンの設定根拠が既存のコンセンサス基準に基づいている点が挙げられます。ハイドロゲルによる自動化という発想自体、ARTの標準化を進めるうえで参考になる技術的方向性です。

一方で限界も明確です。第一に、対象は中国国内の4施設に限られており、他の民族的背景を持つ集団への一般化可能性は今後の検証課題として残ります。第二に、この論文はあくまで研究計画であり、有効性・安全性データそのものはまだ含まれていません。第三に、この臨床試験は装置の開発・製造元であるShenzhen Biorocks Biotechnology社が資金を提供しており、装置や消耗品の提供も同社が行っています。試験の運営や結果の解釈において、この資金関係は念頭に置く必要があります。第四に、延長追跡研究は親試験とは別の同意取得が必要なため、脱落による解析対象の偏りが生じる可能性があります。

おわりに

この研究は、胚培養士の手技に依存してきたガラス化保存の工程を、ハイドロゲルと自動制御によって標準化できるかを、176人規模の無作為化比較試験というかたちで検証しようとする試みです。2024年6月に開始され、2027年2月までの実施が予定されており、患者の組み入れはすでに始まっています。融解後の生存率という主要評価項目に加え、着床・妊娠・出産までを追う枠組みが用意されている点は、単なる技術的な同等性の証明にとどまらない設計といえます。今後公表される結果によって、手技に依存してきた工程がどこまで機械に置き換えられるのかが明らかになっていくものと見られます。

参考文献

1. Wang S, Chen L, Chen L, et al.『Efficacy and safety of a novel semiautomated vitrification system for human blastocysts: a study protocol for a multicentre randomised controlled device trial with a live-birth extension study』BMJ Open 2026;16:e114988. doi:10.1136/bmjopen-2025-114988

黄体補充の血中閾値は「臨床の線引き」ではない

凍結融解胚移植(FET)をホルモン補充周期(HRT)で行う場合、黄体補充としての腟用プロゲステロン製剤の使い方は、移植成績を左右する重要な因子の一つとされています。近年は腟用プロゲステロンの投与量と、実際に到達する血中プロゲステロン濃度の両方を評価し、両者を組み合わせた指標と妊娠成績との関連を検討する研究が増えています。

この分野で、腟用プロゲステロンの投与量と血中プロゲステロン濃度を組み合わせた指標が、着床や妊娠の成績と関連するという報告が2026年にReproductive Medicine and Biology誌に掲載されました。この報告には、研究デザインや統計解析の妥当性を問う批判的なコメンタリーが寄せられ、同誌に掲載されています。それに対する原著者らの再反論が、2026年8月に同誌へ掲載されました(DOI: 10.1002/rmb2.70089)。

再反論では、提案された血中プロゲステロン閾値をどう解釈すべきか、製剤ごとの薬物動態の違いをどう考慮したか、治療選択に伴う交絡やバイアスをどう扱ったかといった論点が、一つずつ整理されています。観察研究が「関連」を「因果」であるかのように語ってしまう危うさと、その歯止めをどうかけるかを考える題材として、今回はこの再反論の内容を紹介します。

何を巡る論争なのか──もとの研究とその批判

議論の出発点は、同じ研究グループが2026年に発表した原著論文です。腟用プロゲステロンの投与量と、実際に到達した血中プロゲステロン濃度を組み合わせた指標を用いて、HRT周期による凍結胚移植における着床、臨床妊娠、進行妊娠、生児獲得との関連を検討したものでした。この研究の目的は、腟用プロゲステロン投与量と達成された血中プロゲステロン濃度の組み合わせが生殖成績とどう関連するかを、大規模な実臨床コホートの中で評価することにあり、因果関係を推定する枠組みとしてではなく、臨床的に意味のある関連を確認することが主眼だったとされています。

この報告に対しては、研究が後ろ向き(レトロスペクティブ)デザインであること、残余交絡の可能性、同定された血中プロゲステロン閾値の判別能の限界、そしてこの閾値を確定的な臨床的カットオフ値として扱うべきではないという点を中心に、コメンタリーが寄せられました。

「閾値」は診断基準ではない

再反論でまず強調されているのは、コメンタリーで指摘された論点の多くが、もとの論文の考察部分ですでに認識され、限界として明記されていたという点です。同定された血中プロゲステロン閾値が過剰適合(オーバーフィッティング)を反映している可能性や、他のコホートに一般化できない可能性についても、著者らは「largely agree(おおむね同意する)」との立場を示しています。

この閾値は、あらゆる施設で通用する普遍的な臨床基準として提示されたものではなく、自施設のコホート内で生殖成績と関連する統計的な値として同定されたものだと説明されています。実際の診療でこの閾値を採用する前には、外部データによる検証と前向き研究が必要であることも、もとの論文で明記されていたとされています。

薬剤ごとに違う「効き方」

コメンタリーは、腟用プロゲステロン製剤間の薬物動態(体内でどう吸収され、どう血中濃度が推移するか)の違いと、採血タイミングのばらつきについても懸念を示していました。再反論では、この点はもとの論文の考察ですでに扱われていたとした上で、各製剤の添付文書に基づく薬物動態の情報が示されています。ルティナスとルテウムは投与開始からおよそ5日で血中濃度が安定するとされる一方、ワンクリノンは投与からおよそ6時間で血中プロゲステロン濃度がピークに達するとされています。

採血のタイミングは、薬物動態研究のプロトコールに沿ってあらかじめ標準化されたものではなく、通常の診療スケジュールに基づくものでした。ただし、それぞれの製剤の既知の薬物動態プロファイルと照らし合わせると、採血のタイミングはおおむね臨床的に意味のある時点だったとされています。加えて、比較対象となった90mg群、300mg群、800mg群は、投与量だけでなく、腟用ゲル・腟錠・腟用カプセルという剤形そのものも異なっていました。この点はもとの論文でも明記されており、製剤の特性や投与頻度の違いがプロゲステロンの吸収や血中濃度に影響しうるため、投与量単独の効果を切り分けることは難しいと説明されています。

したがって、今回の知見は、製剤から独立した「純粋な用量効果」を示すものではなく、投与された薬剤・到達した血中プロゲステロン濃度・製剤ごとの特性が組み合わさった、実臨床における総合的な影響を反映したものと位置づけられています。

患者が「選ぶ」処方

この研究の対象施設では、患者に各製剤の特徴(投与頻度、アプリケーターの有無、想定される腟分泌物の特徴など)を説明した上で、患者自身が希望する製剤を選択する運用が取られていました。この説明の根拠の一つとして、日本国内で実施されたランダム化比較試験が挙げられています。4種類の腟用プロゲステロン製剤について、凍結融解胚移植周期での黄体補充としての有効性を比較したこの試験では、製剤間に有意差は認められなかったと報告されています。

一方で、同一製剤内での用量依存的な生殖成績の改善を報告した先行研究も存在するため、製剤の特性を考慮しつつも、プロゲステロンの投与量そのものが血中濃度や生殖成績に寄与している可能性は完全には否定できないとされています。また、プロゲステロンは自宅で自己投与されるため、実際の投与タイミングを客観的に検証することはできませんでした。この点による測定誤差がどの方向に、どの程度生じたかは特定できないと、限界として述べられています。

なお600mg群は、データ収集後に除外されたわけではなく、投与頻度が多くアプリケーターも付属しないため選択する患者が少なく、統計的な比較に十分な症例数が確保できなかったために、90mg・300mg・800mgの3群を中心とした解析になったと説明されています。

ランダム化されていない治療割り付けをどう見るか

コメンタリーは、治療割り付けがランダム化されていないことによる交換可能性(エクスチェンジャビリティ)や治療選択バイアスの問題も指摘していました。再反論では、製剤の選択が、標準化された説明を受けた上での患者の希望に基づくものであり、予後に関わる臨床的要因によって医師側が意図的に割り付けたものではないという点が示されています。この処方の運用そのものが、治療割り付けが予後の見込みによって系統的に決められていた可能性を小さくする、という主張です。ただし、残余の選択バイアスを完全に排除できるわけではないことも認められています。

また、共変量の選択や、DAG(有向非巡回グラフ)に基づく因果推論の枠組みを用いるべきだという指摘に対しては、この研究が因果効果の推定を目的として設計されたものではないことが改めて説明されています。共変量は、確立された臨床的関連性とこれまでの報告に基づいて選ばれたものであり、多変量調整後も、投与量と血中プロゲステロン濃度を組み合わせた分類は、着床、臨床妊娠、進行妊娠、生児獲得のいずれに対しても独立した予測因子であり続けたとされています。交換可能性・正値性(ポジティビティ)・一致性(コンシステンシー)といった因果推論の前提は、正式な枠組みの中で検証されたわけではなく、臨床的知見に基づく丁寧な共変量調整と、限界の透明な報告によってバイアスの最小化が図られたと位置づけられています。

保険適用という「時代の変化」をどう織り込むか

日本では2022年4月に生殖補助医療(ART)への公的医療保険の適用が始まり、患者層や診療パターンが変化した可能性が指摘されていました。この点についても、著者らは保険適用の影響を否定していません。ただし、今回報告された投与量・血中プロゲステロン濃度・生殖成績の関連や、それに近い血中プロゲステロン閾値は、保険適用が始まる前に実施された院内の中間解析ですでに観察されており、2023年の日本産科婦人科学会学術講演会でも報告されていたと説明されています。保険適用前後の解析で一貫した関連が見られたことは、今回の知見が保険制度の変化だけでは説明できないことを示唆するものとされています。

研究の強みと限界

再反論全体を通じて示されているのは、後ろ向き観察研究としての限界を著者ら自身が繰り返し認めている姿勢です。デザインが後ろ向きであること、残余交絡の可能性を排除できないこと、治療選択がランダム化されていないこと、比較対象の群が投与量だけでなく剤形の違いも含んでいること、投与タイミングを客観的に検証できないこと、そして因果推論のための前提が正式には検証されていないことが、限界として明記されています。

一方で、多変量調整後も指標が生殖成績の独立した予測因子であり続けたこと、保険適用前後で一貫した関連が確認されたことは、この知見が単純な偶然や交絡だけでは説明しにくいことを支持する材料として位置づけられています。

日本の生殖医療における含意

日本の臨床現場では、凍結融解胚移植における黄体補充として複数の腟用プロゲステロン製剤が使用されており、その選択は薬物動態研究のプロトコールに基づいてではなく、投与頻度やアプリケーターの有無、患者の希望といった実務的な要因によって行われることが少なくありません。今回の再反論が示すように、投与量と血中プロゲステロン濃度を組み合わせた指標は生殖成績と関連する可能性がある一方で、それ自体を診療上の一律のカットオフ値として採用するには、外部コホートでの検証や前向き試験が必要とされています。

血中プロゲステロン濃度のモニタリングと個別化された黄体補充の在り方は、現時点ではなお発展途上の領域であり、臨床現場での運用は、今回のような観察研究の限界を踏まえた慎重な解釈のもとで検討される必要があります。

おわりに

再反論は、コメンタリーで指摘された論点の多くがもとの論文ですでに認識・記載されていたことを確認しつつ、今回の知見をあくまで探索的な観察上の関連として位置づけ、因果効果の推定として提示するものではないと結論づけています。示された関連や血中プロゲステロン閾値は仮説を生み出すための材料であり、HRT周期による凍結融解胚移植における黄体補充の個別化や血中プロゲステロンモニタリングを検討する、今後の前向き研究の土台になることが期待されるとされています。

参考文献

1. A. Ito, M. Sekiguchi, and Y. Katagiri.『Authors’ Response to the Commentary on “Micronized Vaginal Progesterone Dose and Serum Progesterone Thresholds Determine Reproductive Outcomes in Frozen–Thawed Embryo Transfer With Hormone Replacement Therapy”』Reproductive Medicine and Biology 2026;25(1):e70089. doi:10.1002/rmb2.70089

2. I.-H. Wu, J.-E. Schwarze, C. Helwig, T. D’Hooghe, and I. Schellschmidt.『Clinical Appraisal of “Micronized Vaginal Progesterone Dose and Serum Progesterone Thresholds Determine Reproductive Outcomes in Frozen-Thawed Embryo Transfer With Hormone Replacement Therapy”』Reproductive Medicine and Biology 2026;25(1):e70088. doi:10.1002/rmb2.70088

3. M. Sekiguchi, A. Ito, Y. Katagiri, et al.『Micronized Vaginal Progesterone Dose and Serum Progesterone Thresholds Determine Reproductive Outcomes in Frozen–Thawed Embryo Transfer With Hormone Replacement Therapy』Reproductive Medicine and Biology 2026;25(1):e70039. doi:10.1002/rmb2.70039

4. Ferring Pharmaceutical Co., Ltd.『ルティナス腟錠 添付文書』(2023). https://pins.japic.or.jp/pdf/newPINS/00063184.pdf

5. ASKA Pharmaceutical Co., Ltd.『ルテウム腟用坐剤 添付文書』(2022). https://pins.japic.or.jp/pdf/newPINS/00066286.pdf

6. Merck Biopharma Co., Ltd.『ワンクリノン腟用ゲル 添付文書』(2025).

7. R. Shiba, M. Kinutani, S. Okano, R. Kawano, and Y. Kikkawa.『Efficacy of Four Vaginal Progesterones for Luteal Phase Support in Frozen-Thawed Embryo Transfer Cycles: A Randomized Clinical Trial』Reproductive Medicine and Biology 2020;19(1):42–49.

8. B. Alsbjerg, N. P. Polyzos, H. O. Elbaek, B. B. Povlsen, C. Y. Andersen, and P. Humaidan.『Increasing Vaginal Progesterone Gel Supplementation After Frozen-Thawed Embryo Transfer Significantly Increases the Delivery Rate』Reproductive Biomedicine Online 2013;26(2):133–137.

9. Y. Enatsu, N. Enatsu, K. Kishi, et al.『Effectiveness of High-Dose Transvaginal Progesterone Supplementation for Women Who Are Undergoing a Frozen-Thawed Embryo Transfer』Reproductive Medicine and Biology 2018;17(3):242–248.

10. A. Ito, S. C. Jwa, A. Kuwahara, et al.『Impact of Health Insurance Coverage for Assisted Reproductive Technology on Multiple Embryo Transfers and Multiple Pregnancies in Japan』Journal of Obstetrics and Gynaecology Research 2025;51(4):e16304.

男性不妊、5つのガイドラインはどこで食い違うか

不妊はカップルにとって身近な問題であり、生涯のうちに妊娠のしづらさを経験する成人は世界で約17.5%にのぼるとされ、その半数近くには男性側の要因が関与していると報告されています。男性不妊は生殖そのものの問題にとどまらず、内分泌・代謝・遺伝・環境といった要因と結びついた、全身の健康状態を映す指標としても注目されるようになっています。

こうした背景のもと、男性不妊の評価・管理については、米国泌尿器科学会/米国生殖医学会(AUA/ASRM)、欧州泌尿器科学会(EAU)、欧州ヒト生殖医学会(ESHRE)、英国国立医療技術評価機構(NICE)などが、それぞれ独自にガイドラインを策定してきました。対象とする医療環境や重視する視点が異なるため、推奨内容には少なからぬ差が生じています。

こうしたなかで2025年、WHOが不妊症に関する新たな包括的ガイドラインを公表しました。従来のWHO文書が主に精液検査の標準化を扱ってきたのに対し、今回は予防から診断・治療までを含みます。この男性不妊に関する部分を、既存の4つの主要ガイドラインと比較した論文が、Andrology誌(2026年)に掲載されました(doi:10.1111/andr.70369)。5つのガイドラインは、どこで一致し、どこで食い違っているのでしょうか。

方法──5つのガイドラインを、共通の枠組みで比較した

この比較分析は、WHOガイドラインを基準点として、AUA/ASRM、EAU、ESHRE、NICEの最新版と照らし合わせる形で行われました。比較の対象領域は、予防、初期評価、診断検査、管理の4つです。

3つの思想モデル──公衆衛生、専門医療、カップル中心

5つのガイドラインは、大きく3つの思想モデルに分類できます。第一は、WHOガイドラインに代表される「世界的な公衆衛生モデル」です。医療資源に大きな差がある多様な医療システムに適用できる最低限の標準を目指し、PICO形式の設問とGRADEという手法に基づく体系的なエビデンス評価に加え、実行可能性・公平性・受容性を考慮する評価から意思決定(EtD)というプロセスを組み込んでいる点が特徴です。

第二は、AUA/ASRMおよびEAUに代表される「専門医療モデル」です。micro-TESEなどにアクセスできる専門医を主な対象とし、内分泌評価・遺伝学的検査・治療選択肢について詳細な推奨を提供します。第三は、ESHREおよびNICEに代表される「カップル中心モデル」で、男性不妊をカップル全体の評価の一部として位置づけ、男性に特化した診療経路は相対的に簡素です。

WHOだけが持つ「予防」という発想

WHOガイドラインの特徴の一つは、予防を診断・治療と並ぶ不妊ケアの柱として位置づけていることです。喫煙や性感染症への対応、禁煙支援や早期治療を重要な予防策として掲げるほか、飲酒・体重・食事・身体活動に関する低コストな生活指導も、多様な医療環境で実施可能な取り組みとして推奨しています。AUA/ASRMやEAUガイドラインでも予防への言及はありますが、独立した領域ではなく臨床評価のなかで間接的に触れられるにとどまり、ESHREやNICEも男性不妊に特化した予防指針は設けていません。

精液検査は「1回でいい」のか、「2回必要」なのか

診断面での明確な相違点の一つが、精液検査の運用方針です。AUA/ASRMおよびEAUガイドラインは、生物学的なばらつきを考慮して原則2回以上の実施を推奨する一方、WHOガイドラインは、基準範囲内であれば1回で足りるとし、異常時のみ11週間以上あけて再検査するという簡略化された方針を採用しています。これは、不必要な検査の繰り返しが医療資源の負担につながりやすい環境への配慮を反映したものです。ホルモン検査・遺伝学的検査・画像検査も、WHOガイドラインでは初期評価に含めず、専門施設での二次評価として扱われています。

抗酸化剤――「使われているのに、推奨できない」

男性不妊の経験的治療として世界的に広く用いられているのが、抗酸化サプリメントです。精子の膜機能・運動率・DNA損傷への酸化ストレスの関与という生物学的根拠があり、低コストで副作用が少ないという印象もあり、コホートによっては不妊男性の40〜50%以上が抗酸化剤に曝露されています。しかし研究デザインの多様性や、出生率のような意味のある指標の報告不足から、臨床効果は依然として不確かです。この限界を踏まえ、WHOガイドラインは「推奨も非推奨もしない」という中立の立場を取っています。

精索静脈瘤(バリコセル)――WHOが唯一「治療」に踏み込んだ疾患

精索静脈瘤(バリコセル)は、男性不妊の原因のなかでもっともよく知られ、治療可能性が高いとされる疾患です。一般男性人口の約15%に、原発性不妊の男性では35〜40%に、続発性不妊ではさらに高い頻度で認められます。WHOガイドラインは、女性パートナーの生殖能に問題がないカップルで、触知可能な(臨床的な)精索静脈瘤と精液所見の異常がある場合に治療を提案しています(条件付き推奨、低い確実性)。一方、画像検査でのみ確認される非触知性(潜在性)の精索静脈瘤は、治療を行わないよう明記しています。

治療法は手術・血管内治療のいずれも許容され、地域の専門性や医療資源、患者の希望に応じた選択が認められています。術式は、再発率・合併症率が低いとされる顕微鏡下手術が優先されつつ、利用できない環境では鼠径部法や後腹膜法も許容されます。触知可能な精索静脈瘤の治療という結論自体はAUA/ASRM・EAUとも一致しており、5つのガイドラインのなかでもっとも合意が得られている領域です。

WHOガイドラインが触れていないもの

WHOガイドラインの範囲は意図的に絞り込まれており、高度な精子機能検査、内分泌療法、詳細な遺伝学的評価、micro-TESEといった、専門的な男性不妊診療で重視される領域の多くは対象外です。これは臨床的重要性が低いことを意味するのではなく、GRADE・PICOという厳格な方法論のもとで、世界的に適用可能な水準のエビデンスを満たす領域が、現時点では抗酸化剤治療と精索静脈瘤治療の2つに限られていたことを反映しています。

臨床的意味・日本への含意

日本では生殖医療専門施設へのアクセスや検査体制が比較的整っており、診療の実態はAUA/ASRMやEAUの専門医療モデルに近い部分が少なくありません。一方で、WHOガイドラインが重視する禁煙支援や性感染症対策、簡潔な初期評価の考え方は、専門施設への紹介前のプライマリケアでトリアージの指針として参考になり得ます。抗酸化剤療法への中立姿勢は日本の診療現場にも共通する課題を浮かび上がらせ、精索静脈瘤の適応基準も、既存の実践を国際的な文脈で裏づける材料となります。

研究の強みと限界

この比較分析の強みは、WHOガイドラインを既存の4つのガイドラインと体系的に照らし合わせ、その位置づけと独自性を明確にした点にあります。一方で、男性不妊領域のエビデンス基盤自体が、小規模な研究や意味のあるアウトカムの報告不足によって特徴づけられ、いずれのガイドラインでも多くの推奨が低い、あるいは非常に低い確実性のエビデンスに基づいています。本分析自体もガイドライン間の記載を整理した総説であり、個々の推奨の妥当性を検証するものではない点にも留意が必要です。

おわりに

WHOによる2025年の不妊ガイドラインは、既存の専門学会ガイドラインを置き換えるものではなく、それらを補完する公衆衛生志向の新しい枠組みです。男性不妊領域における意義は、網羅的な専門的指針を示すことではなく、予防・構造化された臨床評価・厳選された介入を軸に、世界的に適用可能な最低限の標準を確立した点にあります。高度な専門医療を前提とするAUA/ASRMやEAU、カップル中心のESHREやNICEとは異なるアプローチであり、互いに補完し合う文書として理解することが求められます。今後は、エビデンスの強化とあわせ、公衆衛生の枠組みと専門臨床実践との調和が課題として残されています。

参考文献

1. Achermann, A. P. P., T. A. Pereira, and S. C. Esteves.『Male Infertility in the 2025 WHO Infertility Guideline: A Comparative Analysis With AUA/ASRM, EAU, ESHRE, and NICE Recommendations』Andrology 2026;0:1–14. doi:10.1111/andr.70369.

2. Mburu, G., N. Santesso, R. Brignardello-Petersen, et al.『Recommendations From the WHO Guideline for the Prevention, Diagnosis, and Treatment of Infertility』Human Reproduction 2026;41(1):25–38. doi:10.1093/humrep/deaf212.

3. Brannigan, R. E., L. Hermanson, J. Kaczmarek, S. K. Kim, E. Kirkby, and C. Tanrikut.『Updates to Male Infertility: AUA/ASRM Guideline (2024)』Journal of Urology 2024:789–799. doi:10.1097/ju.0000000000004180.

4. Schlegel, P. N., M. Sigman, B. Collura, et al.『Diagnosis and Treatment of Infertility in Men: AUA/ASRM Guideline Part I』Fertility and Sterility 2021;115(1):54–61. doi:10.1016/j.fertnstert.2020.11.015.

5. Minhas, S., L. Boeri, P. Capogrosso, et al.『European Association of Urology Guidelines on Male Sexual and Reproductive Health: 2025 Update on Male Infertility』European Urology 2025;87(5):601–616. doi:10.1016/j.eururo.2025.02.026.

6. Romualdi, D., B. Ata, S. Bhattacharya, et al.『Evidence-Based Guideline: Unexplained Infertility』Human Reproduction 2023;38(10):1881–1890. doi:10.1093/humrep/dead150.

7. National Institute for Health and Care Excellence (NICE).『Fertility Problems: Assessment and Treatment』NICE, 2017(2020年版).

8. Eisenberg, M. L., S. C. Esteves, D. J. Lamb, et al.『Male Infertility』Nature Reviews Disease Primers 2023;9(1):49. doi:10.1038/s41572-023-00459-w.

9. Esteves, S. C., C. J. De Jonge, A. Pacey, and M. H. Vazquez-Levin.『The 2025 WHO Infertility Guideline: Value in Focusing on Clinical Varicocele and Recognizing Gaps in Male Diagnosis and Treatment』Human Reproduction 2026;41(3):314–318. doi:10.1093/humrep/deaf251.

10. WHO.『WHO Laboratory Manual for the Examination and Processing of Human Semen』6th ed. WHO, 2021.

胚移植前の「ひと工夫」は成功率を上げるか──コクランの評価

体外受精(IVF)の治療周期において、胚移植(ET)は培養した胚を子宮内に届ける最終段階にあたります。腟から子宮頸管を通してカテーテルを挿入し、胚を注入するこの工程は、IVFの中でもっとも単純な手技とされる一方、成功を左右する最も重要な局面でもあり、胚移植に至った周期のうち妊娠が成立するのはおよそ3分の1にとどまるとされています。

妊娠率を少しでも高めるため、臨床現場では満膀胱下での胚移植、頸管粘液の除去、カテーテルを子宮内に留置してから胚を注入する「アフターローディング」など、さまざまな準備手技が取り入れられてきました。追加費用を伴う「アドオン治療」として提供されることも少なくありませんが、その有効性を裏づける根拠がどこまで確立しているのかは明らかではありませんでした。

こうした準備手技が実際に成功率を高め、合併症を減らすのかを検証したコクラン・レビューが、Cochrane Database of Systematic Reviews誌2026年第8号に掲載されました(DOI: 10.1002/14651858.CD007682.pub3)。2009年発表のレビューを、2025年10月までの検索で更新した最新版です。

方法──満膀胱、粘液除去、アフターローディングを検証した11件のRCT

今回の更新では、CENTRAL、MEDLINE、Embase、PsycINFOなどを2025年10月6日まで検索し、1829件の文献から46件の全文を精査したうえで、最終的に11件のRCT(13報)が組み入れられました。対象は、いずれもIVF治療を受け胚移植の段階に達した女性です。

対象となった手技は3つに分類されます。子宮頸管角度をまっすぐにする方法として満膀胱下での胚移植(2件)。頸管・子宮内膜の準備として頸管粘液の除去(2件)、頸管内洗浄、子宮腔の培養液洗浄、頸管拡張。頸管を通過させる技術としてアフターローディングと直接的な胚移植を比較した研究(2件)です。カテーテルの種類や超音波ガイドなどは、別のコクラン・レビューの対象です。

エビデンスの確実性はGRADEアプローチで、バイアスリスクはCochrane RoB2ツールでアウトカムごとに評価されました。11件のうち10件がメタアナリシスの対象となり、研究全体で合計3095人がランダム化されています。要旨で示された主要な3つの比較(満膀胱、粘液除去、アフターローディング)に限ると、対象は6件の研究、1341人でした。

満膀胱にしても、妊娠率は変わらなかった

子宮頸管角度をまっすぐにする目的で満膀胱下での胚移植を行う手技は、カテーテル操作を容易にするとして広く推奨されてきました。しかし、イタリアとイギリスの2件のRCT(273人)を統合した結果、満膀胱下での胚移植は空の膀胱での胚移植と比べて妊娠率に明確な差をもたらしませんでした(リスク比[RR] 1.01、95%信頼区間[CI] 0.69〜1.48、非常に低い確実性のエビデンス)。妊娠喪失率も1件(131人)でRR 0.96(95% CI 0.43〜2.14)と差はなく、移送の難しさも1件(142人)でRR 0.41(95% CI 0.16〜1.08)と、数値上は減る傾向はあるものの、信頼区間が1をまたいでおり確実な効果とは言えませんでした。出生率や有害事象を報告した研究はありませんでした。

粘液を取り除いても、妊娠率に差はなし

頸管粘液は胚移植の妨げになる可能性があるとされ、頸管粘液の除去は米国生殖医学会(ASRM)のガイドラインでも推奨されてきた手技です。しかし、アルゼンチンとオランダの2件のRCTでは、いずれも明確な利益は示されませんでした。

出生率については、オランダの研究(周期単位)で、粘液除去群が220周期中52件、対照群が205周期中42件と報告されています(低い確実性のエビデンス)。妊娠率は、アルゼンチンの研究(97人)でRR 1.02(95% CI 0.58〜1.80)、オランダの研究では220周期中65件と205周期中63件で、いずれも明確な差は認められませんでした。両研究は解析単位が異なるため統合されていませんが、合わせて低い確実性のエビデンスです。妊娠喪失率も220周期中15件と205周期中20件で大きな差はなく、移送の難しさを報告した研究はありませんでした。

アフターローディングは「移送の難しさ」を減らすか

アフターローディングは、カテーテルの外筒だけを先に子宮内へ留置し、位置を確認したうえで胚を入れた内筒に差し替える手技です。子宮内膜への物理的な負担を抑えられる可能性があるとされ、スペインとイタリアの2件のRCT(654人)で妊娠率が検討されました。結果は、アフターローディング群と直接胚移植群のあいだで妊娠率に明確な差はありませんでした(RR 1.09、95% CI 0.91〜1.31、低い確実性のエビデンス)。妊娠喪失率も1件(352人)でRR 1.13(95% CI 0.59〜2.13)と、明確な差は確認されませんでした。

一方、移送の難しさについては1件(352人)でアフターローディング群のほうが減る可能性が示されました(RR 0.25、95% CI 0.15〜0.41、非常に低い確実性のエビデンス)。もう1件では0(最も難しい)から10(難しさなし)のスケールでアフターローディング群9.54、直接移植群9.52とほとんど差がないと報告されています。妊娠率や妊娠喪失率への明確な利益は確認されない一方、手技上の難しさを減らす可能性がある、という位置づけです。

頸管拡張は出生率を上げたが、子宮腔洗浄は妊娠率を下げた

要旨の主要な3比較には含まれていませんが、本文ではその他の手技も報告されています。ギリシャ・ベルギーの1件(288人)では、頸管拡張を行った群で出生率が高い結果が示されました(RR 1.80、95% CI 1.20〜2.71、低い確実性のエビデンス)。ただし、妊娠率(2件、506人、RR 1.30、95% CI 0.76〜2.21)や妊娠喪失率(1件、288人、RR 1.56、95% CI 0.52〜4.64)では明確な差は認められていません。

さらに注目されるのは、カナダ・アメリカの1件(240人)で、子宮腔を培養液で洗浄した群のほうが妊娠率が低いという結果が示された点です(RR 0.59、95% CI 0.42〜0.83、非常に低い確実性のエビデンス)。単一の小規模な研究であり、この結果だけで洗浄を避けるべきとは結論づけられません。頸管内洗浄も2件(437人)を統合した結果、妊娠率に明確な差はありませんでした(RR 0.88、95% CI 0.64〜1.20)。

臨床的意味・日本への含意

日本では、今回のレビューに組み入れられた11件のRCTのうち1件が国内で実施されており、頸管内洗浄を検証した内容でした。国内の生殖医療施設でも、満膀胱下での胚移植や頸管粘液の除去、アフターローディングといった手技は、比較的取り入れやすい「ひと工夫」として広く行われていると考えられます。しかし今回のレビューが示したのは、これらの多くで妊娠率や出生率を明確に高める根拠は乏しいという結果でした。

臨床現場では、こうした手技を「害はないだろう」という前提で継続する判断もありえますが、子宮腔洗浄の例のように妊娠率を下げる方向に働く可能性を示すデータもあり、追加の手技が常に無害とは限らない点には留意が必要です。アフターローディングは移送の難しさを軽減する可能性が示唆されており、移植困難例では選択肢のひとつとして検討する余地があります。ただし、いずれの手技についても有害事象や新生児予後を報告した研究は含まれておらず、安全性の判断材料は限定的です。

研究の強みと限界

今回のレビューの強みは、11件のRCTすべてにCochrane RoB2ツールでアウトカムごとの個別バイアスリスク評価を行い、GRADEアプローチで確実性を系統的に格付けした点にあります。検索は2025年10月まで更新され、2009年版に新たに3件の研究(4報)が追加されています。

一方で限界も少なくありません。組み入れられた研究の多くは小規模で、無作為化の手順や追跡不能例の取り扱いが不明瞭など方法論上の課題が共通していました。盲検化は手技の性質上ほとんどの研究で困難で、ほぼすべてのアウトカムが「低い」または「非常に低い」確実性のエビデンスにとどまっています。研究はいずれも高所得国・高中所得国で実施されており、低所得国への一般化には注意が必要です。有害事象や新生児予後のデータが皆無であることも大きな空白です。

Human Reproduction Update誌に2022年に掲載された胚移植最適化に関する包括的なレビューでも、同様のエビデンスの空白が指摘されています。また、Journal of Assisted Reproduction and Genetics誌に2023年掲載の8189件の後方視的研究では、アフターローディングで移植困難の割合が26.85%から9.06%に減少し(P<0.001)、臨床妊娠率もわずかに改善した(41.65%から44.69%、P=0.017)と報告されています。RCTに基づく今回のレビューと観察研究の知見を単純比較はできませんが、移植の難しさを軽減する可能性を示す点で共通しています。

おわりに

今回のコクラン・レビューでは、満膀胱下での胚移植、頸管粘液の除去、アフターローディングという3つの主要な準備手技について、いずれも妊娠率や出生率を明確に高める根拠は得られませんでした。アフターローディングは移送の難しさを軽減する可能性、頸管拡張は出生率を高める可能性がそれぞれ示唆されていますが、いずれも低い、または非常に低い確実性のエビデンスにとどまっています。3件の新規研究が追加された今回の更新でも、結論そのものに変化はありませんでした。今後は、無作為化の手順を明確に記述し、アウトカム評価者を盲検化した、より大規模で質の高いRCTの実施が求められています。

参考文献

1. Yamaji N, Akino R, Sasayama K, Yamamoto M, Brown J, Miyamoto S, Noma H, Ota E, Hasegawa T, Farquhar C.『Techniques for preparation prior to embryo transfer.』Cochrane Database of Systematic Reviews 2026;Issue 8:CD007682. doi:10.1002/14651858.CD007682.pub3.

2. Tyler B, Walford H, Tamblyn J, Keay SD, Mavrelos D, Yasmin E, et al.『Interventions to optimize embryo transfer in women undergoing assisted conception: a comprehensive systematic review and meta-analyses.』Human Reproduction Update 2022;28(4):480-500. doi:10.1093/humupd/dmac009.

3. Federico C, Valentina I, Camilla R, Teresa C, Emanuela M, Elena A, et al.『Steps forward in embryo transfer technique: a retrospective study comparing direct versus afterload catheters at different time frames.』Journal of Assisted Reproduction and Genetics 2023;40(12):2895-902. doi:10.1007/s10815-023-02957-y.

男性不妊をどう診るか──韓国発の診療指針

不妊に悩むカップルのうち、男性側の要因が関わる例はおよそ半数に上るとされています。にもかかわらず、臨床の経路は歴史的に女性側の評価と生殖補助医療(ART)に重点を置いて構築されてきました。この不均衡は、治療可能・改善可能な男性側の病態の発見を遅らせ、男性に焦点を当てた介入によって結果を最適化する機会を逃す一因になってきたと指摘されています。

近年は国際的にも、男性不妊のガイドラインが相次いで改訂されています。米国泌尿器科学会・米国生殖医学会(AUA/ASRM)は2024年に、欧州泌尿器科学会(EAU)は2025年に、それぞれ男性不妊の管理指針を更新しました。オーストラリアでは初の男性不妊エビデンスベースガイドラインが、カナダでは無精子症に特化した診療指針が公表され、Global Andrology Forum(GAF)も非閉塞性無精子症・精索静脈瘤・精子DNA断片化についてデルファイ法とGRADEに基づく声明を発表しています。

こうした国際的な蓄積を自国の医療制度に落とし込む試みとして、韓国性医学・アンドロロジー学会(KSSMA)診療指針委員会がまとめた診療勧告が、World Journal of Men’s Health誌に2026年7月23日にオンライン先行公開されました(doi:10.5534/wjmh.260149)。診断の枠組みはすでに別稿で扱われており、この文書は「治療」に的を絞っている点が特徴です。ARTへ移行する目安を「3〜6か月」という具体的な時間軸で示すなど、保険制度や社会背景を踏まえた実装志向の勧告になっています。

方法──国際指針をどう束ねたか

委員会は、Population-Intervention-Comparator-Outcomes(PICO)フレームワークを用い、(1)非侵襲的な一般管理、(2)是正可能な男性因子(精索静脈瘤や射精障害など)、(3)無精子症管理、(4)精子DNA断片化などの補助的・新興領域という4領域に臨床課題を整理しました。中核となるエビデンス源は、AUA/ASRM 2024年版、EAU 2025年版、オーストラリア・カナダの各ガイドライン、GAFの各声明、そして韓国国内のART登録データです。これに加え、2024年1月から2025年12月までに発表されたランダム化比較試験とシステマティックレビューをPubMed、Embase、Cochrane Libraryで検索し、用語の統一にはWHO第6版精液検査マニュアルを参照しています。ガイドライン間で結論が分かれる場合(精子DNA断片化検査の選択的実施や、非閉塞性無精子症におけるホルモン前処置の是非など)には、対象集団の違い、アウトカムの優先順位、エビデンスの確実性、韓国での実装可能性(顕微鏡下手術の専門性、ARTへのアクセス、保険償還体制)という4つの観点から委員会が直接検討したとされています。

「まず生活習慣、それから薬」──6つの一般原則

一般原則として提示された6つの推奨(表1)のうち、最も強い推奨(Strong)とされたのは、女性パートナーの年齢・卵巣予備能を治療計画に組み込み、ARTへの移行が遅れないよう再評価の時期をあらかじめ定めるカップル単位の管理、手術・精子回収・ARTなど主要な選択肢についてベネフィット・不確実性・合併症・費用・機会費用(ARTへの遅れ)を説明したうえでの共有意思決定、喫煙・肥満・陰嚢の熱曝露(ノートパソコンを膝上で使う習慣など)といった修正可能な危険因子への対応を基盤に据えること、そして妊娠を望む男性への外因性テストステロン投与を避けることの4点です。中程度の推奨(Moderate)としては、是正可能な病態をARTだけに頼る前に狙い撃ちする病因指向の管理と、異常な精液所見のある男性全員に一律の薬物療法を行うのではなく、内分泌学的な表現型に応じて期間を区切った治療として試みることが挙げられています。この「3〜6か月」という時間軸は、精子形成に要する周期がおよそ74日であることや、精索静脈瘤修復や薬物療法による精液所見の改善の多くがこの期間内に現れるという臨床的観察に基づいています。

疾患別に見る治療の分かれ道──精索静脈瘤から無精子症まで

精索静脈瘤については、触知可能な精索静脈瘤と異常な精液所見があり、女性パートナーの妊孕性が良好で治療後の再評価に時間的余裕がある場合には、修復術の実施を検討するとされています(推奨度:中)。画像検査でのみ検出される無症候性(subclinical)の精索静脈瘤については、定期的な治療を行わないことが強く推奨されています。非閉塞性無精子症(NOA)に精索静脈瘤を合併する場合の扱いは条件付きとされ、エビデンスの限界と精子回収・ART開始の遅れという機会費用について十分な説明を行ったうえで、選択的に修復を検討するとされています。ただし、EAU 2025年版が引用する直近のメタ解析では、臨床的精索静脈瘤を伴うNOA男性において、修復術後の精子回収率(SRR)がオッズ比2.65という形で改善したとの報告があり、高品質な対照データはなお限られるものの、無視できない知見として位置づけられています。

内分泌異常のうち、視床下部・下垂体性性腺機能低下症(HH)ではhCG単独またはFSH併用による精子形成誘導が標準治療として強く推奨されています。肥満関連の機能性性腺機能低下症では、生活習慣・併存疾患の最適化を土台としつつ、選択的エストロゲン受容体モジュレーター(SERM、クロミフェンなど)やアロマターゼ阻害薬(レトロゾールなど)を用いた表現型指向の薬物療法を、期間を区切った試みとして検討するとされています。

閉塞性無精子症(OA)では、顕微鏡下による閉塞解除の再建術と、手術的精子回収(SSR)にICSIを組み合わせる方法のいずれもが妥当な選択肢とされ、閉塞部位、女性パートナーの年齢・卵巣予備能、希望する子どもの人数、施設の専門性や費用・アクセスによって個別に選択することが強く推奨されています。非閉塞性無精子症(NOA)では、専門性のある施設では顕微鏡下精巣内精子採取術(micro-TESE)を優先した標準化されたSSR計画が強く推奨される一方、臨床試験外での未実証の「実験的」介入は避けるべきとされています。

ARTとの接点──ICSIは「全員に」ではなく「必要な人に」

近年の大規模ランダム化比較試験の蓄積は、重度の男性因子不妊を伴わないカップルにおいては、卵細胞質内精子注入法(ICSI)を一律に行っても、通常の体外受精(IVF)と比べて累積生児出生率が改善しないことを一貫して示しています。Lancet誌に2024年に報告された多施設共同・非盲検ランダム化比較試験や、Nature Medicine誌に2025年に報告されたランダム化比較試験がその代表例です。この知見を踏まえ、指針はルーチンのICSI使用を強く推奨せず、ICSIは重度の男性因子、過去の受精不全や著しく不良な受精、極めて少ない精子数、手術的に採取された精子を用いる場合など、明確な適応がある場合に限定するよう求めています。人工授精(IUI)を継続するかどうかの判断では、総運動精子数(TMSC)を女性パートナーの年齢や卵巣予備能とあわせて評価し、あらかじめ「何周期まで」という中止基準を定めておくことが推奨されています。胚移植に関しては、多胎妊娠の予防を明示的に説明の対象とし、個々の予後に応じた移植個数の選択を行うことが強く推奨されています。

フォローアップについては、精液所見には個体内変動が大きいことから、少なくとも2回の精液検査を行い、単回の測定ではなく経時的な傾向で解釈することが強く推奨されています。再検査の間隔は精子形成周期(おおむね2〜3か月)に合わせることが一般的とされ、精索静脈瘤修復後の精液所見改善は多くのコホートで術後3か月ごろまでに現れ、6か月以降の追加的な改善は限定的とされています。指針が繰り返し強調しているのは、精液所見の改善そのものを最終目標にせず、妊娠・生児出生・治療負担といった患者にとって重要なアウトカムを追跡の中心に据えるべきだという点です。

日本の生殖医療の現場への含意

日本では、2022年4月から体外受精・顕微授精を含む生殖補助医療が公的医療保険の適用対象となり、保険適用の拡大という政策的転換をすでに経験しています。合計特殊出生率の低さや第一子出産時の母親年齢の高さといった人口動態上の課題も、韓国とかなりの部分で重なります。今回の指針が示す「女性パートナーが35歳以上であれば男性因子単独の治療期間を短縮し、40歳以上であれば男性側の最適化を理由にARTの開始を遅らせない」という時間軸の設計は、日本の診療現場でも参照しうる考え方です。診察室で用いられる「何か月様子を見るか」という判断は経験則に委ねられがちですが、精子形成周期という生物学的な根拠と、女性側の生殖可能年齢という制約の双方から時間軸を導く発想は、カップル単位での意思決定を支える枠組みとして応用可能と考えられます。また、ルーチンICSIを避けて適応を絞り込む方針や、精液所見の改善ではなく生児出生を追跡の主眼に据える考え方も、施設ごとに運用の幅がある生殖医療の現場において、標準化の参考になり得ると位置づけられます。

研究の強みと限界

この文書の強みは、複数の高品質な国際ガイドラインを統合したうえで、PICOフレームワークに基づく明確な臨床課題設定と、GRADEのEvidence to Decisionフレームワークを用いた透明性の高い合意形成プロセスを備えている点にあります。利益相反の開示と、関連する利益相反を持つ委員の投票除外という手続きも取られています。一方で限界も明記されています。韓国国内の大規模臨床試験が特定領域(精索静脈瘤、無精子症など)で乏しいため、国内エビデンスの多くは系統的な文献検索ではなく、専門家のコンセンサスと全国登録データの分析に基づいています。また、非閉塞性無精子症におけるホルモン前処置のように、エビデンスの確実性が非常に低い領域では、推奨は条件付き(conditional)にとどまり、今後のエビデンス更新に応じた改訂が予定されています。抗酸化サプリメントについても、Cochraneレビューが妊娠・生児出生率の改善の可能性を示唆する一方、エビデンスの確実性は低い、または非常に低いと評価されており、中核的な治療ではなく選択的な補助療法として位置づけられています。

おわりに

男性不妊の管理は、病因に応じて、カップル単位で、時間を意識しながら、そして全身の健康にも目を向けて行われるべきものであり、その成否は精液所見の変化そのものではなく、妊娠・生児出生や治療負担といった患者にとって重要なアウトカムによって測られるべきだと結論づけられています。国際的なガイドラインの潮流を踏まえつつ、保険制度や法制度、社会的背景といった国内事情に落とし込む作業は、他国の生殖医療体制を考えるうえでも一つの参照点になり得ます。今後は紹介体制や検査の標準化、アウトカム報告の統一、全国規模のデータ連携を進めることで、地域のエビデンスと資源の状況に応じた継続的な改訂が見込まれています。

参考文献

1. Moon YJ, Jeong JY, Shim KH, Kang DH, Jung HD, Lee DS, Song SH, Park HJ, Lee JY; Korean Society for Sexual Medicine and Andrology Clinical Practice Guideline Committee.『Clinical Recommendations for the Management of Male Infertility: A Consensus from the Korean Society for Sexual Medicine and Andrology (KSSMA) Clinical Practice Guideline Committee』World J Mens Health. Published online Jul 23, 2026. doi:10.5534/wjmh.260149.

2. Minhas S, Boeri L, Capogrosso P, Cocci A, Corona G, Dinkelman-Smit M, et al.『European Association of Urology guidelines on male sexual and reproductive health: 2025 update on male infertility』Eur Urol 2025;87:601-616.

3. Wang Y, Li R, Yang R, Zheng D, Zeng L, Lian Y, et al.『Intracytoplasmic sperm injection versus conventional in-vitro fertilisation for couples with infertility with non-severe male factor: a multicentre, open-label, randomised controlled trial』Lancet 2024;403:924-934.

4. Berntsen S, Zedeler A, Nøhr B, Rønn Petersen M, Grøndahl ML, Andersen LF, et al.『IVF versus ICSI in patients without severe male factor infertility: a randomized clinical trial』Nat Med 2025;31:1939-1948.

5. Lee D, Seong ME, Chang HJ, Choi YS, Lim HJ, Choi Y, et al.『Assisted reproductive technology trends in Korea: annual report for 2022』Clin Exp Reprod Med 2025;52:299-309.

「その臨床試験、本当に行われたのか」──RCTの信頼性を数字で見抜く手法

無作為化比較試験(RCT)は治療効果を評価するうえでの標準的な手法とされ、系統的レビューやメタ解析、そして診療ガイドラインの根拠として広く用いられています。従来、査読を経て雑誌に掲載された研究は、その質(研究デザインの妥当性)にばらつきがあっても、少なくとも実際にデータが取得されたことは前提とされてきました。しかし近年、この前提そのものが揺らいでいます。

研究が実際には行われず、結果が捏造されているという可能性を、査読者や編集者が日常的に検討してこなかったことが指摘されるようになりました。データが操作・改ざん・捏造されている場合だけでなく、方法論上の欠陥によって誤った結果が生じている場合も含め、こうした「信頼できないデータ」をどう見分けるかが、研究公正性(research integrity)をめぐる重要な課題として浮上しています。

この課題に対し、Reproductive Biology and Endocrinology誌(2026年)に、査読済み・公表済みのRCTデータの信頼性を評価する方法論を整理した総説が掲載されました。チェックリストによる評価、集計データや個票データの統計的解析、そして人工知能(AI)を用いたツールという3つのアプローチが取り上げられています(doi:10.1186/s12958-026-01583-4)。

どれほど深刻な問題なのか

この総説が引用する2020年の検証では、Anaesthesia誌に2017年2月から2020年3月までに投稿された526件のRCTが対象とされました。このうち個票データ(IPD)が入手できた153件では、44%に明らかな虚偽データが含まれ、26%は結果の信頼性が著しく低く「致命的な欠陥がある」あるいは「ゾンビ試験」と判定されるレベルでした。個票データが得られない場合でも、集計データのみの解析で14%のRCTに虚偽データが確認されています。

生殖医療分野に関する検証もあります。同一施設に所属する2名の著者が主導した女性の健康に関する35件のRCTを対象とした2020年の研究では、26件の試験でベースライン特性やアウトカムに、無作為化の結果としては説明のつかない、同一あるいは不自然に類似した数値が多数見つかりました。こうした信頼性の確認できないRCTがメタ解析に取り込まれることで、エビデンスの土台自体が歪み、最終的には診療ガイドラインの内容にまで影響が及ぶ可能性が指摘されています。

信頼性チェックリストという発想

RCTの信頼性を評価するための複数のチェックリストが提案されています。早期の例であるREAPPRAISEDは、研究のガバナンスや倫理、著者情報、生産性、盗用、研究の実施、画像操作、統計とデータ、誤りといった11のカテゴリー、54項目の質問を通じて懸念点を洗い出す仕組みです。

RCTに特化したチェックリストとしてTRACTがあり、ガバナンス、著者群、介入の実施可能性、時間的整合性、脱落率、ベースライン特性、アウトカムの7領域について、各項目を「懸念なし」「一部懸念あり/該当なし」「重大な懸念あり」の3段階で評価します。同様の目的を持つツールとして、コクラン妊娠・出産グループが開発した信頼性スクリーニングツール(CPC-TST)もあり、これを18件の公表済みコクランレビューに適用したところ、6件のレビューで結果に重要な差異が生じたことが報告されています。

研究整合性評価(RIA)ツールは、イベルメクチンに関するコクランのCOVID-19レビューを更新する作業の中で開発され、実際の適用によって最初の更新時に40%を超える試験が除外される結果となりました。撤回論文や明白な「危険信号」の有無をまず確認する設計になっており、系統的レビューやメタ解析から不正な研究を迅速に除外するための「前さばき」として位置づけられています。

もっとも新しく、もっとも包括的とされるのがINSPECT-SRです。透明性のあるプロトコルと正式なデルファイ法を経て開発され、4領域21項目のチェック項目と、系統的レビューでの標準的な運用のための手引きを備えています。あるPCOS(多嚢胞性卵巣症候群)診療ガイドラインの根拠となった研究群にTRACTを応用した枠組みを適用したところ、101件中45件が信頼性に問題ありと判定された例も報告されています。ただし、こうしたチェックリストはいずれもまだ広く普及するには至っておらず、評価にかかる時間の長さが一因とされています。

「有意差なし」の裏に隠れた有意差──統計的な見抜き方

無作為化が適切に行われていれば、群間のベースライン特性を比較したp値は、理論上0から1までの一様分布に従うはずです。この統計的性質を利用した検証手法は、最初にこの手法を適用した研究者の名にちなんで「カーライル法」と呼ばれています。

実例として、クロミフェンクエン酸塩による黄体形成ホルモン(LH)サージ抑制効果を検討したある人工授精(IUI)のRCTでは、群間のベースライン特性の比較が「統計学的に有意差なし」と報告されていました。しかし総説の著者らが再計算したところ、年齢のp値は0.0306、不妊期間とBMIのp値はいずれも0.001未満と、明確な有意差が存在することが判明しました。この結果は計算または報告上の誤りを示すだけでなく、無作為化の過程そのものに疑義を投げかけるものであり、当該論文には出版社による「懸念表明(Expression of Concern)」が付されるに至っています。

表と表のあいだで数値が不自然に一致する「データの使い回し」を見抜く手法も紹介されています。同一の著者グループによる2本の論文で、複数の表にまたがって小数点以下まで一致する数値が多数見つかった事例について、同じ研究デザインとデータ収集方法を模した5万組のデータセットをシミュレーションしたところ、そこまでの一致は一度も再現されませんでした。同じ分布から抽出した標本で平均値や標準偏差が偶然一致する頻度は、極めて低いことが分かっています。

このほか、末尾の桁の分布が理論上の一様分布から外れていないかを調べる手法、報告された平均値が整数データの標本サイズとして数学的に成立し得るかを確認するGRIM検定、標準偏差の妥当性を確認するGRIMMER検定、丸められた数値から想定される検定統計量の範囲を計算するRIVETS検定など、複数の統計的チェック手法が体系的に整理されています。

個票データが変える検出力

集計データだけでなく、参加者一人ひとりの生データ(個票データ、IPD)にアクセスできれば、検証の幅は大きく広がります。IPDが利用できる場合、問題のある研究の検出率が最大で40%向上するとされています。

IPDの信頼性を評価するために開発されたIPD Integrity Toolは、研究レベルの13項目とIPD特有の18項目、合計31項目からなり、IPD特有の項目は不自然なデータパターン、ベースライン特性の問題、期待される相関の欠如、日付の矛盾、割り付けパターン、内部・外部の不整合、データの妥当性という8領域に分類されています。年齢と身長のように本来正の相関が期待される変数間の相関の有無を確認したり、無作為化された参加者の登録が時系列上不自然な偏りを示していないかを、ラン検定などの統計的手法で確認したりする項目が含まれます。

今後は、このツールを発展させたINSPECT-IPDというチェックリストの整備も進められており、7領域68項目のチェック項目がプレプリントとして公開されています。

AIは10分で「怪しさ」を見抜けるか

生成AIや大規模言語モデル(LLM)は、研究公正性の分野において両面的な存在です。労力のかかる作業を効率化する助けになる一方で、いわゆる「ペーパーミル」による捏造論文の大量生産を、かつてない速度で可能にしてしまった側面もあります。

臨床試験論文の信頼性評価にAIを活用する試みを検討したある総説は、16本の論文で紹介された17種類のツールを比較し、AIは「疑わしさ」の有無を検出することには長けているものの、実際の調査に着手する前には人間による検証が必要だと結論づけています。

総説の著者らが構築したプロトタイプソフトウェアでは、GPT-4oを用いてPDFから表データを自動抽出し、信頼性チェックを行う一連の流れを試みています。10論文・35個の表からなる検証セットでのデータ抽出精度(F1スコア)は、GPT-4で0.748、Qwen2.5で0.949でした。TRACTチェックリストの19項目についてLLMと人間の評価者の一致度を比べたところ、平均して19項目中14項目で一致が見られ、所要時間は1論文あたりLLMで約10分、人手による評価では約75分と、大幅な時間短縮が示されています。ただし、文献データベースなど外部情報との照合が必要な項目では、LLMの精度は相対的に低い結果でした。

がん研究領域のペーパーミル検出を目的に、オーストラリアとフランスの共同研究チームが開発したBERTモデルでは、ペーパーミル由来の論文と正規のがん研究論文を判別する精度が0.91(551件中502件が正しく分類)、感度0.87(276件中239件のペーパーミル論文を正しく検出)、特異度0.96(275件中263件の正規論文を正しく識別)という結果でした。がん研究に関する既存文献260万件に適用したところ、9.87%がペーパーミル由来の可能性ありと判定され、こうした論文は大手出版社を含む幅広い雑誌に及んでいました。このモデルは現在、大手出版社3誌のオンライン投稿システムに実装され、がん関連原稿のスクリーニングに使われ始めています。

日本の生殖医療研究にとっての意味

今回取り上げられた統計的検証手法の実例には、クロミフェンクエン酸塩やN-アセチルシステインの効果を検討したRCT、PCOS診療ガイドラインの根拠論文など、生殖医療領域の研究が複数含まれています。生殖医療は比較的少数の研究者・施設群による多施設共同研究やメタ解析への依存度が高く、系統的レビューやガイドライン策定の場面で、個々のRCTの信頼性が結果全体を左右しやすい領域のひとつと言えます。

日本の生殖医療の臨床現場や研究者にとっても、国内外の診療ガイドラインが海外のRCTやメタ解析を根拠としている以上、その根拠となる一次研究の信頼性は無関係ではありません。系統的レビューやガイドライン作成に関わる研究者にとっては、TRACTやINSPECT-SRのようなチェックリストの存在を知り、必要に応じて活用することが今後重要になっていくと考えられます。臨床現場で個々の論文を評価する際にも、ベースライン表のp値がすべて「有意差なし」とされている場合や、複数の論文間で数値が不自然に一致している場合には、それが単なる偶然ではない可能性を念頭に置く視点が参考になります。

この総説の限界

この総説自体は特定の研究デザインを検証した実証研究ではなく、既存の手法やツールを整理した総説であるという性質上の限界があります。紹介されている多くのツールは、数十件から数百件規模の論文集団での検証にとどまっており、研究者らが指摘するような「数十万件規模のゾンビ試験」が文献データベース全体に存在するとされる規模感には、まだ届いていません。

また、信頼性チェックツールを公開することが、かえって不正を働く側に「検出を逃れる方法」を学習させてしまうのではないかという懸念も紹介されています。チェックを通過する必要が生じること自体が不正のハードルを上げるとする反論もありますが、この点はツールの設計と運用のあり方次第で結果が変わりうる、今後の検証を要する論点です。

おわりに

今回の総説は、査読済みのRCTであっても「実際にデータが取得された」という前提を無条件に置くべきではないという問題意識のもと、チェックリスト、統計的手法、AIという3つのアプローチを整理したものです。ベースライン特性のp値分布や末尾桁の偏り、表間の不自然な数値の一致といった統計的な手がかりに加え、個票データへのアクセスやAIによる自動化が、信頼性評価の精度と効率をともに高める方向に進みつつあることが示されました。こうした手法が系統的レビューやガイドライン作成の現場に組み込まれていくことで、フェイクデータに基づいた誤った臨床的結論が広がるリスクを、今後どこまで抑えられるかが注目されます。

参考文献

1. Gurrin LC, Au N, Nielsen J, Brown NJL, Hunter KE, Mol BW. Methods to assess trustworthiness of data from peer-reviewed, published randomised controlled trials. Reprod Biol Endocrinol 2026 (Article in Press). doi:10.1186/s12958-026-01583-4.

「調整済み」って何?──IVF研究の回帰分析をやさしく解く

体外受精(IVF)研究において、治療成績を比較する論文の多くは「調整済みオッズ比」や「多変量回帰分析」といった表現を伴っています。年齢や卵巣予備能、胚の質など、複数の要因が同時に妊娠成績に影響するため、これらを数量的に整理する手法として回帰分析が広く用いられてきました。一方で、論文に書かれている内容と、臨床現場でその結果を読み解く医師や患者との間には、しばしば理解のギャップが存在します。「調整済み」という言葉が具体的に何を意味するのか、共変量・交絡変数・媒介変数・合流点といった専門用語がそれぞれ何を指すのかは、必ずしも明確に共有されているわけではありません。

こうした背景のもと、Reproductive BioMedicine Online誌(2026年)に、回帰分析の考え方を臨床医向けに整理した総説が掲載されました。回帰分析で何が答えられ、何が答えられないのか、「調整済み」という結果が実際に意味するところは何か、そして結果をどのように慎重に解釈すべきかを扱った内容です。

回帰分析とは、そもそも何をしているのか

「回帰(regression)」という語は、19世紀後半にフランシス・ゴルトンが観察した「平均への回帰」という現象に由来します。極端に高い、あるいは低い測定値が、次の世代ではより平均値に近づくというこの観察から出発し、統計学者たちはやがて、ある変数が別の変数とどのように関係するかを記述する手法へと発展させていきました。これが現在の回帰分析です。

IVF研究における回帰分析は、年齢、抗ミュラー管ホルモン(AMH)濃度、治療プロトコルの選択といった要因が、生児出生率や臨床妊娠率などの成績とどのように関連するかを、他の要因の影響を考慮したうえで数量化するために用いられます。複数の要因を同時に扱える点が、単純な2群比較とは異なる特徴です。ただし、回帰分析が示すのはあくまで「関連」であり、「因果関係」ではありません。モデルが調整できるのは、正確に測定され、適切にモデルへ組み込まれた要因に限られ、記録されなかった要因や測定の不正確な要因は、結果に影響を与え続けます。

「調整済み」は「群が同等になった」という意味ではない

IVF研究で最も多用されるのが、群間のベースラインの違いを調整する目的での回帰分析です。片方の群がより若く、卵巣予備能が高い、といった臨床的な理由による違いを、測定された要因についてはある程度考慮できます。

しかし、この使い方は同時に最も誤解されやすい部分でもあります。「調整済み」という結果を、群がすでに完全に均質になったかのように読み取ってしまう例は少なくありませんが、実際には調整はモデルに含まれ、正確に測定された変数についてしか機能しません。重要な要因が記録されていなかったり、測定が不正確であったり、モデルから省かれていたりすれば、調整後の推定値にも偏りが残り得ます。ランダム化比較試験が「ゴールドスタンダード」とされ続けている理由は、ランダム化が既知・未知を問わず要因のバランスを取るための、最も信頼性の高い設計上の手段だからです。

交絡・媒介・合流点──同じ「調整」でも意味が違う

回帰モデルに含まれる、主な曝露(exposure)以外の変数は、まとめて「共変量(covariate)」と呼ばれます。ただし、すべての共変量が「交絡変数(confounder)」というわけではありません。

交絡変数とは、曝露と結果の両方に関連する変数です。例えば卵巣予備能は、どの治療プロトコルが選ばれるかにも、生児出生率にも影響し得ます。卵巣予備能をモデルに含めなければ、プロトコルの効果に見える部分の一部が、実際には卵巣予備能の違いを反映している可能性があります。

一方、「媒介変数(mediator)」は、曝露から結果への経路上に位置する変数です。例えば治療プロトコルが採卵数に影響し、採卵数が生児出生に影響するとすれば、採卵数は媒介変数にあたります。プロトコルの総合的な効果を推定したい場合に媒介変数まで調整してしまうと、本来評価したい効果の一部を取り除いてしまう「過剰調整(overadjustment)」が起こり得ます。

さらに注意が必要なのが「合流点(collider)」です。合流点とは、2つの異なる変数から影響を受ける変数を指します。例えばIVFにおいて胚移植の実施は、治療プロトコルと患者の予後の両方から影響を受け得ます。移植された周期のみを対象とした解析は、この合流点によって選択バイアスが生じ、プロトコルの真の効果とは異なる推定値を示す可能性があります。「胚盤胞に到達した周期のみ」「移植された胚のみ」といった限定解析の結果は、こうした観点から慎重に解釈する必要があるとされています。

共変量はどう選ぶべきか

単変量解析で統計学的に有意だった変数だけをモデルに含める方法は広く使われていますが、限界もあります。小規模なデータセットでは真の交絡変数であっても有意にならないことがあり、P値だけを基準に除外すると偏りが生じ得ます。ステップワイズ法などの自動選択手法も、モデルを単純化できる一方、データセットによって結果が不安定になりやすいとされています。

より信頼性が高いとされるのは、事前の知識や生物学的な妥当性、研究デザインに基づいて共変量を選ぶ方法です。曝露と結果の双方に影響し得ることが知られている変数は、データ上で有意でなくても調整の候補として扱われます。変数が少なすぎれば交絡が十分に処理されず、多すぎれば推定の精度が下がり解釈が複雑になるため、臨床的な問いに真に関連する変数を選ぶことが目標とされています。

オッズ比とリスク比、数字が伝える印象は違う

出生の有無のような二値の結果には、多くの場合ロジスティック回帰が用いられ、結果はオッズ比として示されます。ここで注意が必要なのは、オッズ比が「確率の比(リスク比)」とは異なるという点です。

例えば、ある群の生児出生率が40%、別の群が30%だったとします。リスク比は0.40÷0.30=1.33で、確率としては33%高いことになります。一方、オッズはそれぞれ0.40÷0.60=0.67、0.30÷0.70=0.43となり、オッズ比は0.67÷0.43=1.56です。同じデータから計算しているにもかかわらず、オッズ比のほうが明らかに大きな数字になります。「オッズ比1.5」を「妊娠の可能性が50%高い」と読み違える例は、生殖医療領域でも頻出する解釈上の誤りとされています。理論上はわずかな差に見えても、臨床的な受け止め方には大きく影響し得ます。点推定値だけでなく、95%信頼区間の幅にも注意を払うことの重要性も指摘されています。信頼区間が広い場合、点推定値がどれほど印象的であっても、推定の精度自体は低いと考える必要があります。

クラスター構造と、機械学習との違い

多くの患者が複数回の治療周期に参加し、成績が施設ごとにまとまりを持つことがあります。この構造を無視すると、結果が実際よりも精密であるかのように見え、信頼区間が本来より狭く、P値が本来より小さく算出されることがあります。混合効果モデルや一般化推定方程式といった手法が、こうした構造を考慮するために用いられます。

近年注目される機械学習との違いも整理されています。回帰分析は「年齢が生児出生率にどう影響するか」といった、変数間の関係を説明する問いに向いている一方、機械学習は「この患者は出生に至るか」という個人単位の予測に向いているとされ、両者は異なる目的を持つ手法として位置づけられています。機械学習モデルはしばしば予測精度に優れる一方、個々の変数がどのように結果へ寄与しているかが見えにくい「ブラックボックス」になりやすいとも指摘されています。

日本の生殖医療現場にとっての意味

日本でも、IVF・ICSIに関する論文や学会報告の多くが多変量回帰分析による調整済み結果を提示しており、その解釈は診療方針の検討や患者への説明にも影響します。「調整済みオッズ比が有意だった」という記述を、群間の背景がすでに均等化されたかのように受け取ってしまう場面は、日本の臨床現場でも起こり得ます。どの変数が調整されているか、その選択が生物学的に妥当かどうかを確認する姿勢が、論文を読む際の基本的な視点として位置づけられます。また、「移植された胚のみ」「胚盤胞に到達した周期のみ」といった限定解析を紹介する場面では、選択バイアスの可能性をあわせて説明することが、患者との情報共有において有用と考えられます。

本稿の位置づけと留意点

本稿は実証研究ではなく、回帰分析の考え方を整理した解説(コメンタリー)です。そのため、特定のデータセットに基づく数値的な結論を示すものではなく、あくまで論文を読み解くための枠組みを提供するものです。共変量選択の「正解」は臨床的な文脈によって異なり、本稿で示された原則も、個々の研究デザインに応じて柔軟に適用される必要があります。また、モデルの適切性を判断する目安として、変数1つあたり少なくとも10件程度のイベント数が必要とされる点にも触れられていますが、これらはあくまで一般的な指針であり、絶対的な基準ではないとされています。

おわりに

回帰分析は、複数の要因が同時に絡み合うIVF研究において、複雑さを整理するための構造的な手段です。しかし、調整済みの結果が単純な比較よりも常に信頼できるとは限りません。回帰分析の推定値が何を意味するかは、選ばれた結果指標、含まれた変数、置かれた仮定、そしてデータの構造に左右されます。ひとつのP値が研究の全体像を語らないのと同様に、ひとつの回帰モデルも臨床的な現実のすべてを定義するものではなく、理解のための一歩として位置づけられるべきものとされています。

参考文献

1. Aktoz F, Polyzos NP, Blockeel C. Understanding regression analysis: what is inside the box? Reprod Biomed Online 2026;53(3):105800. doi:10.1016/j.rbmo.2026.105800.

2. Galton F. Regression towards mediocrity in hereditary stature. J Anthropol Inst G B Irel 1886;15:246-263.

3. Aktoz F, Blockeel C. The most ‘valuable’ letter in research: is ‘P’ over-rated or under-rated? Reprod Biomed Online 2026;52(6):105632. doi:10.1016/j.rbmo.2026.105632.

体外受精の「追加オプション」──効くのか、見合うのか

体外受精(IVF)の標準治療に上乗せする形で提供される「追加オプション」(アドオン)の利用は、世界的に広がっています。オーストラリアでは、過去3年以内にIVFを受けた女性の80%以上が、鍼治療や漢方薬、着床前染色体異数性検査(PGT-A)など、何らかの追加オプションを利用したと報告されています。背景には、1回の排卵誘発周期でわが子を迎えられる女性が全体の30%にとどまるという現実があり、患者と医師の双方が、追加オプションに希望を託す構図が生まれています。世界の生殖医療市場は2026年時点で300億ポンド規模に達すると予測されており、商業的な動機も、追加オプションの普及を後押ししてきました。

現在、臨床現場で使われている追加オプションは50種類近くにのぼり、価格は1件あたり200〜1,000ポンド(日本円でおよそ4万〜18万円)と幅があります。しかし、その効果を裏づける根拠の質は一様ではありません。欧州ヒト生殖医学会(ESHRE)や英国NICEといった主要な学会・機関がすでに追加オプションに関するガイドラインを公表していますが、これらの推奨は、根拠となるランダム化比較試験(RCT)の「信頼性」そのものを系統的に検証したものではなく、費用対効果も考慮していません。こうした課題を踏まえ、Human Fertility誌(2026年)に、追加オプションを合理的に評価するための枠組みを提案する総説が掲載されました(doi:10.1080/14647273.2026.2696818)。

提案された枠組み──信頼性チェックから始まる2段階評価

新しい枠組みは、大きく2つの段階に分かれます。第一段階は「有効性の評価」です。まず対象となる追加オプションについて、システマティックレビューの手法で文献を網羅的に検索し、その上でINSPECT-SR(INveStigating ProblEmatic Clinical Trials in Systematic Reviews)と呼ばれるツールを用いて、個々のRCTの信頼性を検証します。INSPECT-SRは、国際的な専門家パネルによって開発され、Cochraneが推奨するツールで、実施されたはずのない規模での被験者募集や、報告内容の不整合など、データの信頼性に疑義がある試験を検出することを目的としています。信頼性基準を満たさない試験は、それがどれほど魅力的な結果を示していても、メタ解析の対象から除外されます。

この手続きがどれほど結果を左右しうるかは、多嚢胞性卵巣症候群(PCOS)の国際ガイドライン改訂時の検証が示しています。信頼性基準を適用したところ、採用予定だった研究のうち45%が、あらかじめ定めた基準を満たしていなかったと報告されています。信頼性の低い試験を土台にしたメタ解析は、どれほど統計的に洗練されていても、誤った結論に導きかねません。

信頼性基準を満たしたRCTについては、通常の手順でメタ解析を行い、GRADE(Grading of Recommendations Assessment, Development and Evaluation)という枠組みを用いて、バイアスのリスクや結果の一貫性、精度などを踏まえたうえで、エビデンスの確からしさを評価します。ここまでの手続きを経て、追加オプションは「有効」「無効」「判断保留(不確実)」のいずれかに分類されます。

「生児出生率」だけでは判断を誤る

不妊治療の有効性評価では、生児出生率が「ゴールドスタンダード」とされてきました。子どもを迎えられるかどうかが患者にとっての最終的な関心事である以上、これは自然な考え方です。しかし、この総説は、生児出生率のみを基準にすることの落とし穴を指摘しています。生殖医療分野のRCTのうち、生児出生率を報告しているのはおよそ3分の1にとどまる一方、臨床妊娠率はおよそ9割の試験で報告されています。生児出生率は報告される機会自体が少ないうえ、統計的な検出力も低くなりやすく、メタ解析で有意差が出にくい構造的な弱点を抱えているとされています。

さらに、すべての追加オプションが生児出生率の上昇を目指しているわけではありません。たとえば着床前染色体異数性検査(PGT-A)は、主に流産率の低下を意図した介入です。生児出生率という単一の指標だけで判断すると、こうした介入の意義を見落とすおそれがあるため、総説は、追加オプションが標的とする生物学的な作用機序に応じて、評価する指標を選ぶ必要があると述べています。

見分け方の実例──PICSIをめぐる誤解

この点を具体的に示す例として、総説は、ヒアルロン酸によって精子を選別する技術「PICSI」に関する大規模RCT(HABSelect試験)を取り上げています。この試験では、臨床妊娠率はPICSI群とICSI群でほぼ同等でした(35.2% vs 35.7%、p=0.80)。生児出生率もPICSI群でやや高い傾向はあったものの、統計的な有意差には至りませんでした(27.4% vs 25.2%、絶対差2.2ポイント、95%信頼区間−1.1〜5.5、p=0.18)。一方、流産率はPICSI群で有意に低下していました(4.3% vs 7.0%、絶対差−2.7ポイント、95%信頼区間−4.4〜−0.9、p=0.003)。

英国のヒト受精・胚機構(HFEA)は、この結果をもとに「PICSIは有効ではない」と説明してきましたが、総説はこの解釈に疑義を呈しています。生児出生率の信頼区間には、意味のある改善に相当する値も含まれており、統計的に有意でないことは「効果がない」ことの証明ではなく、「効果の大きさが確定できない」ことを意味するにすぎません。臨床妊娠率が同等であるにもかかわらず流産率が真に低下しているなら、理論的には生児出生率も高くなるはずだという点も、総説は指摘しています。統計的有意性という一つの物差しだけで介入の価値を判断することの危うさを示す事例といえます。

費用対効果をどう計算するか

有効性が確認された、あるいは判断が保留になった追加オプションについては、次に費用対効果が検討されます。総説は、標準的なIVFで生児1人を得るための費用をおよそ27,000米ドル(または20,000英ポンド、30歳の女性を想定)とし、これを費用対効果の目安(閾値)として提案しています。追加オプション1件あたりの費用を、それによって得られる生児出生の増加分で割った値が、この閾値を下回れば、費用対効果があると判断できるという考え方です。

有効性が「不確実」なケースでも、この考え方は応用できます。たとえば540ポンドの追加オプションであれば、540÷20,000=2.7%という計算から、生児出生率を少なくとも2.7ポイント引き上げなければ、費用対効果があるとは言えないことになります。この場合、効果の信頼区間の下限がこの閾値を上回っていれば費用対効果がある可能性が高く、逆に信頼区間の上限がこの閾値を下回っていれば、費用対効果は見込みにくいと判断されます。なお、この閾値は患者の年齢や、公的医療制度か自由診療かといった条件によっても変わりうるとされています。

診断系オプションは「判定が変わった人」だけを見る

追加オプションの中には、治療そのものではなく、治療方針を決めるための検査、いわゆる診断系のオプションも含まれます。代表例が、子宮内膜受容能検査(ERA)です。総説は、この種の検査を評価する際によくある落とし穴を指摘しています。検査を受けた全員と、検査を受けなかった群の成績を単純に比較すると、多くの患者は「正常」という結果が出て治療方針が変わらないため、検査そのものの効果が薄まって見えてしまうというものです。

そのため総説は、検査結果によって実際に治療方針が変わった患者(不一致例)に絞って効果を検証する分析の重要性を強調しています。この視点は、検査結果が診療にどう影響するかを直接評価できる一方、検査を軸にした診療全体の効果を見るには、検査群と標準治療群を丸ごと比較する試験も補完的に有用だとされています。

いつ勧めるべきか──失敗後ではなく、最初から

臨床現場では、追加オプションは、これまでの治療周期がうまくいかなかった患者に対して提案されることが多いのが実情です。しかし総説は、この運用そのものに疑問を投げかけています。IVFの1周期には英国だけでもかなりの費用がかかり、低・中所得国では、年収の50〜200%に相当する負担になるとの報告もあります。すでにこれだけの投資がなされている以上、費用対効果が確認された追加オプションを見送る合理性は乏しいというのが総説の立場です。

患者の視点からも、治療が失敗した後にはじめて追加オプションが提案されると、「なぜ最初から勧めてくれなかったのか」という疑問につながりかねません。費用対効果が示された追加オプションについては、失敗を重ねてからではなく、治療の早い段階から選択肢として提示すべきだと総説は提言しています。

日本の生殖医療現場にとっての意味

日本でも、鍼治療やタイムラプスモニタリング、PGT-Aなど、多様な追加オプションが自由診療の枠組みで提供されており、その説明のあり方は施設ごとに異なります。今回の枠組みは、日本の臨床現場においても、追加オプションを患者に説明する際の考え方を整理する材料になり得ます。特に、統計的に有意でない結果が「無効」と直ちに同一視されがちな点や、費用対効果の議論が十分になされないまま追加オプションが提供されている点は、日本の生殖医療の現場でも共通する課題といえます。医師と患者のあいだで、ある追加オプションを勧める・勧めないという判断を共有する際には、単なる有意差の有無だけでなく、信頼区間の幅や費用対効果まで含めて説明することが、今後の情報提供のあり方として重要になると考えられます。

本総説の意義と留意点

本総説の意義は、追加オプションの評価に、RCTそのものの信頼性チェック、生物学的機序との整合性、費用対効果という複数の視点を統合した点にあります。一方で、留意すべき点もあります。第一に、本総説自体は新たな臨床データを提示するものではなく、既存の考え方を整理した提言であり、実際に個々の追加オプションへ枠組みを適用した検証は今後の課題として残されています。第二に、費用対効果の閾値として示された27,000米ドル(20,000英ポンド)という数値は、特定の医療制度・年齢層を前提にした推計であり、日本を含む他の医療制度にそのまま当てはめられるかは慎重な検討が必要です。第三に、追加オプションは効果の大きさだけでなく、副作用やリスク、心理的な側面も含めて評価すべきものであり、費用対効果の議論だけで実施の可否がすべて決まるわけではない点にも留意が必要です。

おわりに

この総説が示した枠組みは、RCTの信頼性を確認したうえでメタ解析を行い、生児出生率を唯一の指標とせず、診断系オプションについては治療方針が変わった患者に注目し、有効性が確認された介入については費用対効果を定量的に評価するという、一連の手順です。費用対効果が示された追加オプションは、治療の失敗を重ねてから提案するのではなく、早い段階から選択肢として提示すべきだとも提言されています。追加オプションが患者にとって本当に価値のある選択肢かどうかを見極めるうえで、今後、個々の介入にこの枠組みを当てはめた検証が積み重ねられていくことが期待されます。

参考文献

1. Hou L, Feng Q, Mazi M, Lensen S, Maheshwari A, Mol BW. Do they work, and are they worth it? Proposing a framework of evidence synthesis for guiding the evidence-based use of add-ons in in vitro fertilisation. Hum Fertil (Camb) 2026;29(1):2696818. doi:10.1080/14647273.2026.2696818.

2. Miller D, Pavitt S, Sharma V, et al. Physiological, hyaluronan-selected intracytoplasmic sperm injection for infertility treatment (HABSelect): a parallel, two-group, randomised trial. Lancet 2019;393(10170):416-422. doi:10.1016/S0140-6736(18)32989-1.

3. Feng Q, Li W, Callander EJ, Wang R, Mol BW. Applying a simplified economic evaluation approach to evaluate infertility treatments in clinical practice. Hum Reprod 2024;39(3):448-453. doi:10.1093/humrep/dead265.

4. Teede HJ, Tay CT, Laven JJE, et al. Recommendations From the 2023 International Evidence-based Guideline for the Assessment and Management of Polycystic Ovary Syndrome. J Clin Endocrinol Metab 2023;108(10):2447-2469. doi:10.1210/clinem/dgad463.