卵巣切片の卵胞を、AIが自動で数え分ける──非ヒト霊長類で示された精度と限界

卵巣に残る卵胞の数、いわゆる「卵巣予備能」の推定は、生殖医療や生殖生物学の研究において重要な指標です。しかし組織切片から卵胞を数え、発育段階ごとに分類する作業は、これまで人の目に頼る手作業で行われてきました。1つの卵巣から200〜300枚の組織切片が得られることも珍しくなく、複数の個体を対象とする研究では、その作業量は膨大なものになります。

近年、機械学習を用いて卵胞を自動的に検出・分類する試みが、マウスやラット、ヒトの卵巣組織を対象に報告されてきましたが、多くは1〜3段階程度の粗い分類にとどまっていました。より細かい発育段階を、非ヒト霊長類の卵巣全体から自動判定できるかどうかは、これまで十分に検証されていませんでした。

こうした背景のもと、Biology of Reproduction誌(2026年)に、インディアナ大学とアリゾナ州立大学、オレゴン国立霊長類研究センターの共同研究グループによる論文が掲載されました。マカク属のサルの卵巣組織を対象に、畳み込みニューラルネットワーク(CNN)を用いて卵胞を6段階の発育段階に自動分類する機械学習パイプラインを構築し、その精度を検証した内容です(doi:10.1093/biolre/ioag149)。

方法──11頭のサルの卵巣切片を、AIに学習させた

対象は、生後1.1歳から22歳までの11頭のサル(アカゲザル、カニクイザル、ニホンザル)に由来する卵巣組織切片18枚です。ヘマトキシリン・エオジン(HE)染色を施した切片を、2人の作業者がそれぞれ独立して観察し、卵胞を「原始卵胞」「移行期原始卵胞」「一次卵胞」「移行期一次卵胞」「二次卵胞」「多層卵胞」という6段階に分類してマーキングしました。作業者間で判定が食い違った箇所は照合のうえ統一され、さらに卵巣生物学の専門家による最終確認を経て、合計7,770個の卵胞のアノテーションデータが作成されました。

このデータをもとに、大規模な画像データセットで事前学習済みのCNN(ResNet34)を、転移学習という手法で再学習させました。卵胞1個ごとに200×200ピクセルの画像を切り出し、回転や反転、色調変化などの画像加工を加えることでデータを水増しし、最終的には約190万枚の学習用画像が用意されました。データは学習用・テスト用・評価用(バリデーション)の3グループに分けられ、性能が確認されました。

学習データでは98%、未知データでは72〜75%の正答率

学習に使った画像そのものに対する正答率は98%以上と極めて高い一方、モデルが学習時に見ていないテストデータでの正答率は72.4%、バリデーションデータでは75.3%でした(いずれも「卵胞なし」と判定される背景領域を除いた値)。背景領域(卵胞が写っていない部分)については、テスト・バリデーションのいずれでも99%を超える正答率で判別できていました。

段階別に見ると、誤分類の多くは「1つ隣の発育段階」との取り違えでした。たとえば一次卵胞は単独では40%程度の正答率にとどまりましたが、誤答の大部分は前後の段階(原始卵胞寄りか、二次卵胞寄りか)への振れにとどまっており、前後1段階までを正解と見なす基準で採点し直すと、いずれの段階でも90%を超える正答率になりました。原始卵胞の正答率は56〜58%とやや低めでしたが、次の段階である移行期原始卵胞と合算すると98%以上の精度になりました。研究チームは、この結果を、AIが卵胞の発育段階を連続的な順序として学習したことの表れと解釈しています。

実際に、84個の卵胞が含まれる卵巣切片1枚全体にこのモデルを適用したところ、背景領域を除いた全体の正答率は90%に達したと報告されています。過去に報告されている類似の研究(ヒト卵巣組織を対象としたもの)では、分類段階数を絞ったり原始卵胞のみに対象を限定したりする例が多く、6段階という細かい基準を卵巣全体に適用した例としては、今回が最大規模とされています。

卵巣予備能の指標としての「移行期原始卵胞」

卵巣予備能の推定には、従来、原始卵胞の数が主な指標として用いられてきました。しかし今回の研究では、原始卵胞と移行期原始卵胞を合わせた卵胞数、および移行期原始卵胞単独の卵胞数が、個体の年齢と有意な負の相関を示しました(それぞれP=0.015、P=0.018)。一方、原始卵胞単独の数は、年齢との相関が有意ではありませんでした。11頭中9頭で、原始卵胞よりも移行期原始卵胞の数のほうが多く観察されており、研究チームは、霊長類において卵巣予備能を評価する際には、原始卵胞だけでなく移行期原始卵胞も含めて考える必要がある可能性を指摘しています。ただし、この点についてはすでに別の研究者間で見解が分かれており、今後の検証が必要とされています。

日本の生殖医療研究にとっての意味

日本では、卵巣予備能の評価やがん治療後の妊孕性温存に関する研究において、動物モデルを用いた基礎データが重要な役割を果たしています。今回の研究はヒトの臨床検体を対象にしたものではなく、マカク属のサルの卵巣組織を用いた基礎研究ですが、マカクはヒトとほぼ同じ卵巣周期・卵巣構造を持つことから、環境化学物質や薬剤が卵巣機能に与える影響の評価、がん治療に伴う卵巣毒性の検討、卵巣温存法の効果判定など、ヒトへの橋渡しがしやすい研究基盤になり得るとされています。手作業による卵胞の分類・計数は労力と時間がかかる作業であるため、こうした自動化ツールが確立すれば、卵巣組織を用いた研究の再現性と効率が高まることが期待されます。研究チームは、学習データやコード、学習済みモデルをすべて公開しており、他の研究グループが独自の画像に応用したり、手法を検証・発展させたりできる形になっています。

研究の強みと限界

本研究の強みは、7,770個という規模の卵胞アノテーションデータを、6段階という比較的細かい分類基準に基づいて整備した点、そして複数の作業者による相互確認と専門家によるレビューを経て精度の高い教師データを作成した点にあります。

一方で限界も指摘されています。第一に、対象となった動物は11頭、画像は18枚にとどまり、サンプルサイズは大きくありません。第二に、原始卵胞や移行期原始卵胞に比べて二次卵胞・多層卵胞の出現数が少なく、データの偏りが精度に影響した可能性があります。第三に、今回のモデルはマカク属という近縁種の間ではおおむね良好な性能を示しましたが、予備的な検証ではハムスターの組織にそのまま適用した際の精度は低く、種を越えた汎用性には限界があることが示唆されています。第四に、染色の濃淡や画像の質のばらつきが結果に与える影響についても、限られた枚数での検証にとどまっています。

おわりに

今回の研究は、非ヒト霊長類の卵巣組織における卵胞発育段階を、6段階という比較的細かい基準でAIに自動分類させる試みとして、これまでで最大規模のデータを提供するものです。学習データでは98%以上、未知のデータでも72〜75%という正答率が得られ、誤分類の多くは隣接する発育段階との取り違えにとどまっていました。研究チームは、この手法が卵巣毒性評価やがん治療後の妊孕性温存研究、卵巣加齢のメカニズム解明など、幅広い研究領域での活用につながる可能性があるとしています。データとコードが公開されていることから、今後は他の研究グループによる検証や、ヒト組織への応用可能性についての追加研究が期待されます。

参考文献

1. Sluka JP, Israels R, Lund C, Rao PR, Nagda P, Ding Y, Daniele A, Dietrich SW, Zelinski MB, Watanabe KH. Follicle Identification in Primate Ovaries Via Machine Learning. Biol Reprod 2026;ioag149. doi:10.1093/biolre/ioag149.

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です