無作為化比較試験(RCT)は治療効果を評価するうえでの標準的な手法とされ、系統的レビューやメタ解析、そして診療ガイドラインの根拠として広く用いられています。従来、査読を経て雑誌に掲載された研究は、その質(研究デザインの妥当性)にばらつきがあっても、少なくとも実際にデータが取得されたことは前提とされてきました。しかし近年、この前提そのものが揺らいでいます。
研究が実際には行われず、結果が捏造されているという可能性を、査読者や編集者が日常的に検討してこなかったことが指摘されるようになりました。データが操作・改ざん・捏造されている場合だけでなく、方法論上の欠陥によって誤った結果が生じている場合も含め、こうした「信頼できないデータ」をどう見分けるかが、研究公正性(research integrity)をめぐる重要な課題として浮上しています。
この課題に対し、Reproductive Biology and Endocrinology誌(2026年)に、査読済み・公表済みのRCTデータの信頼性を評価する方法論を整理した総説が掲載されました。チェックリストによる評価、集計データや個票データの統計的解析、そして人工知能(AI)を用いたツールという3つのアプローチが取り上げられています(doi:10.1186/s12958-026-01583-4)。
どれほど深刻な問題なのか
この総説が引用する2020年の検証では、Anaesthesia誌に2017年2月から2020年3月までに投稿された526件のRCTが対象とされました。このうち個票データ(IPD)が入手できた153件では、44%に明らかな虚偽データが含まれ、26%は結果の信頼性が著しく低く「致命的な欠陥がある」あるいは「ゾンビ試験」と判定されるレベルでした。個票データが得られない場合でも、集計データのみの解析で14%のRCTに虚偽データが確認されています。
生殖医療分野に関する検証もあります。同一施設に所属する2名の著者が主導した女性の健康に関する35件のRCTを対象とした2020年の研究では、26件の試験でベースライン特性やアウトカムに、無作為化の結果としては説明のつかない、同一あるいは不自然に類似した数値が多数見つかりました。こうした信頼性の確認できないRCTがメタ解析に取り込まれることで、エビデンスの土台自体が歪み、最終的には診療ガイドラインの内容にまで影響が及ぶ可能性が指摘されています。
信頼性チェックリストという発想
RCTの信頼性を評価するための複数のチェックリストが提案されています。早期の例であるREAPPRAISEDは、研究のガバナンスや倫理、著者情報、生産性、盗用、研究の実施、画像操作、統計とデータ、誤りといった11のカテゴリー、54項目の質問を通じて懸念点を洗い出す仕組みです。
RCTに特化したチェックリストとしてTRACTがあり、ガバナンス、著者群、介入の実施可能性、時間的整合性、脱落率、ベースライン特性、アウトカムの7領域について、各項目を「懸念なし」「一部懸念あり/該当なし」「重大な懸念あり」の3段階で評価します。同様の目的を持つツールとして、コクラン妊娠・出産グループが開発した信頼性スクリーニングツール(CPC-TST)もあり、これを18件の公表済みコクランレビューに適用したところ、6件のレビューで結果に重要な差異が生じたことが報告されています。
研究整合性評価(RIA)ツールは、イベルメクチンに関するコクランのCOVID-19レビューを更新する作業の中で開発され、実際の適用によって最初の更新時に40%を超える試験が除外される結果となりました。撤回論文や明白な「危険信号」の有無をまず確認する設計になっており、系統的レビューやメタ解析から不正な研究を迅速に除外するための「前さばき」として位置づけられています。
もっとも新しく、もっとも包括的とされるのがINSPECT-SRです。透明性のあるプロトコルと正式なデルファイ法を経て開発され、4領域21項目のチェック項目と、系統的レビューでの標準的な運用のための手引きを備えています。あるPCOS(多嚢胞性卵巣症候群)診療ガイドラインの根拠となった研究群にTRACTを応用した枠組みを適用したところ、101件中45件が信頼性に問題ありと判定された例も報告されています。ただし、こうしたチェックリストはいずれもまだ広く普及するには至っておらず、評価にかかる時間の長さが一因とされています。
「有意差なし」の裏に隠れた有意差──統計的な見抜き方
無作為化が適切に行われていれば、群間のベースライン特性を比較したp値は、理論上0から1までの一様分布に従うはずです。この統計的性質を利用した検証手法は、最初にこの手法を適用した研究者の名にちなんで「カーライル法」と呼ばれています。
実例として、クロミフェンクエン酸塩による黄体形成ホルモン(LH)サージ抑制効果を検討したある人工授精(IUI)のRCTでは、群間のベースライン特性の比較が「統計学的に有意差なし」と報告されていました。しかし総説の著者らが再計算したところ、年齢のp値は0.0306、不妊期間とBMIのp値はいずれも0.001未満と、明確な有意差が存在することが判明しました。この結果は計算または報告上の誤りを示すだけでなく、無作為化の過程そのものに疑義を投げかけるものであり、当該論文には出版社による「懸念表明(Expression of Concern)」が付されるに至っています。
表と表のあいだで数値が不自然に一致する「データの使い回し」を見抜く手法も紹介されています。同一の著者グループによる2本の論文で、複数の表にまたがって小数点以下まで一致する数値が多数見つかった事例について、同じ研究デザインとデータ収集方法を模した5万組のデータセットをシミュレーションしたところ、そこまでの一致は一度も再現されませんでした。同じ分布から抽出した標本で平均値や標準偏差が偶然一致する頻度は、極めて低いことが分かっています。
このほか、末尾の桁の分布が理論上の一様分布から外れていないかを調べる手法、報告された平均値が整数データの標本サイズとして数学的に成立し得るかを確認するGRIM検定、標準偏差の妥当性を確認するGRIMMER検定、丸められた数値から想定される検定統計量の範囲を計算するRIVETS検定など、複数の統計的チェック手法が体系的に整理されています。
個票データが変える検出力
集計データだけでなく、参加者一人ひとりの生データ(個票データ、IPD)にアクセスできれば、検証の幅は大きく広がります。IPDが利用できる場合、問題のある研究の検出率が最大で40%向上するとされています。
IPDの信頼性を評価するために開発されたIPD Integrity Toolは、研究レベルの13項目とIPD特有の18項目、合計31項目からなり、IPD特有の項目は不自然なデータパターン、ベースライン特性の問題、期待される相関の欠如、日付の矛盾、割り付けパターン、内部・外部の不整合、データの妥当性という8領域に分類されています。年齢と身長のように本来正の相関が期待される変数間の相関の有無を確認したり、無作為化された参加者の登録が時系列上不自然な偏りを示していないかを、ラン検定などの統計的手法で確認したりする項目が含まれます。
今後は、このツールを発展させたINSPECT-IPDというチェックリストの整備も進められており、7領域68項目のチェック項目がプレプリントとして公開されています。
AIは10分で「怪しさ」を見抜けるか
生成AIや大規模言語モデル(LLM)は、研究公正性の分野において両面的な存在です。労力のかかる作業を効率化する助けになる一方で、いわゆる「ペーパーミル」による捏造論文の大量生産を、かつてない速度で可能にしてしまった側面もあります。
臨床試験論文の信頼性評価にAIを活用する試みを検討したある総説は、16本の論文で紹介された17種類のツールを比較し、AIは「疑わしさ」の有無を検出することには長けているものの、実際の調査に着手する前には人間による検証が必要だと結論づけています。
総説の著者らが構築したプロトタイプソフトウェアでは、GPT-4oを用いてPDFから表データを自動抽出し、信頼性チェックを行う一連の流れを試みています。10論文・35個の表からなる検証セットでのデータ抽出精度(F1スコア)は、GPT-4で0.748、Qwen2.5で0.949でした。TRACTチェックリストの19項目についてLLMと人間の評価者の一致度を比べたところ、平均して19項目中14項目で一致が見られ、所要時間は1論文あたりLLMで約10分、人手による評価では約75分と、大幅な時間短縮が示されています。ただし、文献データベースなど外部情報との照合が必要な項目では、LLMの精度は相対的に低い結果でした。
がん研究領域のペーパーミル検出を目的に、オーストラリアとフランスの共同研究チームが開発したBERTモデルでは、ペーパーミル由来の論文と正規のがん研究論文を判別する精度が0.91(551件中502件が正しく分類)、感度0.87(276件中239件のペーパーミル論文を正しく検出)、特異度0.96(275件中263件の正規論文を正しく識別)という結果でした。がん研究に関する既存文献260万件に適用したところ、9.87%がペーパーミル由来の可能性ありと判定され、こうした論文は大手出版社を含む幅広い雑誌に及んでいました。このモデルは現在、大手出版社3誌のオンライン投稿システムに実装され、がん関連原稿のスクリーニングに使われ始めています。
日本の生殖医療研究にとっての意味
今回取り上げられた統計的検証手法の実例には、クロミフェンクエン酸塩やN-アセチルシステインの効果を検討したRCT、PCOS診療ガイドラインの根拠論文など、生殖医療領域の研究が複数含まれています。生殖医療は比較的少数の研究者・施設群による多施設共同研究やメタ解析への依存度が高く、系統的レビューやガイドライン策定の場面で、個々のRCTの信頼性が結果全体を左右しやすい領域のひとつと言えます。
日本の生殖医療の臨床現場や研究者にとっても、国内外の診療ガイドラインが海外のRCTやメタ解析を根拠としている以上、その根拠となる一次研究の信頼性は無関係ではありません。系統的レビューやガイドライン作成に関わる研究者にとっては、TRACTやINSPECT-SRのようなチェックリストの存在を知り、必要に応じて活用することが今後重要になっていくと考えられます。臨床現場で個々の論文を評価する際にも、ベースライン表のp値がすべて「有意差なし」とされている場合や、複数の論文間で数値が不自然に一致している場合には、それが単なる偶然ではない可能性を念頭に置く視点が参考になります。
この総説の限界
この総説自体は特定の研究デザインを検証した実証研究ではなく、既存の手法やツールを整理した総説であるという性質上の限界があります。紹介されている多くのツールは、数十件から数百件規模の論文集団での検証にとどまっており、研究者らが指摘するような「数十万件規模のゾンビ試験」が文献データベース全体に存在するとされる規模感には、まだ届いていません。
また、信頼性チェックツールを公開することが、かえって不正を働く側に「検出を逃れる方法」を学習させてしまうのではないかという懸念も紹介されています。チェックを通過する必要が生じること自体が不正のハードルを上げるとする反論もありますが、この点はツールの設計と運用のあり方次第で結果が変わりうる、今後の検証を要する論点です。
おわりに
今回の総説は、査読済みのRCTであっても「実際にデータが取得された」という前提を無条件に置くべきではないという問題意識のもと、チェックリスト、統計的手法、AIという3つのアプローチを整理したものです。ベースライン特性のp値分布や末尾桁の偏り、表間の不自然な数値の一致といった統計的な手がかりに加え、個票データへのアクセスやAIによる自動化が、信頼性評価の精度と効率をともに高める方向に進みつつあることが示されました。こうした手法が系統的レビューやガイドライン作成の現場に組み込まれていくことで、フェイクデータに基づいた誤った臨床的結論が広がるリスクを、今後どこまで抑えられるかが注目されます。
参考文献
1. Gurrin LC, Au N, Nielsen J, Brown NJL, Hunter KE, Mol BW. Methods to assess trustworthiness of data from peer-reviewed, published randomised controlled trials. Reprod Biol Endocrinol 2026 (Article in Press). doi:10.1186/s12958-026-01583-4.
