Methodological quality of systematic reviews on treatments in stroke rehabilitation: A cross-sectional study
更新日:8 時間前
「脳卒中リハビリテーションにおける治療に関するシステマティックレビューの方法論的質:横断的研究」
この研究は、個々の脳卒中リハビリテーション技術の有効性を論じる研究ではありません。
有効性を判断するために使われている研究そのものが、どれほど信頼できるものかを検証したものです。
2021年1月から2023年9月までに発表されたシステマティックレビューの中で、140件を対象に調査をしています。その結果、130件(92.9%)が方法論的な質について「極めて低い」と評価されました。
これには非常に重要な意味があります。
ひとつは、私たち臨床家にとって、むやみにシステマティックレビューを信頼すべきではないという警告の意味となるでしょう。
そして、研究者にとってみれば、研究論文を書けば科学的に信頼されるという時代が過ぎ去り、信頼性が乏しい研究は淘汰され、より信頼性の高い研究を模索するための試金石となるのだろうと思います。
では、この研究を紹介したいと思います。
1. 研究の目的
一般的に、システマティックレビュー(SR)やメタ分析は、医学研究における高いレベルのエビデンスとして位置づけられています。
しかし、複数の研究を統合するという方法を採用していても、研究の選択、評価、分析の方法に問題があれば、得られる結論も信頼できなくなります。
そこで研究者らは、近年発表された脳卒中リハビリテーションに関するSRについて、研究方法の質を系統的に評価しています。
. 研究方法
2021年1月から2023年9月までに発表されたSRを、以下の4つのデータベースから検索しています。
MEDLINE
EMBASE
PsycINFO
Cochrane Database of Systematic Reviews
対象は、ランダム化比較試験(RCT)を主な根拠とし、少なくとも1つのメタ分析を含む、脳卒中リハビリテーションの治療効果を評価したSRです。
最終的に140件が評価対象となっています。
評価には AMSTAR 2 という、SRの方法論的品質を16項目で評価するツールが使用されました。
ここで重要なのは、この研究自体が治療効果を再計算したものではなく、既存のSRの研究方法を評価したものであるという点です。
〜ここで、AMSTAR2について、少し解説をしておきます。
AMSTAR 2(A MeaSurement Tool to Assess systematic Reviews 2) は、医療介入の効果を検証したシステマティックレビュー(SR)の方法論的品質を評価するためのツールです。
2017年にSheaらによって開発され、BMJに発表されています。
AMSTAR 2には16の評価項目があり、そのうち7項目が、研究の信頼性に重大な影響を与える「重要領域(Critical domains)」として指定されている様です。
番号 | 評価内容 | 重要領域 |
1 | PICOに基づいた研究課題の設定 | |
2 | 研究開始前のプロトコル策定 | ★ |
3 | 採用する研究デザインの選択理由 | |
4 | 十分かつ包括的な文献検索 | ★ |
5 | 複数の研究者による研究選択 | |
6 | 複数の研究者によるデータ抽出 | |
7 | 除外した研究とその理由の提示 | ★ |
8 | 採用した研究の詳細な記述 | |
9 | 一次研究のバイアスリスク評価 | ★ |
10 | 一次研究の資金源の報告 | |
11 | メタ分析の統計手法の妥当性 | ★ |
12 | バイアスが統合結果に与える影響の評価 | |
13 | バイアスを考慮した結果の解釈 | ★ |
14 | 研究間の異質性の説明 | |
15 | 出版バイアスの評価 | ★ |
16 | 利益相反と研究資金の開示 |
AMSTAR 2では、16項目の合計点を計算して研究の品質を判定することを推奨していません。
代わりに、重大な欠陥がいくつ存在するかによって、4段階で総合評価します。
高い(High)
重大な欠陥 0件
重大な欠陥がなく、その他の問題も最大1件。
中程度(Moderate)
重大な欠陥はないが、その他の問題が複数ある。
低い(Low)
重大な欠陥が1件ある。
極めて低い(Critically low)
重大な欠陥が2件以上ある。
と言った具合です。
この評価手法で、140件のSRを検証したという事です。
3. 研究結果
AMSTAR 2による方法論的品質の総合評価。数値は論文の報告値です。

特に注目すべきなのは、次の項目です。
評価項目 | 適切に実施した割合 |
網羅的な文献検索 | 4.3% |
除外研究の一覧と理由の提示 | 12.9% |
採用する研究デザインの選択理由 | 7.1% |
一次研究の十分な詳細記述 | 10.7% |
一次研究の資金源の報告 | 7.9% |
つまり、研究を集めて統合する以前の段階から、重要な方法論的問題が存在していたことになります。
研究のデータを見ていると、特に重要な問題点として浮かび上がってくるものがあります。
59.3% が、メタ分析で適切な統計的統合方法を使用していなかった。
74.3% が、一次研究のバイアスリスクが統合結果に与える影響を評価していなかった。
52.1% が、出版バイアスについて適切な検討をしていなかった。
例えば、あるリハビリテーション技術について複数のRCTを統合し、統計的に有意な効果が認められたとします。
しかし、元になったRCTにバイアスがあり、その影響が適切に検討されていなければ、統合した結果にも問題が残ることになります。
研究を多数集めたからといって、その研究に含まれる問題まで解消されるわけではないですよね。
Garbage In, Garbage Out(ゴミを入れればゴミが出てくる)というわけです。
そうすると、AMSTAR 2の「極めて低い」という評価は、単純な点数不足を意味しない。重要項目に複数の重大な欠陥が存在することを意味する。
したがって、今回の92.9%という数字は、単なる形式上の不備として片づけられないということになります。
蛇足になるかと思いますが、一応書いておきます。
「SRの方法論的品質が低い」ということと、「評価された治療に効果がない」ということは別問題です。
正しくは、「評価された治療に効果があるかどうか不明である」あるいは「効果がないとされた治療が効果がないかどうか不明である」ということになります。
つまり、そのSRの結論を、そのまま信頼することは難しいという事です。
しかし、140件の研究のうち、130件が方法論的に極めて質が低いと評価されたという事は、かなりインパクトがありますね。
(^^;;
まとめ
今回の研究は、システマティックレビューの信頼性について、私たち臨床家に重要な問題を提起していると思います。
システマティックレビューやメタ分析は、一般的にエビデンスレベルの高い研究として扱われています。しかし、その研究方法が適切でなければ、得られた結論の信頼性も低くなります。
だからといって、今回「極めて低い」と評価された研究の結論が、すべて間違っているというわけではありません。また、高く評価された研究であっても、その結論が正しいと保証されたわけではありません。
重要なのは、研究の形式や評価結果をそのまま信じるのではなく、何を根拠に、どのような過程を経て結論が導かれたのかを確認することです。
例えば、研究対象となった患者の状態、介入方法の定義、比較対象の妥当性、一次研究のバイアス、統計処理の適切性、そして結論に至る論理など、確認すべきことは数多くあります。
特にリハビリテーションでは、同じ名称の介入であっても、その内容が研究によって異なることがあります。そもそも何を比較しているのかが明確でなければ、統計的に有意な結果が得られても、その結果をどのように解釈すべきか判断できません。
AMSTAR 2は、こうした研究の信頼性を評価するための有用な指標の一つです。
私たち臨床家が、すべての論文について16項目を詳細に検証することは現実的ではありません。しかし、どのような点に注意して研究を読むべきなのか、その判断基準を知ることには大きな意味があります。
また、臨床家には限られた時間しかありません。方法論的な品質に重大な問題がある研究を、そのまま臨床判断の根拠とするよりも、より信頼性の高い研究や一次研究を優先して確認する方が合理的でしょう。
そして、もう一つ忘れてはならないことがあります。
科学的根拠は、私たちの臨床判断を助けるためのものであって、臨床家の思考を代行するものではないということです。
研究結果を無条件に受け入れることが科学的な態度なのではありません。研究結果を理解し、その限界を認識し、目の前の患者に適用できるのかを考えることが必要なのだと思います。
今回の研究は、システマティックレビューを否定するものではありません。むしろ、科学的根拠をより適切に利用するために、私たちがどのような視点を持つべきなのかを示してくれた研究だと考えています。
科学は、疑うことによって信頼性を高めていくものです。
研究を疑うことは、科学を否定することではありません。科学を科学として扱うために必要な姿勢なのだと思います。



コメント