---
title: 医学論文を読むための医療統計
tags:  #医学  
author: [kokuren](https://image.docswell.com/user/kokuren333)
site: [Docswell](https://www.docswell.com/)
thumbnail: https://bcdn.docswell.com/page/L7LM3X4XJR.jpg?width=480
description: 以下で作成 https://kokuren333.github.io/BookOrderWebUI/
published: September 28, 26
canonical: https://image.docswell.com/s/kokuren333/ZPR32Q-2026-09-28-023700
---
# Page. 1

![Page Image](https://bcdn.docswell.com/page/L7LM3X4XJR.jpg)

医学論文を読むための医療
統計
数字を、臨床のことばに読み替える


# Page. 2

![Page Image](https://bcdn.docswell.com/page/4EMYDLK3EW.jpg)

本書の数値例・図表のうち架空データを用いたものは、その旨を本文または図注に示してい
ます。医学情報は各引用文献を参照してください。


# Page. 3

![Page Image](https://bcdn.docswell.com/page/PER94KXRJ9.jpg)

目次
第 1 章 患者データをどう要約するか
1
1.1 Table 1 の数字から始める . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠1
1.2 平均と中央値は何を代表するか . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠1
1.3 SD と四分位範囲を読む . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠2
1.4 論文の表で確かめる . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠3
第 2 章 標本から推定する—信頼区間と p 値
5
2.1 標本と母集団の距離 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠5
2.2 標準偏差と標準誤差 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠6
2.3 95% 信頼区間の読み方 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠6
2.4 p 値は何を言っているか . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠7
2.5 有意差と臨床的重要性 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠8
第 3 章 研究デザインは推論の範囲を決める
9
3.1 まず誰をどう比べた研究か . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠9
3.2 無作為化比較試験 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠9
3.3 コホート・症例対照・横断研究 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠10
3.4 CONSORT と STROBE を読む地図にする . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠11
3.5 バイアスと交絡 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠12
第 4 章 治療効果を相対値と絶対値で読む
14
4.1 リスクとオッズは分母が違う . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠14
4.2 リスク比を読む . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠15
4.3 オッズ比はリスク比ではない . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠15
4.4 絶対リスク差と NNT . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠16
4.5 効果量と臨床的重要性を結ぶ . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠17
第 5 章 回帰分析と調整済み結果を読む
19
5.1 なぜ調整するのか . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠19
5.2 線形回帰の係数 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠20
5.3 ロジスティック回帰と OR . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠20
5.4 調整済みでも残ること . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠21
第 6 章 Kaplan–Meier 曲線とハザード比
23
6.1 時間と打ち切りを扱う . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠23
iii


# Page. 4

![Page Image](https://bcdn.docswell.com/page/P7XQ2L6YEX.jpg)

6.2 Kaplan–Meier 曲線を読む . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠24
6.3 ハザードと HR の意味 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠25
6.4 Cox 回帰と比例ハザード . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠26
6.5 HR 0.7 が言わないこと . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠26
第 7 章 検査結果から診断確率を考える
28
7.1 検査の結果を 2×2 表に置く . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠28
7.2 感度・特異度 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠29
7.3 陽性的中率と陰性的中率 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠29
7.4 尤度比で確率を更新する . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠30
7.5 ROC 曲線と AUC . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠31
第 8 章 メタ解析と forest plot を読む
32
8.1 複数研究を統合する意味 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠32
8.2 重み付き平均の直感 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠33
8.3 forest plot の読み方 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠33
8.4 異質性と I² . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠34
8.5 PRISMA と統合結果の限界 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠35
第 9 章 医学論文を読むためのチェックリスト
37
9.1 Results を読む順序 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠37
9.2 結果の一文を翻訳する . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠38
9.3 論文読解チェックリスト . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠38
9.4 数字の先にある患者を考える . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠39
参考文献 . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . ⁠40
iv


# Page. 5

![Page Image](https://bcdn.docswell.com/page/37K9ML147D.jpg)

CHAPTER
01
患者データをどう要約するか
1.1 Table 1 の数字から始める
医学論文の Table 1 には、年齢、血圧、検査値など、研究に参加した
人たちの特徴が並びます。連続した数値を「平均（標準偏差）」で示す論
文もあれば、
「中央値［四分位範囲］」で示す論文もあります。どちらも
患者の全体像を短く伝える方法ですが、同じものを表しているわけで
はありません。
たとえば入院期間を考えてみましょう。多くの人が数日で退院し、少
数の人が合併症で長く入院すると、分布は長い右裾を持ちます。このと
き平均は長期入院の人に引き上げられ、典型的な患者の感覚から離れ
ることがあります。表の数値を読む第一歩は、その値だけでなく、どん
な分布を一つの数字にまとめたのか想像することです。
1.2 平均と中央値は何を代表するか
平均は観測値をすべて足し、人数で割った値です。各人の値が平均に
どれだけ寄与するかをそのまま反映します。記号で書けば、標本平均は
次のとおりです。
1


# Page. 6

![Page Image](https://bcdn.docswell.com/page/LJ3WY3QDJ5.jpg)

医学論文を読むための医療統計
𝑥̄ =
𝑥1 + 𝑥2 + ⋯ + 𝑥𝑛
1 𝑛
= ∑ 𝑥𝑖
𝑛
𝑛 𝑖=1
𝑥𝑖 は一人ひとりの測定値、𝑛 は人数、∑ は全員分を足すという意味
です。たとえば 5 人の入院日数が 2、3、3、4、8 日なら、平均は 20÷5=4
日です。
中央値は、値を小さい順に並べたときの中央です。同じ 5 人なら中央
値は 3 日です。8 日の一人がいても中央の位置は変わりません。中央値
は外れ値や偏った分布の影響を受けにくく、
「真ん中あたりの患者」を
示すのに向いています。一方、平均は全員の値を使うため、合計量や群
間の平均差を比較したいときに役立ちます。どちらが常に優れているの
ではなく、分布と臨床上の問いに合っているかを見ます。[1]
1.3 SD と四分位範囲を読む
同じ平均でも、患者の値が平均の近くに集まっている群と、大きく散
らばっている群では様子が違います。標準偏差（SD）は、個々の値が平均
の周りにどの程度散らばっているかを表します。標本での分散は平均か
らのずれを二乗して平均した量（厳密には標本分散では自由度で補正）
で、SD は分散の平方根です。
𝑠=√
∑𝑛𝑖=1 (𝑥𝑖 − 𝑥̄)2
𝑛−1
ここでは 𝑥𝑖 が各人の値、𝑥̄ が平均、𝑛 が人数です。ずれを二乗するの
で、平均との差が大きい値ほど分散に強く影響します。SD は元の測定単
位に戻るため、血圧なら mmHg、体重なら kg で読めます。正規分布に
近いデータでは平均±1 SD の範囲に約 3 分の 2 の値が入りますが、分布
が大きく歪んでいるとこの目安は当てはまりません。
四分位範囲（IQR）は、値を並べたとき下から 25% 点（第 1 四分位数）
から 75% 点（第 3 四分位数）までの幅です。中央半分の患者がどこに分
布するかを示し、外れ値に比較的左右されにくい指標です。先ほどの 2、
3、3、4、8 日では中央の範囲はおおむね 3〜4 日です（四分位数の計算
法により小標本の値は異なります）。
2


# Page. 7

![Page Image](https://bcdn.docswell.com/page/8JDK5492EG.jpg)

第 1 章 患者データをどう要約するか
SD と SE は別のもの
SD は患者どうしの測定値のばらつきです。これとは別に、平均など
の推定値にも標本による揺れが生じます。論文の「平均±SD」を、平
均の 95% 信頼区間と読み替えてはいけません。推定値の揺れと信
頼区間は第 2 章で扱います。
平均=4
中央値=3
人数
中央半分（概略）
1
2
3
4
5
6
7
8
9
入院日数
図 1.1 ‘架空の入院日数分布で平均・中央値・IQR を比較’
1.4 論文の表で確かめる
Table 1 や Results に「年齢 64.2±11.8 歳」とあれば、通常は平均 64.2
歳、SD 11.8 歳という要約です。
「入院期間 中央値 4 日［IQR 2–8］」なら、
中央は 4 日で、中央半分はおよそ 2〜8 日に位置します。IQR は四分位数
の範囲を示すことが多く、幅そのもの（8−2=6 日）と混同しないように
します。
表を見たら、①平均か中央値か、②ばらつきは SD か IQR か、③値の
範囲や外れ値に偏りがありそうか、④単位と対象人数は何かを確認し
てください。群間の背景表に小さな差があっても、その差が重要かは臨
床的に判断します。表の要約だけでは、治療効果の方向や量までは分か
りません。
3


# Page. 8

![Page Image](https://bcdn.docswell.com/page/VEPKGMZL78.jpg)

医学論文を読むための医療統計
要約の選び方は、測定値の性質にも左右されます。左右の裾が似た分
布なら平均と SD で中心と広がりを伝えやすい一方、少数の極端な値が
あると平均と SD の両方が影響を受けます。その場合、中央値と IQR を併
記すれば、典型的な位置と中央半分の広がりを別々に捉えられます。た
だし中央値と IQR だけでは、分布の両端や複数の山が隠れることがあり
ます。可能ならヒストグラムや箱ひげ図も見て、患者の値がどこに集ま
り、どこまで広がっているかを確かめます。要約統計は分布そのものの
代わりではなく、図や臨床的な問いと合わせて読む入口です。
4


# Page. 9

![Page Image](https://bcdn.docswell.com/page/27VV69W67Q.jpg)

CHAPTER
02
標本から推定する—信頼区間と
p値
2.1 標本と母集団の距離
前章第 1 章で見た平均や中央値は、研究参加者の特徴を短く表す要約
です。研究者は、関心のあるすべての患者（母集団）を調べる代わりに、
参加条件を満たし実際に登録された患者（標本）を調べます。標本で得
た平均や治療効果は、母集団での値そのものではなく、その値を推し量
る推定値です。別の患者が登録されていれば、結果は少し違ったかもし
れません。
ここでいう不確実性は、主に標本の偶然のばらつきです。患者の選ば
れ方や測定の誤り、交絡による偏りとは別の問題です。人数を増やせば
偶然の揺れは小さくなりますが、偏った研究が自動的に正しくなるわ
けではありません。前章の SD・IQR は参加者間のばらつきを要約しまし
た。今度は「平均や効果の推定値の標本誤差がどの程度か」を見ます。
5


# Page. 10

![Page Image](https://bcdn.docswell.com/page/5JGLNZD27L.jpg)

医学論文を読むための医療統計
2.2 標準偏差と標準誤差
平均の標準誤差（SE）は、同じ条件の研究を繰り返したとき、標本平
均がどの程度揺れるかの目安です。単純な標本平均なら、標準誤差は標
準偏差を人数の平方根で割ったものです。
𝑠
𝑆𝐸(𝑥̄) = √
𝑛
𝑠 は患者個人の値の標準偏差、𝑛 は人数です。患者間のばらつきが同
じなら、人数が 4 倍で SE は約半分になります。SD は患者の違い、SE は平
均という推定値の精度です。この区別は、論文の「平均±SD」
「平均±SE」
を読むときに大切です。
2.3 95% 信頼区間の読み方
信頼区間（CI）は、点推定値だけでなく、標本誤差と整合する値の幅
を示します。条件が満たされる単純な場合には、推定値±約 2×SE が 95%
信頼区間の近似になります。
95% 𝐶𝐼 ≈ 推定値 ± 1.96 × 𝑆𝐸
これは近似式です。実際の論文ではアウトカムや解析法に合わせた計
算法が使われます。95% という意味は、同じ手順で標本抽出と区間作成
を何度も繰り返せば、その約 95% が母集団の真値を含む、ということで
す。すでに得た一つの区間について「真値がこの中にある確率は 95%」
と解釈するものではありません。
CI の位置と幅を読みましょう。たとえば平均差が 50 g、95% CI −71〜
172 g なら、観察された差は治療群で 50 g 高いものの、データと両立す
る範囲には治療群が低い可能性も含まれています。推定の幅は不精確さ
を示し、臨床上意味のある差がどこにあるかと照らし合わせます。CI は
標本誤差を表しますが、選択バイアスや測定誤差を取り除きません。[2]
尺度ごとの「差がない」値も確認します。平均差やリスク差なら 0、
RR・OR などの比なら 1 が帰無値です。対応する 95% CI が帰無値を含
むかは、同じ統計モデル・両側検定・推定法であれば 5% 水準の検定と
対応します。比の区間で 0 を探してはいけません。
6


# Page. 11

![Page Image](https://bcdn.docswell.com/page/47QYQL19EP.jpg)

第 2 章 標本から推定する—信頼区間と p 値
よくある誤読
95% 信頼区間は、研究結果や真値に関する確率を直接付けた範囲
ではありません。また、狭い区間は標本誤差が小さいことを示して
も、研究に偏りがないことまでは保証しません。
狭い区間
例
広い区間
平均差
リスク比
効果推定値（模式的な共通表示）
図 2.1 点推定値と 95% 信頼区間。差の帰無値は 0、比の帰無値は 1。
2.4 p 値は何を言っているか
p 値を理解するには、まず「差がない」と仮定した帰無仮説を置きま
す。その仮定と解析モデルが正しいとき、今回の結果と同じか、さらに
帰無仮説から離れたデータが得られる確率が p 値です。たとえば p=0.03
は、帰無仮説が正しいときに、この程度以上に極端な結果が得られる確
率が 3% という意味です。
p 値は「治療が効かない確率」でも、
「効果が偶然だけで起きた確率」
でもありません。効果の大きさも示しません。参加者が非常に多ければ
小さな差でも p 値が小さくなることがあり、少人数では重要な差があっ
ても p 値が大きい場合があります。測定方法、解析計画、欠測、複数の
評価項目や解析をどう扱ったかも結果の解釈に関わります。
7


# Page. 12

![Page Image](https://bcdn.docswell.com/page/KE4WND6RJ1.jpg)

医学論文を読むための医療統計
2.5 有意差と臨床的重要性
医学論文では p&lt;0.05 を「統計学的に有意」と呼ぶ慣習がよく見られ
ます。しかし 0.05 は自然界の境界ではなく、これをわずかに下回った結
果だけが真実になるわけではありません。信頼区間と効果量を一緒に
読み、患者にとって意味のある差かを考えます。小さな差でも大規模研
究なら統計学的に有意になり得ます。[2]
反対に p&gt;0.05 でも、効果がないことが証明されたわけではありませ
ん。区間が広く、利益も害も十分あり得るなら、研究はその差を精密に
見分けられなかった可能性があります。検出力は、ある大きさの効果が
実際にあるとき、それを統計学的に検出できる確率です。検出力が低い
研究の「有意差なし」は、無効の証明として弱い情報です。
数値をひと息で読み替える
「平均差 50 g、95% CI −71〜172 g、p=0.41」なら、観察標本では治療群
の出生体重が平均 50 g 高かったが、差の推定には不確実性があり、
帰無値 0 を含むため、対応する 5% 検定では統計学的有意差を認め
なかった、と表現できます。
「差がないと証明された」
「治療は無効」
とまでは言えません。[2]
次章の第 3 章では、同じ推定値や p 値を読むときにも、その研究がど
のように患者を選び、比較したかが結論の範囲を決めることを見ていき
ます。効果を絶対的な差へ読み替える方法は第 4 章で学びます。研究デ
ザインを確かめてから効果量を読む習慣につなげましょう。
8


# Page. 13

![Page Image](https://bcdn.docswell.com/page/L71Y5ZVVJG.jpg)

CHAPTER
03
研究デザインは推論の範囲を決
める
3.1 まず誰をどう比べた研究か
Results の効果量や 95% 信頼区間を見る前に、Methods で「誰を、何を
起点に、どう比べたか」を確かめます。研究デザインは単なる手法名で
はなく、観察された差が何を意味し得るかを決める比較の枠組みです。
治療を割り付けたのか、診療現場で選ばれた治療を観察したのか、病気
の有無から過去をさかのぼったのか。標本の偶然の揺れを CI が示して
も、比較の作り方に由来する偏りまでは示しません。前章の不確実性に
加え、参加者の選ばれ方と測定過程を読む必要があります。
3.2 無作為化比較試験
無作為化比較試験（RCT）では、適格な患者を偶然の仕組みで治療群
へ割り付けます。例えば急性増悪予防薬の候補 A と標準治療を比べると
き、年齢や病気の重さなど、測定した因子も測定していない因子も、十
分な人数では平均的に均衡しやすくなります。無作為化された群のまま
解析する（intention-to-treat の考え方）と、主に「その治療へ割り付ける
方針」の効果を推定します。割付後に実際に受けた治療で群を組み替え
9


# Page. 14

![Page Image](https://bcdn.docswell.com/page/G7WG59L3E2.jpg)

医学論文を読むための医療統計
ると、元の無作為化による均衡が崩れ得るため、治療を受けたこと自体
の効果を因果的に解釈するには追加の前提が必要です。無作為化は個々
の背景を完全一致させる操作ではなく、小規模試験では偶然の不均衡
もあり得ます。
RCT という名前だけで安心せず、割付方法と隠蔽、対象者・医療者・
評価者の盲検化、群ごとの脱落、治療変更、主要評価項目、解析対象を
見ます。無作為化後の脱落が群で異なる、アウトカム評価が治療を知っ
て左右される、といった問題は推定をゆがめる可能性があります。ま
た、試験の対象が限定的なら、結果を別の患者や診療環境へそのまま当
てはめられるとは限りません。
3.3 コホート・症例対照・横断研究
観察研究では、研究者が治療や曝露を割り付けず、実際の診療・生活
で生じた違いを記録します。コホート研究は、治療や曝露の有無で人々
を分け、その後の発症を追う設計です。時間の順序を確かめやすく、追
跡期間中のリスクを比べられますが、治療選択に関わる患者背景の違
いが結果に混ざり得ます。
症例対照研究は、病気になった人（症例）とならなかった人（対照）
を選び、過去の曝露を比べます。まれな病気の研究に効率的ですが、症
例と対照の選び方や過去の情報の集め方が比較を左右します。研究者が
症例・対照の人数を決めて抽出するため、通常はこの標本から発症リス
クそのものを直接読むことはできません。横断研究は、ある時点または
短い期間に曝露と状態を同時に測ります。患者集団の特徴や有病割合を
記述できますが、どちらが先に起きたか分かりにくく、時間的順序や因
果関係を判断する力には限界があります。
どのデザインにも選択バイアスと情報バイアスが入り得ます。選択バ
イアスは、研究への参加・継続や解析対象となる過程が、曝露とアウト
カムに関係して比較をゆがめることです。情報バイアスは、治療歴やア
ウトカムの測定・分類の誤りが群によって異なるなど、情報の集め
方から生じます。観察研究で治療群の転帰が良好でも、重症度、併存疾
患、医療アクセスなどの交絡が説明の一部かもしれません。統計的な調
整は測定された因子を考慮しますが、未測定・誤測定の交絡や不適切な
10


# Page. 15

![Page Image](https://bcdn.docswell.com/page/4JZLN9MGE3.jpg)

第 3 章 研究デザインは推論の範囲を決める
調整を自動的に解消せず、関連だけから因果関係が証明されるわけでも
ありません。何を調整したか、なぜその因子を選んだか、調整前後で推
定がどう変わったかを確かめます。詳しい回帰の読み方は第 5 章で扱い
ます。
01
RCT：適格患者を登録
し、無作為に割付 →
転帰を追跡
02
コホート：曝露で群
分け → 将来の転帰を
追跡
03
症例対照：転帰で選
択 → 過去の曝露を比
較
04
横断：同じ時点で曝
露と状態を測定
図 3.1 研究デザインによって対象の選び方と時間関係が異なる。
3.4 CONSORT と STROBE を読む地図にする
報告ガイドラインは、研究の計画・実施を一律に指示したり質を採点
したりする尺度ではなく、読者が判断に必要な情報を探す地図で
す。CONSORT 2025 は無作為化試験の透明で完全な報告に必要な最低限
の項目を示し、チェックリストと参加者の流れ図を備えます。チェック
項目の充足だけで試験の実施や質が保証されるわけではありません。
[3, 4]
STROBE はコホート、症例対照、横断研究の報告を対象とし、統合版
とデザイン別のチェックリストを公開しています。参加者、測定、バイ
アス 、解析、欠測、限界などの記載をたどる手掛かりになります。
[5, 6] ある項目が本文に見当たらなくても、研究者がその手順を行わな
かったと即断はできません。何が分からず、結論の確かさにどう影響す
るかを保留点として残し、本文・補足資料で確認しましょう。第 4 章で
は、この比較の枠組みに戻りながら、効果量を相対値だけでなく患者に
11


# Page. 16

![Page Image](https://bcdn.docswell.com/page/YE6W8KNQEV.jpg)

医学論文を読むための医療統計
とっての絶対的な差へ読み替えます。観察研究の交絡調整は後の第 5 章
で扱い、複数研究を読む準備は第 8 章につなげます。
01
病気の重症度（交絡
因子）
影響
影響
03
02
転帰
図 3.2
効果を知りたい関係
治療選択
重症度が治療選択と転帰の双方に影響する交絡構造。
3.5 バイアスと交絡
ここで区別したいのは、バイアスと交絡です。バイアスは研究参加者
の選択や測定の仕方など、研究の仕組みによって推定が一方向へず
れることです。交絡は、治療や曝露とアウトカムの両方に関係する背景
因子が比較に混ざることです。たとえば重症度が高い患者ほど新薬を受
12


# Page. 17

![Page Image](https://bcdn.docswell.com/page/GE5M9P52E4.jpg)

第 3 章 研究デザインは推論の範囲を決める
け、同時に増悪しやすいなら、重症度は治療と転帰の関連を交絡させ得
ます。
研究デザインで予防できる問題と、解析で調整できる問題は異なりま
す。RCT の無作為化は、測定できない因子も平均的に均衡させることを
狙いますが、脱落や評価の偏りは残り得ます。観察研究では年齢や重症
度などを測って調整しても、未測定の要因や誤った測定、変数の入れ方
による偏りが残ります。したがって「調整済み」という語だけで因果関
係を確定せず、何が測定され、どう比較されたかを確認します。
読者が確認すること
群間で異なる予後因子は何か、それは治療選択にも関係するか、調
整に使った値は治療前に測られたか、測れない要因がどの程度あ
りそうかを問いましょう。報告に記載がない点は不確実性として
記録し、研究の質を一つの点数に置き換えないことが大切です。
13


# Page. 18

![Page Image](https://bcdn.docswell.com/page/972926N1JR.jpg)

04
CHAPTER
治療効果を相対値と絶対値で読
む
医学論文の Results には「リスク比 0.50」と書かれているのに、患者さ
んにとってどのくらい利益があるのか分かりにくいことがあります。数
字を臨床の言葉に変えるには、まずイベントの頻度、つまりリスクを見
て、その後に相対効果と絶対効果を並べます。以下では計算を手がかり
にしますが、目的は手計算ではなく、結果を正確に説明することです。
4.1 リスクとオッズは分母が違う
リスクは、決めた期間にイベントを経験した人数を、その群の全員で
割った割合です。オッズはイベントが起きた人を起きなかった人と比べ
ます。
リスク =
イベント数
,
全員
オッズ =
イベント数
𝑝
=
1−𝑝
イベントなしの人数
𝑝 はイベントが起きる確率です。100 人中 20 人にイベントがあればリ
スクは 20/100=0.20（20%）、オッズは 20/80=0.25 です。リスクは 0 から
1 までですが、オッズは 1 を超えることもあります。分母が違うため同
じ値にはなりません。[1] [7]
14


# Page. 19

![Page Image](https://bcdn.docswell.com/page/DJY4Y9P47M.jpg)

第 4 章 治療効果を相対値と絶対値で読む
4.2 リスク比を読む
リスク比（RR）は、治療群のリスクを対照群のリスクで割った比です。
𝑅𝑅 =
治療群のリスク
対照群のリスク
新薬 A と標準治療を比べる架空の RCT で、12 か月以内に増悪した患
者が新薬群 50/500 人、対照群 100/500 人だったとします。新薬群のリス
クは 10%、対照群は 20% ですから、RR=0.10/0.20=0.50 です。つまり、こ
の研究では新薬群の 12 か月リスクは対照群の 0.5 倍、相対的には半分で
した。RR の帰無値（差がない値）は 1 です。
RR=0.50 を「イベントが 50 ポイント減った」と言ってはいけません。
50% は相対的な減少で、何人にどのくらい利益があったかは元のリスク
と一緒に考えます。相対リスク減少（RRR）は 1−RR で、この例では 50%
です。しかし、対照群が 20% から 10% になった絶対的な差は 10 ポイン
トです。[1]
表 4.1 架空 RCT のイベント頻度と各群のリスク・オッズ
群
イベント
非イベント
リスク
オッズ
新薬 A
50/500
450/500
10%
0.111
標準治療
100/500
400/500
20%
0.250
4.3 オッズ比はリスク比ではない
オッズ比（OR）は、治療群のオッズを対照群のオッズで割った値です。
𝑂𝑅 =
治療群のイベントオッズ
対照群のイベントオッズ
先ほどの例では、新薬群オッズは 50/450=0.111、対照群オッズは
100/400=0.25 です。したがって OR は約 0.44 です。RR は 0.50 でしたか
ら、同じデータでも値が異なります。この頻度では OR の方がイベント
減少をより大きく見せる方向です。イベントがまれなとき OR と RR は
近づきますが、一般的なイベントでは同じとみなせません。[1] [7]
15


# Page. 20

![Page Image](https://bcdn.docswell.com/page/V7NYPL56E8.jpg)

医学論文を読むための医療統計
論文に「OR 0.50」とあっても、
「リスクが半分」と即断せず、オッズ
が半分と読みます。対照群のリスクや実際のイベント数が示されている
か探してください。症例対照研究では症例・対照の人数を研究者が選ぶ
ため、標本に占める割合から母集団のリスクを直接計算できない場合が
あります。そのため OR がよく使われますが、OR そのものが RR に変わ
るわけではありません。[7]
4.4 絶対リスク差と NNT
絶対リスク差（ARD、risk difference）は二群のリスクの差です。効果の
方向が分かるよう、ここでは対照群リスクから治療群リスクを引き、利
益なら正の値にします。
𝐴𝑅𝑅 = 対照群リスク − 治療群リスク
架空 RCT では ARR=0.20−0.10=0.10、すなわち 12 か月で 10 パーセン
トポイントの減少です。100 人を治療すれば、同じ条件と追跡期間でイ
ベントが約 10 件少ないという規模感です。相対的に半分という表現と、
絶対差 10 ポイントという表現は両方必要です。
治療必要数（NNT）は、この絶対リスク減少の逆数です。
𝑁𝑁𝑇 =
1
1
=
= 10
𝐴𝑅𝑅
0.10
この例では、12 か月間にイベントを 1 件追加で防ぐには約 10 人を治
療する計算です。NNT は必ず期間とアウトカムを添えて読みます。治療
が害を増やす場合は、絶対リスク増加の逆数を NNH（害必要数）とし
て表します。リスク差の帰無値は 0 です。[1] [7]
16


# Page. 21

![Page Image](https://bcdn.docswell.com/page/YJ9P34YR73.jpg)

第 4 章 治療効果を相対値と絶対値で読む
対照リスク 2%
2%
ARR 1 pt / NNT 100
治療リスク 1%
1%
対照リスク 20%
20%
ARR 10 pt / NNT 10
治療リスク 10%
10%
図 4.1 同一の RR=0.50 でも基準リスクが異なると絶対差と NNT が変わる。
NNT は、基準リスクによって大きく変わります。相対リスクが同じ
0.50 でも、対照リスクが 2% なら治療リスクは 1%、ARR は 1 ポイント
で NNT は 100 です。対照リスクが 20% なら治療リスク 10%、ARR は 10
ポイントで NNT は 10 です。よって、ある研究の NNT を別の患者集団
や別の期間にそのまま当てはめることはできません。
4.5 効果量と臨床的重要性を結ぶ
効果を読むときは、①イベントの定義と追跡期間、②対照群と治療群
の実際の割合、③RR や OR などの相対値、④絶対リスク差と NNT、⑤信
頼区間の幅、⑥副作用や患者にとって重要なアウトカムを確認します。
p 値が小さくても効果がごく小さいことはありますし、同じ相対効果で
も基準リスクの低い患者では絶対利益は小さくなります。効果尺度は研
究の問いに合っているか、対照群のリスクは自分の診療場面に近いか
も考えます。
読み違えを防ぐ
「相対リスクが半分」は「全員の半分が助かる」でも「50 ポイント
の減少」でもありません。統計学的有意差があることも、利益が患
17


# Page. 22

![Page Image](https://bcdn.docswell.com/page/GJ8DMQ6GJD.jpg)

医学論文を読むための医療統計
者にとって大きいことを意味しません。相対効果・絶対効果・不確
実性を併せて、研究対象と追跡期間を明示して説明しましょう。
第 5 章では、患者背景など複数の要因を考慮する回帰分析に進みま
す。第 6 章では時間イベントに対する効果尺度を、第 8 章では複数研究
の効果を読む方法を扱います。こうした個別の読み方は最終章第 9 章で
一つの手順に統合します。調整済み OR や回帰係数を見ても、どの比較
を表し、何の交絡が残り得るかを意識することが大切です。
4.5.1 基準リスクと患者への適用
前の例が示すのは算術的な違いです。実際の患者へ絶対効果を当ては
めるには、研究参加者の対照群リスクが診療する患者の基準リスクに近
いかを考えます。年齢、併存疾患、病気の重さなどが異なれば、同じ相
対効果を仮定した場合でも予測される絶対差は変わります。
観察期間が 6 か月なのか 5 年なのかで累積リスクと NNT は変わりま
す。期間の記載がない NNT や、異なる患者集団・期間から移した NNT
は臨床判断に使いにくい値です。[1] [7]
4.5.2 NNT の幅とイベントの定義
実際の研究では ARR も推定値なので不確実です。信頼区間が利益か
ら害までまたぐと、NNT も一つの安定した値で要約できない場合があ
ります。
「NNT=10」だけを見ず、元になったリスク差の区間、解析法、追
跡期間を確認してください。NNT は同じ期間、同じアウトカム、同じ患
者集団で比較する概念です。全死亡を防ぐ NNT と、検査値の改善を得
る NNT は、数字が同じでも患者にとっての重みが異なります。
アウトカムの定義にも注意します。
「再入院」
「症状改善」
「複合アウト
カム」では、数えているイベントの臨床的意味が異なります。複合アウ
トカムの差を読むときは、どの構成要素が結果を主に動かしたかを表
や補足資料で確かめます。相対効果が有意でも、重要度の低い構成要素
が大半を占めるなら、患者にとっての利益を慎重に表現する必要があ
ります。
Results を説明するときは、対象・追跡期間・各群の実際の割合を添
え、相対効果と絶対差を患者の基準リスクやアウトカムの重要度に結
びつけます。
18


# Page. 23

![Page Image](https://bcdn.docswell.com/page/LJLM3X9XER.jpg)

CHAPTER
05
回帰分析と調整済み結果を読む
臨床研究では、治療群と対照群で年齢や病気の重さが異なることが
あります。単純に結果を比べると、治療の効果と患者背景の違いが混ざ
るかもしれません。回帰分析は、結果と複数の要因の関係を一つのモデ
ルにまとめ、他の要因を一定としたときの関連を推定します。論文の「調
整済み」は、比較がより公平に見えるよう統計モデルに共変量を入れた
という意味です。交絡を完全に消したという意味ではありません。[6]
5.1 なぜ調整するのか
たとえば重症患者ほど新薬が処方され、重症患者ほど増悪しやすい
とします。新薬群で増悪が多く見えても、薬が悪いのか、もともと重症
だったためか、単純比較だけでは分かりません。年齢や重症度などアウ
トカムと治療選択の双方に関係する要因を測り、適切な方法で調整す
ることは比較を助けます。
ただし、どの要因を測るか、どうモデルに入れるかは研究者の判断で
す。測定されなかった生活習慣、誤差のある重症度評価、治療選択の仕
組みをモデルが捉えられなければ、残余交絡が残ります。また、治療後
に生じた変数を安易に調整すると、治療効果の一部を取り除いたり、新
たな偏りを作ることもあります。共変量の数を増やすこと自体が、妥当
な調整を保証するわけではありません。
19


# Page. 24

![Page Image](https://bcdn.docswell.com/page/47MYDLZ37W.jpg)

医学論文を読むための医療統計
5.2 線形回帰の係数
線形回帰は、連続した結果の平均が説明変数とどう関係するかを直
線で表します。
𝑌 = 𝛽0 + 𝛽1 𝑋1 + 𝛽2 𝑋2 + ⋯ + 𝜀
𝑌 は結果、𝑋1 , 𝑋2 は治療群や年齢などの説明変数、𝛽0 は切片、𝛽1 な
どは係数、𝜀 はモデルで説明しきれない部分です。たとえば治療を受け
た群を 𝑋1 = 1、対照群を 0 としたとき、𝛽1 = −4.2 mmHg なら、モデ
ルに含めた他の変数が同じと仮定した比較で、治療群の平均血圧が 4.2
mmHg 低いという推定です。
論文で「adjusted mean difference −4.2 mmHg (95% CI −6.0 to −2.4)」
とあれば、単位は mmHg、方向は治療群で低く、区間は差がない値 0 を
含みません。どんな共変量を調整したか、その選択が臨床的に妥当か、
モデルの直線性などの仮定は適切かを Methods で確認します。
5.3 ロジスティック回帰と OR
アウトカムが「起きた／起きない」の二値の場合、ロジスティック回
帰はイベント確率そのものではなく、その確率をオッズに変換した対数
（log odds）を説明変数で表します。
log(
𝑝
) = 𝛽0 + 𝛽1 𝑋1 + 𝛽2 𝑋2 + ⋯
1−𝑝
𝑝 はイベント確率で、log は自然対数です。治療群と対照群の違いを表
す係数 𝛽1 を指数変換した 𝑒𝛽1 が、他のモデル変数を同じにした条件付
きオッズ比（調整済み OR）になります。たとえば 𝑒𝛽1 = 0.70 なら、調
整されたオッズは対照群の 0.70 倍と読みます。
「リスクが 30% 低い」と
言い換えるのは、イベントが稀な場合など限られた条件を除き正しく
ありません。[7]
Results に「adjusted OR 0.70 (95% CI 0.52–0.94)」とあったら、まず
OR なので帰無値は 1、区間は 1 を含まないと読みます。その上で、どの
患者・共変量についての条件付き比較かを確認します。調整済み OR は
調整前 OR と推定対象や尺度上の性質が異なることもあるため、数値の
変化をすべて「交絡が除けた」とは解釈できません。
20


# Page. 25

![Page Image](https://bcdn.docswell.com/page/P7R94K6RE9.jpg)

第 5 章 回帰分析と調整済み結果を読む
5.3.1 係数の単位とモデル仮定
線形回帰式の係数は、他の説明変数を一定としたとき、説明変数が 1
単位変わる場合に結果の平均がどれだけ変わるかを表します。治療群を
1、対照群を 0 と置けば、治療の回帰係数は群間の平均差に対応します。
年齢を 1 歳増やした係数なら、単位は「1 歳あたり」です。Results に回
帰係数が並んでいるときは、基準群、変数の単位、連続変数を直線的に
扱ったかを確認してください。
線形回帰では、平均の関係がモデルで想定した形に近いこと、極端な
外れ値が推定を支配していないこと、誤差の広がりや独立性に大きな
問題がないことなどが推定や標準誤差に関係します。ロジスティック回
帰でも、観測データが独立か、連続変数と log odds の関係をどうモデル
化したか、十分なイベント数があるかなどを見ます。これらのモデル仮
定が大きく外れると、推定値や信頼区間の読み方も慎重にする必要が
あります。
モデルが出した調整済み数値は、あらゆる患者に共通する自然法則で
はありません。例えば年齢とアウトカムの関係が直線でないのに単純
な直線を当てはめると、年齢効果や調整後の治療係数を誤って要約す
る可能性があります。Methods に変数の扱い、交互作用、欠測処理が書
かれているかを確認し、説明が不足していれば「モデルが妥当」という
前提がどれほど確かかを保留します。
5.4 調整済みでも残ること
調整は魔法の補正ではありません。測定した共変量に誤差があれば
調整後も影響が残り、測定していない交絡は直接扱えません。対象者の
選ばれ方や欠測、アウトカムの定義、モデルの形が不適切なら、狭い信
頼区間を持つ推定値でも偏っている可能性があります。観察研究の調整
済み関連を因果効果と呼ぶには、測定された要因で交絡が十分説明さ
れたことなど、データだけでは検証しにくい前提が要ります。
論文を読むときは、①調整前後の推定値、②調整した共変量と選択理
由、③各変数の測定時点、④欠測処理、⑤モデルの仮定と適合性、⑥推定
値の不確実性を確認します。調整前後で方向や大きさが変わったら、単
に「補正されて良くなった」とせず、何が比較に加わり、推定値の意味
21


# Page. 26

![Page Image](https://bcdn.docswell.com/page/PJXQ2LMY7X.jpg)

医学論文を読むための医療統計
がどう変わったかを尋ねます。STROBE の報告項目も、解析方法や交絡
因子を探す手がかりになりますが、チェック欄の有無だけで妥当性は
判定できません。[5] [6]
次章第 6 章では、結果に「いつイベントが起きたか」という時間情報
が加わります。Kaplan–Meier 曲線や Cox 回帰のハザード比にも、対象
となる比較とモデルの前提があることを読みます。これらのモデル結果
を含む論文全体の点検は第 9 章にまとめます。
22


# Page. 27

![Page Image](https://bcdn.docswell.com/page/3JK9MLG4JD.jpg)

CHAPTER
06
Kaplan–Meier 曲線とハザード
比
Abstract に「HR 0.72, 95% CI 0.55–0.94, p=0.01」とあったら、治療群
の生存期間が対照群より 28% 長いと読めるでしょうか。そうではあり
ません。時間イベントデータでは、イベントが起きたかどうかだけでな
く、いつ起きたか、観察がいつまで続いたかを扱います。Kaplan–Meier
曲線とハザード比（HR）は、その時間の情報を要約する道具です。数字
を読む前に、イベントの定義、追跡期間、打ち切り、モデルの仮定を確
かめましょう。
6.1 時間と打ち切りを扱う
死亡、再発、入院など「イベントまでの時間」をアウトカムにする生
存時間解析では、追跡終了時までに全員のイベントを観察できるとは
限りません。研究終了日にまだイベントがない人や、途中で転院して以
後の状況が分からなくなった人について、分かるのは「少なくとも最後
に確認した日まではイベントがなかった」ということです。その人の観
察時間は使い、以後の時間は分からないものとして扱うのが打ち切り
です。
23


# Page. 28

![Page Image](https://bcdn.docswell.com/page/LE3WY3NDE5.jpg)

医学論文を読むための医療統計
打ち切りを「イベントなし」と数えてしまうと、実際には分からない
将来までイベントが起きなかったことにしてしまいます。逆に、打ち切
られた人を単純に解析から捨てると、観察できた人だけの比較になり
得ます。生存時間解析はこの違いを扱う方法ですが、打ち切りがイベン
トリスクと関係する場合など、解析の前提が妥当かは別に点検が必要
です。二値のイベント割合に時間情報を押し込めず、イベントの有無と
観察期間の両方を使う理由です。[1]
6.2 Kaplan–Meier 曲線を読む
Kaplan–Meier（KM）曲線は、各群で「時点 t までイベントを経験せ
ずにいる割合」を追跡時間に沿って推定します。縦軸は生存確率、横軸
は時間です。ここでの「生存」は必ずしも死亡しない意味ではなく、再
発なし、入院なしなど、研究で定義されたイベントをまだ経験していな
い状態を指します。イベントが起きた時点で曲線は階段状に下がり、打
ち切りの印が付く形式では、その印自体では曲線は下がりません。打ち
切り後は、その人の情報を使えないためです。
たとえば新薬 A と標準治療を比べ、再発までの期間を追う架空の
研究を考えます。曲線が離れていれば、少なくとも図に示された期間で
は再発のない割合に群間差が見られます。ただし、曲線の離れ方だけで
差の精度や因果効果が確定するわけではありません 。図の下にある
「number at risk（リスク集合の人数）」も見てください。時間がたつと、
イベント発生や打ち切りにより各時点で比較に残る人数は減ります。追
跡後半は少数の患者に基づく推定になり、曲線の揺れも大きくなり得
ます。信頼区間、追跡期間、打ち切りの数と理由も確認します。
24


# Page. 29

![Page Image](https://bcdn.docswell.com/page/8EDK54W27G.jpg)

第 6 章 Kaplan–Meier 曲線とハザード比
1.0
治療群
イベントなしの割合
対照群
0.9
0.8
0.7
0
1
2
3
4
5
追跡時間（任意単位）
イベント直前のリスク集合人数
100
治療群100
94
87
81
76
100
対照群100
91
81
75
66
打ち切り印は各群の曲線上に表示
図 6.1 架空データの Kaplan–Meier 曲線。段差はイベント、短線は打ち切りを示し、下
段に各時点のイベント直前のリスク集合人数を示す。
6.3 ハザードと HR の意味
リスクが「一定期間にイベントを経験する確率」であるのに対し、ハ
ザードは「時点 t までイベントがなかった人が、その直後の短い時間に
イベントを経験する瞬間的な発生率」です。直感的には、今その時点ま
でイベントなく追跡中の人々の間で、次にイベントが起きる速さを表
します。ハザードは確率そのものではなく、観察期間や時点によって変
わる量です。
群 z の時点 t のハザードを ℎ𝑧 (𝑡) とすれば、群間のハザード比は次の
ように表せます。
𝐻𝑅(𝑡) =
ℎ1 (𝑡)
ℎ0 (𝑡)
分子は治療群、分母は対照群など、どちらを上に置いたかを確認しま
す。再発や死亡のような望ましくないイベントで HR が 1 未満なら、治
療群の時点ごとのハザードが低い方向です。しかしこれは生存時間の比
ではありません。さらに各群のハザードは、その時点までイベントを経
験せずリスク集合に残った人々に条件づけています。治療によってイベ
25


# Page. 30

![Page Image](https://bcdn.docswell.com/page/V7PKGM9LJ8.jpg)

医学論文を読むための医療統計
ント発生が変われば、治療群と対照群で残っている人々の構成も変わ
り得ます。そのため、HR を常に「同じ患者集団に対する瞬間リスクの
比較」や「個々人の効果」とみなすことはできません。[8]
6.4 Cox 回帰と比例ハザード
Cox 回帰は、追跡時間と打ち切りを扱いながら、治療群や年齢などの
共変量とハザードの関係をモデル化する方法です。治療指標 𝑋 が 0（対
照）または 1（治療）の単純なモデルは、次の形です。
ℎ(𝑡 ∣ 𝑋) = ℎ0 (𝑡) exp(𝛽𝑋),
𝐻𝑅 = exp(𝛽)
(6.1)
ℎ0 (𝑡) は基準群の時間ごとのハザード、𝛽 は治療群の係数です。exp(𝛽)
は係数を指数変換した HR で、1 なら比較上の差がありません。共変量
を加えたモデルでは、HR はそれらを考慮した条件付き比較です。回帰
に調整項を入れたからといって、測定されていない交絡やモデルの問題
がなくなるわけではありません。
通常の Cox モデルが一つの HR を示すとき、中心にある仮定が比例
ハザード仮定です。これは、二群のハザード比が追跡時間を通じて一定
であるという仮定です。曲線が大きく交差する、治療差が時間とともに
変わるなどの場合には、一定 HR での要約が適切でない可能性がありま
す。KM 曲線の形や解析計画、比例ハザード仮定をどう調べたかを確認
し、仮定が疑わしければ時間別の効果や、決めた時点までの生存確率・
累積発生を比較する別の要約が示されているか探します。比例ハザード
が成り立たないとき、単一の Cox HR は追跡期間や打ち切り、モデルの
指定にも左右される要約になり得ます。[8]
6.5 HR 0.7 が言わないこと
「HR 0.7」を「生存期間が 30% 延びた」と読み替えるのは誤りです。
HR 0.7 は、モデルと比例ハザード仮定のもとで、比較群に対するハザー
ドがおよそ 0.7 倍と推定されたという意味であり、生存時間を 1.3 倍に
するという意味ではありません。また、すべての患者でイベント発生が
30% 減った、あるいは各患者のハザードを一律に 30% 下げたことも示
しません。ランダム化試験であっても、観察されるのは各人の治療割付
26


# Page. 31

![Page Image](https://bcdn.docswell.com/page/2JVV69M6JQ.jpg)

第 6 章 Kaplan–Meier 曲線とハザード比
下の結果の一方だけであり、同じ人が別の割付を受けた場合の結果は
同時には見えません。個人ごとの因果効果を HR だけから特定すること
はできません。[8]
冒頭の例「HR 0.72, 95% CI 0.55–0.94, p=0.01」なら、推定値は 1 より
小さく、指定されたイベントのハザードが低い方向です。95% 信頼区間
は 1 を含まず、p 値は帰無仮説の下で今回と同等以上に極端なデータが
得られる確率を示します。しかし、これだけで絶対的に何人のイベント
を防いだか、治療によって何人のイベントを防いだか、患者の生存期間
を何日変えたかは分かりません。信頼区間の幅が示す標本誤差に加え、
比較群の KM 曲線・基準となるイベント頻度・追跡期間、そして比例ハ
ザード仮定を照らし合わせて、臨床的な大きさを判断します。Cochrane
も時間イベントデータでは打ち切りを考慮し、単純なイベント割合に
安易に置き換えないよう整理しています。[1] [8]
次章第 7 章では、時間ではなく検査結果を手がかりに、感度・特異度
と事前確率を結びつけて読みます。論文全体を読む順序は第 9 章で振り
返ります。
27


# Page. 32

![Page Image](https://bcdn.docswell.com/page/5EGLNZG2JL.jpg)

07
CHAPTER
検査結果から診断確率を考える
検査結果が陽性でも、病気が確定するとは限りません。陰性でも、病
気が完全に否定されるとは限りません。結果を読むときは、検査の性能
だけでなく、検査前にその病気がどれくらい疑われていたかを合わせ
て考えます。医学論文では感度・特異度、陽性的中率・陰性的中率、尤度
比、ROC 曲線などが登場します。それぞれが答える問いを区別すると、
数字を臨床の判断へつなげやすくなります。[9]
7.1 検査の結果を 2×2 表に置く
まず、検査を受けた人を、病気の有無と検査結果の組み合わせで整理
します。病気の有無は、検査そのものとは別の、より確かな参照標準で
判定されている必要があります。下表の「真陽性」は病気があり検査も
陽性、「偽陽性」は病気がないのに検査が陽性だった人です。
表 7.1
診断検査の 2×2 表
病気あり
病気なし
合計
検査陽性
真陽性 a
偽陽性 b
a+b
検査陰性
偽陰性 c
真陰性 d
c+d
a+c
b+d
a+b+c+d
合計
28


# Page. 33

![Page Image](https://bcdn.docswell.com/page/4JQYQLX97P.jpg)

第 7 章 検査結果から診断確率を考える
この表の縦方向を見ると、病気がある人のうち何人を陽性と拾えた
か、病気がない人のうち何人を陰性と判定できたかが分かります。横方
向を見ると、陽性または陰性という結果を得た人のうち、実際に病気が
ある割合が分かります。分母の向きが違うことが、指標を取り違えない
鍵です。
7.2 感度・特異度
感度は、病気のある人を検査陽性と判定する割合です。式では「感度
= a/(a+c)」。特異度は、病気のない人を検査陰性と判定する割合で、
「特
異度 = d/(b+d)」です。どちらも病気の状態を先に固定して考える指標で
す。感度が高い検査では見逃し（偽陰性）が比較的少なく、特異度が高
い検査では誤った陽性（偽陽性）が比較的少ない、と読めます。
たとえば病気のある 100 人中 90 人が陽性なら感度は 90%。病気のな
い 100 人中 80 人が陰性なら特異度は 80% です。これは「陽性者の 90%
が病気」という意味ではありません。感度・特異度は参照標準や対象患
者、検査の実施条件、陽性とする閾値によって変わり得ます。論文では
どの患者群で、どの基準を用いて評価した値なのかを確かめます。
7.3 陽性的中率と陰性的中率
陽性的中率（PPV）は、検査陽性者のうち実際に病気がある割合で、
「PPV = a/(a+b)」
。陰性的中率（NPV）は、検査陰性者のうち病気がない割
合で、
「NPV = d/(c+d)」です。患者や診療場面にとって直感的な問いに近
い一方で、病気の頻度に強く左右されます。感度・特異度が同じ検査で
も、病気がまれな集団では陽性者に占める偽陽性の割合が大きくなり、
PPV は低くなり得ます。[9]
架空の検査を考えます。感度 90%、特異度 90% の検査を、病気の事前
確率が 1% の 1 万人に行うとします。病気ありは 100 人で、陽性は 90 人、
陰性は 10 人です。病気なしは 9,900 人で、陰性は 8,910 人、陽性は 990
人です。陽性者は合計 1,080 人なので、PPV は 90/1,080、約 8.3%。陰性
者は 8,920 人なので、NPV は 8,910/8,920、約 99.9% です。感度・特異度
がともに 90% でも、陽性結果だけで病気の可能性が高いとは言えない
状況があります。
29


# Page. 34

![Page Image](https://bcdn.docswell.com/page/K74WND2RE1.jpg)

医学論文を読むための医療統計
同じ検査を事前確率 50% の集団に当てはめると、病気あり・なしが各
100 人の例では真陽性 90、偽陰性 10、偽陽性 10、真陰性 90 となり、PPV
は 90%、NPV も 90% です。これは、検査の成績が事前確率で変わると
いう意味ではなく、結果を受け取る集団の病気の頻度によって予測値
が変わるということです。論文の PPV を目の前の患者にそのまま当て
はめず、その患者の事前確率や研究集団との違いを考えます。
7.4 尤度比で確率を更新する
尤度比（LR）は、ある検査結果が病気のある人とない人のどちらでど
れだけ起こりやすいかを表します。陽性尤度比は「LR+ = 感度/(1−特異
度)」、陰性尤度比は「LR− = (1−感度)/特異度」です。LR+が大きいほど陽
性結果は病気を支持し、LR−が小さいほど陰性結果は病気の可能性を下
げます。どちらも単独で診断確率を示すものではありません。
事前確率をオッズに直し、尤度比を掛けて事後オッズにします。確率
p のオッズは「p/(1−p)」、したがって「事後オッズ = 事前オッズ × LR」で
す。最後に、確率は「オッズ/(1+オッズ)」で戻せます。先ほどの検査で
は、LR+ = 0.90/0.10 = 9、LR− = 0.10/0.90 ≈ 0.11 です。事前確率 1% なら
事前オッズは 0.01/0.99 ≈ 0.0101。陽性後は 0.0101×9 ≈ 0.091 となり、事
後確率は約 8.3% です。陰性後は 0.0101×0.11 ≈ 0.0011 で、事後確率は約
0.11% です。陽性は可能性を上げますが、低い事前確率を一度の検査で
必ず高い確率へ変えるわけではありません。[9]
30


# Page. 35

![Page Image](https://bcdn.docswell.com/page/LJ1Y5ZMVEG.jpg)

第 7 章 検査結果から診断確率を考える
感度
7.5 ROC 曲線と AUC
偽陽性率（1−特異度）
図 7.1 閾値を変えたときの感度と偽陽性率の架空 ROC 曲線。
連続値で結果が出る検査では、どこからを陽性とするか（閾値）を動
かすと、感度と偽陽性率（1−特異度）が変わります。ROC 曲線は、複数
の閾値での感度を縦軸、偽陽性率を横軸に示したものです。閾値を下げ
れば陽性と判定される人が増え、感度が上がる一方、偽陽性も増えるこ
とがあります。閾値を選ぶ判断には、見逃しと不要な追加検査・治療の
どちらをどれだけ避けたいかという臨床上の重みが関わります。
AUC は ROC 曲線の下の面積で、病気のある人とない人を検査値でど
の程度順位づけできるかを要約します。AUC が高いほど識別能が高い
傾向を示しますが、特定の閾値での感度・特異度や、患者の事後確率、
患者にとっての利益を直接表す値ではありません。対象集団、参照標
準、閾値の設定方法を確認し、性能指標を診療場面へ移す際には事前確
率も考えます。
論文全体を読む順序と最終チェックは第 9 章にまとめています。
なお、本章で引用した資料は、診断指標と事前確率・尤度比の関係を
扱う StatPearls 章の書誌情報とアクセス可能な索引要約に限られ、章本
文そのものは取得できていません。引用はこの範囲の一般的な関係を
示すために付しています。数値例は説明用に作った架空例です。[9]
31


# Page. 36

![Page Image](https://bcdn.docswell.com/page/GJWG593372.jpg)

CHAPTER
08
メタ解析と forest plot を読む
複数の研究が同じ問いを扱っているとき、それらの結果を統計的にま
とめる方法がメタ解析です。研究を一つずつ読むと、対象者数が少なく
信頼区間が広いことがあります。共通の問いに答える研究を適切に統合
できれば、推定の精度を高められる場合があります。しかし、数を足せ
ば結論が正しくなるわけではありません。対象患者、介入、比較対照、
アウトカム、追跡期間が大きく異なる研究を一つの値に押し込むと、臨
床的に意味の乏しい平均を作ってしまいます。統合前に、何をどの範囲
の患者について知りたいのかを確認します。[10]
8.1 複数研究を統合する意味
メタ解析は通常、各研究で同じ効果尺度による推定値を得て、その不
確実性を踏まえて統合する二段階で考えます。たとえば各試験のリスク
比（RR）を比較するなら、イベントの定義、評価時点、対象集団、比較
の向きがそろっているかを先に確かめます。研究間の違いは単なる計算
上の問題ではなく、
「どの患者に、どの治療をしたときの効果か」とい
う臨床の問いそのものに関わります。統合値が得られても、各研究のバ
イアスや欠測、報告されなかった研究は消えません。[10]
本章の説明に使う架空例として、同じ治療と標準治療を比べた 3 試験
の RR を 0.60、0.80、1.00、log(RR)の標準誤差をそれぞれ 0.10、0.20、0.15
32


# Page. 37

![Page Image](https://bcdn.docswell.com/page/4EZLN9VG73.jpg)

第 8 章 メタ解析と forest plot を読む
とします。これは説明用の数字であり、実在する薬や研究の結果ではあ
りません。比の尺度は、通常、対数（log）に変換した値を統合してから
元の尺度へ戻します。異なる研究の結果を統合する際には、どの尺度で
何を平均しているかを把握することが大切です。
8.2 重み付き平均の直感
推定値の精度が高い研究ほど、統合値を決める情報を多く持ちます。
標準誤差（SE）が小さい、つまり推定値の揺れが小さい研究には大きな
重みを置きます。逆分散法の基本形は次の通りです。
𝜃̂統合 =
∑𝑖 𝑤𝑖 𝜃̂𝑖
∑𝑖 𝑤𝑖
,
𝑤𝑖 =
1
𝑆𝐸𝑖2
(8.1)
ここで 𝜃̂𝑖 は研究 𝑖 の効果推定値、𝑆𝐸𝑖 はその標準誤差、𝑤𝑖 は重みで
す。この比の例では 𝜃̂𝑖 = log(𝑅𝑅𝑖 ) として計算し、log(RR)の逆分散重み
は 100、25、約 44 です。固定効果モデルで統合すると RR は約 0.72、95%
CI は約 0.62〜0.83 になります。SE が最小の第 1 試験が最も強く統合値
に影響します。式は計算手順を暗記するためでなく、
「症例数が多いから
常に同じ重さ」ではなく推定精度も重みに反映される、と読むためのも
のです。[10]
8.3 forest plot の読み方
forest plot（フォレストプロット）は、研究ごとの効果推定値と 95%
信頼区間（CI）、統合推定値を並べた図です。まず横軸と「効果なし」の
位置を探します。RR や OR なら通常は 1、平均差なら 0 が基準です。各行
の四角は研究の推定値、横線は CI を表し、四角の面積が大きいほど重
みが大きい表示が一般的です。横線が効果なしの線をまたぐ研究は、そ
の研究単独では効果なしと両立する範囲を含みますが、それだけで「効
果がない」とは言えません。
図の下部のひし形は統合推定値を示し、中央が点推定値、幅がその CI
です。ひし形が効果なしの線をまたぐかどうかだけで結論を決めず、効
果の向きと大きさ、CI の幅、臨床的に重要な差を含むかを読みます。架
空例で RR 0.60、0.80、1.00 の研究が並んでいても、個々の線の重なり、
33


# Page. 38

![Page Image](https://bcdn.docswell.com/page/Y76W8K5Q7V.jpg)

医学論文を読むための医療統計
統合後の幅、対象の違いを合わせて確認します。比の横軸は対数目盛で
描かれることが多く、左右の距離を通常の算術差と同じに見なさない
ことにも注意します。[10]
試験1
0.600 [0.493, 0.730] 重み 100
試験2
0.800 [0.541, 1.184] 重み 25
試験3
1.000 [0.745, 1.342] 重み 44.44
統合
0.716 [0.616, 0.832] 重み 169.44
0.25
0.5
1
2
リスク比（対数目盛）
図 8.1
架空の 3 研究のリスク比と 95% 信頼区間、統合値を示す forest plot。
8.4 異質性と I²
研究間の結果の違いを異質性と呼びます。診療環境、患者の重症
度、治療量や併用治療、アウトカムの測り方、追跡期間、研究方法が違
えば、真の治療効果が異なることもあります。偶然の標本変動だけで説
明しにくい統計的な違いを示す指標の一つが I²です。I²は観察された研
究間のばらつきのうち、標本誤差を超える差が占める割合を概算する
統計量です。0〜100% で示され、異質性の程度を読む手掛かりになりま
すが、研究数が少ないと推定は不確かで、境界値だけで機械的に判断で
きません。
I²は治療効果の差そのものの大きさでも、研究結果の臨床的重要性で
もありません。たとえば小さな差でも各研究が非常に精密なら I²が高く
なり得ますし、研究数が少なければ重要な差を見逃し得ます。研究間分
散を表す τ²（tau²）は、採用した効果尺度上で研究ごとの真の効果がど
れほど散らばるかを表す量です。Q 検定の p 値が有意かどうかで固定効
果かランダム効果かを選ぶのではなく、患者・介入・方法の違いが結果
にどう関係するかを検討します。[10]
固定効果モデルは、すべての研究が共通する一つの真の効果を推定し
ている、という考え方のもとでその効果を要約します。ランダム効果モ
34


# Page. 39

![Page Image](https://bcdn.docswell.com/page/G75M9PY274.jpg)

第 8 章 メタ解析と forest plot を読む
デルは研究ごとに真の効果が異なると考え、研究間分散 τ²も重みに織
り込んで、効果の分布の平均を要約します。したがって両者は同じ問い
に対する「厳しさの違い」ではなく、標的とする要約が異なります。ラ
ンダム効果モデルの信頼区間は平均効果の不確実性を表し、将来のある
研究で期待される効果の散らばりを直接示すものではありません。研
究間の範囲を知りたい場合、予測区間が参考になりますが、研究数が少
ないとこれも不確かです。[10]
8.5 PRISMA と統合結果の限界
統合結果では、相対効果だけでなく、想定する対照群リスクに当ては
めた絶対リスクや絶対差も確認します。相対効果が同じでも、もともと
のリスクが違えば患者が得る絶対利益は異なります。また、二値アウト
カムでイベントがまれな場合、ゼロ件の扱いや選んだ統計手法によっ
て結果が変わり得ます。どの研究を含めるか、欠測値をどう扱うか、固
定効果・ランダム効果の選択、効果尺度の選択を変えても結論が保たれ
るかを調べるのが感度分析です。結論が特定の一つの判断に左右される
なら、その依存性自体を読者に伝える必要があります。[10]
小規模研究の方が大きな効果を示すなど、出版バイアスや小規模研究
効果が疑われる場合もあります。funnel plot の左右非対称性は注意を促
しますが、研究規模による効果の違いや偶然でも生じるため、非対称だ
けで出版バイアスが証明されたとは言えません。未公表研究を含む検
索の範囲、研究選択の理由、資金源、リスク・オブ・バイアス評価、欠
測データの扱いも確かめます。研究が多いことや統合値が精密であるこ
とは、系統的な偏りがない保証ではありません。[10]
PRISMA 2020 は、システマティックレビューの報告に必要な項目を示
すガイドラインです。27 項目のチェックリストと拡張版、抄録用チェッ
クリスト、新規・更新レビュー用のフローダイアグラムなどが用意され、
説明と実例を示す解説論文と併用することが勧められています。フロー
ダイアグラムでは検索で見つかった記録、重複除外、全文確認、最終的
に採用した研究の数と除外理由を追えます。報告の透明性を確かめる助
けになりますが、項目が埋まっていることだけで研究の質や結論の正
しさが保証されるわけではありません。[11, 12]
35


# Page. 40

![Page Image](https://bcdn.docswell.com/page/9J2926G1ER.jpg)

医学論文を読むための医療統計
論文全体を読む順序と最終チェックは第 9 章にまとめています。論文
を読むときは、統合値を先に受け入れるのではなく、①レビューの問い
と対象が臨床上まとまっているか、②効果尺度と統合モデルが何を要
約するか、③forest plot の個別研究と CI にどんな違いがあるか、④I²や
τ²が示す不確実性と臨床的な違いは何か、⑤感度分析や出版バイアスへ
の検討で結論が変わるか、の順に確認します。メタ解析は根拠を見通し
よくまとめる道具ですが、元の研究を批判的に読む作業を置き換える
ものではありません。次章ではここまでの視点をつなぎ、実際の論文を
読む手順を組み立てます。
36


# Page. 41

![Page Image](https://bcdn.docswell.com/page/DEY4Y9V4JM.jpg)

CHAPTER
09
医学論文を読むためのチェック
リスト
9.1 Results を読む順序
論文の結果は、Abstract の結論だけを読んでも十分には分かりませ
ん。Methods で何をどう比べたかを確かめ、Results では「誰に、何を、
どの期間、どの尺度で調べた数字か」をたどります。研究デザインは因
果推論の範囲を、アウトカムと効果尺度は数字の意味を決めます。前章
までの概念をつなぎ、次の順で確認しましょう。
まず研究デザインと対象患者を確認します。ランダム化試験か観察研
究か、参加・除外条件、診療場所、登録時期、比較群、追跡期間を見ま
す。次に主要評価項目（primary outcome）が事前に定められ、臨床的
に意味のあるものか確かめます。イベント数と群の人数を読み、効果量
が RR・OR・リスク差・平均差・HR のどれかを区別します。
その後、点推定値と 95% 信頼区間（95%CI）を帰無値と照らし合わせ、
区間がどのくらい広いかを考えます。相対効果だけで終わらず、基準リ
スクと絶対効果に読み替えます。調整済み結果なら何を調整したか、欠
測や脱落、プロトコルからの変更、限界、一般化できる患者の範囲を確
認します。
37


# Page. 42

![Page Image](https://bcdn.docswell.com/page/VJNYPLM678.jpg)

医学論文を読むための医療統計
9.2 結果の一文を翻訳する
たとえば Abstract に「HR 0.72, 95% CI 0.55–0.94, p=0.01」とありま
す。この一文から直接言えるのは、解析モデルが要約した時間イベント
のハザード比の推定値が 0.72 で、区間は 1 を含まず、対応する検定では
帰無値との不整合が示されたということです。HR は生存期間が 28% 延
びた意味ではなく、個人ごとのイベント率が必ず 28% 減ったと保証
するものでもありません。比例ハザードの仮定や追跡中の曲線、対象患
者、イベントの定義を Methods と図表で確かめます。[1] [8]
さらに「p=0.01 だから大きな臨床効果」とは言えません。絶対的なイ
ベント差や患者に重要な利益・害、区間の幅を見ます。観察研究なら未
測定交絡が残り得ます。結果の一文を自分の言葉で説明するときは、数
字が示す範囲と、研究の設計・モデルに依存する部分を分けるのがこつ
です。
9.3 論文読解チェックリスト
論文の Abstract、Methods、Results、主要な表図を読むときに、次の
項目を手元で確認してください。
1. 研究デザイン：RCT、コホート、症例対照、横断研究、診断精度研
究、系統的レビューのどれか。
2. 対象患者：どこで、いつ、どんな条件の人が参加し、誰が除外され
たか。
3. 比較群：介入・曝露と比較対照は何か。割付や選択の仕組みはど
うか。
4. 主要評価項目：primary outcome は何で、いつ、どのように測定し
たか。望ましい結果か。
5. 分母と追跡期間：各群の人数、イベント数、欠測、脱落はどの程度
か。追跡期間は同じか。
6. 効果量：平均差、RR、OR、リスク差、NNT、HR など、どの尺度
で示されたか。帰無値は 0 か 1 か。
7. 95% 信頼区間（95%CI）：点推定値だけでなく、どの範囲の効果
と整合するか。狭さは精度を、偏りのなさを保証しない。
38


# Page. 43

![Page Image](https://bcdn.docswell.com/page/YE9P34NRJ3.jpg)

第 9 章 医学論文を読むためのチェックリスト
8. 絶対効果：相対効果を基準リスク、追跡期間、絶対リスク差に結び
つけると、患者 100 人あたりどの程度の差か。
9. p 値と臨床的重要性：有意かだけで判断せず、効果の大きさ、区間、
患者にとっての意味を考えたか。
10. 調整因子：何を、なぜ調整したか。調整前後で変化したか。残余交
絡やモデル仮定はないか。
11. 限界と一般化可能性：選択・測定バイアス、欠測、追跡、精度、他
の患者・施設への適用に懸念はあるか。
12. 報 告 の 透 明 性 ： RCT な ら CONSORT、 観 察 研 究 な ら STROBE、
systematic review / meta-analysis なら PRISMA の項目を、情報を
探す手がかりにしたか。チェックリストの充足だけを研究の質の
点数や妥当性の証明と誤解していないか。[3] [5] [13] [11] [10] [6]
表 9.1 医学論文を読むための確認表
順
確認すること
主に見る場所
1
研究デザイン・対象患者・比較群
Methods
2
primary outcome・分母・追跡期間
Methods / Table 1
3
効果量・95%CI・絶対効果
Results / Figure
4
調整因子・欠測・脱落
Statistical methods / Results
5
バイアス・限界・一般化可能性
Discussion / Supplement
一文でまとめる
「この研究では、誰を何と比べ、どのアウトカムを、どの効果尺度
でどの程度推定した。区間はこの幅で、絶対的にはこの程度の差で
ある。ただし、こうした前提や限界があるため、ここまでしか言え
ない。」と説明できれば、数字を結論に飛躍させずに読めています。
9.4 数字の先にある患者を考える
統計結果は、患者にとって重要な利益や害を考える材料です。p 値や
「有意」の一語で判断を終えず、どの患者にどのくらいの利益があり得
るのか、どんな副作用があるのか、本人が何を大切にするのかを考えま
39


# Page. 44

![Page Image](https://bcdn.docswell.com/page/GE8DMQKGED.jpg)

医学論文を読むための医療統計
す。研究に参加した人と、目の前の患者が違うなら、その違いも結論の
一部です。
本書の目的は、解析を暗算することではなく、Methods と Results に
ある数字を根拠と限界とともに説明することです。次の論文を開いた
ら、チェックリストを使い「何が言えて、何はまだ分からないか」を一
つずつ言葉にしてみてください。
参考文献
[1] Higgins JP, Li T, Deeks JJ. Chapter 6: Choosing effect measures and
computing estimates of effect. Cochrane Handbook for Systematic Reviews of
Interventions, version 6.5, Cochrane, 2024 年. https://training.cochrane.
org/handbook/current/chapter-06 (参照 2026 年 9 月 27 日).
[2] Philip Sedgwick. Confidence intervals, P values, and statistical significance.
BMJ, 350:h1113, BMJ, 2015 年 2 月 27 日. https://www.bmj.com/content/350/
bmj.h1113 (参照 2026 年 9 月 27 日).
[3] Hopewell S, Chan A-W, Collins GS, Hróbjartsson A, Moher D, Schulz KF,
et al. CONSORT 2025 statement: updated guideline for reporting randomised
trials. The BMJ, 389:e081123, BMJ Publishing Group, 2025 年 4 月 14 日.
https://www.bmj.com/content/389/bmj-2024-081123 (参照 2026 年 9 月 27
日).
[4] Hopewell S, Chan A-W, Collins GS, Hróbjartsson A, Moher D, Schulz KF,
et al. CONSORT 2025 explanation and elaboration: updated guideline for
reporting randomised trials. The BMJ, 389:e081124, BMJ Publishing Group,
2025 年 4 月 14 日. https://www.bmj.com/content/389/bmj-2024-081124 (参
照 2026 年 9 月 27 日).
[5] STROBE Initiative. Checklists. STROBE Statement website, STROBE
Initiative, 日付なし. https://www.strobe-statement.org/checklists/ (参照
2026 年 9 月 27 日).
[6] Erik von Elm, Douglas G Altman, Matthias Egger, Stuart J Pocock, Peter C
Gøtzsche, Jan P Vandenbroucke, STROBE Initiative. Strengthening the
Reporting of Observational Studies in Epidemiology (STROBE) statement:
guidelines for reporting observational studies. BMJ, 335:806–808, BMJ, 2007 年
10 月 20 日. https://www.bmj.com/content/335/7624/806 (参照 2026 年 9 月
27 日).
[7] Thomas F Monaghan, Syed N Rahman, Christina W Agudelo, Alan J
Wein, Jason M Lazar, Karel Everaert, Roger R Dmochowski. Foundational
Statistical Principles in Medical Research: A Tutorial on Odds Ratios, Relative
Risk, Absolute Risk, and Number Needed to Treat. International Journal of
Environmental Research and Public Health, 18(11):5669, MDPI, 2021 年 5
40


# Page. 45

![Page Image](https://bcdn.docswell.com/page/LELM3XZX7R.jpg)

第 9 章 医学論文を読むためのチェックリスト
月 25 日. https://pmc.ncbi.nlm.nih.gov/articles/PMC8198228/ (参照 2026 年
9 月 27 日).
[8] Michael P Fay, Fan Li. Causal Interpretation of the Hazard Ratio in
Randomized Clinical Trials. Clinical Trials, 21(5):623–635, SAGE
Publications, 2024 年 4 月 28 日. https://pmc.ncbi.nlm.nih.gov/articles/PMC
11502288/ (参照 2026 年 9 月 27 日).
[9] Jacob Shreffler, Martin R. Huecker. Diagnostic Testing Accuracy: Sensitivity,
Specificity, Predictive Values and Likelihood Ratios. StatPearls [Internet],
StatPearls Publishing, 2023 年 3 月 6 日. https://pubmed.ncbi.nlm.nih.gov/
32491423/ (参照 2026 年 9 月 27 日).
[10] Jonathan J Deeks, Julian PT Higgins, Douglas G Altman, Joanne E
McKenzie, Areti Angeliki Veroniki. Chapter 10: Analysing data and
undertaking meta-analyses. Cochrane Handbook for Systematic Reviews of
Interventions, version 6.5, Cochrane, 2024 年 11 月. https://www.cochrane.
org/authors/handbooks-and-manuals/handbook/current/chapter-10 (参照
2026 年 9 月 27 日).
[11] PRISMA Group. PRISMA 2020 statement. PRISMA Statement website,
PRISMA Group, 日付なし. https://www.prisma-statement.org/prisma-2020
(参照 2026 年 9 月 27 日).
[12] Matthew J Page, Joanne E McKenzie, Patrick M Bossuyt, Isabelle
Boutron, Tammy C Hoffmann, Cynthia D Mulrow, et al. PRISMA 2020
statement paper. PRISMA statement website; links to BMJ 2021;372:n71,
PRISMA statement, 2021 年. https://www.prisma-statement.org/prisma2020-statement (参照 2026 年 9 月 27 日).
[13] STROBE Initiative. Publications of STROBE Statement. STROBE Statement
website, STROBE Initiative, 日付なし. https://www.strobe-statement.org/
strobe-publications/ (参照 2026 年 9 月 27 日).
41


