<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>数学 &gt; 確率・統計 on M1KE BL0G</title><link>https://www.m1ke.org/categories/math_stats/</link><description>Recent content in 数学 &gt; 確率・統計 on M1KE BL0G</description><generator>Hugo -- gohugo.io</generator><language>ja-jp</language><copyright>mike</copyright><atom:link href="https://www.m1ke.org/categories/math_stats/index.xml" rel="self" type="application/rss+xml"/><item><title>正規分布の公式の意味</title><link>https://www.m1ke.org/p/%E6%AD%A3%E8%A6%8F%E5%88%86%E5%B8%83%E3%81%AE%E5%85%AC%E5%BC%8F%E3%81%AE%E6%84%8F%E5%91%B3/</link><pubDate>Mon, 18 Mar 2024 11:53:18 +0900</pubDate><guid>https://www.m1ke.org/p/%E6%AD%A3%E8%A6%8F%E5%88%86%E5%B8%83%E3%81%AE%E5%85%AC%E5%BC%8F%E3%81%AE%E6%84%8F%E5%91%B3/</guid><description>&lt;img src="https://www.m1ke.org/p/%E6%AD%A3%E8%A6%8F%E5%88%86%E5%B8%83%E3%81%AE%E5%85%AC%E5%BC%8F%E3%81%AE%E6%84%8F%E5%91%B3/normal-distrib1.png" alt="Featured image of post 正規分布の公式の意味" /&gt;&lt;h2 id="概要"&gt;概要&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;統計でよくみる正規分布の式&lt;/li&gt;
&lt;li&gt;平均値の周りにランダムに分布するという式&lt;/li&gt;
&lt;li&gt;その意味を分解して説明する&lt;/li&gt;
&lt;/ul&gt;
$$
f(x) = \frac{1}{\sqrt{2\pi \sigma^2}} \exp \left(-\frac{(x - \mu)^2}
{2\sigma^2} \right) \hspace{20px} (-\infty &lt; x &lt; \infty)
$$&lt;h2 id="正規分布の条件"&gt;正規分布の条件&lt;/h2&gt;
&lt;p&gt;正規分布の目的（条件）は次の4つ。&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;ピークが1つ&lt;/li&gt;
&lt;li&gt;ピークを中心に左右対称&lt;/li&gt;
&lt;li&gt;指数関数の速さで0に漸近&lt;/li&gt;
&lt;li&gt;面積は1&lt;/li&gt;
&lt;/ol&gt;
&lt;h2 id="条件の内訳"&gt;条件の内訳&lt;/h2&gt;
&lt;h3 id="ピークが1つ"&gt;ピークが1つ&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;平均値 $\mu$ を中心にした分布であり、データが最も集中している場所を示す&lt;/li&gt;
&lt;li&gt;つまり、平行移動すればOK&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="ピークを中心に左右対称"&gt;ピークを中心に左右対称&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;正と負で対象にしたいので、二乗すればOK&lt;/li&gt;
&lt;li&gt;つまり、$(x - \mu)^2$&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="指数関数の速さで0に漸近"&gt;指数関数の速さで0に漸近&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;ゼロに漸近なので、$\frac{1}{x}$で&lt;/li&gt;
&lt;li&gt;2の条件を適用すると、$\frac{1}{x^2}$&lt;/li&gt;
&lt;li&gt;ただし、x=0 =&amp;gt; エラーになってしまうので、$\frac{1}{x^2+1}$&lt;/li&gt;
&lt;li&gt;ただし、リアルの分布は端になるほど急にしなければいけない
&lt;ul&gt;
&lt;li&gt;例) サイコロをn回振った時の分布だと$(\frac{1}{6})^n$で、反比例の傾きだと弱い
&lt;ul&gt;
&lt;li&gt;$\frac{1}{x}$でも$\frac{1}{x^2}$でも逆数は遅い&lt;/li&gt;
&lt;li&gt;$(\frac{1}{a})^x$のような指数の方が早い&lt;/li&gt;
&lt;li&gt;$a$は関数のパラメーター&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;サイコロのように試行=指数関数的に作用する&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;$(\frac{1}{a})^n = a^{-n}$になる&lt;/li&gt;
&lt;li&gt;それらを加味すると次になる
&lt;ul&gt;
&lt;li&gt;$\frac{1}{e^{(x-\mu)^2}} = e^{-(x - \mu)^2}$
&lt;ul&gt;
&lt;li&gt;$(x - \mu)$だけずらすのは、1の条件のため&lt;/li&gt;
&lt;li&gt;$(x - \mu)^2$乗するのは、2の条件のため&lt;/li&gt;
&lt;li&gt;$a^{-(x - \mu)^2}$乗するのは、3の条件のため&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;原型としては、次となる。&lt;/p&gt;
$$
\frac{1}{a^{(x-\mu)^2}} = a^{-(x - \mu)^2}
$$&lt;h3 id="面積は1"&gt;面積は1&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;面積を面積で割れば1となるので、それを利用するため面積の式を求める&lt;/li&gt;
&lt;li&gt;面積は次の式となる&lt;/li&gt;
&lt;/ul&gt;
$$
f(x) = \frac{1}{a^{(x-\mu)^2}} = a^{-(x - \mu)^2} \\\\
s = \int_{-\infty}^{+\infty} f(x) dx
$$&lt;ul&gt;
&lt;li&gt;単純化するために
&lt;ul&gt;
&lt;li&gt;定数の$\mu$は一旦無視する&lt;/li&gt;
&lt;li&gt;aはある定数とする&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;積分するため、底をaからeに書き直す&lt;/li&gt;
&lt;li&gt;目的関数はf(x)&lt;/li&gt;
&lt;/ul&gt;
$$
f(x) = a^{-x^2} \\\\
a = e^{\log a} \\\\
f(x) = e^{(\log a)^{-x^2}} \\\\
f(x) = e^{\log a \times -x^2} \\\\
A = \log a \\\\
f(x) = e^{A \times -x^2} \\\\
f(x) = a^{-x^2} = e^{-A x^2} = e^{- \log a \times x^2} \\\\
$$&lt;p&gt;最後の行はを積分すると、下のようになる。&lt;/p&gt;
$$
\int f(x) = \int_{-\infty}^{\infty}e^{-Ax^2}dx=\sqrt{\dfrac{\pi}{A}}
$$&lt;p&gt;下にガウス積分の公式を示す。&lt;/p&gt;
$$
\int_{-\infty}^{\infty}e^{-ax^2}dx=\sqrt{\dfrac{\pi}{a}}
$$&lt;p&gt;この面積を逆数にして、もともとの関数にかければ結果が1になるので、下のようになる。&lt;/p&gt;
$$
\sqrt{\frac{A}{\pi}} e^{-A x^2}
$$&lt;p&gt;最後条件1を満たすために、平行移動（$B$）の定数を入れると次になる。&lt;/p&gt;
$$
f(x) = \sqrt{\frac{A}{\pi}} e^{-A (x -B)^2}
$$&lt;ul&gt;
&lt;li&gt;条件1, 2, 3, 4を満たした、正規分布の原型の式が完成する&lt;/li&gt;
&lt;li&gt;この原型の変数AとBを調整する方法は次
&lt;ul&gt;
&lt;li&gt;&lt;code&gt;5. ヒストグラムから計算された平均と分散と、この原型の式から計算された平均と分散が一致すること。&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;という条件5を満たすAとBを探す&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="bのパラメータ"&gt;Bのパラメータ&lt;/h4&gt;
&lt;p&gt;Bの方は単純に平均を当てればOK。&lt;/p&gt;
&lt;h4 id="aのパラメータ"&gt;Aのパラメータ&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;Aの方は単純から計算すればいい&lt;/li&gt;
&lt;li&gt;Bは既に$\mu$としてわかっている
&lt;ul&gt;
&lt;li&gt;NOTE: $f(x)$は確率が戻り値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;分散は次を満たせばいい&lt;/li&gt;
&lt;/ul&gt;
$$
var = \sigma^2 = V(X) = \int (x - B)^2 f(x) dx \\\\
$$&lt;p&gt;Bは定数で面積に影響がないので、0と置くと以下になる。&lt;/p&gt;
$$
var = \sigma^2 = \int x^2 f(x) dx \\\\
var = \sigma^2 = \int x^2 \sqrt{\frac{A}{\pi}} e^{-A x^2} dx \\\\
$$&lt;p&gt;係数を前に出すと次になる。&lt;/p&gt;
$$
var = \sigma^2 = \sqrt{\frac{A}{\pi}} \int x^2 e^{-A x^2} dx
$$&lt;p&gt;次の&lt;a class="link" href="https://mathwords.net/gausssekibun" target="_blank" rel="noopener"
&gt;ガウス積分の公式&lt;/a&gt;に当てはめられる。&lt;/p&gt;
$$
\int_{-\infty}^{\infty} x^{2n}e^{-ax^2}dx
=\dfrac{(2n-1)!!}{2^na^n}\sqrt{\dfrac{\pi}{a}}
$$&lt;p&gt;今回はn=1なので次になる。&lt;/p&gt;
$$
\int_{-\infty}^{\infty}x^2e^{-ax^2}dx=\dfrac{1}{2a}\sqrt{\dfrac{\pi}{a}}
$$&lt;p&gt;つまり、次となる。&lt;/p&gt;
$$
var = \sqrt{\frac{A}{\pi}} \frac{1}{2A} \sqrt{\frac{\pi}{A}}
$$&lt;p&gt;よって以下となる。&lt;/p&gt;
$$
var = \sigma^2 = V(X) = \frac{1}{2A}
$$&lt;ul&gt;
&lt;li&gt;結果は分散=$\frac{1}{2A}$&lt;/li&gt;
&lt;li&gt;つまり、$\frac{1}{2A}$の$A$に逆$\frac{1}{2 \sigma^2}$を仕込めば、&lt;/li&gt;
&lt;li&gt;結果は$var = \sigma^2$になる&lt;/li&gt;
&lt;li&gt;つまり、$A=\frac{1}{2 \sigma^2}$となる&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="4つの条件のまとめ"&gt;4つの条件のまとめ&lt;/h3&gt;
&lt;p&gt;これらの定数AとBを正規分布の原型に当てはめると、完成する。&lt;/p&gt;
$$
A = \frac{1}{2 \sigma^2}, \\; B = \mu \\\\
f(x) = \sqrt{\frac{A}{\pi}} e^{-A (x -B)^2} \\\\
f(x) = \frac{1}{\sqrt{2\pi \sigma^2}} \exp \left(-\frac{(x - \mu)^2}
{2\sigma^2} \right) \hspace{20px}
$$&lt;h3 id="正規分布の変曲点について"&gt;正規分布の変曲点について&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;上の$f(x)$を二回微分した関数の傾きが0になるところを求めると$f''(x)=0$&lt;/li&gt;
&lt;li&gt;$x = \mu \pm \sigma$ となる&lt;/li&gt;
&lt;li&gt;つまり、傾きが凸から凹に変わる傾き=0の点が$\mu \pm \sigma$ということ&lt;/li&gt;
&lt;li&gt;また、正規標準分布の場合は平均は1、SDは1になるので、1の地点で凹凸の変曲点となる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;p&gt;正規分布の式は、次のように導かれる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;分散 $\sigma^2$ と平均 $\mu$ を用いて、データの分布の広がりと中心を調整する&lt;/li&gt;
&lt;li&gt;式内の $\exp\left(-\frac{(x - \mu)^2}{2\sigma^2}\right)$ 部分は、データが平均から離れるほど値が小さくなることを示しており、分布が急速に0に近づくことを表す&lt;/li&gt;
&lt;li&gt;分布の全体の面積を1に保つため、$\frac{1}{\sqrt{2\pi \sigma^2}}$ で正規化される&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="参考文献"&gt;参考文献&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class="link" href="https://bellcurve.jp/statistics/glossary/2080.html" target="_blank" rel="noopener"
&gt;正規分布 | 統計用語集 | 統計WEB&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class="link" href="https://mathwords.net/gausssekibun" target="_blank" rel="noopener"
&gt;ガウス積分まわりの公式リスト - 具体例で学ぶ数学&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>確率の復習</title><link>https://www.m1ke.org/p/%E7%A2%BA%E7%8E%87%E3%81%AE%E5%BE%A9%E7%BF%92/</link><pubDate>Fri, 20 Oct 2023 21:32:47 +0900</pubDate><guid>https://www.m1ke.org/p/%E7%A2%BA%E7%8E%87%E3%81%AE%E5%BE%A9%E7%BF%92/</guid><description>&lt;img src="https://www.m1ke.org/p/%E7%A2%BA%E7%8E%87%E3%81%AE%E5%BE%A9%E7%BF%92/probability.jpg" alt="Featured image of post 確率の復習" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;プログラムでの計算で確率を使うことは多い&lt;/li&gt;
&lt;li&gt;しかし、高校の時にやった確率をほとんど忘れてしまった&lt;/li&gt;
&lt;li&gt;すると計算が必要な時に困るので改めて復習した&lt;/li&gt;
&lt;li&gt;また、データ処理で特に間違いやすかったメモも入れた&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="確率"&gt;確率&lt;/h2&gt;
&lt;h3 id="全体像"&gt;全体像&lt;/h3&gt;
&lt;p&gt;「確率」は、大きく分けると次の流れで進む&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;場合の数（数え方）&lt;/li&gt;
&lt;li&gt;基本的な確率（数え方の比）&lt;/li&gt;
&lt;li&gt;独立な試行・反復試行&lt;/li&gt;
&lt;li&gt;条件付き確率&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="場合の数"&gt;場合の数&lt;/h3&gt;
&lt;h4 id="事象"&gt;事象&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;事象とは、試行（サイコロを振る、カードを引く等）の結果として起こりうる事柄のこと&lt;/li&gt;
&lt;li&gt;例えば「サイコロを振って偶数の目が出る」も1つの事象&lt;/li&gt;
&lt;li&gt;事象$A$・事象$B$のように、アルファベットで名前をつけて表すことが多い&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="樹形図"&gt;樹形図&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;場合の数を数える基本は、樹形図で枝分かれを全て書き出すこと&lt;/li&gt;
&lt;li&gt;樹形図を一般化した数え方が、次の和の法則と積の法則&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="和の法則"&gt;和の法則&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;事象$A$がm通り、事象$B$がn通りで、$A$と$B$が同時には起こらないとき&lt;/li&gt;
&lt;li&gt;$A$または$B$の起こり方は$m+n$通り&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="積の法則"&gt;積の法則&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;事象$A$の起こり方がm通り&lt;/li&gt;
&lt;li&gt;その各々に対して事象$B$の起こり方がn通り&lt;/li&gt;
&lt;li&gt;$A$の後に$B$が続けて起こる場合の数は$m \times n$通り&lt;/li&gt;
&lt;li&gt;例: サイコロを2回振るときの目の出方は、$6 \times 6 = 36$通り（積の法則）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="階乗"&gt;階乗&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;$n!$は、$n$から$1$までを全て掛け合わせたもの&lt;/li&gt;
&lt;li&gt;定義は以下&lt;/li&gt;
&lt;/ul&gt;
$$
n! = n \times (n-1) \times (n-2) \times \cdots \times 1
$$&lt;ul&gt;
&lt;li&gt;便宜上、$0! = 1$と定義される&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="順列"&gt;順列&lt;/h3&gt;
&lt;h4 id="順列permutationの定義"&gt;順列（Permutation）の定義&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;異なる$n$個から$r$個を選んで、順序をつけて並べる場合の数&lt;/li&gt;
&lt;li&gt;定義は以下&lt;/li&gt;
&lt;/ul&gt;
$$
{}_nP_r = n \times (n-1) \times \cdots \times (n-r+1) = \frac{n!}{(n-r)!}
$$&lt;ul&gt;
&lt;li&gt;並び方が違えば別の場合として数える&lt;/li&gt;
&lt;li&gt;例: A・B・Cの3人から2人を選んで1列に並べる場合、AB・BA・AC・CA・BC・CBの6通り（${}_3P_2 = 6$）&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="例順列"&gt;例：順列&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;問題: 1〜9の数字が1つずつ書かれた9枚のカードから3枚を選んで並べ、3桁の整数を作る。何通りできるか？&lt;/li&gt;
&lt;li&gt;「9個から3個選んで順序をつけて並べる」ので、そのまま順列の定義に当てはまる&lt;/li&gt;
&lt;/ul&gt;
$$
{}_9P_3 = 9 \times 8 \times 7 = 504
$$&lt;ul&gt;
&lt;li&gt;百の位・十の位・一の位の順に「使えるカードの枚数」を掛けているのと同じこと
&lt;ul&gt;
&lt;li&gt;百の位: 9枚から選べる&lt;/li&gt;
&lt;li&gt;十の位: 百の位で1枚使った残り8枚から選べる&lt;/li&gt;
&lt;li&gt;一の位: さらに残り7枚から選べる&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;この「1つ選ぶごとに選択肢が1つ減っていく」感覚が、そのまま${}_nP_r$の掛け算の中身になっている&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="同じものを含む順列"&gt;同じものを含む順列&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;$n$個のうち、同じものがそれぞれ$p$個、$q$個、$r$個…ずつ含まれるときの並べ方&lt;/li&gt;
&lt;li&gt;定義は以下&lt;/li&gt;
&lt;/ul&gt;
$$
\frac{n!}{p! \, q! \, r! \cdots}
$$&lt;ul&gt;
&lt;li&gt;全部を区別して並べる${}_nP_n = n!$通りから、同じもの同士の並び替え分を割って重複を消しているイメージ&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="組み合わせ"&gt;組み合わせ&lt;/h3&gt;
&lt;h4 id="組み合わせcombinationの定義"&gt;組み合わせ（Combination）の定義&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;異なる$n$個から$r$個を選ぶ場合の数（順序は区別しない）&lt;/li&gt;
&lt;li&gt;定義は以下&lt;/li&gt;
&lt;/ul&gt;
$$
{}_nC_r = \frac{n!}{r!(n-r)!} = \frac{{}_nP_r}{r!}
$$&lt;ul&gt;
&lt;li&gt;順列${}_nP_r$を、選んだ$r$個の並び替え分（$r!$通り）で割ったものがCのイメージ&lt;/li&gt;
&lt;li&gt;例: A・B・Cの3人から2人を選ぶだけなら、AB・AC・BCの3通り（${}_3C_2 = 3$）、並び順は数えない&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="例組合せを使った基本的な確率"&gt;例：組合せを使った基本的な確率&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;問題: 22台の製品のうち3台が故障している。無作為に2台取り出すとき、ちょうど1台が故障している確率は？&lt;/li&gt;
&lt;li&gt;全体の場合の数（22台から2台選ぶ）&lt;/li&gt;
&lt;/ul&gt;
$$
{}_{22}C_2 = \frac{22 \times 21}{2} = 231
$$&lt;ul&gt;
&lt;li&gt;条件を満たす場合の数（故障3台から1台、正常19台から1台をそれぞれ選ぶ）&lt;/li&gt;
&lt;/ul&gt;
$$
{}_3C_1 \times {}_{19}C_1 = 3 \times 19 = 57
$$&lt;ul&gt;
&lt;li&gt;求める確率は以下&lt;/li&gt;
&lt;/ul&gt;
$$
\frac{57}{231} = \frac{19}{77}
$$&lt;ul&gt;
&lt;li&gt;ポイントは、「故障からr台・正常から残りを選ぶ」と分けて、それぞれ組合せで数えてから割ること&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="表記の違い"&gt;表記の違い&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;高校では${}_nC_r$と書くが、大学以降や海外の教科書では二項係数の表記を使うことが多い&lt;/li&gt;
&lt;li&gt;定義は同じで、記号が違うだけ&lt;/li&gt;
&lt;/ul&gt;
$$
\binom{n}{r} = {}_nC_r = \frac{n!}{r!(n-r)!}
$$&lt;ul&gt;
&lt;li&gt;読み方は「$n$ choose $r$」（$n$個から$r$個選ぶ）&lt;/li&gt;
&lt;li&gt;縦に$n$、$r$を並べて大きい括弧で囲む書き方で、割り算の記号は書かない&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="基本的な確率の求め方"&gt;基本的な確率の求め方&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;全ての場合が同様に確からしいとき、事象$A$の確率は以下&lt;/li&gt;
&lt;/ul&gt;
$$
P(A) = \frac{n(A)}{n(U)}
$$&lt;ul&gt;
&lt;li&gt;$n(A)$は事象$A$の場合の数、$n(U)$は全体（全事象）の場合の数&lt;/li&gt;
&lt;li&gt;サイコロ・コイン・カード・くじのような「全パターンのうち何パターンが条件に合うか」を、前述の場合の数（樹形図・和の法則・積の法則・順列・組合せ）で数えれば求まる&lt;/li&gt;
&lt;li&gt;「少なくとも1つ」「ちょうど1つ」のような条件は、全体からどの部分を数えるかの言い換えに過ぎない&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="余事象"&gt;余事象&lt;/h3&gt;
&lt;h4 id="余事象の定義"&gt;余事象の定義&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;事象$A$が起こらない事象を余事象と呼び、$\bar{A}$（または$A^c$）と書く&lt;/li&gt;
&lt;li&gt;全事象の確率は1なので、以下が成り立つ&lt;/li&gt;
&lt;/ul&gt;
$$
P(A) + P(\bar{A}) = 1
$$&lt;ul&gt;
&lt;li&gt;「少なくとも1つは〜」のような計算は、直接数えると場合分けが多くなりがちなので、余事象（1つも〜でない）から引く方が楽なことが多い&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="例余事象を使う確率"&gt;例：余事象を使う確率&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;問題: サイコロを3回振るとき、少なくとも1回は6の目が出る確率は？&lt;/li&gt;
&lt;li&gt;直接数えると「1回だけ6」「2回だけ6」「3回とも6」を別々に足す必要があり面倒&lt;/li&gt;
&lt;li&gt;余事象「3回とも6が出ない」を考える方が早い&lt;/li&gt;
&lt;li&gt;1回振って6以外が出る確率は$\frac{5}{6}$なので、3回とも6が出ない確率は以下&lt;/li&gt;
&lt;/ul&gt;
$$
\left(\frac{5}{6}\right)^3 = \frac{125}{216}
$$&lt;ul&gt;
&lt;li&gt;求める確率は、これを1から引く&lt;/li&gt;
&lt;/ul&gt;
$$
1 - \frac{125}{216} = \frac{91}{216}
$$&lt;h3 id="和事象と加法定理"&gt;和事象と加法定理&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;$A$または$B$が起こる確率は以下&lt;/li&gt;
&lt;li&gt;$A$と$B$が同時に起こる部分を二重に数えないよう、その分を引く&lt;/li&gt;
&lt;/ul&gt;
$$
P(A \cup B) = P(A) + P(B) - P(A \cap B)
$$&lt;ul&gt;
&lt;li&gt;$A$と$B$が同時に起こりえない（排反）場合は$P(A \cap B) = 0$なので、以下まで単純化できる&lt;/li&gt;
&lt;/ul&gt;
$$
P(A \cup B) = P(A) + P(B)
$$&lt;h3 id="独立な試行反復試行"&gt;独立な試行・反復試行&lt;/h3&gt;
&lt;h4 id="独立な試行反復試行の定義"&gt;独立な試行・反復試行の定義&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;事象$A$の結果が事象$B$の起こりやすさに一切影響しない場合、$A$と$B$は独立という&lt;/li&gt;
&lt;li&gt;独立な場合、両方起こる確率は単純な掛け算になる&lt;/li&gt;
&lt;/ul&gt;
$$
P(A \cap B) = P(A) \times P(B)
$$&lt;ul&gt;
&lt;li&gt;独立でない場合は、そのまま掛け算にはできないので、後述の条件付き確率を使う&lt;/li&gt;
&lt;li&gt;独立な試行を何度も繰り返すのが反復試行&lt;/li&gt;
&lt;li&gt;確率$p$で起こる試行を$n$回繰り返したとき、ちょうど$r$回起こる確率は以下&lt;/li&gt;
&lt;/ul&gt;
$$
{}_nC_r \, p^r (1-p)^{n-r}
$$&lt;ul&gt;
&lt;li&gt;${}_nC_r$が出てくる理由は、$n$回のうち「どのタイミングで$r$回起こるか」の組み合わせの数だから&lt;/li&gt;
&lt;li&gt;例: コインを5回投げて、ちょうど3回表が出る確率、当たり確率$p$のくじを$n$回引いて$r$回当たる確率など&lt;/li&gt;
&lt;li&gt;この考え方をさらに一般化したものが二項分布&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 id="例反復試行の確率復元抽出"&gt;例：反復試行の確率（復元抽出）&lt;/h4&gt;
&lt;ul&gt;
&lt;li&gt;問題: 箱に赤玉2個と白玉2個が入っている。1つ取り出して色を確認し、箱に戻す操作を3回繰り返すとき、赤玉がちょうど2回出る確率は？&lt;/li&gt;
&lt;li&gt;「取り出して戻す」ので、毎回同じ条件（赤2個・白2個、計4個）で引く独立な試行になる&lt;/li&gt;
&lt;li&gt;1回で赤が出る確率は以下&lt;/li&gt;
&lt;/ul&gt;
$$
p = \frac{2}{4} = \frac{1}{2}
$$&lt;ul&gt;
&lt;li&gt;3回中ちょうど2回赤が出る確率は、反復試行の公式に$n=3, r=2, p=\frac{1}{2}$を当てはめる&lt;/li&gt;
&lt;/ul&gt;
$$
{}_3C_2 \left(\frac{1}{2}\right)^2 \left(\frac{1}{2}\right)^1 = 3 \times \frac{1}{8} = \frac{3}{8}
$$&lt;ul&gt;
&lt;li&gt;毎回箱に戻す（復元抽出）から、3回とも独立に同じ確率$\frac{1}{2}$で扱える&lt;/li&gt;
&lt;li&gt;もし戻さない（非復元抽出）なら、回を追うごとに箱の中身が変わるので独立にならず、反復試行の公式は使えない（前述の「組合せを使った基本的な確率」のように直接数える必要がある）&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="条件付き確率"&gt;条件付き確率&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;$B$が起こったという条件のもとで、$A$が起こる確率&lt;/li&gt;
&lt;li&gt;定義は以下&lt;/li&gt;
&lt;/ul&gt;
$$
P(A \mid B) = \frac{P(A \cap B)}{P(B)}
$$&lt;ul&gt;
&lt;li&gt;この式を変形すると、一般の乗法定理になる（独立でない場合もこちらを使う）&lt;/li&gt;
&lt;/ul&gt;
$$
P(A \cap B) = P(B) \times P(A \mid B)
$$&lt;h3 id="期待値"&gt;期待値&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;確率変数$X$が値$x_1, x_2, \dots, x_n$を、それぞれ確率$p_1, p_2, \dots, p_n$でとるとき、期待値は以下&lt;/li&gt;
&lt;/ul&gt;
$$
E(X) = \sum_i x_i p_i
$$&lt;ul&gt;
&lt;li&gt;試行を何度も繰り返したときに、平均的にどれくらいの値になるかを表す指標&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="その他"&gt;その他&lt;/h2&gt;
&lt;h3 id="月はカテゴリカル変数"&gt;月はカテゴリカル変数&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;1月〜12月を「月の区分」として扱う場合はカテゴリカル変数&lt;/li&gt;
&lt;li&gt;月は周期的で、12月と1月は隣り合っているため、単純な数値として扱うのは適切でないことが多い&lt;/li&gt;
&lt;li&gt;一方、「2024年1月 =&amp;gt; 2024年2月 =&amp;gt; &amp;hellip;」のように時間の経過を表す場合は、年月を量的変数として扱える&lt;/li&gt;
&lt;li&gt;つまり、月がややこしい理由は月が２つの意味を持つから
&lt;ul&gt;
&lt;li&gt;3月 = March（時点・カテゴリ） =&amp;gt; カテゴリカル変数&lt;/li&gt;
&lt;li&gt;3か月 = 3 months（期間・量） =&amp;gt; 量的変数&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;まあ、「郵便番号」は数字だけど、カテゴリカル変数というのと同じ&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="クロス集計表の切り方"&gt;クロス集計表の切り方&lt;/h3&gt;
&lt;p&gt;クロス表の分母も結構間違えがち。&lt;/p&gt;
&lt;p&gt;例: ワクチンの有効性を説明するにはどう比較すればいいか？&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;-&lt;/th&gt;
&lt;th style="text-align: right"&gt;感染した&lt;/th&gt;
&lt;th style="text-align: right"&gt;感染しなかった&lt;/th&gt;
&lt;th style="text-align: right"&gt;合計&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;ワクチン未接種&lt;/td&gt;
&lt;td style="text-align: right"&gt;100人&lt;/td&gt;
&lt;td style="text-align: right"&gt;900人&lt;/td&gt;
&lt;td style="text-align: right"&gt;1000人&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ワクチン接種済み&lt;/td&gt;
&lt;td style="text-align: right"&gt;450人&lt;/td&gt;
&lt;td style="text-align: right"&gt;8550人&lt;/td&gt;
&lt;td style="text-align: right"&gt;9000人&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;合計&lt;/td&gt;
&lt;td style="text-align: right"&gt;550人&lt;/td&gt;
&lt;td style="text-align: right"&gt;9450人&lt;/td&gt;
&lt;td style="text-align: right"&gt;10000人&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;2つの見方がある。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;見方&lt;/th&gt;
&lt;th&gt;計算&lt;/th&gt;
&lt;th&gt;何がわかる？&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;A&lt;/td&gt;
&lt;td&gt;(100/550)、(450/550)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;感染した人の中で&lt;/strong&gt;、接種・未接種がどれくらいいるか&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;B&lt;/td&gt;
&lt;td&gt;(100/1000)、(450/9000)&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;接種した人・していない人の中で&lt;/strong&gt;、どれくらい感染したか&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul&gt;
&lt;li&gt;この場合は、適切なのは、AではなくBとなる&lt;/li&gt;
&lt;li&gt;理由は、Aだと、そもそも論、ワクチン接種者の方が多い可能性があり、ワクチン自体の有効性を示せないから&lt;/li&gt;
&lt;li&gt;Bはワクチンを摂取した人の中で、という事になっている&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;言い換えると次になる:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;A: 感染者のワクチンを接種したしていない人の“確率”を見る&lt;/li&gt;
&lt;li&gt;B: ワクチンを接種した人と接種していない人の感染する“確率”を見る&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Aだと、何人ワクチンを接種していたのかが加味されていないため、ワクチンの有効性を示す上では不適切ということ。&lt;/p&gt;
&lt;h3 id="確率の直感の罠"&gt;確率の直感の罠&lt;/h3&gt;
&lt;p&gt;例:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;10の中に2つのあたりがあるくじ&lt;/li&gt;
&lt;li&gt;AとBがいる&lt;/li&gt;
&lt;li&gt;Aが先に引いた後に、Bが引く順番でくじを引く&lt;/li&gt;
&lt;li&gt;Bの確率はどうなるのか？&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一見、Aが引いた後に、Bが引くから確率が変わりそうだが実際は変わらない。&lt;/p&gt;
$$
A=2/10
B=2/10 \times 1/9 + 8/10 \times 2/9 = \frac{2+16}{90} = 18/90 = 2/10
$$&lt;p&gt;つまり、Aさんが先に引いても、Bさんが先に引いても同じということ。&lt;/p&gt;
&lt;p&gt;ちなみに、もしAさんの結果をBさんが知れる場合は、総合的には以下になる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;Aの結果を知った場合:
&lt;ul&gt;
&lt;li&gt;$P(Bあたり|Aあたり)1/9=0.111$&lt;/li&gt;
&lt;li&gt;$P(Bあたり|Aハズレ)=2/9=0.222$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Aの結果を知らない場合:
&lt;ul&gt;
&lt;li&gt;$P(Bあたり)=2/10=0.2$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;だから、事前条件を知った上だと、より精緻な確率になるということ。&lt;/p&gt;
&lt;h3 id="確率の直感の罠-1"&gt;確率の直感の罠②&lt;/h3&gt;
&lt;p&gt;モンティホール問題は、直感と実際の確率がずれやすい有名な例。&lt;/p&gt;
&lt;p&gt;例:&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;3つのドアがある&lt;/li&gt;
&lt;li&gt;1つだけ当たりで、残り2つはハズレ&lt;/li&gt;
&lt;li&gt;Aさんが最初に1つのドアを選ぶ&lt;/li&gt;
&lt;li&gt;司会者は当たりの場所を知っていて、Aさんが選んでいないドアの中から必ずハズレを1つ開ける&lt;/li&gt;
&lt;li&gt;その後、Aさんは「最初に選んだドアのままにする」か「残ったもう1つのドアに変更する」かを選べる&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一見、最後には2つのドアしか残っていないので、以下に見える。&lt;/p&gt;
$$
1/2
$$&lt;p&gt;しかし実際には、以下となる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;最初に選んだドアが当たりである確率は$1/3$&lt;/li&gt;
&lt;li&gt;最初に選んだドアがハズレである確率は$2/3$&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;言い換えると、&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;つまり、最初に当たりを選んでいた場合、ドアを変更するとハズレになる&lt;/li&gt;
&lt;li&gt;一方、最初にハズレを選んでいた場合、司会者は残ったハズレを必ず開けるため、ドアを変更すれば必ず当たりになる&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;したがって、以下となる。&lt;/p&gt;
$$
P(\text{変更せずに当たる}) = 1/3
$$$$
P(\text{変更して当たる}) = 2/3
$$&lt;ul&gt;
&lt;li&gt;つまり、ドアを変更した方が当たる確率は2倍になる&lt;/li&gt;
&lt;li&gt;ポイントは、司会者がランダムにドアを開けているわけではなく、&lt;strong&gt;当たりを知ったうえで必ずハズレを開けている&lt;/strong&gt;こと&lt;/li&gt;
&lt;li&gt;そのため、「最後に2つ残ったから確率は $1/2$ ずつ」とはならない&lt;/li&gt;
&lt;li&gt;確率を考えるときは、単に残っている選択肢の数を見るのではなく、&lt;strong&gt;どのようなルールで情報が得られたのか&lt;/strong&gt;を見る必要がある&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="ppdacサイクル"&gt;PPDACサイクル&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;統計的な問題解決の進め方を5つのステップに整理したフレームワーク&lt;/li&gt;
&lt;li&gt;Problem（問題）・Plan（計画）・Data（データ）・Analysis（分析）・Conclusion（結論）の頭文字&lt;/li&gt;
&lt;li&gt;各ステップの内容
&lt;ul&gt;
&lt;li&gt;Problem: 何を明らかにしたいか、問題を明確にする&lt;/li&gt;
&lt;li&gt;Plan: どうやって調べるか、調査方法やデータの集め方を計画する&lt;/li&gt;
&lt;li&gt;Data: 計画に沿ってデータを収集・整理する&lt;/li&gt;
&lt;li&gt;Analysis: データを分析し、パターンや傾向を見出す&lt;/li&gt;
&lt;li&gt;Conclusion: 分析結果から結論を導き、Problemに立ち返って答える&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Conclusionの結果、新たな疑問が生まれた場合は、それを次のProblemとしてサイクルを繰り返す&lt;/li&gt;
&lt;li&gt;統計は計算そのものより、このサイクル全体を意識することが大切&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;計算しましょう！&lt;/li&gt;
&lt;/ul&gt;</description></item><item><title>統計の基本的なこと</title><link>https://www.m1ke.org/p/%E7%B5%B1%E8%A8%88%E3%81%AE%E5%9F%BA%E6%9C%AC%E7%9A%84%E3%81%AA%E3%81%93%E3%81%A8/</link><pubDate>Fri, 20 Oct 2023 21:32:47 +0900</pubDate><guid>https://www.m1ke.org/p/%E7%B5%B1%E8%A8%88%E3%81%AE%E5%9F%BA%E6%9C%AC%E7%9A%84%E3%81%AA%E3%81%93%E3%81%A8/</guid><description>&lt;img src="https://www.m1ke.org/p/%E7%B5%B1%E8%A8%88%E3%81%AE%E5%9F%BA%E6%9C%AC%E7%9A%84%E3%81%AA%E3%81%93%E3%81%A8/stats.png" alt="Featured image of post 統計の基本的なこと" /&gt;&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;京大の統計の「統計の入門」イントロダクションのPDFを見ていたらいい事が書いてあった&lt;/li&gt;
&lt;li&gt;そこで、AIで記述統計から検定・回帰・因果推論まで、基本的な用語と考え方を一覧化した&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="確率と統計の違い"&gt;確率と統計の違い&lt;/h2&gt;
&lt;p&gt;以下の違いがある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;確率
&lt;ul&gt;
&lt;li&gt;「モデルから起こりうる事象の確率を計算する」学問&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;統計
&lt;ul&gt;
&lt;li&gt;「手元のデータから逆にモデルや母集団の性質を推測する」学問&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="統計学の分類"&gt;統計学の分類&lt;/h2&gt;
&lt;h3 id="記述統計と推測統計"&gt;記述統計と推測統計&lt;/h3&gt;
&lt;p&gt;統計学は大きく2つに分かれる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;記述統計（Descriptive statistics）
&lt;ul&gt;
&lt;li&gt;手元にあるデータそのものの特徴を、要約・可視化してわかりやすくすること&lt;/li&gt;
&lt;li&gt;例: クラス40人の身長を測って、平均や分布を出す&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;推測統計（Inferential statistics）
&lt;ul&gt;
&lt;li&gt;手元のデータ（標本）から、その背後にある母集団の性質を推測すること&lt;/li&gt;
&lt;li&gt;例: そのクラス40人の身長から、日本全体の同学年の平均身長を推測する&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;手元のデータを「見やすくする」のが記述統計、手元のデータから「見えていないものを推測する」のが推測統計。&lt;/p&gt;
&lt;h3 id="推測統計の方法仮説検定と推定"&gt;推測統計の方法（仮説検定と推定）&lt;/h3&gt;
&lt;p&gt;推測統計はさらに2つの方法に分かれる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;仮説検定（Hypothesis testing）
&lt;ul&gt;
&lt;li&gt;標本をもとに、母集団に関する仮説の真偽を調べる方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;推定（Estimation）
&lt;ul&gt;
&lt;li&gt;標本をもとに、母集団の未知のパラメータ（母数）の値を推定する方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="データの種類と尺度水準"&gt;データの種類と尺度水準&lt;/h2&gt;
&lt;p&gt;統計データは大きく2種類に分かれる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;質的データ（Qualitative data）
&lt;ul&gt;
&lt;li&gt;血液型や好き嫌いのように、記号・カテゴリを値としてとるデータ&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;量的データ（Quantitative data）
&lt;ul&gt;
&lt;li&gt;身長や気温のように、数値を値としてとるデータ&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;さらに、データがどんな演算を許すかで4つの尺度水準に分けられる。&lt;/p&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;尺度&lt;/th&gt;
&lt;th&gt;意味&lt;/th&gt;
&lt;th&gt;許される演算&lt;/th&gt;
&lt;th&gt;例&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;名義尺度（Nominal scale）&lt;/td&gt;
&lt;td&gt;値がただのラベル&lt;/td&gt;
&lt;td&gt;一致/不一致の判定のみ&lt;/td&gt;
&lt;td&gt;血液型・性別&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;順序尺度（Ordinal scale）&lt;/td&gt;
&lt;td&gt;順序に意味がある&lt;/td&gt;
&lt;td&gt;大小比較まで&lt;/td&gt;
&lt;td&gt;満足度アンケート（良い/普通/悪い）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;間隔尺度（Interval scale）&lt;/td&gt;
&lt;td&gt;間隔（差）に意味があるが原点は任意&lt;/td&gt;
&lt;td&gt;加減算まで&lt;/td&gt;
&lt;td&gt;気温（摂氏）&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;比率尺度（Ratio scale）&lt;/td&gt;
&lt;td&gt;原点（0）にも意味がある&lt;/td&gt;
&lt;td&gt;加減乗除すべて&lt;/td&gt;
&lt;td&gt;体重・身長・金額&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;尺度水準を間違えると、平均を取ってはいけないデータの平均を取ってしまうような誤りにつながる。例えば、アンケートの「良い=3、普通=2、悪い=1」を単純平均するのは、間隔が本当に等しいとは限らないので本来は注意が必要。&lt;/p&gt;
&lt;h2 id="データの整理と確認"&gt;データの整理と確認&lt;/h2&gt;
&lt;h3 id="量子化quantization"&gt;量子化（Quantization）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;量的データは、測定の精度によって際限なく細かい値を取りうるため、生のままでは種類が多すぎて分布をつかみにくい&lt;/li&gt;
&lt;li&gt;そこで、値が取りうる範囲をあらかじめいくつかの区間（階級）に区切っておき、観測された値をどの階級に入るかで置き換えて集計することを量子化と呼ぶ&lt;/li&gt;
&lt;li&gt;階級は英語でbin（ビン）とも呼ばれ、量子化は「連続的な値をbin単位の有限個の値にまとめ直す」処理といえる&lt;/li&gt;
&lt;li&gt;例: 体重を1kg刻みの階級に量子化する場合、52.3kgも52.7kgも「52kg台」という同じ階級にまとめられる&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="データ階級度数"&gt;データ・階級・度数&lt;/h3&gt;
&lt;p&gt;データ・階級・度数を、それぞれ記号で表すと以下のようになる。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;データ（Data）
&lt;ul&gt;
&lt;li&gt;$n$個のデータを$X = \{x_1, x_2, \ldots, x_n\}$とする&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;階級（Class）
&lt;ul&gt;
&lt;li&gt;値の範囲を$k$個の区間に分け、$j$番目の階級を$I_j = [a_j,\ a_{j+1})$とする&lt;/li&gt;
&lt;li&gt;つまり、下限を含み上限を含まない、など境界の扱いはあらかじめ決めておく&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;度数（Frequency）
&lt;ul&gt;
&lt;li&gt;階級$I_j$に入るデータの個数を$f_j$とする&lt;/li&gt;
&lt;li&gt;つまり$x_i \in I_j$を満たす$x_i$の個数&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;この記号からも、度数$f_j$がデータ$X$と階級$I_j$の両方に依存して決まる値であることがわかる。&lt;/p&gt;
&lt;h3 id="累積度数相対度数累積相対度数"&gt;累積度数・相対度数・累積相対度数&lt;/h3&gt;
&lt;p&gt;度数だけだと全体に対する割合がわかりにくい。そこで、以下のような指標もあわせて使う。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;相対度数（Relative frequency）
&lt;ul&gt;
&lt;li&gt;度数を全体の件数で割ったもの&lt;/li&gt;
&lt;li&gt;全ての階級で足し合わせるとちょうど1（100%）になる&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;累積度数（Cumulative frequency）
&lt;ul&gt;
&lt;li&gt;$j$番目の階級までの度数を足し合わせたもの&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
$$
F_j = \sum_{i=1}^{j} f_i
$$&lt;ul&gt;
&lt;li&gt;累積相対度数（Cumulative relative frequency）
&lt;ul&gt;
&lt;li&gt;累積度数を全体の件数$n$で割ったもの（$F_j / n$）&lt;/li&gt;
&lt;li&gt;例: テストの点数を階級ごとに集計したとき、「60点未満の階級までの累積相対度数」を見れば、そのテストで60点未満だった人が全体の何割いたかが一目でわかる&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="度数分布表とヒストグラム"&gt;度数分布表とヒストグラム&lt;/h3&gt;
&lt;p&gt;各階級に入るデータの個数（度数）を数え、それを表・グラフにしたもの。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;度数分布表（Frequency distribution table）
&lt;ul&gt;
&lt;li&gt;各階級の度数を表にまとめたもの&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;ヒストグラム（Histogram）
&lt;ul&gt;
&lt;li&gt;度数分布表をグラフにしたもの&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="階級の決め方"&gt;階級の決め方&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;階級の幅を細かくしすぎるとデータがまばらになって分布が読み取りにくく、粗くしすぎると情報が潰れてしまう&lt;/li&gt;
&lt;li&gt;ちょうどよい階級の数を決める目安として、スタージェスの公式（Sturges&amp;rsquo; rule）がよく使われる&lt;/li&gt;
&lt;/ul&gt;
$$
k = 1 + \log_2 n
$$&lt;ul&gt;
&lt;li&gt;$n$はデータの個数、$k$は階級の数の目安（実際には四捨五入して使う）&lt;/li&gt;
&lt;li&gt;データの個数が多いほど階級数を増やしてよいが、対数なので増え方は緩やか（データが2倍になっても階級を1つ増やす程度）&lt;/li&gt;
&lt;li&gt;あくまで目安であり、データの分布の形に応じて調整してよい&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="データの要約"&gt;データの要約&lt;/h2&gt;
&lt;h3 id="最小値最大値四分位数"&gt;最小値・最大値・四分位数&lt;/h3&gt;
&lt;p&gt;データを小さい順に並べたときの端の値と、その幅を表す指標。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;最小値（Minimum）
&lt;ul&gt;
&lt;li&gt;一番小さい値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;最大値（Maximum）
&lt;ul&gt;
&lt;li&gt;一番大きい値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;範囲（レンジ、Range）
&lt;ul&gt;
&lt;li&gt;最大値から最小値を引いたもの&lt;/li&gt;
&lt;li&gt;データ全体がどれくらいの幅に収まっているかを表す最も単純な散らばりの指標&lt;/li&gt;
&lt;li&gt;外れ値が1つ混ざるだけで大きく変わってしまうので、外れ値に弱いという欠点がある&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;中央値と同じ考え方を応用したものが四分位数（Quartile）。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;第1四分位数
&lt;ul&gt;
&lt;li&gt;小さい方から数えて全体の25%の位置にくる値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;第2四分位数
&lt;ul&gt;
&lt;li&gt;ちょうど中央値のこと（50%の位置）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;第3四分位数
&lt;ul&gt;
&lt;li&gt;小さい方から数えて全体の75%の位置にくる値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;四分位範囲（Interquartile range）
&lt;ul&gt;
&lt;li&gt;第1四分位数から第3四分位数までの幅&lt;/li&gt;
&lt;li&gt;データの真ん中50%がどれくらいの幅に収まっているかがわかる&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="代表値measure-of-central-tendency"&gt;代表値（Measure of central tendency）&lt;/h3&gt;
&lt;p&gt;データ全体を1つの値で代表させたものを代表値と呼ぶ。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;平均値（Mean）
&lt;ul&gt;
&lt;li&gt;全データの合計をデータ数で割ったもの&lt;/li&gt;
&lt;li&gt;外れ値の影響を強く受ける&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;中央値（Median）
&lt;ul&gt;
&lt;li&gt;データを小さい順に並べたとき、ちょうど真ん中にくる値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;最頻値（Mode）
&lt;ul&gt;
&lt;li&gt;最も出現頻度が高い値&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例えば、社員9人の年収がだいたい400万円台に集まっている会社に、年収1億円の社長が1人加わると、平均年収は一気に跳ね上がるが、中央値はほとんど動かない。「平均的な年収」を知りたいなら、こういう場面では中央値の方が実態に近いことが多い。&lt;/p&gt;
&lt;h3 id="散らばりの指標"&gt;散らばりの指標&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;代表値だけでは「データがどれくらいばらついているか」がわからない&lt;/li&gt;
&lt;li&gt;平均値が同じでも、全員がほぼ同じ値のデータと、大きくばらついているデータでは意味が違う&lt;/li&gt;
&lt;li&gt;分散（Variance）は、各データが平均からどれだけ離れているかの2乗を平均したもの&lt;/li&gt;
&lt;/ul&gt;
$$
s^2 = \frac{1}{n}\sum_{i=1}^{n}(x_i - \bar{x})^2
$$&lt;ul&gt;
&lt;li&gt;2乗しているため単位がもとのデータと変わってしまうので、その平方根を取った標準偏差（Standard deviation）がよく使われる&lt;/li&gt;
&lt;/ul&gt;
$$
s = \sqrt{s^2}
$$&lt;h3 id="箱ひげ図box-plot"&gt;箱ひげ図（Box plot）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;最小値・第1四分位数・中央値（第2四分位数）・第3四分位数・最大値の5つを、まとめて1つの図に表したもの&lt;/li&gt;
&lt;li&gt;箱の下端が第1四分位数、上端が第3四分位数、箱の中の線が中央値&lt;/li&gt;
&lt;li&gt;箱から伸びるひげが、最小値と最大値の方向を示す&lt;/li&gt;
&lt;li&gt;複数のグループのデータを並べて箱ひげ図にすると、ヒストグラムを並べるより一覧性が高く、グループ間のばらつきや中心の違いを比較しやすい&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="標本調査と推定"&gt;標本調査と推定&lt;/h2&gt;
&lt;h3 id="母集団と標本population-and-sample"&gt;母集団と標本（Population and sample）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;母集団（Population）
&lt;ul&gt;
&lt;li&gt;調査の対象となる集団全体&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;全数調査（Census）
&lt;ul&gt;
&lt;li&gt;母集団のすべてを漏れなく調べる方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;標本（Sample）
&lt;ul&gt;
&lt;li&gt;母集団の一部だけを抜き出したもの&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;標本調査（Sample survey）
&lt;ul&gt;
&lt;li&gt;標本を使って母集団の性質を推測する調査&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;全数調査はコストや時間の面で難しいことが多いため、標本調査が使われることが多い。&lt;/p&gt;
&lt;h3 id="標本調査の方法sampling-methods"&gt;標本調査の方法（Sampling methods）&lt;/h3&gt;
&lt;p&gt;標本の選び方には大きく2種類ある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;無作為抽出（Random sampling）
&lt;ul&gt;
&lt;li&gt;母集団の各要素が等しい確率で選ばれるように、偶然に任せて抽出する方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;有意抽出（Purposive sampling）
&lt;ul&gt;
&lt;li&gt;調べる側の都合や意図で対象を選ぶ方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;さらに、無作為抽出には主に5種類の方法がある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;単純無作為抽出（Simple random sampling）
&lt;ul&gt;
&lt;li&gt;母集団全体に通し番号を振り、くじや乱数を使って必要な数をそのまま選ぶ、最も基本的な方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;系統抽出（Systematic sampling）
&lt;ul&gt;
&lt;li&gt;母集団の名簿に番号を振り、一定の間隔ごとに標本を選ぶ方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;多段抽出（Multi-stage sampling）
&lt;ul&gt;
&lt;li&gt;抽出を複数の段階に分けて行う方法&lt;/li&gt;
&lt;li&gt;例: 全国調査で、まず都道府県を無作為に選び、その中から市区町村を選び、さらにその中から対象者を選ぶ&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;層化抽出（Stratified sampling）
&lt;ul&gt;
&lt;li&gt;母集団の構成（性別や年代の割合など）があらかじめ分かっている場合に、その構成比に合わせて各層から抽出する方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;集落抽出（Cluster sampling）
&lt;ul&gt;
&lt;li&gt;あらかじめ母集団をいくつかのグループ（集落）に分けておき、グループ単位で無作為に選び、選ばれたグループ内は全員を調査する方法&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;有意抽出は手軽だが、選ばれ方に偏りが生まれやすい。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;選択バイアス（Selection bias）
&lt;ul&gt;
&lt;li&gt;標本の選ばれ方が偏っていることで、標本が母集団を正しく代表しなくなること&lt;/li&gt;
&lt;li&gt;例: 「駅前で道行く人にアンケートを取る」方法は、平日昼間に駅前を歩ける人に偏ってしまい、働き方や年齢層に偏りが出やすい&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;母集団全体について何かを言いたいなら、無作為抽出が原則望ましい。&lt;/p&gt;
&lt;h3 id="推定estimation"&gt;推定（Estimation）&lt;/h3&gt;
&lt;p&gt;標本から母集団の値（母数）を推測することを推定と呼ぶ。&lt;/p&gt;
&lt;h3 id="推定の方法点推定と区間推定"&gt;推定の方法（点推定と区間推定）&lt;/h3&gt;
&lt;p&gt;推定には大きく2種類の方法がある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;点推定（Point estimation）
&lt;ul&gt;
&lt;li&gt;母数を1つの値でズバリ言い当てる推定&lt;/li&gt;
&lt;li&gt;例: 標本平均を、母平均の推定値としてそのまま使う&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;区間推定（Interval estimation）
&lt;ul&gt;
&lt;li&gt;母数がこの範囲に入っているだろう、という幅（区間）で推定する&lt;/li&gt;
&lt;li&gt;「95%信頼区間（Confidence interval）」のように、どれくらいの確からしさで区間を示しているかをセットで表す&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;点推定は分かりやすいが、標本を変えるたびに値がずれるので、そのズレ（誤差）の大きさまでは分からない。区間推定は、その誤差の大きさまで含めて表現できるので、より情報量が多い。&lt;/p&gt;
&lt;h2 id="仮説検定hypothesis-testing"&gt;仮説検定（Hypothesis testing）&lt;/h2&gt;
&lt;h3 id="帰無仮説と有意水準"&gt;帰無仮説と有意水準&lt;/h3&gt;
&lt;p&gt;仮説検定は、「差がない」「関係がない」という仮説が、データと矛盾するかどうかを確率的に判断する方法。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;帰無仮説（Null hypothesis）
&lt;ul&gt;
&lt;li&gt;「差がない」「効果がない」のように、否定したい前提として立てる仮説&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;対立仮説（Alternative hypothesis）
&lt;ul&gt;
&lt;li&gt;帰無仮説が正しくなかった場合に採用する、本来主張したい仮説&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;有意水準（Significance level）
&lt;ul&gt;
&lt;li&gt;帰無仮説を誤って棄却してしまう確率の上限として、あらかじめ決めておく基準（よく5%や1%が使われる）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;検定の考え方は、いきなり「差がある」ことを直接証明するのではなく、まず「差がない」と仮定して、それとデータが矛盾するかどうかを調べる、という間接的な進め方をする。具体的には、帰無仮説が正しいと仮定したときに、実際に観測された標本（またはそれ以上に極端な標本）が得られる確率を計算し、その確率が有意水準より小さければ「帰無仮説のもとでは起こりにくすぎる」とみなして帰無仮説を棄却する。&lt;/p&gt;
&lt;h3 id="主な検定の種類適合度の検定と独立性の検定"&gt;主な検定の種類（適合度の検定と独立性の検定）&lt;/h3&gt;
&lt;p&gt;限られた標本から母集団の性質を検定したいとき、よく使われる検定は主に2つある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;適合度の検定（Goodness-of-fit test）
&lt;ul&gt;
&lt;li&gt;母集団の分布が、ある理論値と差があるとみなせるかどうかを調べる検定&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;独立性の検定（Test of independence）
&lt;ul&gt;
&lt;li&gt;2つの事象の間に関係があるとみなせるかどうかを調べる検定&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;いずれも「差がある」「関係がある」と言えるかどうかを、カイ二乗統計量を使って判断する点は共通している。&lt;/p&gt;
&lt;h3 id="適合度の検定goodness-of-fit-test"&gt;適合度の検定（Goodness-of-fit test）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;観測された度数の分布が、理論的に想定される分布と一致しているかを調べる検定&lt;/li&gt;
&lt;li&gt;例: サイコロを600回振って、1〜6の目がそれぞれ均等（各100回程度）に出るはずのところ、実際の出目の分布が理論値からどれくらいズレているかを調べる&lt;/li&gt;
&lt;li&gt;観測度数と期待度数のズレを、次のような統計量にまとめる（カイ二乗統計量、Chi-square statistic）&lt;/li&gt;
&lt;/ul&gt;
$$
\chi^2 = \sum_{i} \frac{(O_i - E_i)^2}{E_i}
$$&lt;ul&gt;
&lt;li&gt;$O_i$は実際に観測された度数、$E_i$は理論上期待される度数&lt;/li&gt;
&lt;li&gt;このズレが偶然の範囲では説明しにくいほど大きければ、「理論値通りではない（サイコロが歪んでいる等）」と判断する&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="独立性の検定test-of-independence"&gt;独立性の検定（Test of independence）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;2つの質的データの間に関係があるかどうかを調べる検定&lt;/li&gt;
&lt;li&gt;データをクロス集計表（分割表、Contingency table）に整理し、「もし2つの変数が独立だったら、理論的にはどんな表になるはずか」という期待度数を計算する&lt;/li&gt;
&lt;li&gt;実際のクロス集計表と、独立を仮定した場合の期待度数のズレが大きいほど、2つの変数の間に何らかの関連があると判断できる&lt;/li&gt;
&lt;li&gt;計算方法自体は適合度の検定と同じカイ二乗統計量を使う&lt;/li&gt;
&lt;li&gt;例: 「コーヒーを毎日飲むかどうか」と「よく眠れているかどうか」を集計して、両者に関連があるかを調べる、といった使い方をする&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="相関と回帰"&gt;相関と回帰&lt;/h2&gt;
&lt;h3 id="相関係数correlation-coefficient"&gt;相関係数（Correlation coefficient）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;2つの量的データの間に、直線的な関係がどれくらい強いかを表す指標が相関係数&lt;/li&gt;
&lt;li&gt;$-1$から$1$までの値を取り、$1$に近いほど強い正の相関、$-1$に近いほど強い負の相関、$0$に近いほど直線的な関係が弱いことを表す&lt;/li&gt;
&lt;/ul&gt;
$$
r = \frac{\sum_{i}(x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum_{i}(x_i - \bar{x})^2}\sqrt{\sum_{i}(y_i - \bar{y})^2}}
$$&lt;ul&gt;
&lt;li&gt;散布図を描いて、実際の点の散らばり方を目で確認することも重要&lt;/li&gt;
&lt;li&gt;相関係数だけを見ていると、直線的でない関係（例えばU字型の関係）を見落としてしまうことがある&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="相関と因果の違い"&gt;相関と因果の違い&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;相関関係（Correlation）
&lt;ul&gt;
&lt;li&gt;$X$が大きい（小さい）ほど$Y$も大きい（小さい）という、両者が連動する関係&lt;/li&gt;
&lt;li&gt;$X$と$Y$のどちらが原因でどちらが結果かは問わない、対称的な関係&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;因果関係（Causality）
&lt;ul&gt;
&lt;li&gt;$X$の変化や差によって$Y$の変化や差が生じるという、一方向の関係&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;相関関係があるからといって、必ずしも因果関係があるとは限らない。&lt;/p&gt;
&lt;h3 id="見せかけの相関spurious-correlation"&gt;見せかけの相関（Spurious correlation）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;見せかけの相関（Spurious correlation）
&lt;ul&gt;
&lt;li&gt;2つの変数の間に直接の因果関係がないにもかかわらず、統計的には相関が観測されてしまう現象&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;交絡因子（Confounding factor）
&lt;ul&gt;
&lt;li&gt;2つの変数の両方に影響を与えることで、見せかけの相関を生み出している別の要因&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;例えば、「アイスクリームの売り上げ」と「水難事故の件数」には正の相関があるが、アイスクリームが水難事故を引き起こしているわけではない。実際には「気温が高い」という共通の原因が、両方を同時に押し上げているだけである。相関関係を見つけたときは、両者を同時に動かしている交絡因子がないかを疑う必要がある。&lt;/p&gt;
&lt;h3 id="因果関係の3条件"&gt;因果関係の3条件&lt;/h3&gt;
&lt;p&gt;$X$が$Y$の原因であると言うためには、次の3条件をすべて満たす必要がある。&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;時間的先行性（Temporal precedence）
&lt;ul&gt;
&lt;li&gt;原因となる$X$の変化が、結果となる$Y$の変化より時間的に先に起きていること&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;共変関係（Covariation）
&lt;ul&gt;
&lt;li&gt;$X$が変動すると、それに伴って$Y$も変動すること（相関関係があること）&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;他の説明の排除（No confounding）
&lt;ul&gt;
&lt;li&gt;$X$と$Y$の両方に影響を与えるような別の要因（交絡因子）が存在しないか、その影響が取り除かれていること&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;3つ目の条件が特に満たしにくく、交絡因子を完全に排除できたと言い切るのは難しい。そこで、次に説明するランダム化比較試験のような手法で、この条件を実験的に近づけるアプローチが取られる。&lt;/p&gt;
&lt;h3 id="単回帰分析simple-regression"&gt;単回帰分析（Simple regression）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;1つの量的データ$x$から、別の量的データ$y$を予測する直線を求める方法&lt;/li&gt;
&lt;li&gt;求める直線は次のような式で表される&lt;/li&gt;
&lt;/ul&gt;
$$
y = a + bx
$$&lt;ul&gt;
&lt;li&gt;$a$は切片、$b$は傾き&lt;/li&gt;
&lt;li&gt;データ全体と直線とのズレ（残差、Residual）の2乗和が最小になるように、$a$と$b$を決める方法を最小二乗法（Least squares method）と呼ぶ&lt;/li&gt;
&lt;li&gt;回帰分析はあくまで相関関係の延長にすぎず、$x$が$y$の原因であることまでは保証しない&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="因果推論causal-inference"&gt;因果推論（Causal inference）&lt;/h2&gt;
&lt;p&gt;相関だけでは因果関係を主張できないので、因果関係そのものを調べるための手法もある。&lt;/p&gt;
&lt;h3 id="ランダム化比較試験rct"&gt;ランダム化比較試験（RCT）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;対象を「介入する群」と「介入しない群（対照群）」にランダムに振り分けて、結果を比較する方法&lt;/li&gt;
&lt;li&gt;ランダムに振り分けることで、年齢や生活習慣などのあらゆる交絡因子が、平均的には両群で同じくらいになることが期待できる&lt;/li&gt;
&lt;li&gt;交絡因子を意図的にそろえるのではなく、ランダム化によって「均等にばらけさせる」のがポイント&lt;/li&gt;
&lt;li&gt;新薬の効果を調べる臨床試験などで使われる代表的な方法&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="操作変数法instrumental-variable-method"&gt;操作変数法（Instrumental variable method）&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;RCTのようにランダムな割り付けができない場面で、因果関係に迫るための手法の1つ&lt;/li&gt;
&lt;li&gt;「結果には直接影響しないが、原因となる変数にだけ影響する」ような第三の変数（操作変数）を探し、それを手がかりに間接的に因果効果を推定する&lt;/li&gt;
&lt;li&gt;適切な操作変数を見つけること自体が難しく、実務ではここが一番の勘所になる&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 id="まとめ"&gt;まとめ&lt;/h2&gt;
&lt;ul&gt;
&lt;li&gt;記述統計（データを要約する）と推測統計（母集団を推測する）の違いを整理した&lt;/li&gt;
&lt;li&gt;データの尺度水準・代表値・散らばりの指標など、データを正しく要約するための基本用語をまとめた&lt;/li&gt;
&lt;li&gt;推定・仮説検定・カイ二乗検定・感度特異度など、標本から判断を下すための道具を確認した&lt;/li&gt;
&lt;li&gt;相関と回帰、因果推論についても、相関と因果を混同しないことを軸にまとめた&lt;/li&gt;
&lt;li&gt;どの道具も「何のためにその計算をしているのか」を見失うと使い方を誤りやすいので、目的に立ち返って使うことを意識したい&lt;/li&gt;
&lt;/ul&gt;</description></item></channel></rss>