スープ鍋全体の味を知るには、よくかき混ぜてからスプーン一杯だけ味見すればよい。
Stage 33の確率は未来への問いだった——コインが公平だとわかっているとき、明日の投げで表が出る確率は? 統計学はその逆向き、過去に目を向ける。データはすでに手元にある——昨日記録した数値 x₁, x₂, …, xₙ の山。仕事はそれを正直に読むこと:生の数値の山を要約に変え、要約を山よりはるかに大きな世界についての結論へと変えること。最初の決断こそ、多くの人が飛ばしてしまうもの:どの数値を集めるか? ここを間違えると、後でどれほど巧みな計算をしても取り返しがつかない。
世界についての誠実な主張はすべてデータに基づいている。十代の若者は十分に眠れているか? この新薬はより安全か? 選挙の結果はどうなるか? これらはどれも、安楽椅子で考えるだけでは答えられない。外に出て測定しなければならない。統計学は、正確に測定し、測定結果から論理的に推論する学問だ。
この科目全体は一本の弧を描いており、Stage 34 はその端から端まで歩く:
| ステップ | 何をするか | レッスン |
|---|---|---|
| データ | 何を知りたいか決め、標本抽出で正直な数値を集める | 34.1 — 今ここ |
| 要約 | 数値の山を図示し(グラフ・ヒストグラム)、中心と広がりに圧縮する | 34.2 – 34.4 |
| 推論 | 標本に母集団の声を語らせ、関係を探し、結論を出す | 34.5 – 34.7 |
このレッスンは基礎の基礎だ。平均や中央値が何かを意味するためには、まず数値が公平に集められていなければならない。だからまず言葉から始め、次に他のすべてが依存するただ一つのスキル——標本抽出——へと進む。
統計学はデータから推論する技術だ:収集 → 要約 → 推論。結論の誠実さは、収集の誠実さを超えることができない。
三つのシンプルな言葉がアイデア全体を運ぶ。母集団とは、関心を持つ対象のすべてだ。一つひとつが個体。そして標本は、実際に調べる一握りだ。大きさにも名前がある:母集団の大きさをN、標本の大きさをnといい、ほぼ常にnはNよりはるかに小さい。
料理人のたとえが完璧に言い表している。スープ鍋全体の味を判断するとき、鍋ごと飲み干しはしない。よくかき混ぜてからスプーン一杯だけ味見する。鍋が母集団、スプーン一杯が標本、そしてかき混ぜることがスプーン一杯に全体を代表させるのだ。標本で測った統計量——たとえばスプーン一杯の塩辛さ、記号では標本平均x̄——は鍋全体の真実、母集団平均μへの最良の推測だ。(x̄からμへのその飛躍を、34.5で厳密に示す。)
ある校長が、学校の2,000人の生徒の平均睡眠時間を知りたいが、50人にしか聞く時間がない。
母集団:2,000人全員 (N = 2000)。 個体:生徒一人。 標本:聞いた50人 (n = 50)。報告する睡眠時間——50人のx̄——は、直接は測れない真の学校平均μの推定値だ。
数値を得る方法はちょうど二つある。全数調査(センサス)は母集団のすべての個体を測定する——全員の名簿を呼び上げる。標本調査は一部だけを測定し、それに残りの代弁をさせる。10年ごとの国勢調査は全数調査、1,000人の有権者への電話アンケートは標本調査だ。
全数調査が完全で正確なら、なぜ標本調査をするのか? 全数調査はしばしば不可能、莫大な費用がかかる、あるいは破壊的だからだ。工場が作るすべての電球の寿命を試験することはできない——売るものがなくなる。選挙前に全5,000万人の有権者に聞くこともできない。標本調査は少しの不確実性を引き受ける代わりに、時間・費用・(時には)測定対象そのものを大幅に節約する。
そして心強い事実がある。34.5で定量化するが、大きな公平な標本は一般に真実に近い。スプーンの数が多く、よくかき混ぜるほど、味は安定する。しかし——これがこのレッスン全体の要——大きいことが助けになるのは標本が公平なときだけだ。大きく偏った標本は、精密に間違った答えにすぎない。
全数調査 = 全員を測定(完全・正確・費用大)。標本調査 = 公平な一部を測定(安価・少し不確実)。大きい公平な標本ほど安定する——公平さが先、大きさは二番目。
「公平」とは実際にどういう意味か? 黄金基準は単純無作為抽出(SRS)だ:すべての個体が選ばれる等しい確率を持ち、大きさnのすべての可能なグループが等確率で選ばれる方法。えこひいきなし、パターンなし、隠れた傾きなし。
古典的なやり方はくじ引きだ:N個の同じ紙に名前を書き、丸めて帽子に入れ、かき混ぜ、見ずにn枚を引く。より大きなリストには、統計学者は乱数表やコンピューターの乱数生成器を使う:母集団を1…Nと番号付けし、乱数を読んで対応する個体を選ぶ。どちらの方法でも、選択は意図を持たない偶然に委ねられる。
下のウィジェットは、真の平均がちょうどμ = 14の既知の母集団(クイズ得点40個)から実際に単純無作為標本を抽出する。二つのことを観察しよう:標本平均x̄は14の近くに落ちるが、ぴったりではない(標本は揺れる)、そしてnを大きくすると揺れが縮む——スプーン一杯が鍋の味に近づく。
12人のクラブ員からくじ引きで4人を選ぶ。1〜12の番号を付け、4枚引く:たとえば3, 7, 8, 11。全員が引かれる確率は同じ412 = 1/3であり、4人の全組み合わせが等確率だ。この等確率の保証がSRSの要点だ。
純粋なSRSは公平だが、運が悪いことがある:偶然、小さいが重要なグループからほとんど誰も選ばれないことがある。二つの改良法がこれを解決しつつ公平さを保つ。
まず母集団を重ならない層(ストラタ)——男/女、学年、都市/農村などの自然な層——に分け、次に各層の内側でその大きさに比例した単純無作為標本を抽出する。学校が80%の通学生と20%の寄宿生なら、20人の層別標本は16人の通学生と4人の寄宿生を取り、両層が正しいバランスで代表されることを保証する。測定対象で層が実際に異なるときに使う。
母集団を順番に並べ(リスト、生産ライン)、ランダムな開始点を選び、k番目ごとに取る——たとえば名簿の10番目ごと。素早く、リスト全体に標本を均等に広げる。一つの危険:リストにkと一致する隠れたリズムがある場合(10番目ごとの家が角の区画)、「系統」が偏りを忍び込ませることがある。
下のトグルは、二つの不均等な層における丁寧な層別割り当てと、無造作な一回のSRSを比較する。層別は常に80/20の分割を守る;無造作なSRSは小さな層を大幅に過小・過大代表することがある。
層別抽出——層に分け、それぞれを比例して抽出(層が異なるときに使う)。系統抽出——ランダムな開始後にk番目ごと(素早いが隠れたリズムに注意)。どちらもSRSの等確率の公平さの上に成り立つ。
標本が良いのは代表性があるとき——その構成が母集団を映し出すとき——だけだ。方法が系統的に標本を一方に傾けるとき、それを偏り(バイアス)と呼び、結果は予測可能な方向に嘘をつく標本になる。
バスケットボールの体育館の入り口に立って生徒の身長を調査する場面を想像しよう。スプーンは鍋の最も背の高い部分からしか取られないので、平均は大きく高くなる。報告する数値は精密で、注意深く、小数点もついている——そして間違っている。現実世界の偏りのほとんどは二つの罠が原因だ:
下のウィジェットは偏りを見えるようにする。30人の生徒の固定された母集団は、既知の真の平均身長μ = 165 cmを持つ。公平なフレームは学校全体を標本化し、バスケットボールチームのフレームと自発的参加者のフレームは歪んでいる——偏り(標本平均 − μ)が赤く光る。
これが最も痛い誤解だ。偏った標本を二倍にしても、真実に近づかない——精密に間違った答えになるだけだ。体育館で1,000人を測定しても、μよりはるかに高い身長を報告する;間違った数値をより正確に固定しただけだ。偏りの治療法は公平な方法であって、大きな方法ではない。(上の「大きくする」ボタンを試してみよう——偏りはまったく動かない。)
| 用語・方法 | 意味 | なぜ重要か |
|---|---|---|
| 母集団 (N) | 関心を持つすべての個体 | 求める真実、平均 μ |
| 標本 (n) | 実際に測定する部分 | μ の推定値 x̄ を与える |
| 全数調査 vs 標本調査 | 全員を測定 vs 一部を測定 | 全数調査が高コストすぎるとき標本を使う |
| 単純無作為抽出 | すべての個体が等しい確率 | 公平さの黄金基準 |
| 層別抽出 | 比例して層ごとに抽出 | すべての層が確実に代表される |
| 系統抽出 | ランダムな開始後にk番目ごと | 素早い;隠れたリズムに注意 |
| 偏り(バイアス) | 標本を傾ける方法 | 大きな標本では決して直せない |
一文で覚えよう:公平さが先、大きさは二番目。 公平な一握り、よくかき混ぜれば、鍋全体を代表する;傾いた一握りは、どれほど大きくても自分自身のことしか語らない。
母集団 = 1,250個全てのランドセル、よってN = 1250。個体 = ランドセル一個。標本 = 量った60個、よってn = 60。その60個の平均は真の母集団平均μの推定値だ。
標本調査。寿命の測定は破壊的——故障するまで試験した電池は売れない。全数調査では一日の生産量が全滅する。たとえば100個の公平な標本は平均寿命を推定しながら、49,900個を出荷できる。
各学年を2,000人中のシェアに比例して取る、抽出率802000 = 0.04。1年生 600·0.04 = 24;2年生 500·0.04 = 20;3年生 450·0.04 = 18;4年生 18。確認:24 + 20 + 18 + 18 = 80。✓
これは自発的回答バイアスだ。強く感じた聴取者だけが電話し、不満な人は満足な人より多く電話する——標本は反対意見を過大代表する。9,000という数字は結果を精密にするが公平にはしない:大きく偏った標本はやはり偏っている。真の全体像には全公衆の無作為標本が必要だ。
これは系統抽出(ランダムな開始点7からk = 10番ごと)だ。通常は標本をうまく広げる。リストにkと一致する隠れたリズムがある場合にうまくいかない——たとえばリストが管理職1人、次に9人のスタッフを10人ごとに繰り返していると、毎回同じ役職に当たり、標本が事務所を誤って代表する。
調査員A、はるかに小さい標本にもかかわらず。Aの方法は公平——30人の推定は真実の周りで揺れ、もっと聞けば安定する。Bの300人は富裕層に偏ったフレームから取られているので、Bは精密に高すぎる平均を報告する。大きさは偏りを治せない;公平さは治せる。
6問で定着させよう。正しいと思う答えをタップしよう。
Stage 34の導入レッスンでは、データの言語(大きさNの母集団、個体、大きさnの標本)、全数調査と標本調査のトレードオフ、そして生徒が区別しなければならない三つの抽出法(単純無作為・層別・系統)を確立する。CCSS HSS-IC.A.1——無作為標本から母集団に関する推論を行うプロセスとして統計学を理解すること——とHSS-IC.B.3——標本調査・実験・観察研究の目的と違い、無作為化の中心的役割を認識すること——に対応する。繰り返し現れる赤い糸は大きな標本は偏った方法を修正しないこと;偏りの治療法は公平な無作為選択だ。次のレッスン、34.2では、収集したデータを図に変える。