無作為抽出
無作為抽出とは、母集団の一人ひとりが選ばれる確率を等しく(あるいは決まった確率に)して、調べる相手を偶然にゆだねて抜き出す抽出方法です。
無作為抽出を具体例で理解する
ある自治体の住民 10 万人から、500 人にアンケートを取りたいとする。
つい「駅前で声をかけた 500 人」で済ませたくなる。集めやすいし、早い。でもそれでは、平日の昼間に駅前にいる人へ答えが寄ってしまう。
無作為抽出は、ここを断ち切る。住民台帳に通し番号をふり、乱数で 500 人を選ぶ。誰が選ばれるかは、こちらの意図でも相手の意欲でもなく、偶然が決める。だからこそ選ばれた 500 人は、母集団である 10 万人の縮図になりやすい。
無作為抽出の仕組み
核は、ひとつだけだ。母集団の全員に、選ばれる確率があらかじめ決まっていること。
確率が決まっているから、抜き出した標本から「全体ではこのくらいだろう」と推計でき、その推計のぶれ、つまり標本誤差や信頼区間を数式で計算できる。確率が分からない選び方では、この計算の土台が成り立たない。
選ぶ相手は偶然が決めるが、何人選ぶか(サンプルサイズ)はこちらが設計する。誤差をどこまで許せるかから、必要な標本数を逆算しておく。
無作為抽出の使い分け
同じ無作為抽出でも、いつどれを選ぶかの基準が違う。
- 単純無作為抽出 — 全員に通し番号をふって乱数で選ぶ。名簿がそろい、偏りが小さいときの基本。
- 系統抽出 — 名簿の先頭から一定間隔(例: 200 人ごと)で選ぶ。名簿が長いときの近道。並び順に周期があると偏るので注意する。
- 層化抽出 — 性別や年代で層に分け、層ごとに無作為で選ぶ。「20 代の声を確実に拾いたい」など、層ごとの精度を担保したいときに選ぶ。
- 多段抽出 — まず地域を無作為で選び、その中の世帯を無作為で選ぶ。全国の名簿が一枚で手に入らない大規模調査で使う。
ただ、現実も正直に言っておきたい。ネット調査の多くは、調査会社が事前に集めたパネルからリクルーティングするため、純粋な無作為抽出にはなっていない。登録した時点で、その人は「自分から手を挙げた人」だからだ。実務では、その偏りを年代や性別の割付やウェイトバックであとから補正することが多い。
無作為抽出でわからないこと
ここが、最も大事な限界である。
標本誤差や信頼区間の数式は、無作為抽出であることを前提に組み立てられている。「±5%」や「95% の信頼度」といった数字は、選ぶ相手を偶然が決めたからこそ意味を持つ。
だから、自分から登録したパネルへの調査は、厳密には無作為抽出ではなく、誤差の数式がそのまま成り立つわけではない。それでも報告書には、当たり前のように「±◯%」と書かれることがある。補正をかけても、自ら手を挙げた人だけを見ているという出発点は消えない。
無作為抽出が保証してくれるのは、答えの正しさではない。選び方に、こちらの都合を持ち込んでいないという一点だけである。
無作為抽出とは、選ぶ手を引っ込めることである
調査で人を選ぶとき、私たちはつい、答えてくれそうな人を選びたくなる。でも選ぶ相手をこちらが決めた瞬間、その標本はこちらの都合を映す鏡になる。
無作為抽出は、その手を止める。誰を選ぶかという最後の判断を、あえて偶然に手放す。駅前で声をかけた 500 人と、乱数が引き当てた 500 人を分けるのは、集めた速さでも人数でもない。選ぶ手を、途中で引っ込めたかどうかだ。
どれだけ速く、どれだけ大量に集められるようになっても、問われることは変わらない。その数字が、こちらの都合で選ばれていない誰かから生まれたかどうかだ。
手を引っ込めたぶんだけ、数字は全体に近づく。