標本調査法:有限母集団からの抽出
有限修正係数と、単純無作為・系統・層化・クラスター・多段の各抽出法を、分散の式と使い分けで整理します。
このモジュールで学ぶこと
世論調査や品質検査は、母集団の全員を調べず、一部を抜き出して全体を推測します。このとき母集団が有限であること、そしてどう抜き出すかが、推定の精度と費用を左右します。このモジュールでは、有限母集団の分散の補正と、5つの抽出法の特徴・長所短所・使い分けを整理します。
1. 有限母集団の補正:標本の割合が大きいときの分散
標準誤差の式 は、母集団が非常に大きい(または復元抽出)という前提で成り立ちます。母集団が 人しかいない有限母集団から非復元で 人を抜き出すと、一度選ばれた人は二度と選ばれないので、標本平均のばらつきは前提の式より小さくなります。
母分散を ( で割った分散)とすると、非復元の単純無作為抽出での標本平均の分散は次のとおりです。
後ろの が有限修正係数です。 に対して が小さければほぼ1になり、補正は不要です。目安は が5%未満のときで、全国の有権者を数千人で調べる世論調査では補正を気にしなくてかまいません。逆に、クラス40人のうち30人を調べるような場合は係数が約0.26となり、標準誤差は大きく縮みます。全員を調べれば で係数は0、つまり誤差が消えます。
よくある取り違え:有限修正は「標本が大きいと精度が上がる」という話の言い換えではありません。 を増やす効果()とは別に、**母集団に占める割合 ** が効く補正です。
標本の取り方が決まったので、次は取り方の種類を順に見ます。
2. 単純無作為抽出と系統抽出
単純無作為抽出は、母集団のどの個体も、どの組み合わせも、同じ確率で選ばれる抽出です。理論の基準になる方法で、前節の式もこれを前提にしています。ただし、母集団の名簿が全員分そろっていて、乱数で選んだ人に実際に会いにいける必要があります。
系統抽出は、名簿から最初の1人を乱数で決め、あとは一定の間隔で拾う方法です。間隔は で決めます。名簿が100,000人で1,000人を選ぶなら、 で、最初に乱数で37番を引けば 37, 137, 237, … と選びます。乱数表を何度も引かずに済むので作業が楽です。
系統抽出の落とし穴:名簿の並びに間隔 と同じ周期があると、偏った標本になります。たとえば世帯名簿が「各ブロックの1番目が世帯主・以後は家族」の順で、 がブロックの大きさと一致すると、世帯主ばかりを拾います。並びに周期性がないかを確かめるのが条件です。
3. 層化抽出:先に分けてから抜く
母集団を、調べたい量が似た者どうしの層に分け、各層から別々に無作為抽出する方法です。男女・年代・都道府県のように、事前にわかっている属性で分けます。
層 の大きさを 、標本数を とすると、母平均の推定量は層ごとの標本平均を層の重み で足し合わせたものです。
その分散には、層の中のばらつきだけが入ります。
層の間の差は分散に入らないので、層を「中は似ていて、層どうしは違う」ように切るほど、単純無作為抽出より精度が上がります。層の切り方が悪い(層内がばらばら)と、効果はほとんどありません。
層ごとに標本数をどう配分するかには2つの考え方があります。
- 比例配分:。母集団の構成比と標本の構成比が一致します。
- ネイマン配分:。大きい層、ばらつきの大きい層に多く割り当てると、同じ総数で分散が最小になります。
試験頻出:「層化抽出は、層内の分散が小さいほど効果が大きい」「ネイマン配分は に比例」の2点です。
4. クラスター抽出と多段抽出
クラスター抽出(集落抽出)は、個人を直接選ばず、学校・町丁・事業所のようなまとまり(クラスター)を無作為に選び、選ばれたクラスターの全員を調べる方法です。名簿が個人単位でなくても、移動や訪問の手間が小さくなるので、費用が安く済みます。
その代わり、同じクラスターの人は似通っているのがふつうです。同じ学校の生徒は、学力も生活環境も近いので、同じ人数でも情報量は少なくなります。クラスター内の個体どうしの相関を 、クラスターの大きさを とすると、単純無作為抽出に比べて分散が何倍になるかを表すデザイン効果は、おおよそ次の式です。
なら1を超え、精度が落ちます。クラスターの人数 が大きいほど悪化します。
多段抽出は、「市区町村を選ぶ → その中の地点を選ぶ → その地点の住民を選ぶ」のように、段階を踏んで絞る方法です。最終段で全員を調べず一部だけ抜くので、クラスター抽出より調査の手間と偏りのバランスを調整できます。全国規模の世論調査は、ほとんどが多段抽出を基本にしています。
層化とクラスターは逆向き:層化は「層の中は似ている」ように、クラスターは「クラスターの中が似ていない(母集団の縮図になっている)」ほど良く、切り方の理想が正反対です。
5. 抽出法の使い分け
| 方法 | 抜き方 | 長所 | 短所 |
|---|---|---|---|
| 単純無作為 | 全体から等確率 | 理論が単純・基準になる | 全員の名簿が必要・調査費がかさむ |
| 系統 | 一定間隔で拾う | 作業が楽 | 並びに周期があると偏る |
| 層化 | 層ごとに無作為 | 層内が均質なら高精度 | 層の情報が事前に必要 |
| クラスター | まとまりごと全員 | 費用が安い | 内部が似ると精度低下 |
| 多段 | 段階的に絞る | 名簿なしで大規模調査 | 推定量の式が複雑 |
判断の目安:精度を優先するなら層化、費用を優先するならクラスターか多段、名簿が整っていて作業を簡単にしたいなら系統、と考えると整理しやすくなります。実際の調査はこれらを組み合わせます(例:層化多段抽出)。
確認クイズ(抜粋)
Q1. 有限修正係数が必要になるのはどの状況か?
A. 標本サイズ が母集団サイズ に対して無視できない割合のとき
Q2. から非復元で を単純無作為抽出するとき、有限修正係数 に最も近い値はどれか?
A. 約0.90
Q3. 層化抽出法(Stratified Sampling)の主な利点はどれか?
A. 各層を確実に代表でき、単純無作為より推定精度が上がる
全10問のクイズはサイトのインタラクティブ版でお試しください。
第5章の他のモジュール
※本サイトは個人による学習支援サイトであり、統計質保証推進協会・日本統計学会の公式サイトではありません。