この章で学ぶこと

この章では、これまでの「1つの図形・1つの式に正確な値を求める」数学から一歩進んで、集団としてのデータをどう要約し、どう比較し、どう判断するかを学ぶ。第4章「図形と計量(三角比)」までは対象がいつも1つに定まっていたが、この章で扱うデータには必ず「ばらつき」があり、代表値・四分位数・分散・標準偏差といった道具を使って、その集団の特徴を1つの数値や1枚の図(箱ひげ図・ヒストグラム・散布図)で表現する練習をする。さらに相関係数で2つの数量の関係の強さを数値化し、仮説検定の考え方で「たまたま起きたことなのか、それとも意味のある違いなのか」を基準にもとづいて判断する視点まで身につける。数Iはこの章で一区切りとなり、次は数A「場合の数と確率」に進むが、ここで身につけた「データを整理し、数値の基準で判断する」見方は、数B「統計的な推測」でさらに本格的に発展していく。

学習の順路

下から順番に読み進めよう。1で「データを1つの数・1枚の図でどう要約するか」を学び、2で「散らばりの大きさをどう数値にするか」を学び、3で「2つの数量の関係をどう調べ、どう判断するか」に進む、という流れになっている。

  1. 1. 代表値・四分位数・箱ひげ図 ― 平均値・中央値・最頻値の使い分けと、四分位数の求め方、箱ひげ図による散らばりの比較のしかたを学ぶ。
  2. 2. 分散と標準偏差 ― 偏差・分散・標準偏差でデータの散らばりを数値にする方法と、全員に同じ数を足す・掛けるとき平均や分散がどう変化するかを学ぶ。
  3. 3. 相関係数・仮説検定の考え方 ― 2つの数量の関係の強さを表す相関係数の求め方・性質と、「めったに起こらないことが起きた」を基準に判断する仮説検定の考え方を学ぶ。

要点整理 代表値・四分位数・箱ひげ図(データを要約する)

「ひとつの数」でデータを代表させる方法は1つではない。テスト前は、まずどの代表値がどんな性格を持つかを思い出そう。

代表値の使い分け
平均値 全データの値を使うので情報量は多いが、極端に大きい・小さい値(外れ値)1つに大きく引っぱられる。
中央値 順番だけで決まるので外れ値があっても動きにくい。「実態に近い代表値」がほしいときに使う。
最頻値 いちばん度数が多い値(ヒストグラムでは、その階級の階級値)。「いちばん典型的な値」を知りたいときに使う。
手順1 データを小さい順に並べ、中央値\(Q_2\)を求める
↓
手順2 データ数が奇数なら\(Q_2\)を除いて2組に分ける/偶数ならそのまま半分に分ける
↓
手順3 下組の中央値が\(Q_1\)、上組の中央値が\(Q_3\)
箱ひげ図の読み方 箱の左端=\(Q_1\)、箱の中の線=中央値、箱の右端=\(Q_3\)、ひげ=最小値から最大値まで。箱が短いほど真ん中のデータが密集している(散らばりが小さい)。複数グループを並べて比較したいときに特に威力を発揮する。
外れ値の基準(1.5×IQR基準) \(Q_1-1.5\times\text{IQR}\)より小さい値、または\(Q_3+1.5\times\text{IQR}\)より大きい値を外れ値と判定する(\(\text{IQR}=Q_3-Q_1\))。外れ値は「間違ったデータ」とは限らないので、見つけたらまず「なぜその値になったのか」を考える姿勢が大切。

要点整理 分散・標準偏差と変換のルール(散らばりを数値にする)

代表値だけでは「散らばりの大きさ」はわからない。分散・標準偏差はそれを数値にする道具であり、データ全体を変換したときの動き方には、はっきりした規則がある。

分散の2つの公式 \[V=\dfrac{1}{n}\sum(x-\bar x)^2 = \overline{x^2}-(\bar x)^2\] 偏差が小さい整数になるときは左の定義式、平均や\(\overline{x^2}\)が先にわかっているときは右の近道公式が速い。どちらで求めても同じ値になる(検算にも使える)。
標準偏差 \(s=\sqrt V\)(分散の正の平方根)。分散は2乗しているぶん単位がずれてしまうので、元の単位に戻すために使う。「データはだいたい平均から\(s\)くらい離れている」という散らばりの目安になる。
全員に\(a\)を足す(\(y=x+a\))
平均:\(\bar x+a\)
分散:変わらない
標準偏差:変わらない
全員を\(b\)倍する(\(y=bx\))
平均:\(b\bar x\)
分散:\(b^2\)倍
標準偏差:\(|b|\)倍
\(y=bx+a\)のとき、分散・標準偏差に効くのは\(b\)の部分だけ 「\(+a\)」は散らばりの形をそのまま平行移動させるだけ(分散は不変)、「\(b\)倍」は散らばりの幅自体を伸び縮みさせる(分散は2乗で効いてくる)。2つのグループを合併するときは、各グループの平均が全体の平均からどれだけずれているかも影響するので、各グループの分散を単純に平均するだけでは求まらない(\(\overline{x^2}\)を経由するのが確実)。

要点整理 相関係数・仮説検定の考え方(2つの量の関係を調べ、数値で判断する)

見た目の印象(右上がり・右下がり)を数値にするのが相関係数、「めったに起こらないことが起きた」を数値の基準で判断するのが仮説検定。どちらも「印象ではなく数値で判断する」という考え方でつながっている。

共分散と相関係数 \[S_{xy}=\dfrac{1}{n}\sum(x-\bar x)(y-\bar y)\qquad r=\dfrac{S_{xy}}{S_x\times S_y}\]
相関係数\(r\)の4つの性質
性質1 \(-1\le r\le1\)(この範囲を超えたら計算ミス)
性質2 単位を変えても\(r\)は変わらない
性質3 外れ値がひとつ混ざるだけで大きく変わることがある
性質4 相関があっても、因果関係があるとは限らない
手順1 仮説を立てる(例:「このコインは公正である」)
↓
手順2 仮説が正しいとしたら、今回のような結果がどれくらい起こりやすいかを調べる
↓
手順3 その起こりやすさを、あらかじめ決めた基準(多くの場合5%)と比べる
↓
手順4 基準より小さければ仮説を棄却する。基準より大きければ棄却できない
「棄却できない」は「証明された」ではない あくまで「今回の結果だけでは、疑うだけの十分な根拠がなかった」という意味にすぎない。
まとめテスト(標準)

この章全体を横断する総合演習、全25問。目標時間は30分。答えを入力して「採点」を押すと○×が出るぞ。分数は「-1/2」のように、根号は「2√6」または「2sqrt6」のように入力。
わからないときは「解説を見る」で解き方を確認しよう。

基本(1〜15)
1
中央値(データ数が奇数)

9人のバドミントン部員のサーブ練習の成功本数:\(15,\ 22,\ 19,\ 25,\ 18,\ 20,\ 24,\ 17,\ 21\)。中央値を求めよ。

中央値
解説を見る
小さい順に並べる:\(15,17,18,19,20,21,22,24,25\) 9個なので5番目が中央値。 中央値 \(20\)
2
四分位数(データ数が奇数・11個)

次の11個のデータについて、\(Q_1\)・\(Q_3\)・四分位範囲を求めよ:\(5,9,12,15,18,20,23,26,29,31,34\)

\(Q_1=\)  \(Q_3=\)  四分位範囲
解説を見る
すでに小さい順。11個は奇数なので、中央値(6番目)\(20\)を除いて2組に分ける。 下組(1〜5番目):\(5,9,12,15,18\) → 中央値(3番目)\(Q_1=12\) 上組(7〜11番目):\(23,26,29,31,34\) → 中央値(3番目)\(Q_3=29\) 四分位範囲は\(29-12=17\) \(Q_1=12\)、\(Q_3=29\)、四分位範囲 \(17\)
3
四分位数(データ数が偶数・8個)

次の8個のデータについて、\(Q_1\)・\(Q_3\)・四分位範囲を求めよ:\(4,9,11,14,16,19,21,25\)

\(Q_1=\)  \(Q_3=\)  四分位範囲
解説を見る
8個は偶数なので、そのまま半分(4個ずつ)に分ける。 下組:\(4,9,11,14\) → \(Q_1=\dfrac{9+11}{2}=10\) 上組:\(16,19,21,25\) → \(Q_3=\dfrac{19+21}{2}=20\) 四分位範囲は\(20-10=10\) \(Q_1=10\)、\(Q_3=20\)、四分位範囲 \(10\)
4
平均値と中央値の違い

次の7個のデータについて、平均値と中央値を求めよ:\(3,4,5,5,6,7,40\)

平均値  中央値
解説を見る
すでに小さい順。 平均値:\(\dfrac{3+4+5+5+6+7+40}{7}=\dfrac{70}{7}=10\) 中央値(4番目):\(5\) 平均値 \(10\)、中央値 \(5\)。最後の\(40\)という外れ値に平均値だけ引っぱられている。
5
ヒストグラムの読み取り(最頻値)

30人の小テストの得点の分布を表したヒストグラムである。最頻値が含まれる階級の階級値を求めよ。

階級値
解説を見る
度数がいちばん多い階級は「\(20\)以上\(30\)未満」で度数\(11\)。 この階級の階級値は\(\dfrac{20+30}{2}=25\) 階級値 \(25\)
6
箱ひげ図の読み取り

1組の小テスト結果を表した箱ひげ図である。中央値と第3四分位数を読み取れ。

中央値  第3四分位数
解説を見る
箱ひげ図から、箱の中の線が中央値、箱の右端が第3四分位数。目盛は\(10\)刻みなので、中央値は\(50\)の目盛線上、第3四分位数は\(60\)と\(70\)の目盛のちょうど中間の\(65\)と読み取れる。 中央値 \(50\)、第3四分位数 \(65\)
7
分散・標準偏差(基本)

データ\(7,\ 7,\ 13,\ 13\)について、平均・分散・標準偏差を求めよ。

平均  分散  標準偏差
解説を見る
平均\(=\dfrac{7+7+13+13}{4}=\dfrac{40}{4}=10\) 偏差は\(-3,\ -3,\ 3,\ 3\)。2乗の和は\(9+9+9+9=36\)。 分散\(=\dfrac{36}{4}=9\)、標準偏差\(=\sqrt9=3\) 平均 \(10\)、分散 \(9\)、標準偏差 \(3\)
8
公式「(x²の平均)−(平均)²」を使う

データ\(3,\ 3,\ 3,\ 11,\ 11,\ 11\)(6個)の分散を、\(\overline{x^2}-(\bar x)^2\)の公式で求め、標準偏差も答えよ。

分散  標準偏差
解説を見る
平均\(=\dfrac{3+3+3+11+11+11}{6}=\dfrac{42}{6}=7\) \(x^2\)は\(9,9,9,121,121,121\)。和は\(9\times3+121\times3=27+363=390\)。 \(\overline{x^2}=\dfrac{390}{6}=65\) \(V=\overline{x^2}-(\bar x)^2=65-7^2=65-49=16\)、標準偏差\(=\sqrt{16}=4\) 分散 \(16\)、標準偏差 \(4\)
9
全員に同じ数を足す→分散はどうなる?

あるデータの平均は\(18\)、分散は\(9\)である。全員に\(7\)を加えると、新しいデータの平均・分散・標準偏差はいくらになるか。

平均  分散  標準偏差
解説を見る
平均は\(18+7=25\)。偏差の形は変わらないので分散は変わらず\(9\)、標準偏差も変わらず\(\sqrt9=3\)。 平均 \(25\)、分散 \(9\)、標準偏差 \(3\)
10
全員をb倍する→分散はb²倍

あるデータの平均は\(8\)、分散は\(5\)である。全員を\(3\)倍すると、新しいデータの平均・分散・標準偏差はいくらになるか。

平均  分散  標準偏差
解説を見る
平均は\(8\times3=24\)。分散は\(3^2=9\)倍なので\(5\times9=45\)。標準偏差は\(3\)倍なので\(\sqrt5\times3=3\sqrt5\)(または\(\sqrt{45}=\sqrt{9\times5}=3\sqrt5\)と直接求めてもよい)。 平均 \(24\)、分散 \(45\)、標準偏差 \(3\sqrt5\)(\(\approx6.71\))
11
共分散の計算

4人の生徒の練習時間\(x\)(時間)と、その後の小テストの得点\(y\)(点)は\(x=1,3,5,7\)、\(y=2,5,6,11\)であった(生徒の順は対応している)。共分散\(S_{xy}\)を求めよ。

\(S_{xy}=\)
解説を見る
\(\bar x=\dfrac{1+3+5+7}{4}=4\)、\(\bar y=\dfrac{2+5+6+11}{4}=6\) \(x-\bar x\):\(-3,-1,1,3\) \(y-\bar y\):\(-4,-1,0,5\) 積:\(12,1,0,15\) 合計\(28\) \(S_{xy}=28\div4=7\)
12
公式に代入するだけ

あるデータについて、\(x\)の標準偏差\(S_x=2.5\)、\(y\)の標準偏差\(S_y=4\)、共分散\(S_{xy}=-7\)であった。相関係数\(r\)を求めよ。

\(r=\)
解説を見る
\(r=\dfrac{S_{xy}}{S_x\times S_y}=\dfrac{-7}{2.5\times4}=\dfrac{-7}{10}\) \(r=-0.7\)
13
散布図の読み取り

次の散布図は、7人の1日の自習時間(時間)と定期テストの合計点(点)の関係を表したものである。相関の種類を「正」「負」「なし」のいずれかで答えよ。

相関の種類
解説を見る
自習時間が長い生徒ほど、合計点が高い傾向にある。点がおおむね右上がりに分布している。 正の相関
14
相関係数の範囲

次の値\(0.95,\ -1.2,\ 0,\ 1.05,\ -0.6\)のうち、相関係数の値としてありえないものを、小さい順にコンマ区切りで全て答えよ。

ありえない値
解説を見る
相関係数は必ず\(-1\le r\le1\)の範囲におさまる。 \(-1.2\)はこの範囲より小さく、\(1.05\)はこの範囲より大きいのでありえない。\(0.95,\ 0,\ -0.6\)はどれも範囲内なのであり得る。 ありえない値は\(-1.2,\ 1.05\)
15
仮説検定:表を使った割合の計算

友達が「このコインは公正だ(表が出る確率0.5)」と言うので、20回投げてみたところ表が17回出た。公正なコインを20回投げる実験を1000回シミュレーションした結果(の一部)を下の表に示す。「20回中17回以上表が出る」割合(%)を求め、5%を基準に「このコインは公正である」という仮説を棄却できるか判断せよ。

表の枚数1011121314151617181920
1000回中の回数17616012074371551000
割合 % 判断
解説を見る
表から、17回・18回・19回・20回が出た回数を足し合わせる。 \(1+0+0+0=1\)(1000回中1回) 割合にすると\(1\div1000=0.001\)、つまり0.1%。 \(0.1\%<5\%\)なので、「公正なコインで17回以上表が出る」ことは非常にめずらしいと判断できる。したがって、「このコインは公正である」という仮説は疑わしいとして棄却できる。 17回以上表が出る割合は0.1%(5%より小さい)→ 仮説を棄却できる
発展(16〜25)
16
箱ひげ図の比較・四分位範囲

P組・Q組の小テスト結果を表した箱ひげ図である。それぞれの四分位範囲を求め、どちらの組の方が成績が「そろっている」(散らばりが小さい)と言えるか、P・Qの記号で答えよ。

P組の四分位範囲  Q組の四分位範囲  そろっている組
解説を見る
P組:\(Q_3-Q_1=55-20=35\) Q組:\(Q_3-Q_1=45-30=15\) 四分位範囲が短いほど、箱の中(真ん中50%)のデータが密集していて散らばりが小さい。Q組の方が四分位範囲がずっと短いので、Q組の方が成績がそろっている。 P組の四分位範囲 \(35\)、Q組の四分位範囲 \(15\)。そろっているのはQ組。
17
変換の複合(y=bx+a、bが負の数)

あるデータの平均は\(12\)、分散は\(8\)である。全員を\(-2\)倍してから\(5\)を引いた新しいデータ(\(y=-2x-5\))の平均・分散・標準偏差を求めよ。

平均  分散  標準偏差
解説を見る
平均は「\(-2\)倍してから\(5\)を引く」をそのまま平均に適用する:\(12\times(-2)-5=-24-5=-29\)。 分散は「\(-2\)倍」の部分だけが効き、「\(-5\)」(定数を引く)の部分は無関係。倍率の符号に関係なく\(2\)乗するので\((-2)^2=4\)倍:\(8\times4=32\)。 標準偏差は\(\sqrt{32}=\sqrt{16\times2}=4\sqrt2\)(標準偏差は必ず正の値になる)。 平均 \(-29\)、分散 \(32\)、標準偏差 \(4\sqrt2\)(\(\approx5.66\))
18
2グループ合併・加重平均

生徒15人のグループAの小テストの平均点は\(72\)点、生徒25人のグループBの平均点は\(84\)点であった。AとBを合わせた全体の平均点を求めよ。

全体の平均点
解説を見る
合計人数は\(15+25=40\)人。平均点は「人数の重みつき平均」で計算する(人数が違うグループを単純に\(\dfrac{72+84}{2}\)と平均してはいけない)。 合計点は\(\text{Aの合計}+\text{Bの合計}=15\times72+25\times84=1080+2100=3180\)点。 全体の平均点\(=\dfrac{3180}{40}=79.5\)点。 全体の平均点 \(79.5\)点
19
2グループ合併・加重分散

生徒6人のグループAは平均\(5\)点・分散\(3\)、生徒4人のグループBは平均\(10\)点・分散\(3\)であった。AとBを合わせた10人全体の平均点と分散を求めよ。

全体の平均点  全体の分散
解説を見る
全体の平均点\(=\dfrac{6\times5+4\times10}{10}=\dfrac{30+40}{10}=\dfrac{70}{10}=7\)点。 分散は「各グループの分散をそのまま平均する」だけでは求まらない。各グループの平均が全体の平均からずれている分も加味する必要があるので、\(\overline{x^2}\)を使う方法で確認する。公式\(V=\overline{x^2}-(\bar x)^2\)を逆に使うと\(\overline{x^2}=V+(\bar x)^2\)。 Aグループ:\(\overline{x^2}_A=3+5^2=3+25=28\)、合計\(=6\times28=168\) Bグループ:\(\overline{x^2}_B=3+10^2=3+100=103\)、合計\(=4\times103=412\) 全体の\(\overline{x^2}=\dfrac{168+412}{10}=\dfrac{580}{10}=58\) 全体の分散\(=\overline{x^2}-(\bar x)^2=58-7^2=58-49=9\) 全体の平均点 \(7\)、全体の分散 \(9\)
20
相関係数の計算(同じ数の集まりの並べ替え)

5人の生徒の1回目のテスト得点\(x\)(点)と2回目のテスト得点\(y\)(点)は\(x=10,20,30,40,50\)、\(y=30,10,50,20,40\)であった(生徒の順は対応している)。共分散\(S_{xy}\)と相関係数\(r\)を求めよ。

\(S_{xy}=\)  \(r=\)
解説を見る
\(x,\ y\)はどちらも\(\{10,20,30,40,50\}\)を並べ替えただけの、同じ数の集まりなので、平均も分散も等しい。 \(\bar x=\bar y=30\) \(x-\bar x\):\(-20,-10,0,10,20\) \(y-\bar y\):\(0,-20,20,-10,10\) 積:\(0,200,0,-100,200\) 合計\(300\) \(S_{xy}=300\div5=60\) \(x\)の分散\(=(400+100+0+100+400)\div5=200\)。\(x,y\)は同じ数の集まりなので\(y\)の分散も\(200\)、よって\(S_x=S_y=\sqrt{200}\)。 \(r=\dfrac{60}{\sqrt{200}\times\sqrt{200}}=\dfrac{60}{200}\) \(S_{xy}=60\)、\(r=0.3\)(正の相関だが、1回目と2回目の得点の並びがかなり入れ替わっているので、弱い相関にとどまっている)
21
相関係数の性質・総合選択

相関係数についての次の記述のうち、正しいものを全て選び、番号を小さい順にコンマ区切りで答えよ。
1.単位を変えると相関係数の値は必ず変化する
2.相関係数は常に\(-1\)以上\(1\)以下の値をとる
3.外れ値が1つ混ざっても相関係数の値は変化しない
4.相関係数の絶対値が\(1\)に近いほど、直線的な関連が強い

正しい記述の番号
解説を見る
1は誤り:単位を変えても(正の数倍・平行移動しても)点の並び方の「形」は変わらないので、相関係数の値は変わらない。 2は正しい:相関係数は必ず\(-1\le r\le1\)の範囲におさまる。 3は誤り:相関係数は外れ値の影響を受けやすい。傾向から大きく外れた点が1つ混ざるだけで、値は大きく変わってしまう。 4は正しい:\(r=1\)は完全な正の相関(点が右上がりの一直線)、\(r=-1\)は完全な負の相関を表すので、絶対値が\(1\)に近いほど点は一直線に近づく(直線的な関連が強い)。 正しい記述は2, 4
22
仮説検定(別の題材・サイコロ)

友達が持ってきたサイコロについて「6の目が出やすい」と主張したので、40回投げてみたところ6の目が11回出た。次の表は、公正なサイコロ(6の目が出る確率\(\dfrac16\))で40回投げる実験を1000回シミュレーションした結果(の一部)である。「40回中11回以上6の目が出る」割合(%)を求め、5%を基準に「このサイコロは公正である」という仮説を棄却できるか判断せよ。

6の目の回数67891011121314151617181920
1000回中の回数1671621349559321673100000
割合 % 判断
解説を見る
表から、11回以上(11回〜20回)が出た回数を足し合わせる。 \(32+16+7+3+1+0+0+0+0+0=59\)(1000回中59回) 割合は\(59\div1000=0.059\)、つまり5.9%。 \(5.9\%>5\%\)なので、「公正なサイコロで11回以上6の目が出る」ことは、それほどめずらしいとは言えない。したがって、「このサイコロは公正である」という仮説は棄却できない(=今回の40回・11回という結果だけでは、友達の主張を裏づける十分な根拠があるとは言えない)。 11回以上6の目が出る割合は5.9%(5%より大きい)→ 仮説を棄却できない
23
四分位数+外れ値の判定(データ数が多い場合)

あるゲームアプリのユーザー13人の1週間のプレイ時間(分、小さい順):\(12,15,18,20,22,24,26,28,30,32,34,36,75\)。\(Q_1\)・\(Q_3\)・上側の基準値を求め、\(75\)分が外れ値と言えるか判定せよ。

\(Q_1=\)  \(Q_3=\)  上側の基準値  判定
解説を見る
すでに小さい順。13個は奇数なので、中央値(7番目)\(26\)を除いて2組に分ける。 下組(1〜6番目):\(12,15,18,20,22,24\) → 6個(偶数)なので3番目と4番目の平均 \(Q_1=\dfrac{18+20}{2}=19\) 上組(8〜13番目):\(28,30,32,34,36,75\) → 3番目と4番目の平均 \(Q_3=\dfrac{32+34}{2}=33\) 四分位範囲:\(\text{IQR}=33-19=14\) 上側の基準値:\(Q_3+1.5\times\text{IQR}=33+1.5\times14=33+21=54\) \(75\)は上側の基準値\(54\)より大きい。 上側の基準値は\(54\)で、\(75\)分はこれを超えているので外れ値と判定される
24
変換の複合・文章題(総合)

あるクラス20人の小テストの平均点は\(50\)点、標準偏差は\(6\)点であった。全員の点数を\(1.5\)倍にしたあと、\(10\)点を一律に加える特別採点を行った(先に\(1.5\)倍、その後に\(+10\))。最終的な平均点・分散・標準偏差を求めよ。

最終的な平均点  分散  標準偏差
解説を見る
もとの点数を\(x\)とすると、最終的な点数は\(y=1.5x+10\)(先に\(1.5\)倍、その後に\(+10\)すると、この順に式になる)。 平均:\(1.5\times50+10=75+10=85\)点。 分散:もとの分散は標準偏差\(6\)の2乗で\(V=6^2=36\)。「\(+10\)」の部分は分散に無関係で、「\(1.5\)倍」の部分だけが\(1.5^2=2.25\)倍として効く。 \(36\times2.25=81\) 標準偏差:\(\sqrt{81}=9\)。 最終的な平均点 \(85\)点、分散 \(81\)、標準偏差 \(9\)
25
章の総仕上げ:平均・四分位数・外れ値の判定

9人が参加したマラソン大会の記録(分、すでに小さい順に並んでいる):\(38,40,42,44,46,48,50,52,90\)。(1) 平均値、(2) \(Q_1\)・中央値・\(Q_3\)・四分位範囲、(3) 1.5×IQR基準で\(90\)分の記録が外れ値と言えるかを求めよ。

平均値  \(Q_1=\)  中央値  \(Q_3=\)  四分位範囲  上側の基準値  判定
解説を見る
(1) 平均値:\(\dfrac{38+40+42+44+46+48+50+52+90}{9}=\dfrac{450}{9}=50\)分 (2) 9個は奇数なので、中央値(5番目)\(46\)を除いて2組に分ける。 下組(1〜4番目):\(38,40,42,44\) → \(Q_1=\dfrac{40+42}{2}=41\) 上組(6〜9番目):\(48,50,52,90\) → \(Q_3=\dfrac{50+52}{2}=51\) 四分位範囲:\(51-41=10\) (3) 上側の基準値:\(Q_3+1.5\times\text{IQR}=51+1.5\times10=51+15=66\) \(90\)は上側の基準値\(66\)より大きいので、外れ値と判定される。 この章で学んだ「平均値は外れ値に引っぱられる(中央値\(46\)より平均値\(50\)の方が高い)」「四分位範囲・外れ値の基準は極端な値の影響を受けにくい」という2つの見方が、同じ1組のデータの中で同時に確認できる。 平均値 \(50\)、\(Q_1=41\)、中央値 \(46\)、\(Q_3=51\)、四分位範囲 \(10\)、上側の基準値 \(66\)。\(90\)分は外れ値と判定される。
記述チャレンジ

答えだけでなく「なぜそうなるか」を文章と式で書く練習。模範解答と見比べて、書き方の型を身につけよう。

記1

平均値・中央値・分散・標準偏差は、どれも「データの特徴を1つの数値にまとめる」道具である。これらを「外れ値に対する強さ」という観点から比較し、どのような場面でどれを使うべきかを説明せよ。

模範解答を見る
平均値は、全データの値をそのまま足して個数で割るので、極端に大きい・小さい値(外れ値)が1つ混ざるだけで、その値に大きく引っぱられてしまう。実際にこの章の練習問題でも、\(3,4,5,5,6,7,40\)のようなデータでは、中央値が\(5\)であるのに対し平均値は\(10\)まで押し上げられていた。 中央値は、データを小さい順に並べたときの「順位」だけで決まる値である。外れ値がどれだけ極端な値であっても、それが最大側・最小側にあるかぎり順位そのものは動かないので、中央値はほとんど影響を受けない。四分位数・四分位範囲も同じ理由で外れ値に強い(真ん中50%だけを見るため)。 分散・標準偏差はどうかというと、これらは平均値からの偏差を2乗して平均する量なので、平均値と同じ弱点を受け継いでいる。むしろ偏差を2乗する分、外れ値の影響はより強く出る(外れ値の偏差は大きいので、2乗するとさらに大きくなる)。四分位範囲(\(Q_3-Q_1\))は分散・標準偏差と同じ「散らばりの指標」でありながら、外れ値の影響をほとんど受けない点で対照的である。 したがって、データにどんな外れ値が混ざっているかわからない、あるいは外れ値の影響を避けて「典型的な実態」をつかみたい場面では中央値・四分位範囲を使うべきであり、逆に、外れ値も含めた全データの情報をそのまま反映させたい場面(合計に直結する量を扱うときなど)では平均値・分散・標準偏差を使うのが適切である。 平均値・分散・標準偏差は全データを使う分、外れ値に弱い。中央値・四分位範囲は順位や真ん中50%だけで決まるので外れ値に強い。外れ値を避けて実態をつかみたいなら中央値・四分位範囲、全データの情報を反映したいなら平均値・分散・標準偏差を使う。
記2

相関係数と仮説検定は、一見すると別々の技術に見えるが、どちらも「見た目の印象だけで判断せず、数値の基準で判断する」という共通の考え方にもとづいている。それぞれ具体例を1つずつ挙げながら、この共通点を説明せよ。

模範解答を見る
散布図を見るだけでも「点が右上がりに並んでいるから、正の相関がありそうだ」という印象は得られる。しかし「かなり強い相関」なのか「弱い相関」なのかは、見た目の印象だけでは人によって判断がぶれてしまう。そこで相関係数\(r\)を計算すると、この関連の強さが必ず\(-1\)以上\(1\)以下のただ1つの数値として表される。例えば5人のテストの得点を比べた例題で、\(r=0.8\)と計算できれば、「かなり強い正の相関」だと、印象ではなく数値の根拠をもって言い切ることができる。 仮説検定も同じ発想である。「20回コインを投げて16回も表が出た」という結果を見ると、直感的には「なんだか多い気がする」という印象を持つ。しかしその「気がする」をそのまま結論にはしない。公正なコインで実際に20回投げる実験を1000回シミュレーションし、「16回以上表が出る」ことが1000回中何回起こったか(この章の例では6回、つまり0.6%)を数値で確認し、あらかじめ決めておいた基準(5%)と比べてはじめて、「公正だという仮説を棄却できる」と判断する。 このように、相関係数は「関連の強さ」という印象を、仮説検定は「結果のめずらしさ」という印象を、それぞれ具体的な数値(\(r\)の値、割合(%))に置きかえ、あらかじめ決めた基準と比べることで結論を出す。感覚や思い込みではなく、計算された数値と基準にもとづいて判断するという姿勢は、この章全体を貫く共通の考え方である。 相関係数は「関連の強さ」という印象を\(-1\)から\(1\)の数値に、仮説検定は「結果のめずらしさ」という印象を割合(%)の数値に置きかえ、あらかじめ決めた基準と比べて判断する。どちらも「印象ではなく数値の基準で判断する」という共通の考え方にもとづいている。
共通テスト形式チャレンジ

大問1 目標時間 8分/配点 20点

花子さんのクラス(Aクラス)では、文化祭の来場者アンケートで「満足度スコア」(\(0\)点から\(100\)点)を聞いている。ランダムに選んだ5人分の記録は\(72,\ 78,\ 80,\ 84,\ 86\)点であった。先生「これを使って、データの基本的な特徴を調べてみよう。」
(1)

Aクラスの5人分のスコアについて、平均値\(\bar x=\boxed{\text{アイ}}\)点、偏差の2乗の和は\(\boxed{\text{ウエオ}}\)、分散は\(V=\boxed{\text{カキ}}\)である。また、標準偏差は\(s=\boxed{\text{ク}}\)である(根号を用いて表せ)。

アイ ウエオ カキ ク
解説を見る
平均値:\(\bar x=\dfrac{72+78+80+84+86}{5}=\dfrac{400}{5}=80\)点 偏差:\(72-80=-8\)、\(78-80=-2\)、\(80-80=0\)、\(84-80=4\)、\(86-80=6\) 偏差の2乗:\(64,\ 4,\ 0,\ 16,\ 36\) 和は\(64+4+0+16+36=120\) 分散:\(V=\dfrac{120}{5}=24\) 標準偏差:\(s=\sqrt{24}=\sqrt{4\times6}=2\sqrt6\) \(\bar x=80\)点、偏差の2乗の和は\(120\)、\(V=24\)、\(s=2\sqrt6\)(\(\approx4.90\))
(2)

太郎「後日、この5人には一律\(5\)点のボーナス点を追加することになりました。」

ボーナス点を追加した後の平均点は\(\boxed{\text{ケコ}}\)点、分散は\(\boxed{\text{サシ}}\)である。

ケコ サシ
解説を見る
全員に一律\(5\)点を加えるのは「\(+5\)」の平行移動なので、平均は\(80+5=85\)点に変わるが、偏差の形(散らばり方)は変わらないので分散は変わらず\(24\)のままである。 平均点 \(85\)点、分散 \(24\)(不変)
(3)

花子「隣のBクラスでも同じアンケートを5人からとったところ、\(75,\ 79,\ 80,\ 81,\ 85\)点でした。」

Bクラスの平均値は\(\boxed{\text{スセ}}\)点、分散は\(\boxed{\text{ソタ}}\)である。また、Aクラス(ボーナス点追加前、分散\(24\))とBクラスでは、どちらのスコアがより「そろっている」(散らばりが小さい)と言えるか、\(\boxed{\text{チ}}\)に\(A\)・\(B\)の記号で答えよ。

スセ ソタ チ
解説を見る
Bクラスの平均:\(\dfrac{75+79+80+81+85}{5}=\dfrac{400}{5}=80\)点 偏差:\(-5,-1,0,1,5\) 2乗の和:\(25+1+0+1+25=52\) 分散:\(\dfrac{52}{5}=10.4\) Aクラス(ボーナス点追加前)の分散は\(24\)、Bクラスの分散は\(10.4\)。分散が小さいBクラスの方が、スコアのばらつきが小さく、成績がそろっている。 Bクラスの平均値 \(80\)点、分散 \(10.4\)。そろっているのはBクラス。

大問2 目標時間 8分/配点 20点

太郎さんは、文化祭の模擬店の準備として、5日間の気温\(x\)(℃)と、模擬店の来場者数\(y\)(人)を記録した。\(x=20,\ 22,\ 24,\ 26,\ 28\)、\(y=34,\ 37,\ 43,\ 40,\ 46\)であった(日の順は対応している)。先生「気温と来場者数に関係がありそうか、数値で確かめてみよう。」
(1)

\(\bar x=\boxed{\text{アイ}}\)℃、\(\bar y=\boxed{\text{ウエ}}\)人である。共分散は\(S_{xy}=\boxed{\text{オカ}}\)、相関係数は\(r=\boxed{\text{キ}}\)である。

アイ ウエ オカ キ
解説を見る
\(\bar x=\dfrac{20+22+24+26+28}{5}=\dfrac{120}{5}=24\)℃ \(\bar y=\dfrac{34+37+43+40+46}{5}=\dfrac{200}{5}=40\)人 \(x-\bar x\):\(-4,-2,0,2,4\) \(y-\bar y\):\(-6,-3,3,0,6\) 積:\(24,6,0,0,24\) 合計\(54\) \(S_{xy}=54\div5=10.8\) \(x\)の分散\(=(16+4+0+4+16)\div5=8\) \(y\)の分散\(=(36+9+9+0+36)\div5=18\) \(r=\dfrac{10.8}{\sqrt8\times\sqrt{18}}=\dfrac{10.8}{\sqrt{144}}=\dfrac{10.8}{12}\) \(\bar x=24\)℃、\(\bar y=40\)人、\(S_{xy}=10.8\)、\(r=0.9\)(気温が高い日ほど来場者数が多い、強い正の相関)
(2)

花子「相関係数が\(0.9\)ということは、かなり強い正の相関ですね。ここで、\(x\)の単位を℃からF(華氏)に変える(\(x'=1.8x+32\)という変換)と、\(r\)の値はどうなるでしょうか。」

相関係数の性質を用いて、単位を変換した後の相関係数は\(r'=\boxed{\text{ク}}\)であることを答えよ。

ク
解説を見る
相関係数には「単位を変えても\(r\)は変わらない」という性質がある(1. 学習の順路の3「相関係数・仮説検定の考え方」の要点整理で学んだ性質2)。 \(x'=1.8x+32\)は、\(x\)を\(1.8\)倍してから\(32\)を足す変換である。「\(1.8\)倍」の部分は偏差も\(1.8\)倍にするので、共分散は\(1.8\)倍、\(x\)の標準偏差も\(1.8\)倍になり、相関係数の式で\(1.8\)がちょうど約分されて消える。「\(+32\)」の部分は全データを平行移動させるだけなので、そもそも偏差そのものを変えない(平均も\(32\)だけ動くので、データ\(-\)平均の値は変わらない)。 したがって、℃をF(華氏)に変換しても、相関係数の値はまったく変わらない。 \(r'=0.9\)(変換前と同じ。単位を変える一次変換では、倍率の部分は約分されて消え、平行移動の部分は偏差そのものを変えないため)
(3)

先生「実は、このアンケートには\(6\)日目の記録もありました。ただしこの日は大雨で模擬店を早めに閉めてしまい、気温は\(30\)℃と高かったのに、来場者数はわずか\(10\)人でした。」

花子「(1)では\(r=0.9\)というかなり強い正の相関でしたよね。この\(6\)日目のデータ(\(x=30,\ y=10\))を加えても、同じように強い相関になるんでしょうか。」

\(6\)日分のデータ\(x=20,22,24,26,28,30\)、\(y=34,37,43,40,46,10\)について、新しい平均は\(\bar x=\boxed{\text{ケコ}}\)℃、\(\bar y=\boxed{\text{サシ}}\)人、共分散は\(S_{xy}=\boxed{\text{ス}}\)である(\(S_{xy}\)は符号もつけて入力せよ)。また、この\(6\)日分で相関係数を計算し直すと、符号は\(\boxed{\text{セ}}\)(正・負・なしのいずれか)になる。

ケコ サシ ス セ
解説を見る
新しい平均:\(\bar x=\dfrac{20+22+24+26+28+30}{6}=\dfrac{150}{6}=25\)℃、\(\bar y=\dfrac{34+37+43+40+46+10}{6}=\dfrac{210}{6}=35\)人 \(x-\bar x\):\(-5,-3,-1,1,3,5\) \(y-\bar y\):\(-1,2,8,5,11,-25\) 積:\(5,-6,-8,5,33,-125\) 合計\(5-6-8+5+33-125=-96\) \(S_{xy}=-96\div6=-16\) \(x\)の分散\(=(25+9+1+1+9+25)\div6=70\div6≒11.67\)、\(y\)の分散\(=(1+4+64+25+121+625)\div6=840\div6=140\)。どちらも正の値なので\(S_x,\ S_y\)は必ず正になり、相関係数\(r=\dfrac{S_{xy}}{S_x\times S_y}\)の符号は\(S_{xy}\)の符号と一致する。\(S_{xy}=-16<0\)なので、相関係数は負になる(実際に計算すると\(r=\dfrac{-16}{\sqrt{11.67}\times\sqrt{140}}≒-0.40\))。 (1)では\(5\)日間で\(r=0.9\)という強い正の相関があったのに、\(6\)日目のデータを\(1\)つ加えただけで\(r\)は負の値にまで変わってしまった。これは、この章の要点整理で学んだ相関係数の性質「外れ値がひとつ混ざるだけで大きく変わることがある」の実例である。\(6\)日目は気温が高いのに来場者数が極端に少ないという、それまでの5日間の傾向から大きく外れた点(外れ値)であり、この1点が相関係数全体を大きく動かしてしまった。 \(\bar x=25\)℃、\(\bar y=35\)人、\(S_{xy}=-16\)、相関係数の符号は負(\(r≒-0.40\))。外れ値が1つ混ざるだけで相関係数が大きく変わるという性質の実例。