Aufgabe 1 dieses Blatts hat gezeigt, wie man misst, ob zwei Größen gemeinsam steigen oder
fallen: mit Kovarianz und Korrelation. Hier kommt eine neue Frage dazu. Reicht ein
Zusammenhang, den man in wenigen Daten sieht, als Nachweis? Oder könnte er Zufall sein?
Die Daten: fünf Kartoffeln. Von jeder kennt man zwei Zahlen.
Das spezifische Gewicht x x x : wie viel ein Kubikzentimeter der Knolle wiegt, in
Milligramm je Kubikzentimeter (mg/cm³). Gemeint ist also die Dichte. 1.060 mg/cm³ sind 1,06
g/cm³; Wasser hat 1 g/cm³. Die Kartoffeln sind also etwas schwerer als Wasser.
Der Stärkegehalt y y y : welcher Anteil der Knolle aus Stärke besteht, in Prozent.
„Normalverteilung der Daten wird angenommen“ heißt: Man darf davon ausgehen, dass beide
Messgrößen normalverteilt sind. Das braucht der Test in (ii).
Gesucht sind:
(i) eine Zahl, die Stichprobenkorrelation ρ ^ \hat\rho ρ ^ (gelesen „rho Dach“), und ihre
Deutung: Welche Art von Zusammenhang, steigend oder fallend? Und wie stark ?
(ii) eine Testentscheidung zum Niveau 5 %: Lässt sich der Zusammenhang nachweisen?
Der Weg in sechs Etappen:
Die Daten als Punkte ansehen und ihren Schwerpunkt bestimmen (Schritte 1–2).
Von Hand die Kovarianz ausrechnen: Abweichungen, Produkte, Summe (Schritte 3–5).
Durch die Standardabweichungen teilen: die Korrelation ρ ^ \hat\rho ρ ^ . Mit R prüfen und nach der
Daumenregel deuten (Schritte 6–9).
(ii) Den Test aufstellen und die Teststatistik R R R von Hand ausrechnen, dabei die
Rundungsfalle (Schritte 10–15).
Mit kritischem Wert und p p p -Wert entscheiden, antworten und mit R prüfen (Schritte 16–20).
Einordnen: einseitig oder zweiseitig, Zusammenhang oder Ursache; als Ergänzung die Grenze
für ρ ^ \hat\rho ρ ^ (Schritte 21–23).
Merke: (i) beschreibt nur die fünf Kartoffeln. (ii) fragt, ob man daraus auf
alle Kartoffeln dieser Art schließen darf. Dafür braucht man einen Test.
Zur Musterlösung: Sie rechnet (i) nur mit R; hier steht die Rechnung zusätzlich von
Hand. Zwei Zahlen weichen ab, die Entscheidungen nicht. (1) Im Text steht
ρ ^ ≈ 0,9878 \hat\rho \approx
0{,}9878 ρ ^ ≈ 0 , 9878 , die R-Ausgabe direkt darüber zeigt 0,98675. Richtig ist
ρ ^ ≈ 0,9868 \hat\rho \approx
0{,}9868 ρ ^ ≈ 0 , 9868 ; in der 0,9878 steht an der dritten Nachkommastelle eine 7 statt einer 6, ein
Tippfehler (Schritt 7). (2) Für den Test in (ii) wird aus
ρ ^ \hat\rho ρ ^ eine Prüfzahl
R R R
berechnet, die Teststatistik. Die Musterlösung erhält
10,5542 10{,}5542 10 , 5542 , weil sie
ρ ^ \hat\rho ρ ^ vorher
auf
0,9868 0{,}9868 0 , 9868 rundet. Mit allen Stellen ergibt sich
10,5339 10{,}5339 10 , 5339 ; dasselbe liefert das
Statistikprogramm R (Ausgabe
t = 10.534). Mehr dazu in den Schritten
14 und 15.
( x i , y i ) (x_i,\ y_i) ( x i , y i ) = (Gewicht, Stärke) für
i = 1 , … , 5 i = 1, \dots, 5 i = 1 , … , 5 ;
n = 5 n = 5 n = 5
Zuerst bekommen die Zahlen Namen. i i i ist die Nummer der Kartoffel, von 1 bis 5. x i x_i x i ist
ihr spezifisches Gewicht, y i y_i y i ihr Stärkegehalt. Kartoffel 1 hat also x 1 = 1.060 x_1 = 1.060 x 1 = 1.060 und
y 1 = 9,6 y_1 = 9{,}6 y 1 = 9 , 6 . Der Punkt in 1.060 trennt die Tausender: Die Zahl heißt tausendsechzig.
Die beiden Zahlen einer Kartoffel gehören zusammen. Sie wurden an
derselben Knolle gemessen. Man schreibt sie deshalb als Paar ( x i , y i ) (x_i,\ y_i) ( x i , y i ) .
Solche Daten heißen verbundene Stichprobe . Die Paare darf man nicht
auseinanderreißen: Würde man die y y y -Werte umsortieren, gehörten sie zu anderen
Kartoffeln. Es gibt n = 5 n = 5 n = 5 Paare.
Ein Paar lässt sich als Punkt zeichnen: x i x_i x i nach rechts, y i y_i y i nach oben. Alle
Punkte zusammen heißen Streudiagramm (englisch scatter plot ). Im Bild ist
jeder Punkt eine Kartoffel, die Nummer steht daneben.
Was man sieht: Die Punkte steigen von links unten nach rechts oben, fast wie auf
einer Linie. Schwerere Knollen haben mehr Stärke. Man sagt: x x x und y y y sind
positiv assoziiert . Eine Zunahme von x x x geht mit einer Zunahme von y y y einher.
Wie stark dieser Zusammenhang ist, soll eine einzige Zahl messen. Die nächsten Schritte
bauen sie auf.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
Werden an jedem Objekt zwei Größen gemessen, bilden die Paare eine verbundene Stichprobe.
Im Streudiagramm ist jedes Paar ein Punkt; so sieht man einen Zusammenhang schon vor dem
Rechnen.
x ˉ = 1.070,8 \bar x = 1.070{,}8 x ˉ = 1.070 , 8 ,
y ˉ = 11,34 \bar y = 11{,}34 y ˉ = 11 , 34
Ob die Punkte gemeinsam steigen, misst man von einem Bezugspunkt aus: der Mitte der
Punktwolke. Das ist der Punkt aus den beiden Mittelwerten, ( x ˉ ∣ y ˉ ) (\bar x \mid \bar y) ( x ˉ ∣ y ˉ ) . Er
heißt Schwerpunkt . Wären die fünf Punkte gleich schwere Kugeln auf einem Brett,
wäre das Brett genau dort im Gleichgewicht.
Mittelwert der Gewichte (x ˉ \bar x x ˉ , gelesen „x quer“): alle fünf addieren, dann durch 5
teilen.
1.060 + 1.065 + 1.070 + 1.075 + 1.084 = 5.354 1.060 + 1.065 + 1.070 + 1.075 + 1.084 = 5.354 1.060 + 1.065 + 1.070 + 1.075 + 1.084 = 5.354 und 5.354 : 5 = 1.070,8 5.354 : 5 = \mathbf{1.070{,}8} 5.354 : 5 = 1.070 , 8
Mittelwert der Stärkegehalte (y ˉ \bar y y ˉ , „y quer“):
9,6 + 10,5 + 11,4 + 11,6 + 13,6 = 56,7 9{,}6 + 10{,}5 + 11{,}4 + 11{,}6 + 13{,}6 = 56{,}7 9 , 6 + 10 , 5 + 11 , 4 + 11 , 6 + 13 , 6 = 56 , 7 und 56,7 : 5 = 11,34 56{,}7 : 5 = \mathbf{11{,}34} 56 , 7 : 5 = 11 , 34
Die „mittlere Kartoffel“ hat also 1.070,8 mg/cm³ und 11,34 % Stärke. Im Bild ist der
Schwerpunkt der kleine gefüllte Punkt. Die gestrichelten Linien gehen durch ihn: senkrecht
bei x ˉ \bar x x ˉ , waagerecht bei y ˉ \bar y y ˉ .
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Der
Stichprobenmittelwert ist
x ˉ = 1 n ∑ i = 1 n x i \bar x = \frac{1}{n}\sum_{i=1}^{n} x_i x ˉ = n 1 ∑ i = 1 n x i , die Summe aller Werte
geteilt durch ihre Anzahl. Das Zeichen
Σ \Sigma Σ heißt „addiere für
i = 1 i = 1 i = 1 bis
n n n “.
x i − x ˉ x_i - \bar x x i − x ˉ und
y i − y ˉ y_i - \bar y y i − y ˉ ; Summe jeweils 0
Jetzt wird jede Kartoffel mit dem Schwerpunkt verglichen, getrennt für beide Größen:
x i − x ˉ x_i - \bar x x i − x ˉ : Wie weit liegt der Punkt rechts (plus) oder links (minus)
vom Schwerpunkt?
y i − y ˉ y_i - \bar y y i − y ˉ : Wie weit liegt er über (plus) oder unter (minus) dem
Schwerpunkt?
Kartoffel 1: 1.060 − 1.070,8 = − 10,8 1.060 - 1.070{,}8 = -10{,}8 1.060 − 1.070 , 8 = − 10 , 8 und 9,6 − 11,34 = − 1,74 9{,}6 - 11{,}34 = -1{,}74 9 , 6 − 11 , 34 = − 1 , 74 . Sie liegt
links und unten. Die Tabelle zeigt alle fünf.
Die gestrichelten Linien teilen das Bild in vier Felder. In welchem Feld ein Punkt liegt,
sagen die beiden Vorzeichen:
Kartoffel 1 und 2: beide Abweichungen minus, also links unten .
Kartoffel 4 und 5: beide plus, also rechts oben .
Kartoffel 3: x x x minus (− 0,8 -0{,}8 − 0 , 8 ), y y y plus (+ 0,06 +0{,}06 + 0 , 06 ), also knapp links oben .
Sie liegt fast genau auf dem Schwerpunkt.
Probe: Die Abweichungen ergeben zusammen 0, bei x x x wie bei y y y . Die Rechnung steht
unter der Tabelle. Stimmt die Probe, sind die Mittelwerte und die Abweichungen richtig.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Die Summe der
Abweichungen vom Mittelwert ist bei jeder Stichprobe 0. Allein taugt sie deshalb nicht als
Maß.
∑ ( x i − x ˉ ) ( y i − y ˉ ) = 54,54 \sum (x_i - \bar x)(y_i - \bar y) = 54{,}54 ∑ ( x i − x ˉ ) ( y i − y ˉ ) = 54 , 54
Wie misst man, ob die Punkte gemeinsam vom Schwerpunkt abweichen? Man multipliziert
für jede Kartoffel ihre beiden Abweichungen.
Das Bild dazu: Jeder Punkt spannt mit dem Schwerpunkt ein Rechteck auf. Seine
Seiten sind die beiden Abweichungen, seine Fläche ist ihr Produkt. Das Vorzeichen des
Produkts sagt, in welchem Feld der Punkt liegt:
links unten: minus mal minus = plus
rechts oben: plus mal plus = plus
links oben und rechts unten: einmal plus, einmal minus = minus
Punkte rechts oben und links unten sprechen für „steigen gemeinsam“. Sie liefern positive
Produkte, im Bild grün. Punkte links oben und rechts unten sprechen dagegen. Sie liefern
negative Produkte, im Bild rot.
Die fünf Produkte:
( − 10,8 ) ⋅ ( − 1,74 ) = + 18,792 (-10{,}8) \cdot (-1{,}74) = +18{,}792 ( − 10 , 8 ) ⋅ ( − 1 , 74 ) = + 18 , 792
( − 5,8 ) ⋅ ( − 0,84 ) = + 4,872 (-5{,}8) \cdot (-0{,}84) = +4{,}872 ( − 5 , 8 ) ⋅ ( − 0 , 84 ) = + 4 , 872
( − 0,8 ) ⋅ 0,06 = − 0,048 (-0{,}8) \cdot 0{,}06 = -0{,}048 ( − 0 , 8 ) ⋅ 0 , 06 = − 0 , 048
4,2 ⋅ 0,26 = + 1,092 4{,}2 \cdot 0{,}26 = +1{,}092 4 , 2 ⋅ 0 , 26 = + 1 , 092
13,2 ⋅ 2,26 = + 29,832 13{,}2 \cdot 2{,}26 = +29{,}832 13 , 2 ⋅ 2 , 26 = + 29 , 832
Zusammenzählen, Schritt für Schritt: 18,792 + 4,872 = 23,664 18{,}792 + 4{,}872 = 23{,}664 18 , 792 + 4 , 872 = 23 , 664 ; minus 0,048 0{,}048 0 , 048
ergibt 23,616 23{,}616 23 , 616 ; plus 1,092 1{,}092 1 , 092 ergibt 24,708 24{,}708 24 , 708 ; plus 29,832 29{,}832 29 , 832 ergibt
54,54 \mathbf{54{,}54} 54 , 54 .
Das einzige negative Produkt, − 0,048 -0{,}048 − 0 , 048 von Kartoffel 3, ist winzig. Im Bild ist es das
kleine rote Rechteck direkt am Schwerpunkt. Fast die ganze Summe kommt von positiven
Rechtecken, am meisten von Kartoffel 5 (29,832). Die Punkte steigen also deutlich
gemeinsam.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Die
Summe der Rechtecke
∑ ( x i − x ˉ ) ( y i − y ˉ ) \sum (x_i - \bar x)(y_i - \bar y) ∑ ( x i − x ˉ ) ( y i − y ˉ ) misst die gemeinsame Streuung der
Paare um den Schwerpunkt. Überwiegen die Rechtecke rechts oben und links unten, ist sie
positiv.
s X Y = 54,54 4 = 13,635 s_{XY} = \dfrac{54{,}54}{4} = 13{,}635 s X Y = 4 54 , 54 = 13 , 635
Die Summe 54,54 wird noch durch n − 1 = 4 n - 1 = 4 n − 1 = 4 geteilt, wie bei der Varianz. Das Ergebnis
heißt Stichprobenkovarianz s X Y s_{XY} s X Y . Das kleine X Y XY X Y sagt: Sie gehört zu beiden
Größen gemeinsam.
s X Y = 54,54 5 − 1 = 54,54 4 = 13,635 s_{XY} = \dfrac{54{,}54}{5 - 1} = \dfrac{54{,}54}{4} = \mathbf{13{,}635} s X Y = 5 − 1 54 , 54 = 4 54 , 54 = 13 , 635
Warum n − 1 n - 1 n − 1 ? Aus demselben Grund wie bei der Stichprobenvarianz: Die Abweichungen
werden vom geschätzten Schwerpunkt aus gemessen, nicht vom unbekannten wahren. Mit
n − 1 n - 1 n − 1 liegt s X Y s_{XY} s X Y im Mittel richtig.
s X Y s_{XY} s X Y schätzt die Kovarianz der beiden Zufallsvariablen X X X (Gewicht) und Y Y Y
(Stärke). Im Skript steht dafür c o v ( X , Y ) = E ( [ X − E ( X ) ] [ Y − E ( Y ) ] ) \mathrm{cov}(X, Y) = E\bigl([X - E(X)]\,[Y -
E(Y)]\bigr) cov ( X , Y ) = E ( [ X − E ( X )] [ Y − E ( Y )] ) : der Erwartungswert des Produkts der Abweichungen.
Das Vorzeichen sagt die Richtung. 13,635 13{,}635 13 , 635 ist positiv, also steigen Gewicht und
Stärke gemeinsam.
Die Größe sagt dagegen wenig. Die Einheit ist „mg/cm³ mal Prozent“. Misst man das
Gewicht in g/cm³ statt mg/cm³, wird jede x x x -Abweichung 1.000-mal kleiner. Dann wäre
s X Y = 0,013635 s_{XY} = 0{,}013635 s X Y = 0 , 013635 , obwohl sich an den Kartoffeln nichts geändert hat. Ob 13,635 „viel“
ist, lässt sich also nicht sagen. Deshalb teilt man im nächsten Schritt durch die Streuung
jeder einzelnen Größe.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
s X Y = 1 n − 1 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) s_{XY} = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar x)(y_i - \bar y) s X Y = n − 1 1 ∑ i = 1 n ( x i − x ˉ ) ( y i − y ˉ ) . Positiv heißt
gleichgerichtet, negativ gegenläufig. Der Wert hängt von den Einheiten ab.
s X = 85,7 ≈ 9,257429 s_X = \sqrt{85{,}7} \approx 9{,}257429 s X = 85 , 7 ≈ 9 , 257429 ,
s Y = 2,228 ≈ 1,492649 s_Y = \sqrt{2{,}228} \approx
1{,}492649 s Y = 2 , 228 ≈ 1 , 492649
Um die Kovarianz vergleichbar zu machen, teilt man sie durch die Streuung jeder Messreihe
für sich. Diese Streuung misst die Standardabweichung . Sie wird ähnlich gebaut wie
die Kovarianz. Nur multipliziert man jede Abweichung mit sich selbst statt mit der
Abweichung der anderen Größe:
Gewichte: Quadrate 116,64 116{,}64 116 , 64 ; 33,64 33{,}64 33 , 64 ; 0,64 0{,}64 0 , 64 ; 17,64 17{,}64 17 , 64 ; 174,24 174{,}24 174 , 24 . Summe
342,8 342{,}8 342 , 8 .
Stärke: Quadrate 3,0276 3{,}0276 3 , 0276 ; 0,7056 0{,}7056 0 , 7056 ; 0,0036 0{,}0036 0 , 0036 ; 0,0676 0{,}0676 0 , 0676 ; 5,1076 5{,}1076 5 , 1076 . Summe
8,912 8{,}912 8 , 912 .
Zum Beispiel ( − 10,8 ) 2 = ( − 10,8 ) ⋅ ( − 10,8 ) = 116,64 (-10{,}8)^2 = (-10{,}8) \cdot (-10{,}8) = 116{,}64 ( − 10 , 8 ) 2 = ( − 10 , 8 ) ⋅ ( − 10 , 8 ) = 116 , 64 . Minus mal minus ist
plus, deshalb sind alle Quadrate positiv.
Durch n − 1 = 4 n - 1 = 4 n − 1 = 4 geteilt, ergeben sich die Stichprobenvarianzen :
s X 2 = 342,8 : 4 = 85,7 s_X^2 = 342{,}8 : 4 = 85{,}7 s X 2 = 342 , 8 : 4 = 85 , 7 und s Y 2 = 8,912 : 4 = 2,228 s_Y^2 = 8{,}912 : 4 = 2{,}228 s Y 2 = 8 , 912 : 4 = 2 , 228
Die Wurzeln daraus sind die Standardabweichungen:
s X = 85,7 ≈ 9,257429 s_X = \sqrt{85{,}7} \approx 9{,}257429 s X = 85 , 7 ≈ 9 , 257429 (in mg/cm³) und s Y = 2,228 ≈ 1,492649 s_Y = \sqrt{2{,}228} \approx
1{,}492649 s Y = 2 , 228 ≈ 1 , 492649 (in %)
Die Gewichte streuen also typischerweise um rund 9,3 mg/cm³ um ihren Mittelwert, die
Stärkegehalte um rund 1,5 Prozentpunkte.
Gerundet wird auf sechs Nachkommastellen, weil mit beiden Zahlen weitergerechnet wird.
Nebenbei: Die Varianz ist die Kovarianz einer Größe mit sich selbst. Das Skript schreibt
c o v ( X , X ) = v a r ( X ) \mathrm{cov}(X, X) = \mathrm{var}(X) cov ( X , X ) = var ( X ) .
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): s 2 = 1 n − 1 ∑ i = 1 n ( x i − x ˉ ) 2 s^2 =
\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar x)^2 s 2 = n − 1 1 ∑ i = 1 n ( x i − x ˉ ) 2 und
s = s 2 s = \sqrt{s^2} s = s 2 . Die Standardabweichung
hat wieder die Einheit der Daten.
ρ ^ = 13,635 9,257429 ⋅ 1,492649 ≈ 0,98675 ≈ 0,9868 \hat\rho = \dfrac{13{,}635}{9{,}257429 \cdot 1{,}492649} \approx 0{,}98675 \approx
0{,}9868 ρ ^ = 9 , 257429 ⋅ 1 , 492649 13 , 635 ≈ 0 , 98675 ≈ 0 , 9868
Jetzt wird die Kovarianz durch beide Standardabweichungen geteilt. Das Ergebnis ist die
Stichprobenkorrelation ρ ^ \hat\rho ρ ^ . ρ \rho ρ ist der griechische Buchstabe „rho“. Das
Dach zeigt: ein Schätzwert aus der Stichprobe.
ρ ^ = s X Y s X ⋅ s Y \hat\rho = \dfrac{s_{XY}}{s_X \cdot s_Y} ρ ^ = s X ⋅ s Y s X Y
Nenner: 9,257429 ⋅ 1,492649 ≈ 13,81809 9{,}257429 \cdot 1{,}492649 \approx 13{,}81809 9 , 257429 ⋅ 1 , 492649 ≈ 13 , 81809 . Dann:
ρ ^ = 13,635 13,81809 ≈ 0,98675 \hat\rho = \dfrac{13{,}635}{13{,}81809} \approx 0{,}98675 ρ ^ = 13 , 81809 13 , 635 ≈ 0 , 98675
Warum dieses Teilen hilft: Oben steht die Einheit „mg/cm³ mal %“, unten auch (s X s_X s X
in mg/cm³ mal s Y s_Y s Y in %). Die Einheiten kürzen sich weg. ρ ^ \hat\rho ρ ^ ist eine reine Zahl.
Ob man in mg/cm³ oder g/cm³ misst, ist jetzt egal. Außerdem liegt ρ ^ \hat\rho ρ ^ immer
zwischen − 1 -1 − 1 und 1 1 1 :
ρ ^ = 1 \hat\rho = 1 ρ ^ = 1 : Alle Punkte liegen genau auf einer steigenden Geraden.
ρ ^ = − 1 \hat\rho = -1 ρ ^ = − 1 : Alle liegen genau auf einer fallenden Geraden.
ρ ^ \hat\rho ρ ^ nahe 0: kein linearer Zusammenhang erkennbar.
0,98675 liegt sehr nahe an 1. Die fünf Punkte liegen also fast auf einer steigenden
Geraden. Das passt zum Bild.
Probe auf einem zweiten Weg: In s X Y s_{XY} s X Y , s X 2 s_X^2 s X 2 und s Y 2 s_Y^2 s Y 2 steckt jeweils der
Faktor 1 4 \frac{1}{4} 4 1 . Unten steht er zweimal unter einer Wurzel: 1 4 ⋅ 1 4 = 1 4 \sqrt{\tfrac14} \cdot
\sqrt{\tfrac14} = \tfrac14 4 1 ⋅ 4 1 = 4 1 . Oben und unten steht also 1 4 \frac14 4 1 , und er kürzt sich weg.
Übrig bleiben die Summen aus Schritt 4 und 6: 54,54 : 342,8 ⋅ 8,912 = 54,54 : 55,27236 ≈ 0,98675 54{,}54 : \sqrt{342{,}8 \cdot 8{,}912} =
54{,}54 : 55{,}27236 \approx 0{,}98675 54 , 54 : 342 , 8 ⋅ 8 , 912 = 54 , 54 : 55 , 27236 ≈ 0 , 98675 . Dasselbe Ergebnis.
Rundung: Für die Antwort reicht ρ ^ ≈ 0,9868 \hat\rho \approx 0{,}9868 ρ ^ ≈ 0 , 9868 (vier Stellen). In (ii)
wird mit 0,98675 0{,}98675 0 , 98675 weitergerechnet. Warum das wichtig ist, zeigt Schritt 15.
Zur Musterlösung: Dort steht im Text ρ ^ ≈ 0,9878 \hat\rho \approx 0{,}9878 ρ ^ ≈ 0 , 9878 . Die R-Ausgabe
direkt darüber zeigt aber 0,98675 0{,}98675 0 , 98675 , gerundet 0,9868 0{,}9868 0 , 9868 . In der 0,9878 steht an der
dritten Nachkommastelle eine 7 statt einer 6: ein Tippfehler. An der Deutung ändert er
nichts.
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“):
ρ ^ = s X Y s X s Y \hat\rho = \frac{s_{XY}}{s_X s_Y} ρ ^ = s X s Y s X Y schätzt die Korrelation
ρ = c o v ( X , Y ) v a r ( X ) v a r ( Y ) \rho =
\frac{\mathrm{cov}(X,Y)}{\sqrt{\mathrm{var}(X)}\sqrt{\mathrm{var}(Y)}} ρ = var ( X ) var ( Y ) cov ( X , Y ) . Es gilt immer
− 1 ≤ ρ ^ ≤ 1 -1
\le \hat\rho \le 1 − 1 ≤ ρ ^ ≤ 1 .
cor(x, y) = 0,98675 = 0{,}98675 = 0 , 98675 ✓
R rechnet dieselben Zahlen mit je einem Befehl. Das prüft die Rechnung von Hand; es
ersetzt sie nicht.
c(…) fasst Zahlen zu einer Reihe zusammen,
<- gibt ihr einen Namen. R schreibt einen Dezimalpunkt
statt eines Kommas und keinen Tausenderpunkt: 1.060 wird 1060,
9,6 wird 9.6.
mean: Mittelwert (Schritt 2). Das Semikolon trennt zwei
Befehle in einer Zeile.
cov(x, y): Stichprobenkovarianz s X Y s_{XY} s X Y mit n − 1 n - 1 n − 1 im Nenner
(Schritt 5).
sd: Standardabweichung, englisch
standard deviation (Schritt 6).
cor(x, y): Stichprobenkorrelation ρ ^ \hat\rho ρ ^ , englisch
correlation (Schritt 7).
Alle Werte stimmen mit der Rechnung von Hand überein. R zeigt 0,98675. Genauer ist es
0,98675000 … 0{,}98675000\ldots 0 , 98675000 … ; die fünf Stellen reichen also zum Weiterrechnen.
Übrigens ist ρ ^ \hat\rho ρ ^ symmetrisch : cor(y, x) gibt
dasselbe. Welche Größe man x x x und welche y y y nennt, ist für die Korrelation egal.
Aus Blatt 5, Aufgabe 3 („Stichprobenvarianz: die Länge der Fische“): Mit
x <- c(…) werden Daten in R eingegeben;
mean(x) und sd(x) geben Mittelwert und
Standardabweichung.
ρ ^ > 0 \hat\rho > 0 ρ ^ > 0 : positiv;
∣ ρ ^ ∣ ≈ 0,9868 > 0,7 |\hat\rho| \approx 0{,}9868 > 0{,}7 ∣ ρ ^ ∣ ≈ 0 , 9868 > 0 , 7 : stark
(i) fragt nach Art und Stärke des Zusammenhangs.
Art ist die Richtung. Man liest sie am Vorzeichen ab. ρ ^ ≈ 0,9868 \hat\rho \approx 0{,}9868 ρ ^ ≈ 0 , 9868
ist positiv: Mit dem Gewicht steigt tendenziell auch die Stärke. Das heißt
positiver oder gleichgerichteter Zusammenhang. Bei negativem ρ ^ \hat\rho ρ ^ wäre er
gegenläufig.
Stärke hängt nur vom Abstand zu 0 ab, nicht vom Vorzeichen. Diesen Abstand nennt
man Betrag und schreibt ihn mit senkrechten Strichen: ∣ ρ ^ ∣ |\hat\rho| ∣ ρ ^ ∣ . Zum Beispiel
ist ∣ − 0,8 ∣ = 0,8 |-0{,}8| = 0{,}8 ∣ − 0 , 8∣ = 0 , 8 und ∣ 0,8 ∣ = 0,8 |0{,}8| = 0{,}8 ∣0 , 8∣ = 0 , 8 . Hier ist ∣ ρ ^ ∣ = 0,9868 |\hat\rho| = 0{,}9868 ∣ ρ ^ ∣ = 0 , 9868 .
Die Daumenregel aus dem Skript (Tabelle rechts) sagt:
schwache Korrelation, wenn 0,5 < ∣ ρ ^ ∣ ≤ 0,7 0{,}5 < |\hat\rho| \le 0{,}7 0 , 5 < ∣ ρ ^ ∣ ≤ 0 , 7
starke Korrelation, wenn ∣ ρ ^ ∣ > 0,7 |\hat\rho| > 0{,}7 ∣ ρ ^ ∣ > 0 , 7
Für ∣ ρ ^ ∣ ≤ 0,5 |\hat\rho| \le 0{,}5 ∣ ρ ^ ∣ ≤ 0 , 5 nennt das Skript keine Stufe; dort ist kaum ein linearer
Zusammenhang zu sehen.
0,9868 > 0,7 0{,}9868 > 0{,}7 0 , 9868 > 0 , 7 , also stark .
Antwort zu (i): Zwischen spezifischem Gewicht und Stärkegehalt besteht ein
starker positiver linearer Zusammenhang. „Linear“ heißt: Die Punkte streuen um eine
Gerade . Nur diese Art Zusammenhang misst die Korrelation.
Das ist auch die Antwort der Musterlösung.
Merke: Die Daumenregel beschreibt nur die Stichprobe. Ob der Zusammenhang über die
fünf Kartoffeln hinaus gilt, sagt sie nicht. Das prüft (ii).
Aus Aufgabe 1 dieses Blatts („Kovarianz und Korrelation: Werbung und Umsatz“): Art
= Vorzeichen, Stärke = Betrag nach der Daumenregel. Dort war
ρ ^ ≈ 0,8552 \hat\rho \approx 0{,}8552 ρ ^ ≈ 0 , 8552 ,
also ebenfalls stark positiv.
ρ ^ ≈ 0,9868 \hat\rho \approx 0{,}9868 ρ ^ ≈ 0 , 9868 bekannt,
ρ \rho ρ unbekannt: gilt
ρ ≠ 0 \rho \ne 0 ρ = 0 ?
(i) hat gezeigt: In den fünf Kartoffeln steigen Gewicht und Stärke gemeinsam. (ii) fragt
mehr: Gilt das allgemein , für alle Kartoffeln dieser Art?
Deren Korrelation heißt ρ \rho ρ , ohne Dach. Das ist die wahre Korrelation der
Zufallsvariablen X X X (Gewicht) und Y Y Y (Stärke). Niemand kennt sie. ρ ^ \hat\rho ρ ^ ist nur ein
Schätzwert dafür, berechnet aus fünf Knollen. Mit fünf anderen Knollen käme ein
anderes ρ ^ \hat\rho ρ ^ heraus.
Das Problem: Fünf Punkte können auch rein zufällig ungefähr auf einer Linie liegen.
Wie oft das passiert, zeigt eine Simulation in R (rechts):
rnorm(5) zieht fünf zufällige normalverteilte Zahlen. Zweimal
aufgerufen, entstehen fünf x x x - und fünf y y y -Werte, die nichts miteinander zu tun
haben. Hier gilt also ρ = 0 \rho = 0 ρ = 0 .
cor(…) rechnet dafür ρ ^ \hat\rho ρ ^ aus.
replicate(100000, …) wiederholt das 100.000-mal.
mean(abs(r) > 0.7) ist der Anteil der Fälle mit ∣ ρ ^ ∣ > 0,7 |\hat\rho|
> 0{,}7 ∣ ρ ^ ∣ > 0 , 7 ; abs ist der Betrag.
set.seed(1) legt den Startwert des Zufalls fest. So kommt beim
Nachrechnen dieselbe Zahl heraus.
Ergebnis: In rund 19 % der Fälle ist ∣ ρ ^ ∣ > 0,7 |\hat\rho| > 0{,}7 ∣ ρ ^ ∣ > 0 , 7 , also nach der
Daumenregel „stark“. Und das, obwohl es gar keinen Zusammenhang gibt. Im Bild sind das die
roten Randzonen der Achse. Bei nur fünf Punkten beweist ein „starkes“ ρ ^ \hat\rho ρ ^ also noch
nichts.
Deshalb braucht (ii) einen Test . Er entscheidet so, dass ein bestimmter Irrtum
selten bleibt: einen Zusammenhang zu behaupten, den es nicht gibt.
Die Simulation dient nur der Anschauung; für die Lösung ist sie nicht nötig. Mit einem
anderen Startwert kommt eine leicht andere Zahl heraus, immer rund 19 %.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Ein Test
beantwortet die Frage: Könnten die Daten auch dann so aussehen, wenn es den vermuteten
Effekt gar nicht gibt? Nur wenn das sehr unwahrscheinlich ist, gilt der Effekt als
nachgewiesen.
Korrelationstest nach Pearson; Voraussetzung: normalverteilt (laut Aufgabe)
Für die Frage „Ist die wahre Korrelation ρ \rho ρ zweier gemessener Größen von 0
verschieden?“ gibt es den Korrelationstest nach Pearson . Karl Pearson hat die
Stichprobenkorrelation in dieser Form eingeführt; ρ ^ \hat\rho ρ ^ heißt deshalb auch
Pearson-Korrelation.
Warum nicht der χ²-Unabhängigkeitstest? Der ist für Merkmale mit Kategorien, etwa
„ledig“ oder „verheiratet“. Hier liegen Messzahlen vor, und gefragt ist nach einem
linearen Zusammenhang. Dafür ist der Korrelationstest gemacht.
Voraussetzung (Skript): Beide Messreihen sind u.i.v. normalverteilt .
„u.i.v.“ heißt unabhängig und identisch verteilt :
unabhängig: Die fünf Kartoffeln beeinflussen einander nicht.
identisch verteilt: Alle x x x -Werte stammen aus derselben Normalverteilung N ( μ X , σ X 2 ) N(\mu_X,
\sigma_X^2) N ( μ X , σ X 2 ) , alle y y y -Werte aus N ( μ Y , σ Y 2 ) N(\mu_Y, \sigma_Y^2) N ( μ Y , σ Y 2 ) . Dabei ist μ \mu μ der
Erwartungswert und σ 2 \sigma^2 σ 2 die Varianz.
Unabhängig sein müssen die Kartoffeln untereinander. Ob x x x und y y y derselben
Kartoffel zusammenhängen, ist ja gerade die Frage.
Hier: Die Aufgabe sagt „Normalverteilung der Daten wird angenommen“. Die
Voraussetzung gilt also als erfüllt. Wer sie trotzdem prüfen will, nimmt den
Shapiro-Wilk-Test (rechts, nur zur Kontrolle). Beide p p p -Werte, 0,9542 und 0,8037, liegen
weit über 5 %: Nichts spricht gegen die Normalverteilung. Bei nur fünf Werten ist dieser
Test aber schwach. Bewiesen ist die Normalverteilung damit nicht.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Ein Test
hat eine
Nullhypothese H 0 H_0 H 0 , die Behauptung, die er zu widerlegen versucht. Er
liefert einen
p p p -Wert: Je kleiner er ist, desto schlechter passen die Daten zu
H 0 H_0 H 0 ; unter 5 % wird
H 0 H_0 H 0 verworfen. Der Shapiro-Wilk-Test (dort Schritt 16) prüft
H 0 H_0 H 0 : „normalverteilt“. Ist sein
p p p -Wert größer als 5 %, wird die Normalverteilung nicht
verworfen. Für den Korrelationstest kommen
H 0 H_0 H 0 und
p p p -Wert in den Schritten 12 und 18
ausführlich.
Aus Blatt 7, Aufgabe 6 („Chi-Quadrat-Unabhängigkeitstest: Trinkgewohnheit und
Familienstand“):
Der χ²-Unabhängigkeitstest prüft an einer Tabelle von Anzahlen, ob zwei Merkmale mit
Kategorien zusammenhängen.
H 0 : ρ = 0 H_0:\ \rho = 0 H 0 : ρ = 0 gegen
H A : ρ ≠ 0 H_A:\ \rho \ne 0 H A : ρ = 0 ,
α = 0,05 \alpha = 0{,}05 α = 0 , 05
Ein Test stellt zwei Hypothesen gegeneinander, also zwei Behauptungen. Die
Vermutung, die man zeigen will, kommt in die Alternative H A H_A H A . Ihr Gegenteil ist
die Nullhypothese H 0 H_0 H 0 .
„Der Zusammenhang ist nachweisbar“ heißt: Die wahre Korrelation ist nicht 0. Also:
H 0 : ρ = 0 H_0:\ \rho = 0 H 0 : ρ = 0 (kein linearer Zusammenhang) gegen H A : ρ ≠ 0 H_A:\ \rho \ne 0 H A : ρ = 0 (ein linearer
Zusammenhang)
Zweiseitig: H A H_A H A lässt die Richtung offen. Ein ρ ^ \hat\rho ρ ^ weit über 0 spricht
gegen H 0 H_0 H 0 , eines weit unter 0 genauso. Im Bild ist H 0 H_0 H 0 der eine Punkt 0 auf der Achse,
H A H_A H A alles links und rechts davon.
Warum nicht gleich „ρ > 0 \rho > 0 ρ > 0 “? Die Aufgabe fragt nur, ob „der Zusammenhang“
nachweisbar ist, ohne Richtung. Dass er positiv ist, weiß man bisher nur aus ρ ^ \hat\rho ρ ^ ,
also aus denselben Daten, mit denen getestet wird. Die Richtung daraus abzulesen, ist
nicht erlaubt; warum, zeigt Schritt 21. Die Musterlösung testet ebenfalls zweiseitig.
Signifikanzniveau: α = 5 % = 0,05 \alpha = 5\,\% = 0{,}05 α = 5 % = 0 , 05 . Es begrenzt den Fehler 1. Art :
H 0 H_0 H 0 zu verwerfen, obwohl H 0 H_0 H 0 stimmt. Hier hieße das: einen Zusammenhang zwischen
Gewicht und Stärke behaupten, obwohl es keinen gibt. Das darf höchstens mit
Wahrscheinlichkeit 5 % passieren.
Nebenbei (Skript): Sind X X X und Y Y Y gemeinsam normalverteilt, dann heißt ρ = 0 \rho = 0 ρ = 0
sogar: X X X und Y Y Y sind unabhängig. Der Test prüft dann auf Unabhängigkeit.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Die
Vermutung gehört in
H A H_A H A , weil nur das Verwerfen von
H 0 H_0 H 0 abgesichert ist: Stimmt
H 0 H_0 H 0 ,
verwirft der Test sie höchstens mit Wahrscheinlichkeit
α \alpha α .
α \alpha α wird vor dem
Test festgelegt.
Aus Blatt 6, Aufgabe 6 („Einseitig oder zweiseitig: die Dicke der Marmorplatten“):
Zweiseitig heißt: Werte weit links und weit rechts sprechen gegen
H 0 H_0 H 0 . Jeder Rand
bekommt dann die Hälfte von
α \alpha α .
R = n − 2 ⋅ ρ ^ 1 − ρ ^ 2 R = \sqrt{n-2} \cdot \dfrac{\hat\rho}{\sqrt{1 - \hat\rho^2}} R = n − 2 ⋅ 1 − ρ ^ 2 ρ ^ , hier
3 ⋅ ρ ^ 1 − ρ ^ 2 \sqrt 3 \cdot
\dfrac{\hat\rho}{\sqrt{1 - \hat\rho^2}} 3 ⋅ 1 − ρ ^ 2 ρ ^
Jetzt wird ρ ^ \hat\rho ρ ^ in eine Teststatistik umgerechnet: eine einzige Zahl, an der
entschieden wird. Das Skript nennt sie R R R :
R = n − 2 ⋅ ρ ^ 1 − ρ ^ 2 R = \sqrt{n-2} \cdot \dfrac{\hat\rho}{\sqrt{1 - \hat\rho^2}} R = n − 2 ⋅ 1 − ρ ^ 2 ρ ^
Achtung, Verwechslungsgefahr: Die Teststatistik R R R hat nichts mit dem Programm R
zu tun. In Formeln steht R R R (kursiv) immer für die Teststatistik.
Wie die Formel gebaut ist:
ρ ^ \hat\rho ρ ^ im Zähler : Je weiter ρ ^ \hat\rho ρ ^ von 0 weg ist, desto größer ist ∣ R ∣ |R| ∣ R ∣ .
R R R hat dasselbe Vorzeichen wie ρ ^ \hat\rho ρ ^ . Bei ρ ^ = 0 \hat\rho = 0 ρ ^ = 0 ist R = 0 R = 0 R = 0 .
1 − ρ ^ 2 \sqrt{1 - \hat\rho^2} 1 − ρ ^ 2 im Nenner : Liegen die Punkte eng an einer Geraden, ist
ρ ^ 2 \hat\rho^2 ρ ^ 2 fast 1 und 1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 fast 0. Man teilt dann durch eine sehr kleine
Zahl, und R R R wird sehr groß. Ausblick: 1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 ist der Anteil der Streuung der
y y y -Werte, der um die passende Gerade übrig bleibt; das kommt in Aufgabe 3 dieses
Blatts.
n − 2 \sqrt{n - 2} n − 2 vorne: Mehr Paare bringen mehr Gewicht. Dasselbe ρ ^ \hat\rho ρ ^ ist bei 50
Kartoffeln viel schwerer durch Zufall zu erklären als bei 5. Warum n − 2 n - 2 n − 2 und nicht
n n n , erklärt Schritt 16.
Man kann R R R auch so lesen: R = ρ ^ : 1 − ρ ^ 2 n − 2 R = \hat\rho : \sqrt{\frac{1 - \hat\rho^2}{n - 2}} R = ρ ^ : n − 2 1 − ρ ^ 2 . Der
Nenner ist der geschätzte Standardfehler von ρ ^ \hat\rho ρ ^ , also wie stark ρ ^ \hat\rho ρ ^
von Stichprobe zu Stichprobe schwankt. R R R misst damit, wie viele Standardfehler
ρ ^ \hat\rho ρ ^ von 0 entfernt ist.
Mit n = 5 n = 5 n = 5 steht vorne 5 − 2 = 3 \sqrt{5 - 2} = \sqrt 3 5 − 2 = 3 . Das Bild zeigt R R R für alle ρ ^ \hat\rho ρ ^
zwischen − 1 -1 − 1 und 1 1 1 . In der Mitte steigt die Kurve langsam, nahe ± 1 \pm 1 ± 1 fast senkrecht.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Dort war
t ^ = n ⋅ d ˉ − μ 0 s D \hat t = \sqrt n \cdot \frac{\bar d - \mu_0}{s_D} t ^ = n ⋅ s D d ˉ − μ 0 : der Abstand vom Wert unter
H 0 H_0 H 0 ,
gemessen in Standardfehlern.
R R R folgt derselben Idee.
R = 1,732051 ⋅ 0,98675 0,0263244 = 1,709101 0,162248 ≈ 10,5339 R = \dfrac{1{,}732051 \cdot 0{,}98675}{\sqrt{0{,}0263244}} =
\dfrac{1{,}709101}{0{,}162248} \approx 10{,}5339 R = 0 , 0263244 1 , 732051 ⋅ 0 , 98675 = 0 , 162248 1 , 709101 ≈ 10 , 5339
Jetzt werden die Zahlen eingesetzt, Zeile für Zeile. Eingesetzt wird ρ ^ = 0,98675 \hat\rho =
0{,}98675 ρ ^ = 0 , 98675 aus Schritt 7, nicht das gerundete 0,9868. Warum, zeigt Schritt 15.
Quadrieren: 0,98675 ⋅ 0,98675 = 0,9736755625 ≈ 0,9736756 0{,}98675 \cdot 0{,}98675 = 0{,}9736755625 \approx 0{,}9736756 0 , 98675 ⋅ 0 , 98675 = 0 , 9736755625 ≈ 0 , 9736756 .
Von 1 abziehen: 1 − 0,9736756 = 0,0263244 1 - 0{,}9736756 = 0{,}0263244 1 − 0 , 9736756 = 0 , 0263244 . Eine kleine Zahl, weil ρ ^ \hat\rho ρ ^ nahe
an 1 liegt.
Wurzel ziehen: 0,0263244 ≈ 0,162248 \sqrt{0{,}0263244} \approx 0{,}162248 0 , 0263244 ≈ 0 , 162248 . Das ist der Nenner.
Zähler: 3 = 1,7320508 … ≈ 1,732051 \sqrt 3 = 1{,}7320508\ldots \approx 1{,}732051 3 = 1 , 7320508 … ≈ 1 , 732051 , mal 0,98675 0{,}98675 0 , 98675 ergibt
1,709101 1{,}709101 1 , 709101 .
Teilen: 1,709101 : 0,162248 ≈ 10,5339 1{,}709101 : 0{,}162248 \approx \mathbf{10{,}5339} 1 , 709101 : 0 , 162248 ≈ 10 , 5339 .
Zwischenwerte werden mit sechs bis sieben Stellen mitgeführt; gerundet wird erst das
Ergebnis.
Was sagt die Zahl? Im Bild ist R R R der Punkt oben rechts auf der Kurve. ρ ^ \hat\rho ρ ^
liegt rund zehneinhalb Standardfehler von 0 entfernt. Das wirkt groß. Ob es groß genug
ist, klärt ab Schritt 16 der Vergleich mit der t-Verteilung.
Zur Musterlösung: Dort steht R ≈ 10,5542 R \approx 10{,}5542 R ≈ 10 , 5542 . Das Programm R gibt mit
cor.test dagegen t = 10.534 aus
(Schritt 20), also unseren Wert. Woher der Unterschied kommt, zeigt der nächste Schritt.
ρ ^ \hat\rho ρ ^ :
+ 0,005 % +0{,}005\,\% + 0 , 005 % →
R R R :
+ 0,19 % +0{,}19\,\% + 0 , 19 % , fast 40-mal so viel
Die Musterlösung rundet ρ ^ \hat\rho ρ ^ zuerst auf 0,9868 0{,}9868 0 , 9868 und setzt dann ein:
R = 3 ⋅ 0,9868 1 − 0,9868 2 = 1,709188 0,0262258 R = \sqrt 3 \cdot \dfrac{0{,}9868}{\sqrt{1 - 0{,}9868^2}} =
\dfrac{1{,}709188}{\sqrt{0{,}0262258}} R = 3 ⋅ 1 − 0 , 986 8 2 0 , 9868 = 0 , 0262258 1 , 709188
R = 1,709188 0,161944 ≈ 10,5542 \phantom{R} = \dfrac{1{,}709188}{0{,}161944} \approx 10{,}5542 R = 0 , 161944 1 , 709188 ≈ 10 , 5542
Mit 0,98675 0{,}98675 0 , 98675 kam 10,5339 10{,}5339 10 , 5339 heraus. Die Rundung hat ρ ^ \hat\rho ρ ^ nur um 0,00005 0{,}00005 0 , 00005
verändert, R R R aber um 0,02 0{,}02 0 , 02 .
Warum reagiert R R R so stark? Im Nenner steht 1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 . Weil ρ ^ 2 \hat\rho^2 ρ ^ 2
fast 1 ist, ist diese Differenz winzig, nur 0,0263 0{,}0263 0 , 0263 . Eine winzige Änderung vorne ist im
Verhältnis zu einer winzigen Zahl groß:
ρ ^ \hat\rho ρ ^ steigt von 0,98675 auf 0,9868, das sind 0,005 %.
ρ ^ 2 \hat\rho^2 ρ ^ 2 steigt dadurch um rund 0,0000987. 1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 fällt von 0,0263244 auf
0,0262258, das sind 0,37 %.
Die Wurzel fällt um 0,19 %, und R R R steigt um 0,19 %.
Die kleine Änderung ist also fast 40-mal verstärkt worden. Die Lupe im Bild zeigt es: Ein
kaum sichtbarer Schritt nach rechts ist ein deutlicher Sprung nach oben.
Mit dem Tippfehler 0,9878 aus dem Text der Musterlösung käme sogar R ≈ 10,99 R \approx 10{,}99 R ≈ 10 , 99
heraus (letzte Zeile der Tabelle, im Bild der gestrichelte Kreis).
Für die Entscheidung ist das hier ohne Bedeutung: Alle drei Werte liegen weit über
der Grenze 3,18 aus Schritt 17. Liegen Daten aber knapp an der Grenze, kann zu frühes
Runden die Entscheidung kippen.
Merke: Erst am Ende runden. Zwischenwerte mit allen Stellen weiterverwenden, die
Taschenrechner oder R liefern. Besonders vorsichtig bei
ρ ^ \hat\rho ρ ^ nahe
± 1 \pm 1 ± 1 : Dort ist
1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 sehr klein und
R R R sehr empfindlich.
wenn
H 0 H_0 H 0 stimmt:
T T T t-verteilt mit
n − 2 = 3 n - 2 = 3 n − 2 = 3 Freiheitsgraden
Ist R ≈ 10,53 R \approx 10{,}53 R ≈ 10 , 53 groß genug? Dazu ein Gedankenexperiment: Es gibt in Wahrheit
keinen Zusammenhang, ρ = 0 \rho = 0 ρ = 0 . Man misst immer wieder fünf neue Kartoffeln und rechnet
jedes Mal R R R aus. Die Werte streuen um 0: mal positiv, mal negativ, selten weit weg.
Vor der Messung ist die Teststatistik also eine Zufallsvariable. Sie heißt T T T . R ≈ 10,5339 R \approx
10{,}5339 R ≈ 10 , 5339 ist der eine Wert, der hier beobachtet wurde.
Wie T T T verteilt ist, weiß man genau (Skript): Stimmt H 0 H_0 H 0 und sind die Daten
normalverteilt, dann ist T T T t-verteilt mit n − 2 n - 2 n − 2 Freiheitsgraden . Hier 5 − 2 = 3 5 - 2 =
3 5 − 2 = 3 . Warum genau diese Verteilung, folgt aus einer längeren Rechnung, die nicht zur
Vorlesung gehört.
Warum n − 2 n - 2 n − 2 und nicht n − 1 n - 1 n − 1 wie beim t-Test?
Anschaulich: Durch zwei Punkte geht immer genau eine Gerade. Bei n = 2 n = 2 n = 2 wäre ρ ^ \hat\rho ρ ^
immer + 1 +1 + 1 oder − 1 -1 − 1 , ganz gleich, ob ein Zusammenhang besteht. Zwei Punkte sagen über
die Korrelation also nichts. Erst ab dem dritten Punkt kann die Wolke von einer Geraden
abweichen. Von den fünf Punkten tragen deshalb nur 5 − 2 = 3 5 - 2 = 3 5 − 2 = 3 Information.
Ausblick: Dahinter steht eine allgemeine Regel. Jede Größe, die man aus den Daten
schätzen muss, kostet einen Freiheitsgrad. Beim t-Test für eine Stichprobe war das der
Mittelwert, daher n − 1 n - 1 n − 1 . Hinter der Korrelation steckt die Gerade durch die Punktwolke;
sie hat zwei Kennzahlen, Achsenabschnitt und Steigung. In Aufgabe 3 dieses Blatts wird
eine solche Gerade berechnet.
Das Bild zeigt die Dichte der t-Verteilung mit 3 Freiheitsgraden. Wahrscheinlichkeiten
sind Flächen darunter. Sie ist glockenförmig und symmetrisch um 0. Mit nur 3
Freiheitsgraden hat sie weit außen deutlich mehr Fläche als die Standardnormalverteilung
N ( 0 , 1 ) N(0, 1) N ( 0 , 1 ) (gestrichelt).
Achtung beim Bild: R ≈ 10,53 R \approx 10{,}53 R ≈ 10 , 53 liegt so weit rechts, dass die Achse
unterbrochen werden musste. Maßstäblich läge der Punkt mehr als doppelt so weit von der
Mitte entfernt wie der rechte Rand der Kurve bei 5.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Unter
H 0 H_0 H 0 ist die Teststatistik des t-Tests t-verteilt. Die Zahl der Freiheitsgrade legt fest,
welche t-Verteilung gemeint ist; dort waren es
n − 1 = 4 n - 1 = 4 n − 1 = 4 . Je weniger Freiheitsgrade,
desto mehr Fläche liegt weit außen.
Aus Blatt 4, Aufgabe 3 („Standardnormalverteilung mit R“): Die
Standardnormalverteilung
N ( 0 , 1 ) N(0, 1) N ( 0 , 1 ) ist die Normalverteilung mit Erwartungswert 0 und
Varianz 1.
t 3 ; 0,975 ≈ 3,1824 t_{3;\,0{,}975} \approx 3{,}1824 t 3 ; 0 , 975 ≈ 3 , 1824 ;
∣ R ∣ ≈ 10,5339 > 3,1824 |R| \approx 10{,}5339 > 3{,}1824 ∣ R ∣ ≈ 10 , 5339 > 3 , 1824
Welche Werte von R R R sind „zu extrem für Zufall“? Nach Schritt 12 sprechen
beide Richtungen gegen H 0 H_0 H 0 : ein R R R weit rechts und eines weit links. Deshalb
gibt es zwei Grenzen, eine auf jeder Seite. Jeder Rand bekommt die Hälfte von α \alpha α :
α 2 = 0,05 2 = 0,025 = 2,5 % \dfrac{\alpha}{2} = \dfrac{0{,}05}{2} = 0{,}025 = 2{,}5\,\% 2 α = 2 0 , 05 = 0 , 025 = 2 , 5 % links und 2,5 % 2{,}5\,\% 2 , 5 %
rechts.
Rechts der rechten Grenze liegen 2,5 %, links von ihr also 1 − 0,025 = 0,975 1 - 0{,}025 = 0{,}975 1 − 0 , 025 = 0 , 975 der
Fläche. Die Grenze ist deshalb das 0,975-Quantil der t-Verteilung mit 3
Freiheitsgraden, geschrieben t 3 ; 0,975 t_{3;\,0{,}975} t 3 ; 0 , 975 . Unten steht zuerst die Zahl der
Freiheitsgrade, dann die Fläche links der Grenze. Die linke Grenze ist wegen der Symmetrie
dieselbe Zahl mit Minus.
R rechnet sie mit qt(0.975, df = 3) aus: 3,182446 3{,}182446 3 , 182446 , auf vier
Stellen 3,1824 3{,}1824 3 , 1824 .
Der Ablehnbereich (im Bild rot) sind alle Werte mit ∣ R ∣ > 3,1824 |R| > 3{,}1824 ∣ R ∣ > 3 , 1824 , also R > 3,1824 R
> 3{,}1824 R > 3 , 1824 oder R < − 3,1824 R < -3{,}1824 R < − 3 , 1824 . Der Betrag fasst beide Seiten in einer Bedingung
zusammen. Das ist die Regel aus dem Skript für H A : ρ ≠ 0 H_A:\ \rho \ne 0 H A : ρ = 0 .
Vergleich: ∣ R ∣ ≈ 10,5339 |R| \approx 10{,}5339 ∣ R ∣ ≈ 10 , 5339 ist mehr als dreimal so groß wie 3,1824 3{,}1824 3 , 1824 . R R R
liegt weit im rechten Ablehnbereich.
Die roten Flächen laufen links und rechts über das Bild hinaus weiter: Jenseits von ± 5 \pm
5 ± 5 liegen zusammen noch rund 1,5 % der Fläche. Bei nur 3 Freiheitsgraden reicht die
Verteilung weit nach außen.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Der
kritische Wert ist ein Quantil der t-Verteilung, in R
qt(Fläche links, df = Freiheitsgrade). Liegt die Teststatistik
im Ablehnbereich, wird
H 0 H_0 H 0 verworfen.
Aus Blatt 6, Aufgabe 6 („Einseitig oder zweiseitig: die Dicke der Marmorplatten“):
Zweiseitig steht
1 − α / 2 1 - \alpha/2 1 − α /2 im Quantil, einseitig
1 − α 1 - \alpha 1 − α .
p = 2 ⋅ P ( T ≥ 10,5339 ) ≈ 0,0018 ≤ 0,05 p = 2 \cdot P(T \ge 10{,}5339) \approx 0{,}0018 \le 0{,}05 p = 2 ⋅ P ( T ≥ 10 , 5339 ) ≈ 0 , 0018 ≤ 0 , 05
Der zweite Weg zur Entscheidung ist der p p p -Wert : die Wahrscheinlichkeit, unter
H 0 H_0 H 0 eine Teststatistik zu erhalten, die mindestens so extrem ist wie die beobachtete.
Zweiseitig heißt „extrem“: weit weg von 0, egal auf welcher Seite. Gezählt wird
also die Fläche rechts von 10,5339 10{,}5339 10 , 5339 und links von − 10,5339 -10{,}5339 − 10 , 5339 . Wegen der
Symmetrie sind beide Flächen gleich groß. Deshalb steht in der Formel „2 ⋅ 2 \cdot 2 ⋅ “.
pt liefert die Fläche links einer Grenze. Die Fläche
rechts ist 1 minus diese. R antwortet 0,001827 0{,}001827 0 , 001827 , also p ≈ 0,0018 = 0,18 % p \approx 0{,}0018 =
0{,}18\,\% p ≈ 0 , 0018 = 0 , 18 % .
In Worten: Gäbe es keinen Zusammenhang, käme ein so extremes R R R nur in etwa 2 von
1.000 solchen Stichproben vor.
Im Bild ist diese Fläche nicht zu sehen. Sie liegt hinter der unterbrochenen Achse und ist
hauchdünn.
Die Regel: H 0 H_0 H 0 verwerfen, falls p ≤ α p \le \alpha p ≤ α . Hier ist 0,0018 ≤ 0,05 0{,}0018 \le 0{,}05 0 , 0018 ≤ 0 , 05 ,
also wird verworfen.
Als Evidenzmaß (Tabelle rechts, aus dem Skript): p p p liegt unter 1 %. Gegen H 0 H_0 H 0
spricht also sehr vieles .
Warum beide Wege dasselbe sagen: R R R liegt rechts vom kritischen Wert. Die Fläche
rechts von R R R ist deshalb kleiner als die 2,5 % rechts vom kritischen Wert. Das Doppelte
davon ist kleiner als 5 %.
Aus Blatt 7, Aufgabe 1 („Gepaarter t-Test: wirkt das Haarwuchsmittel?“): Der
p p p -Wert ist eine Fläche unter der Dichte;
pt(x, df = …) gibt
die Fläche links von
x x x . Er ist
nicht die Wahrscheinlichkeit, dass
H 0 H_0 H 0 stimmt.
Aus Blatt 6, Aufgabe 6 („Einseitig oder zweiseitig: die Dicke der Marmorplatten“):
Beim zweiseitigen Test zählen für den
p p p -Wert beide Seiten. Wegen der Symmetrie ist er
doppelt so groß wie die Fläche auf einer Seite.
H 0 H_0 H 0 verwerfen: Zusammenhang nachweisbar
Jetzt ist alles beisammen:
Kritischer Wert (Schritt 17): ∣ R ∣ ≈ 10,5339 |R| \approx 10{,}5339 ∣ R ∣ ≈ 10 , 5339 ist größer als 3,1824 3{,}1824 3 , 1824 .
p p p -Wert (Schritt 18): p ≈ 0,0018 p \approx 0{,}0018 p ≈ 0 , 0018 ist kleiner als α = 0,05 \alpha = 0{,}05 α = 0 , 05 .
Voraussetzung (Schritt 11): Normalverteilung laut Aufgabe angenommen.
Beide Wege sagen dasselbe: H 0 H_0 H 0 wird verworfen.
Antwort im Sachzusammenhang: Der Zusammenhang zwischen spezifischem Gewicht und
Stärkegehalt von Kartoffeln ist zum Niveau 5 % statistisch nachweisbar. Die wahre
Korrelation ist nicht 0.
Dass sie positiv ist, sagt das Vorzeichen von ρ ^ \hat\rho ρ ^ : 0,9868 > 0 0{,}9868 > 0 0 , 9868 > 0 . Das
ist genau die Antwort der Musterlösung.
Was „nachweisbar“ hier bedeutet: Das Verfahren behauptet einen Zusammenhang, den es
nicht gibt, höchstens mit Wahrscheinlichkeit 5 %. Es heißt nicht, dass H A H_A H A mit 95 %
Wahrscheinlichkeit stimmt.
Merke: Die Antwort gehört in Worte der Aufgabe: nicht nur „
H 0 H_0 H 0 verwerfen“,
sondern was das für Gewicht und Stärke der Kartoffeln heißt.
t = 10.534, df = 3, p-value = 0.001827 ✓
cor.test(x, y) rechnet den ganzen Test mit einem Befehl. Ohne
weitere Angabe testet R zweiseitig, wie hier gewünscht. Die Ausgabe, Zeile für Zeile:
Pearson's product-moment correlation: der Korrelationstest
nach Pearson. „Produkt-Moment“ ist ein alter Name für ρ ^ \hat\rho ρ ^ , weil es aus Produkten
von Abweichungen gebaut ist (Schritt 4).
t = 10.534: die Teststatistik. R nennt sie
t, weil sie t-verteilt ist; im Skript heißt sie R R R . Es ist
unser R ≈ 10,5339 R \approx 10{,}5339 R ≈ 10 , 5339 aus Schritt 14, nicht die 10,5542 aus der Musterlösung.
df = 3: die Freiheitsgrade n − 2 n - 2 n − 2 (Schritt 16);
degrees of freedom heißt Freiheitsgrade.
p-value = 0.001827: der p p p -Wert (Schritt 18).
alternative hypothesis: true correlation is not equal to 0:
H A : ρ ≠ 0 H_A:\ \rho \ne 0 H A : ρ = 0 , also zweiseitig.
95 percent confidence interval: 0.8072993 0.9991660: ein
Konfidenzintervall für die wahre Korrelation ρ \rho ρ . Das Verfahren dahinter
trifft das wahre ρ \rho ρ bei 95 % aller Stichproben. Wie R es berechnet, gehört nicht zur
Aufgabe. Es enthält die 0 nicht; das passt dazu, dass ρ = 0 \rho = 0 ρ = 0 verworfen wird. Es ist
aber breit: Bei nur fünf Kartoffeln könnte ρ \rho ρ auch nur 0,81 sein.
sample estimates: cor 0.98675: ρ ^ \hat\rho ρ ^ aus Schritt 7.
Alle Zahlen stimmen mit der Rechnung von Hand überein.
Aus Blatt 6, Aufgabe 1 („Konfidenzintervall bei bekannter Varianz“): Ein
95-%-Konfidenzintervall ist ein Bereich, der aus den Daten berechnet wird. Das Verfahren
trifft den wahren Wert bei 95 % aller Stichproben.
einseitig nur mit Richtung vorab; hier:
t 3 ; 0,95 ≈ 2,3534 t_{3;\,0{,}95} \approx 2{,}3534 t 3 ; 0 , 95 ≈ 2 , 3534 ,
p ≈ 0,000914 p \approx
0{,}000914 p ≈ 0 , 000914
Die Musterlösung schließt mit einem Hinweis: Hier wurde bewusst
zweiseitig getestet.
Die Regel: Die Richtung eines Tests legt man fest, bevor man die Daten
sieht. Man darf sie nicht aus denselben Daten ablesen, mit denen man dann testet.
Warum? Angenommen, jemand schaut erst auf ρ ^ \hat\rho ρ ^ . Ist es positiv, testet er
H A : ρ > 0 H_A:\ \rho > 0 H A : ρ > 0 mit den ganzen 5 % rechts. Wäre es negativ, testete er H A : ρ < 0 H_A:\ \rho
< 0 H A : ρ < 0 mit 5 % links. Er wählt also immer die Seite, auf der R R R gerade liegt. Stimmt
H 0 H_0 H 0 , verwirft er dann rechts mit 5 % und links mit 5 %, zusammen mit 10 % . Das
versprochene α = 5 % \alpha = 5\,\% α = 5 % stimmt nicht mehr.
Wann einseitig erlaubt ist: wenn die Richtung schon vor der Messung aus der
Sache feststeht. Das wäre hier der Fall. Stärke ist der größte Teil der Trockenmasse einer
Kartoffel, also von allem außer Wasser. Eine Knolle mit hohem spezifischem Gewicht enthält
mehr Trockenmasse und damit mehr Stärke. Einen positiven Zusammenhang durfte man also
schon vorher erwarten.
Dann lauten die Hypothesen H 0 : ρ ≤ 0 H_0:\ \rho \le 0 H 0 : ρ ≤ 0 gegen H A : ρ > 0 H_A:\ \rho > 0 H A : ρ > 0 (erste Zeile der
Tabelle rechts, aus dem Skript). Die ganzen 5 % liegen rechts. Verworfen wird, falls R > t 3 ; 0,95 R
> t_{3;\,0{,}95} R > t 3 ; 0 , 95 :
kritischer Wert: qt(0.95, df = 3) = 2,353363 = 2{,}353363 = 2 , 353363 , auf vier
Stellen 2,3534 2{,}3534 2 , 3534 . Im Bild die Grenze 2,35 mit 5 % rechts davon.
R ≈ 10,5339 > 2,3534 R \approx 10{,}5339 > 2{,}3534 R ≈ 10 , 5339 > 2 , 3534 : verwerfen.
p = P ( T ≥ 10,5339 ) ≈ 0,000914 p = P(T \ge 10{,}5339) \approx 0{,}000914 p = P ( T ≥ 10 , 5339 ) ≈ 0 , 000914 , halb so groß wie zweiseitig.
In R heißt das alternative = "greater" („größer“). Die
Teststatistik bleibt t = 10.534, nur der p p p -Wert halbiert sich.
Der Balken „p-Wert zweiseitig“ links zeigt weiter den Wert der Hauptlösung.
Ergebnis: Beide Tests verwerfen H 0 H_0 H 0 . Weil die Aufgabe keine Richtung nennt,
bleibt der zweiseitige Test die Hauptlösung, wie in der Musterlösung.
Aus Blatt 6, Aufgabe 6 („Einseitig oder zweiseitig: die Dicke der Marmorplatten“):
Wer die Seite erst nach dem Blick auf die Daten wählt, verdoppelt den Fehler 1. Art. Erst
die Vermutung, dann die Daten. Ohne begründete Richtung testet man zweiseitig.
ρ ≠ 0 \rho \ne 0 ρ = 0 nachgewiesen; eine Ursache nicht
Der Test hat gezeigt: ρ ≠ 0 \rho \ne 0 ρ = 0 . Gewicht und Stärke hängen linear zusammen, nicht nur
in diesen fünf Knollen. Er hat nicht gezeigt, dass das eine das andere
verursacht .
Eine Korrelation misst nur, ob zwei Größen gemeinsam steigen oder fallen. Woher das kommt,
sagt sie nicht. Möglich ist:
X X X beeinflusst Y Y Y ,
Y Y Y beeinflusst X X X ,
oder eine dritte Größe beeinflusst beide.
Bei den Kartoffeln passt eher das Zweite oder Dritte. Stärke ist schwerer als Wasser.
Enthält eine Knolle mehr Stärke und damit mehr Trockenmasse, ist sie dichter und hat ein
höheres spezifisches Gewicht. Das Gewicht „macht“ also keine Stärke. Beide Messgrößen
spiegeln den Anteil der Trockenmasse.
Das Skript warnt mit einem Scherzbeispiel: Die Zahl der Piraten und die globale
Durchschnittstemperatur sind stark negativ korreliert (ρ = − 0,94 \rho = -0{,}94 ρ = − 0 , 94 ). Weniger Piraten
verursachen trotzdem keine Erwärmung.
Noch eine Grenze: ρ \rho ρ misst nur lineare Zusammenhänge. Das Skript zeigt
mit dem Anscombe-Quartett vier völlig verschiedene Punktwolken mit derselben Korrelation
0,816. Deshalb sieht man sich immer zuerst das Streudiagramm an. Hier liegen die Punkte
tatsächlich nahe an einer Geraden (Schritt 1).
Merke: „Statistisch nachweisbar“ heißt: Der Zusammenhang ist kaum durch Zufall zu
erklären. Eine Ursache ist damit nicht belegt; dafür braucht es etwa kontrollierte
Experimente. Mehr dazu in Aufgabe 4 dieses Blatts („Korrelation ist keine Kausalität“).
verwerfen bei
n = 5 n = 5 n = 5 erst ab
∣ ρ ^ ∣ > 0,8783 |\hat\rho| > 0{,}8783 ∣ ρ ^ ∣ > 0 , 8783
Diese Ergänzung geht über die Aufgabe hinaus. Sie beantwortet: Wie groß muss
ρ ^ \hat\rho ρ ^ bei fünf Kartoffeln mindestens sein, damit der Test verwirft?
Gesucht ist die Stelle, an der R R R den kritischen Wert 3,182446 3{,}182446 3 , 182446 übersteigt. Das gilt
für positives ρ ^ \hat\rho ρ ^ ; für negatives gilt dasselbe mit Minus. Die Ungleichung wird
Zeile für Zeile nach ρ ^ \hat\rho ρ ^ umgestellt (rechts):
Beide Seiten sind positiv. Dann ändert Quadrieren das Zeichen > > > nicht. Aus ( 3 ) 2 = 3 (\sqrt
3)^2 = 3 ( 3 ) 2 = 3 wird links 3 ρ ^ 2 1 − ρ ^ 2 \frac{3\hat\rho^2}{1 - \hat\rho^2} 1 − ρ ^ 2 3 ρ ^ 2 , rechts 3,182446 2 ≈ 10,127964 3{,}182446^2 \approx
10{,}127964 3 , 18244 6 2 ≈ 10 , 127964 .
Mit dem Nenner 1 − ρ ^ 2 1 - \hat\rho^2 1 − ρ ^ 2 malnehmen. Er ist positiv, das Zeichen bleibt.
Alle Terme mit ρ ^ 2 \hat\rho^2 ρ ^ 2 auf die linke Seite bringen: 3 + 10,127964 = 13,127964 3 + 10{,}127964 =
13{,}127964 3 + 10 , 127964 = 13 , 127964 .
Teilen: 10,127964 : 13,127964 ≈ 0,771480 10{,}127964 : 13{,}127964 \approx 0{,}771480 10 , 127964 : 13 , 127964 ≈ 0 , 771480 . Die Wurzel daraus ist
0,8783 0{,}8783 0 , 8783 .
Ergebnis: Bei n = 5 n = 5 n = 5 wird nur verworfen, wenn ∣ ρ ^ ∣ > 0,8783 |\hat\rho| > 0{,}8783 ∣ ρ ^ ∣ > 0 , 8783 ist. Im
Bild entspricht das dem kritischen Wert 3,18.
Die Lehre: Ein ρ ^ \hat\rho ρ ^ von 0,85 wäre nach der Daumenregel „stark“. Bei fünf
Kartoffeln ergäbe es aber nur R ≈ 2,79 R \approx 2{,}79 R ≈ 2 , 79 , weniger als 3,18: nicht nachweisbar.
„Stark“ nach der Daumenregel und „statistisch nachweisbar“ sind zwei verschiedene Fragen.
Mit mehr Paaren sinkt die Grenze, weil n − 2 \sqrt{n - 2} n − 2 wächst.
Unsere Kartoffeln liegen mit 0,9868 0{,}9868 0 , 9868 deutlich darüber.
Größe
Weg
Wert
Schwerpunkt ( x ˉ ∣ y ˉ ) (\bar x \mid \bar y) ( x ˉ ∣ y ˉ )
5.354 : 5 5.354 : 5 5.354 : 5 und 56,7 : 5 56{,}7 : 5 56 , 7 : 5
1.070,8 | 11,34
Kovarianz s X Y s_{XY} s X Y
54,54 : 4 54{,}54 : 4 54 , 54 : 4
13,635
Standardabweichungen s X s_X s X , s Y s_Y s Y
85,7 \sqrt{85{,}7} 85 , 7 und 2,228 \sqrt{2{,}228} 2 , 228
9,2574 und 1,4926
Korrelation ρ ^ \hat\rho ρ ^
13,635 : 13,8181 13{,}635 : 13{,}8181 13 , 635 : 13 , 8181
0,9868
Teststatistik R R R
3 ⋅ 0,98675 : 1 − 0,98675 2 \sqrt 3 \cdot 0{,}98675 : \sqrt{1 - 0{,}98675^2} 3 ⋅ 0 , 98675 : 1 − 0 , 9867 5 2
10,5339
kritischer Wert
qt(0.975, df = 3)
3,1824
p p p -Wert
2 * (1 - pt(R, df = 3))
0,0018
In Worten: In den fünf Kartoffeln steigen spezifisches Gewicht und Stärkegehalt fast
genau entlang einer Geraden, ρ ^ ≈ 0,9868 \hat\rho \approx 0{,}9868 ρ ^ ≈ 0 , 9868 : stark positiv. Gäbe es in Wahrheit
keinen Zusammenhang, käme ein so extremes R R R nur in etwa 2 von 1.000 Stichproben vor. Zum
Niveau 5 % ist der Zusammenhang deshalb statistisch nachweisbar . Eine Ursache ist
damit nicht belegt.
Rückblick — so geht ein Korrelationstest:
(1) Streudiagramm ansehen. (2)
ρ ^ \hat\rho ρ ^ ausrechnen: Schwerpunkt, Produkte der
Abweichungen, durch
n − 1 n - 1 n − 1 teilen, durch
s X s Y s_X s_Y s X s Y teilen. (3)
H 0 : ρ = 0 H_0:\ \rho = 0 H 0 : ρ = 0 gegen
H A H_A H A
aufstellen; eine Richtung nur, wenn sie vorher feststeht;
α \alpha α festlegen. (4)
R = n − 2 ρ ^ / 1 − ρ ^ 2 R =
\sqrt{n-2}\,\hat\rho / \sqrt{1 - \hat\rho^2} R = n − 2 ρ ^ / 1 − ρ ^ 2 mit allen Stellen ausrechnen. (5) Mit
t n − 2 ; 1 − α / 2 t_{n-2;\,1-\alpha/2} t n − 2 ; 1 − α /2 vergleichen oder den
p p p -Wert bestimmen. (6) Antwort in Worten der
Aufgabe; mit
cor.test prüfen.
Zwei Fragen, zwei Werkzeuge: Wie stark ist der Zusammenhang in den Daten? Das sagt
die Daumenregel. Ist er über die Daten hinaus nachweisbar? Das sagt der Test. Bei wenigen
Paaren kann ein „starkes“
ρ ^ \hat\rho ρ ^ trotzdem Zufall sein (Schritte 10 und 23).