Bisher war die Verteilung vorgegeben, und daraus wurden Wahrscheinlichkeiten berechnet. Jetzt
ist es umgekehrt: Gegeben sind 20 gemessene Wartezeiten, die Verteilung dahinter ist unbekannt.
Ein Histogramm macht aus den Daten ein Bild ihrer Verteilung. Hier wird es Schritt für
Schritt gebaut: Wertebereich, Klassen, Zählen, Dichte, Fläche — und am Ende mit R und drei
verschiedenen Klassenbreiten verglichen. Rechts steht der ganze Lösungsweg, links die Erklärung
zum aktuellen Schritt. Mit Weiter geht es Schritt für Schritt voran. Ein Klick auf einen
Schritt springt direkt dorthin.
Schritt 0Die Aufgabe
Wichtige R-Befehle für deskriptive Statistik (Auszug vom Blatt, soweit Aufgabe 1 sie
braucht). Für eine Stichprobe x <- c(x1, ..., xn) bietet R unter
anderem:
Kennzahl
R-Befehl
Hinweis
Histogramm
hist(x)
Klassenbreite via breaks
Hinweis: Das Argument breaks in
hist(x) erwartet einen Vektor mit den Klassengrenzen. Mit
seq(von, bis, by = b) lässt sich dieser erzeugen — z. B. liefert
seq(1, 6, by = 1) die Grenzen 1, 2, 3, 4, 5, 6 für fünf Klassen der
Breite b=1.
Aufgabe 1. An einer Bushaltestelle wurden die Wartezeiten (in Minuten) von n=20
Fahrgästen gemessen:
2,1
3,4
1,8
5,2
4,7
2,9
3,1
4,2
1,9
4,5
1,5
3,8
2,6
4,9
3,3
2,2
4,1
3,7
3,2
2,8
Bestimmen Sie den Wertebereich (Minimum und Maximum) der Daten. Verwenden Sie die Faustformel
k≈n für die Anzahl der Klassen k und leiten Sie eine sinnvolle
Klassenbreite b ab.
Unterteilen Sie den Wertebereich in Intervalle der in (i) bestimmten Breite und zählen Sie die
Häufigkeiten nj in jedem Intervall.
Berechnen Sie für jedes Intervall die empirische Dichte fj=n⋅bnj sowie
die relative Häufigkeit hj=fj⋅b. Überprüfen Sie, dass ∑jhj=1.
Erstellen Sie das Histogramm in R zunächst mit Ihrer Klassenbreite aus (i). Probieren Sie
anschließend b∈{0,5;2} aus. Was beobachten Sie? Was spricht jeweils gegen eine zu
kleine bzw. zu große Klassenbreite?
Hinweis zur Musterlösung: Die Ergebnisse zu (i) bis (iii) stimmen: k=5, b=1, nj=3;5;6;5;1 und fj=hj=0,15;0,25;0,30;0,25;0,05. Vier Punkte
weichen ab. (1) Sie begründet k=5 mit „Intervalle müssen ganzzahlig sein“. Gemeint ist: Die
Anzahlk muss eine ganze Zahl sein (Schritt 2). (2) Sie nennt den höchsten Balken
einmal „[3,4)“. Die Klassen sind aber rechts geschlossen, richtig ist (3,4] (Schritt 4). (3)
Ihre Nummern sind verschoben: Das Zählen steht dort unter (i), fj und hj unter (ii), der
R-Code unter (iii). (4) Den R-Code für b=1 enthält sie (hier Schritt 9). Der Vergleich mit
b=0,5 und b=2 aus Teil (iv) fehlt dort ganz. Hier steht er vollständig in den
Schritten 10 bis 13.
(i) Wertebereich und Klassenbreite
wie viele Klassen, wie breit
Schritt 1Die Stichprobe sortieren: Minimum und Maximum
Die sortierte Stichprobe x(1)≤x(2)≤⋯≤x(20) in Minuten
Platz i
1
2
3
4
5
6
7
8
9
10
x(i)
1,5
1,8
1,9
2,1
2,2
2,6
2,8
2,9
3,1
3,2
Platz i
11
12
13
14
15
16
17
18
19
20
x(i)
3,3
3,4
3,7
3,8
4,1
4,2
4,5
4,7
4,9
5,2
Minimum und Maximum: der erste und der letzte Platz
k zählt Klassen und muss eine ganze Zahl sein: 4 oder 5. Welche passt, zeigt Schritt 3:
Mit der runden Breite 1 ab Grenze 1 reichen vier Klassen nur bis 5, das Maximum ist 5,2 —
deshalb
k=5
sqrt(20)
#[1] 4.472136
Schritt 3Eine runde Klassenbreite: b=1
Spannweite gleichmäßig auf k=5 Klassen verteilen
b≈kSpannweite=53,7=0,74 Minuten
Auf eine runde Zahl aufrunden, damit alles hineinpasst
b=1 Minute,5⋅1=5≥3,7
Start an einer runden Zahl unter dem Minimum 1,5, Ende mindestens beim Maximum: die
Grenzen
1,2,3,4,5,6(letzte Grenze 6≥5,2)
Warum nicht k=4: auch dann b=1, aber vier Klassen ab 1 enden bei 5 — also k=5
Klasse j reicht von der Grenze gj−1 (ausgeschlossen) bis gj (eingeschlossen)
(gj−1,gj]={t:gj−1<t≤gj}
j
Klasse
bedeutet: Wartezeit t in Minuten mit
1
(1,2]
1<t≤2
2
(2,3]
2<t≤3
3
(3,4]
3<t≤4
4
(4,5]
4<t≤5
5
(5,6]
5<t≤6
Schritt 5Die Häufigkeiten nj zählen
j
Klasse
Werte darin (sortiert)
nj
1
(1,2]
1,5; 1,8; 1,9
3
2
(2,3]
2,1; 2,2; 2,6; 2,8; 2,9
5
3
(3,4]
3,1; 3,2; 3,3; 3,4; 3,7; 3,8
6
4
(4,5]
4,1; 4,2; 4,5; 4,7; 4,9
5
5
(5,6]
5,2
1
Summe
20
Probe: Jeder Wert ist genau einmal gezählt
j=1∑5nj=3+5+6+5+1=20=n
(iii) Dichte und relative Häufigkeit
Höhe und Fläche der Balken
Schritt 6Die empirische Dichte fj: die Höhe des Balkens
Empirische Dichte der Klasse j
fj=n⋅bnj
Der Nenner mit n=20 und b=1
n⋅b=20⋅1=20
j
Klasse
nj
Rechnung
fj
1
(1,2]
3
3:20
0,15
2
(2,3]
5
5:20
0,25
3
(3,4]
6
6:20
0,30
4
(4,5]
5
5:20
0,25
5
(5,6]
1
1:20
0,05
Schritt 7Die relative Häufigkeit hj: die Fläche des Balkens
Fläche = Breite mal Höhe; das b kürzt sich weg
hj=fj⋅b=n⋅bnj⋅b=nnj
Hier ist b=1, also hj=fj⋅1=fj
h1=0,15,h2=0,25,h3=0,30,h4=0,25,h5=0,05
Probe aus der Aufgabe: die Summe aller Flächen
j=1∑5hj=0,15+0,25+0,30+0,25+0,05=1
Warum immer 1 herauskommt
j∑hj=j∑nnj=nn1+⋯+n5=2020=1
Schritt 8Das Histogramm lesen
Der höchste Balken
f3=0,30u¨ber (3,4]:h3=0,30=30% der Fahrga¨ste
Flächen links und rechts davon
bis 3 Minuten: 0,15+0,25=0,40,u¨ber 4 Minuten: 0,25+0,05=0,30
(iv) Das Histogramm in R, drei Klassenbreiten
b = 1, dann 0,5 und 2
Schritt 9Das Histogramm mit R zeichnen
seq(1, 6, by = 1)
#[1] 1 2 3 4 5 6
hist(x,
breaks = seq(1, 6, by = 1), # Klassen der Breite 1
right = TRUE, # rechts geschlossene Intervalle
freq = FALSE, # Dichte auf der y-Achse
main = "Wartezeiten an der Bushaltestelle",
xlab = "Wartezeit (min)",
ylab = "Dichte",
col = "steelblue")
Zwei halbe Balken ergeben im Mittel den ganzen: Klasse (3,4] bei b=1
20,4+0,2=0,3=f3 bei b=1
Schritt 11Der Fallstrick: seq(1, 6, by = 2)
seq(1, 6, by = 2)
#[1] 1 3 5
hist(x, breaks = seq(1, 6, by = 2), freq = FALSE)
#Error in hist.default(x, breaks = seq(1, 6, by = 2), freq = FALSE) :# some 'x' not counted; maybe 'breaks' do not span range of 'x'
Die letzte Grenze liegt unter dem Maximum
5<5,2=x(20)⇒5,2 liegt in keiner Klasse
Abhilfe: „bis“ so wählen, dass die letzte Grenze mindestens das Maximum ist
seq(1, 7, by = 2)
#[1] 1 3 5 7
Schritt 12Klassenbreite b=2: drei breite Balken
hist(x, breaks = seq(1, 7, by = 2), freq = FALSE)
3 Klassen; Nenner n⋅b=20⋅2=40
fj=40nj,hj=fj⋅2=20nj
Klasse
nj
Rechnung
fj
hj
(1,3]
8
8:40
0,2
0,40
(3,5]
11
11:40
0,275
0,55
(5,7]
1
1:40
0,025
0,05
Summe
20
1,00
Ein breiter Balken ist das Mittel der zwei Balken mit b=1 darunter
(3,5]:20,30+0,25=0,275,(1,3]:20,15+0,25=0,2
Schritt 13Zu klein oder zu groß: was dagegen spricht
b
k
Werte je Klasse im Mittel
Beobachtung
0,5
10
20:10=2
zackig, eine leere Klasse, Zufall sichtbar
1
5
20:5=4
ein Gipfel bei 3 bis 4 Minuten, Form erkennbar
2
3
20:3≈6,7
nur drei Blöcke, Form geht verloren
Mit freq = FALSE hat jedes der drei Histogramme die Gesamtfläche
1
j∑hj=1fu¨r b=0,5,b=1 und b=2
Schritt 14Ergebnis
✓(i) Minimum 1,5, Maximum 5,2 Minuten, Spannweite 3,7. 20≈4,47, also k=5 Klassen der Breite b=1 Minute mit den Grenzen
1, 2, …, 6.
✓(ii) nj=3;5;6;5;1 in (1,2],(2,3],(3,4],(4,5],(5,6] — zusammen
20.
✓(iii) fj=hj=0,15;0,25;0,30;0,25;0,05 und ∑jhj=1.
✓(iv) b=0,5: zackig mit Lücke — zu wenige Werte je Klasse. b=2: nur drei Balken
— die Form verschwindet. In R braucht b=2 die Grenzen
seq(1, 7, by = 2), weil
seq(1, 6, by = 2) bei 5 aufhört.
Klasse
nj
fj
hj
(1,2]
3
0,15
0,15
(2,3]
5
0,25
0,25
(3,4]
6
0,30
0,30
(4,5]
5
0,25
0,25
(5,6]
1
0,05
0,05
Summe
20
1,00
Probe: Die Häufigkeiten ergeben n=20, die Flächen ergeben 1. Bei jeder
Klassenbreite gilt dasselbe (Schritte 10 und 12).
Typische Fehler: Den Wert auf einer Grenze in die falsche Klasse zählen (rechts
geschlossen: 4,5 gehört zu (4;4,5]). Bei b=1 vergessen, durch b zu teilen — dann
ist fj keine Dichte mehr und die Flächen ergeben nicht 1. In R die letzte Grenze kleiner
als das Maximum wählen.