umwelt-online: Aktivität von Rückständen (4)
UWS Umweltmanagement GmbH Frame öffnen

B.3.7 Kritische Werte Sn;i

Analog zu (B32) können für beliebige geradzahlige Stichprobenumfänge n mit Hilfe von Gl. (B22) kritische Werte Sn,; berechnet werden, mit denen die Aussage

Pr(x<n i> ≥ E sn ≤; Sn;i) ≥ 0,95 (B33)

gilt. Sie sind für n = 6(2)30 bzw. n = 10(10)100 mit den zur Berechnung von sr,n benötigten Perzentilen k(n-1)/n der Standardnormalverteilung in den Tabellen B2 und B3 angegeben.

B.3.8 Schritte zur einfachen Schätzung oberer Konfidenzgrenzen zum Erwartungswert

Die erläuterte Methode zur einfachen Schätzung oberer Konfidenzgrenzen zum Erwartungswert von lognormal verteilten Zufallsgrößen (für ein vorgegebenes Vertrauensniveau von 0,95) beinhaltet die folgenden Schritte:

  1. Für eine zufällige Stichprobe mit geradzahligem Umfang n sind die Messwerte nach der Größe zu ordnen. Die so geordnete Reihenfolge der Messwerte ist: x<1> ≤; x<2> ≤; ... ≤; x<n>
  2. Es wird die folgende Prüfgröße berechnet,
    Druck- und Lokalversion
    wobei kp das P%-Perzentil der Standardnormalverteilung bezeichnet.
  3. Der Messwert
    X<n-i> mit der größten Zahl i, für die sn ≥ Sn;i ist, (B34)

    wozu kritische Werte Sn; in den Tabellen B2 und B3 angegeben sind, stellt dann eine obere Konfidenzgrenze für den Erwartungswert E zum Vertrauensniveau von 0,95 dar.

  4. Wenn sn ≥ Sn;i ist, kann diese Methode zur einfachen Schätzung oberer Konfidenzgrenzen zum Erwartungswert E nicht angewendet werden.

Abbildung B6: Verlauf der Wahrscheinlichkeiten Pr(x<n-i> ≥ E | s20) in Abhängigkeit vom Wert des für die Stichprobe (n = 20) gemessenen Wertes s20

Druck- und Lokalversion

Tabelle B2: Kritische Werte Sn;i und Perzentile k(n-1)/n, der Standardnormalverteilung zur einfachen Schätzung oberer Konfidenzgrenzen zum Erwartungswert E; Stichprobenumfänge n = 6(2)30; P = 0,95

i/n 6 8 10 12 14 16 18 20 22 24 26 28 30
0 0,34 0,66 0,92 1,13 1,31 1,47 1,61 1,73 1,84 1,94 2,03 2,11 2,19
1 - 0,11 0,41 0,64 0,83 1,00 1,14 1,27 1,38 1,48 1,58 1,66 1,74
2 - - - 0,26 0,48 0,66 0,81 0,95 1,07 1,18 1,27 1,36 1,44
3 - - - - 0,15 0,36 0,53 0,68 0,81 0,92 1,03 1,12 1,21
4 - - - - - 0,07 0,27 0,44 0,58 0,70 0,81 0,91 1,00
5 - - - - - - 0,01 0,20 0,36 0,50 0,62 0,72 0,82
6 - - - - - - - - 0,14 0,30 0,43 0,54 0,65
7 - - - - - - - - - 0,10 0,24 0,37 0,48
8 - - - - - - - - - - 0,06 0,20 0,32
9 - - - - - - - - - - - 0,03 0,16
k(n-1)/n 0,967 1,150 1,282 1,383 1,465 1,534 1,593 1,645 1,691 1,732 1,769 1,803 1,834

Tabelle B3: Kritische Werte Sn;i und Perzentile k(n-1)/n, der Standardnormalverteilung zur einfachen Schätzung oberer Konfidenzgrenzen zum Erwartungswert E; Stichprobenumfänge n = 10(10)100; P = 0,95

i \ n 10 20 30 40 50 60 70 80 90 100
0 0,92 1,73 2,19 2,50 2,73 2,95 3,11 3,26 3,38 3,50
1 0,41 1,27 1,74 2,06 2,30 2,52 2,69 2,84 2,97 3,08
2 - 0,95 1,44 1,78 2,03 2,25 2,42 2,57 2,70 2,82
3 - 0,68 1,21 1,56 1,81 2,04 2,21 2,37 2,50 2,62
4 - 0,44 1,00 1,37 1,63 1,86 2,04 2,20 2,34 2,46
5 - 0,20 0,82 1,20 1,48 1,71 1,90 2,06 2,19 2,32
6 - - 0,65 1,05 1,34 1,58 1,77 1,93 2,07 2,20
7 - - 0,48 0,91 1,21 1,46 1,65 1,81 1,96 2,09
8 - - 0,32 0,78 1,09 1,34 1,54 1,71 1,85 1,98
9 - - 0,16 0,65 0,97 1,23 1,44 1,61 1,76 1,89
10 - - - 0,52 0,86 1,13 1,34 1,52 1,67 1,80
11 - - - 0,40 0,76 1,04 1,25 1,43 1,58 1,72
12 - - - 0,28 0,66 0,94 1,16 1,35 1,50 1,64
13 - - - 0,16 0,56 0,85 1,08 1,27 1,43 1,57
14 - - - 0,04 0,46 0,77 1,00 1,19 1,35 1,50
15 - - - - 0,36 0,68 0,92 1,12 1,28 1,43
16 - - - - 0,26 0,60 0,84 1,05 1,22 1,36
17 - - - - 0,17 0,51 0,77 0,98 1,15 1,30
18 - - - - 0,07 0,43 0,70 0,91 1,09 1,24
19 - - - - - 0,35 0,62 0,84 1,02 1,18
20 - - - - - 0,27 0,55 0,78 0,96 1,12
21 - - - - - 0,19 0,48 0,71 0,90 1,06
22 - - - - - 0,11 0,41 0,65 0,84 1,01
23 - - - - - 0,03 0,34 0,59 0,78 0,95
24 - - - - - - 0,27 0,52 0,73 0,90
25 - - - - - - 0,20 0,46 0,67 0,85
26 - - - - - - 0,13 0,40 0,61 0,79
27 - - - - - - 0,06 0,34 0,56 0,74
28 - - - - - - - 0,28 0,50 0,69
29 _ _ _ - - - - 0,22 0,45 0,64
30 - - - - - - - 0,16 0,39 0,59
31 _ _ _ _ _ - - 0,09 0,34 0,54
32 - - - - - - - 0,03 0,29 0,49
33 - - - - - - - - 0,23 0,44
34 - - - - - - - - 0,18 0,39
35 - - - - - - - - 0,12 0,34
36 - - - - - - - - 0,07 0,29
37 - - - - - - - - 0,01 0,24
38 - - - - - - - - - 0,20
38 - - - - - - - - - 0,15
40 - - - - - - - - - 0,10
41 - - - - - - - - - 0,05
k(n-1)/n 1,282 1,645 1,834 1,960 2,054 2,128 2,189 2,241 2,287 2,326

B.4 Literatur

[B1] David, H.A.; Nagaraja, H.N. Order Statistics (Third Edition) John Wiley & Sons, Inc., Hoboken, New Jersey, 2003

[B2] Rinne, H.
Taschenbuch der Statistik
Verlag Harri Deutsch, Thun und Frankfurt am Main, 1997

[B3] Jeffreys, H. Theory of Probability (Third Edition) Oxford University Press Inc., New York, 1961

[B4] Bernardo, J.M.; Smith, A.F.M.
Bayesian Theory
John Wiley & Sons, Ltd, Baffins Lane, Chichester, 2000

[B5] Robert, C.P.
The Bayesian Choice
Springer-Verlag New York Inc., New York, Berlin, Heidelberg, Barcelona, Hongkong, London, Milan, Paris, Singapore, Tokyo, 2001

.

Schätzung der Parameter von normal und lognormal verteilten Zufallsgrößen Anhang C

Die Schätzung der Verteilungsparameter für normal bzw. log-normal verteilte Zufallsgrößen auf der Basis von Stichprobenwerten (Messwerten) ist u. a. Voraussetzung für die genaue Berechnung von Konfidenzgrenzen für den Erwartungswert E der Zufallsgröße. Sie kann auf der Grundlage gut bekannter Beziehungen erfolgen (siehe z.B. [C1]), sofern die Verteilungen "ungestört" sind. In Abschnitt C.1 werden die hierzu gebräuchlichen Maximum-Likelihood-Schätzer angegeben. In der Praxis muss jedoch immer damit gerechnet werden, dass die Verteilungen gestört sind. Hierzu sind insbesondere folgende Fälle zu beachten:

C.1 Schätzung der Parameter μ und σ für ungestörte Verteilungen

Eine normalverteilte Zufallsgröße X mit dem Erwartungswert μ und der Varianz σ2 (bzw. der Standardabweichung σ ) X ~ N(μ; σ), hat folgende Verteilungsdichte und Verteilungsfunktion:

Druck- und Lokalversion (C1)


Druck- und Lokalversion (C2)

wobei erf(x) die sogenannte Fehlerfunktion bezeichnet,

Druck- und Lokalversion (C3)

Zur Schätzung der Verteilungsparameter μ und σ sind die so genannten erwartungstreuen Momentenschätzer geeignet [C1]. Danach werden aus den n Einzelwerten xi (i = 1 bis n) einer Stichprobe vom Umfang n, die auf zufällige Weise aus einer ungestört normalverteilten Grundgesamtheit gewonnen wurde, folgende Schätzwerte μn, des Erwartungswertes und σ2n der Varianz berechnet:

Druck- und Lokalversion (C4)


Druck- und Lokalversion (C5)

Eine Zufallsgröße Y ist lognormal verteilt, wenn X = ln(Y) eine normalverteilte Größe ist. Mit dem Erwartungswert μ und der Standardabweichung σ von X schreibt man Y ~ Ln(μ; σ). Die Verteilungsdichte der Realisierungen y ist

Druck- und Lokalversion (C6)

Für die Verteilungsfunktion der Lognormalverteilung folgt:

Druck- und Lokalversion (C7)

Zur Schätzung der Verteilungsparameter μ und σ der Lognormalverteilung aus n Einzelwerten yi (i = 1 bis n) einer Stichprobe vom Umfang n, die auf zufällige Weise aus einer ungestört lognormal verteilten Grundgesamtheit gewonnen wurde, werden Gl. (C4) und (C5) mit

xi = ln(yi) , i = 1 bis n (C8)

genutzt. Die Verteilungsparameter von ungestörten (reinen) Normal- bzw. Lognormalverteilungen werden somit völlig analog geschätzt. Der einzige Unterschied besteht darin, dass im Fall der Normalverteilung in Gl. (C4) und (C5) die Messwerte und im Fall der Lognormalverteilung die Logarithmen der Messwerte einzusetzen sind.

Es sei darauf hingewiesen, dass die Bedeutung der Parameter μ und σ für die beiden Verteilungen sehr unterschiedlich ist. Der Erwartungswert E der Zufallsgröße genügt z.B. folgenden Beziehungen:

Normalverteilung:
Druck- und Lokalversion
(C9)
Lognormalverteilung:
Druck- und Lokalversion
(C10)

C.2 Schätzung der Parameter μ und σ bei Unterschreitungen von Erkennungsgrenzen

Liegt für eine gewisse Probenzahl ne einer Stichprobe vom Umfang n nur das Ergebnis "Messwert kleiner Erkennungsgrenze" vor, so kann mit Gl. (C4) und (C5) keine korrekte Schätzung der Parameter μ und σ vorgenommen werden. Im vorliegenden Abschnitt wird für diesen Fall das in [C2] entwickelte Schätzverfahren erläutert und für die praktische Anwendung aufbereitet.

Das Schätzverfahren wird für eine normal verteilte Größe X dargelegt. Es ist auf die Schätzung der Parameter μ und σ einer lognormal verteilten Größe Y durch die Transformation X = ln(Y), die nach Gl. (C8) auch für die Messwerte von Stichproben bzw. die Erkennungsgrenzen, xi* = ln(yi*), anzuwenden ist, direkt übertragbar.

DA die Erkennungsgrenzen x*i (i = 1 bis n) der n untersuchten Einzelproben unterschiedlich sein können, ist es möglich, dass für eine j-te Probe ein konkreter Messwert xj vorliegt, der kleiner ist als die Erkennungsgrenze x*i einer i-ten Probe, für die aus der Messung nur die Aussage xi < x*i resultiert. In solchen Fällen kann der Messwert xi nicht direkt zur Schätzung der Parameter μ und σ genutzt werden. Mit x werden die nach der Größe geordneten Messergebnisse bezeichnet, wobei für Proben mit dem Ergebnis "xi < x*i" die Erkennungsgrenze x*i eingesetzt wird. Dann gilt x ≤; x<j>, bei i < j für alle i und j von 1 bis n.

Es sei x* das Maximum der Erkennungsgrenzen all jener Proben, für die aus den Messungen nur die Aussage xi < x*i gewonnen wurde,

Druck- und Lokalversion (C11)

ist dann die Anzahl von Einzelproben, deren Wert nicht größer als x* ist. Die Zahl n* kann größer als die Anzahl ne sein. Für alle i > n* liegen echte Messwerte x vor (evtl. liegen weitere kleine Messwerte x<j>, < x* für j < n* vor, die jedoch unter die "Zensur" fallen und deren Werte nicht weiter genutzt werden).

Die in [C2] zur Schätzung der Parameter einer Normalverteilung anhand so genannter "zensierter" + Stichproben entwickelte Methode basiert auf dem Maximum-Likelihood-Prinzip.

Die Likelihood-Funktion L dieser Stichprobe ist eine Funktion von μ und σ, deren Verlauf durch die Erkennungsgrenze x*, die Stichprobenwerte x sowie durch die Zahlen n und n* bestimmt wird:

Druck- und Lokalversion (C12)

mit

Druck- und Lokalversion (C13)

In (C12) sind mit FN(0;1)(x) die Verteilungsfunktion der Standardnormalverteilung und mit fN(μ ;σ )(x) die Verteilungsdichte der gesuchten Normalverteilung bezeichnet; siehe Gl. (C1) und (C2). Zur Schätzung der Parameter μ und σ werden jene Werte μn und σn bestimmt, für die das Maximum der Likelihood-Funktion (C12) vorliegt. Im Fall n* = 0 führt dieses Prinzip zu den folgenden Schätzern:

Druck- und Lokalversion (C4")


(C5")

Der ML-Schätzwert (C4") für μ stimmt mit dem Momentenschätzer (C4) überein, wogegen der ML-Schätzwert (C5") für σ2 vom Momentenschätzer (C5) um den Faktor (n-1)/n abweicht. Dieser Faktor wird später auch für den allgemeinen Fall n* > 0 zusätzlich eingeführt, um Kompatibilität mit dem üblichen Schätzer (C5) zu erreichen (s. u.). Auf die Kennzeichnung "ML" wird nachfolgend zur Vereinfachung der Formeln verzichtet.

Für die hier betrachtete "linkszensierte" Stichprobe erhält man aus (C12) zur Berechnung von μn und σn die Gleichungen

(C14)


(C15)

mit

(C16)


(C17)


(C18)

Zur Lösung des Gleichungssystems (C14)/(C15) wird die Größe

(C19)

eingeführt. Damit erhält man die Beziehungen

(C20)
(C21")
(C22)

Um für die Schätzung von σ Kompatibilität mit (C5) zu erreichen, wird der ML-Schätzer (C21") noch mit dem Faktor n/(n-1) korrigiert:

(C21)

Die Berechnung der Schätzwerte μ n und σ n2 mit Gl. (C20) und (C21) erfordert somit drei Schritte:

  • Berechnung von ` X und s2 nach Gl. (C16) und (C17) aus den n - n* Werten x > x*;
  • Berechnung von ξ durch Lösung von Gl. (C22);
  • Berechnung von λ(ξ) nach Gl. (C19).

Aus (C22), (C18) und (C19) ist ersichtlich, dass die Stichprobendaten nur über die Parameter

α = n* / n und (C23)
β = s2 / (`x - x* ) 2 (C24)

in die Berechnung von λ eingehen. Somit kann λ als Funktion von α und β dargestellt werden. Die Abhängigkeit des Parameters λ von α und β ist in den Abbildungen C1 und C2 für Wertebereiche von 0 ≤;α ≤ 0,5 und 0 ≤; β ≤ 1 dargestellt. Im Grenzfall α = 0 (n* = 0) gehen die Gleichungen (C20) und (C21) mit λ = 0 in die Gl. (C4) und (C5) über.

Zur Anwendung der erläuterten Methode zur Schätzung der beiden Parameter der Normalverteilung μ und σ kann die Funktion λ = λ (α, β) durch ein Polynom approximiert werden,

(C25)

das mit den in Tabelle C1 angegebenen Koeffizienten λj,k im o. g. Wertebereich sehr genau ist.

Tabelle C1: Koeffizienten λ j,k der Approximation (C25) für von 0 ≤; α ≤ 0,5 und 0 ≤; β ≤ 1

k = 0 k = 1 k = 2 k = 3
j = 1 0,99886 0,84223 -0,52221 0,20181
j = 2 1,05480 -0,62573 1,02967 -0,50063
j = 3 -0,16628 0,83956 -1,35989 0,70305
j = 4 1,51328 -0,44622 0,88411 -0,46149

Alternativ können die von den beiden Parametern α und β (siehe Gl. (C23) und (C24)) abhängigen Werte von λ auch aus dem in der Abbildung C1 dargestellten Nomogramm entnommen werden.

C.3 Identifikation von Ausreißern

Zur Ausreißer-Identifikation wird der GRUBBS-Test empfohlen; siehe [C1], [C3]. Der Test wird für eine normal verteilte Größe X erläutert. Er ist auf die Identifikation von Ausreißern in Stichproben für lognormal verteilte Zufallsgrößen Y durch die Transformation X = ln(Y), die nach Gl. (C8) auch für einzelne Messwerte der Stichprobe vorzunehmen ist, direkt übertragbar.

Der GRUBBS-Test basiert auf der statistischen Verteilung der Extremwerte x<1> bzw. x<n> von zufälligen Stichproben aus einer normalverteilten Grundgesamtheit X ~ N(μ ;σ ), wobei mit x (i = 1 bis n) die der Größe nach geordneten Einzelwerte bezeichnet werden.

Es sei nun {x}n eine Stichprobe für die Zufallsgröße X vom Umfang n (für eine lognormal verteilte Zufallsgröße Y ~ Ln(μ;σ),wird {x = ln(y)}n betrachtet).

Abbildung C1: Abhängigkeit des Parameters λ von β = s2/( ` X -x* )2 für Werte α = n*/n von 0,05(0,05)0,50

Abbildung C2: Abhängigkeit des Parameters λ von α = n*/n für β = s2/(` X -x* )2 = {0,0; 0,5; 1,0}

Der GRUBBS-Test beinhaltet die Prüfung der Hypothese

(C26)

gegen die alternative Hypothese H1, dass der minimale bzw. der maximale Extremwert der Stichprobe {x}n ein Ausreißer sei. H0 wird verworfen (x<1> bzw. x<n>, werden als Ausreißer betrachtet), wenn x<1> bzw. x<n> bei einer vorgegebenen zulässigen Irrtumswahrscheinlichkeit α für den Fehler 1. Art (Verwerfen von H0, obwohl H0 zutrifft) nicht der durch die Stichprobe charakterisierten Normalverteilung zuzuordnen ist. Hierzu wird die Prüfgröße

(C27)

betrachtet, wobei μn und σn die nach Abschnitt C.2 berechneten Schätzer der beiden (unbekannten) Parameter μ und σ der Normalverteilung X ~ N(μ;σ) sind.

Die Prüfgrößen G1 und Gn sind mit so genannten kritischen Werten gn;α zu vergleichen, die vom Umfang n der Stichprobe sowie von der vorgegebenen Irrtumswahrscheinlichkeit α für den Fehler 1. Art abhängig sind. Dann gilt:

x ist Ausreißer, wenn G1 > gn,α bzw. x<n> ist Ausreißer, wenn Gn > gn;α. (C28)

Im Zusammenhang mit der Schätzung von Konfidenzgrenzen für den Erwartungswert von normal oder lognormal verteilten Zufallsgrößen wird empfohlen, den GRUBBS-Test mit einer zulässigen Irrtumswahrscheinlichkeit von α = 0,01 vorzunehmen. Eine größere Irrtumswahrscheinlichkeit (z.B. Α = 0,05) würde dazu führen, dass zu viele kleine bzw. große Messwerte irrtümlich aus der Stichprobe separiert werden, was erhebliche Fehler bei weiteren Berechnungen und Bewertungen zur Folge haben könnte. Gewinnt man aus einer (reinen) normal verteilten Grundgesamtheit eine sehr große Anzahl von Stichproben mit gleichen Umfängen n, so werden im Durchschnitt α·100 % der kleinsten Werte x<1>, und α·100 % der Maximalwerte x<n> irrtümlich als Ausreißer klassifiziert.

Für 5 ≤; n ≤; 100 sind die kritischen Werte gn;α für den GRUBBS-Test, bei deren Überschreitung durch die Prüfgrößen (C27) der Extremwert x<1> bzw. x<n> gemäß (C28) als Ausreißer zu klassifizieren ist, in Tabelle C2 für die Irrtumswahrscheinlichkeiten von Α = 0,01 und Α = 0,05 angegeben.

Die kritischen Werte gn,α können gemäß [C4] mit einer zur Anwendung hinreichenden Genauigkeit durch folgende Näherungen berechnet werden, die für Stichprobenumfänge 5 ≤; n ≤; 10.000 gelten:

(C29)
(C30)

wobei kp das P%-Perzentil der Standardnormalverteilung bezeichnet (FN(0;1)(kp) = P). Mit den Wahrscheinlichkeiten P(n,α) stellen die Perzentile kp(n,a) kritische Werte für den Ausreißertest bei bekannten Werten der Parameter μ, σ der Normalverteilung dar.

C.4 Schätzung des Untergrundwertes c für gestörte Lognormalverteilungen

In der Realität treten relativ oft Überlagerungen von lognormal verteilten Zufallsgrößen Y ~ Ln(μ;σ) mit einem Untergrund C auf, der im Vergleich zu Y nur geringe Schwankungen aufweist. Die reale Messgröße ist dann Z = Y + C. Wird für C vereinfachend ein konstanter Wert c angenommen, so kann dessen Verteilungsdichte durch die DIRAC'sche Deltafunktion approximiert werden:

fc(t) = δ (t-c) . (C31)

Mit der Verteilungsdichte Gl. (C6) für den lognormal verteilten Anteil Y folgt dann:

(C32)

Bei einer Zufallsgröße Z = C + Y ~ c + Ln(μ ; σ ) mit einer Verteilungsdichte der Form (C32) spricht man von einer "Drei-Parameter-Lognormalverteilung" [C1] bzw. auch von einer "Lognormalverteilung, die durch einen konstanten Untergrund gestört ist" [C4].

Offensichtlich ist es erforderlich, bei der Schätzung der Parameter μ und σ (siehe Abschnitt C.2) sowie für die Prüfung einer Stichprobe hinsichtlich möglicher Ausreißer (siehe Abschnitt C.3) zunächst einen in den Messwerten der Stichprobe enthaltenen Untergrund zu separieren, weil sonst die Annahme, dass die Logarithmen der Messwerte Realisierungen einer normal verteilten Größe sind, nicht zutrifft. Es ist zwar X = ln(Y) normal verteilt, nicht jedoch ln(Z) =ln (c + Y). Wird ein vorhandener Untergrundwert c einer gestörten Lognormalverteilung nicht beachtet, so kann dies gravierende Fehler bei der Schätzung weiterer Kenngrößen, z.B. des Erwartungswertes E oder seiner Konfidenzgrenzen, bewirken [C4].

Wenn der Untergrundwert c einen relativ hohen Beitrag zu den Messwerten einer Stichprobe bildet, so ist dies z.B. im Quantil-Quantil-Plot (Q-Q-Plot) der Logarithmen der nach der Größe geordneten Messwerte z über den Perzentilen kPi der Standardnormalverteilung zu den Wahrscheinlichkeiten

(C33)

ersichtlich, wie in Abbildung C3 beispielhaft dargestellt. Sie zeigt den Q-Q-Plot einer zufälligen Stichprobe vom Umfang n = 30 aus einer Lognormalverteilung Y Ln(μ;σ) mit den folgenden nach der Größe geordneten Werten y und den Q-Q-Plot für die mit einem Untergrund von c = 50 gestörten Messwerte z = 50 + y:

y : 4; 6; 10; 19; 28; 32; 39; 42; 47; 49; 56; 61; 70; 73; 79; 89; 136;
146; 150; 227; 265; 331; 445; 528; 607; 805; 1321; 1814; 2325; 4197.
(C34)

In Abbildung C3 zeigt die ungestörte Stichprobe von Y eine starke lineare Relation zwischen den Logarithmen ln(y) der geordneten Stichprobenwerte und den Perzentilen kPi, was am hohen Wert des Bestimmtheitsmaßes R2 abzulesen ist. Für die mit c = 50 gestörte Stichprobe von Z = c + Y zeigt der Q-Q-Plot dagegen eine deutliche Krümmung - die Kurve "hängt" im Bereich der kleinen Daten über dem Logarithmus ln(c) des Untergrundwertes. Für starke Störungen von Lognormalverteilungen durch einen Untergrund ist dies ein charakteristisches Merkmal.

Zur Schätzung des Untergrundwertes c aus den Messwerten zi (i = 1 bis n ) der Stichprobe kommen verschiedene, i.W. gleichwertige Methoden in Betracht. Nach [C4] sind besonders die Maximierung des Bestimmtheitsmaßes R2(c) im QQ-Plot und die Suche der Nullstelle der Schiefe S(c) geeignet.

Es werden die folgenden Bezeichnungen verwendet: z ist der i-te der nach der Größe geordneten Werte von {z}n;

(C35)


(C36)


(C37)

Die erste Methode erfordert die Ermittlung des Wertes cR, für den das Bestimmtheitsmaß

Tabelle C2: Kritische Werte gn;a für den GRUBBS-Ausreißertest für Stichprobenumfänge n von 5 bis 100 für die Irrtumswahrscheinlichkeiten α = 0,01 und α = 0,05; aus [C1]

n gn;0,01 gn;0,05 n gn;0,01 gn;0,05 n gn;0,01 gn;0,05 n gn;0,01 gn;0,05
5 1,749 1,672 29 3,085 2,730 53 3,361 2,978 77 3,507 3,116
6 1,944 1,822 30 3,103 2,745 54 3,368 2,986 78 3,512 3,121
7 2,097 1,938 31 3,119 2,759 55 3,376 2,992 79 3,517 3,125
8 2,221 2,032 32 3,135 2,773 56 3,383 3,000 80 3,521 3,130
9 2,323 2,110 33 3,150 2,786 57 3,390 3,006 81 3,525 3,134
10 2,410 2,176 34 3,164 2,799 58 3,397 3,013 82 3,529 3,139
11 2,485 2,234 35 3,178 2,811 59 3,404 3,019 83 3,534 3,143
12 2,550 2,285 36 3,191 2,823 60 3,411 3,025 84 3,539 3,147
13 2,607 2,331 37 3,204 2,835 61 3,418 3,032 85 3,543 3,151
14 2,659 2,371 38 3,216 2,846 62 3,424 3,038 86 3,547 3,155
15 2,705 2,409 39 3,228 2,857 63 3,430 3,044 87 3,551 3,159
16 2,747 2,443 40 3,240 2,866 64 3,436 3,049 88 3,555 3,163
17 2,785 2,475 41 3,251 2,877 65 3,442 3,055 89 3,559 3,167
18 2,821 2,504 42 3,261 2,887 66 3,448 3,061 90 3,563 3,171
19 2,854 2,532 43 3,271 2,896 67 3,454 3,066 91 3,567 3,174
20 2,884 2,557 44 3,282 2,905 68 3,460 3,071 92 3,571 3,178
21 2,912 2,580 45 3,292 2,914 69 3,466 3,076 93 3,575 3,182
22 2,939 2,603 46 3,301 2,923 70 3,471 3,082 94 3,579 3,186
23 2,963 2,624 47 3,310 2,931 71 3,476 3,087 95 3,583 3,189
24 2,987 2,644 48 3,319 2,940 72 3,482 3,092 96 3,586 3,193
25 3,009 2,663 49 3,329 2,948 73 3,487 3,098 97 3,589 3,197
26 3,029 2,681 50 3,337 2,956 74 3,492 3,102 98 3,593 3,201
27 3,049 2,698 51 3,345 2,964 75 3,497 3,107 99 3,597 3,204
28 3,068 2,714 52 3,353 2,971 76 3,502 3,111 100 3,600 3,207


(C38)

im Bereich c < z<1> ein Maximum erreicht; kp ist das P · 100%-Perzentil der Standard-Normalverteilung.

In Gl. (C38) sind die durch Gl. (C33) definierten Wahrscheinlichkeiten Pi zu verwenden.

Die zweite Methode erfordert die Ermittlung der Nullstelle cs der standardisierten Schiefe

(C39)

im Bereich c < z<1>.

Die für eine Stichprobe {z}n resultierenden Werte cR und cs können etwas voneinander abweichen. Im Sinne eines besten Schätzwertes für den konstanten Untergrund c kann mit

(C40)

gerechnet werden.

In den Abbildungen C4 und C5 sind für das Beispiel (C34) die Ergebnisse einer Schätzung des Untergrundwertes für die mit c = 50 gestörte Stichprobe {z<1>}n = {c + y<1>}n dargestellt. Die beiden nach den oben erläuterten Methoden resultierenden Schätzwerte sind in diesem Fall: cR = 51,3 und cs = 51,7. Gemäß Gl. (C40) würde man mit einem geschätzten Untergrund von c = 51,5 rechnen, der dem wahren Wert hinreichend genau entspricht.

Abbildung C3: Q-Q-Plot für die ungestörte Stichprobe {y}n, (C34) aus einer Lognormalverteilung und für die durch einen Untergrund von c = 50 gestörte Probe {z}n = {c + y}n

Abbildung C4: Schätzung des Untergrundwertes cR durch Bestimmung des Maximums des Bestimmtheitsmaßes R2(c); mit c = 50 gestörte Stichprobe {z}n = {c + y}n; y aus (C34)

Abbildung C5: Schätzung des Untergrundwertes cs durch Bestimmung des Nulldurchgangs der Schiefe S(c); mit c = 50 gestörte Stichprobe {z}n = {c + y}n y aus (C34)

C.5 Literatur

[C1] RINNE, H.
Taschenbuch der Statistik
Verlag Harri Deutsch, Thun und Frankfurt am Main, 1997

[C2] COHEN, A.C.
Simplified Estimators for the Normal Distribution When Samples Are Singly Censored or Truncated, Technometrics 1 (1959), pp. 217 - 237

[C3] GRUBBS, F.E
Procedures for Detecting Outlying Observations in Samples
Technometrics, 11 (1969), pp. 1 - 21

[C4] BARTHEL, R.
Statistische Auswertung von Stichproben lognormal verteilter Größen für realistisch-konservative radioökologische Bewertungen, in: Aktuelle und zukünftige Aufgaben in der Radioökologie - Klausurtagung des Ausschusses "Radioökologie" der Strahlenschutzkommission am 25./26. Juli 2001; Veröffentlichungen der Strahlenschutzkommission Band 49, S. 207 - 280, Urban & Fischer, München, Jena, 2003

UWS Umweltmanagement GmbH weiter . Frame öffnen