Statistik-FAQ
Grundbegriffe und Interpretation
Ist ein p-Wert von .051 noch signifikant?
Nein. Die übliche Grenze für statistische Signifikanz liegt bei einem p-Wert von 0,05. Ein Wert von 0,051 liegt knapp darüber und gilt damit nach der klassischen Konvention nicht mehr als signifikant, auch wenn der Unterschied zu einem Wert knapp unter 0,05 inhaltlich meist marginal ist.
Was bedeutet Varianzhomogenität?
Varianzhomogenität bedeutet, dass die Streuung (Varianz) einer Variable in den verglichenen Gruppen ungefähr gleich groß ist. Diese Annahme ist Voraussetzung für viele Testverfahren wie den t-Test oder die ANOVA und ist verletzt, wenn eine Gruppe deutlich stärker streut als eine andere.
Wie interpretiere ich die Schiefe (Skewness) einer Verteilung?
Die Schiefe zeigt, ob eine Verteilung symmetrisch ist oder zu einer Seite hin ausläuft. Werte zwischen -2 und +2 gelten meist als akzeptabel für eine annähernd normalverteilte Variable. Positive Werte deuten auf eine rechtsschiefe Verteilung, negative Werte auf eine linksschiefe Verteilung. Zusätzlich zur Kennzahl hilft ein Q-Q-Diagramm oder ein Histogramm, die Form der Verteilung visuell zu prüfen.
Muss ich bei Effektstärken Konfidenzintervalle angeben?
Das hängt vom Zweck ab. Willst du Effektstärken zwischen mehreren Modellen oder Gruppen vergleichen, sind Konfidenzintervalle sinnvoll, weil sie zeigen, wie präzise die Schätzung ist. Geht es nur um eine einzelne Effektstärke ohne Vergleich, sind sie hilfreich, aber nicht zwingend erforderlich.
Was bedeutet eine Hazard Ratio von 1,7?
Eine Hazard Ratio von 1,7 bedeutet, dass in der betrachteten Gruppe das Risiko für das untersuchte Ereignis, zum Beispiel ein Rückfall oder ein Todesfall, 1,7-mal so hoch ist wie in der Referenzgruppe, also um 70 Prozent erhöht. Eine Hazard Ratio unter 1 zeigt entsprechend ein verringertes Risiko an.
Besteht immer ein linearer Zusammenhang, wenn die Pearson-Korrelation nicht Null ist?
Nein. Eine Pearson-Korrelation ungleich Null zeigt nur, dass irgendein linearer Zusammenhang zwischen den Variablen besteht, sagt aber nichts darüber aus, ob zusätzlich noch ein nicht-linearer Zusammenhang vorliegt. Es kann durchaus parallel eine kurvenförmige Beziehung existieren, die der lineare Korrelationskoeffizient nicht vollständig abbildet.
Normalverteilung und Voraussetzungen
Wie kann ich einschätzen, ob meine Daten normalverteilt sind?
Am einfachsten mit einem Q-Q-Diagramm. Liegen die Punkte im Q-Q-Diagramm nah an der Diagonalen, spricht das für eine Normalverteilung. Ergänzend gibt es formale Tests wie den Shapiro-Wilk-Test, deren Ergebnis du aber immer zusammen mit der grafischen Prüfung interpretieren solltest, da es von der Fallzahl abhängt.
Wie kann ich Homoskedastizität erkennen?
Indem du die Residuen deiner Regression betrachtest und grafisch darstellst, zum Beispiel in einem Streudiagramm der Residuen gegen die vorhergesagten Werte. Streuen die Residuen über den gesamten Wertebereich etwa gleichmäßig, liegt Homoskedastizität vor. Nimmt die Streuung systematisch zu oder ab, deutet das auf Heteroskedastizität hin.
Muss ich bei einem t-Test die Normalverteilung für jede Gruppe prüfen?
Ja. Beim t-Test für unabhängige Stichproben musst du die Normalverteilung für jede Gruppe getrennt prüfen, nicht nur für die Gesamtstichprobe.
Stichprobe und Fallzahl
Ab welcher Stichprobengröße macht eine statistische Analyse Sinn?
Rein rechnerisch ist eine Analyse schon ab einer Stichprobengröße von n=3 rechenbar, sinnvoll interpretierbar wird eine Analyse aber erst mit deutlich mehr Fällen. Wie viele genau nötig sind, hängt stark vom Fachgebiet ab, in Tierversuchen wird teils mit n=5 gearbeitet, in den Wirtschaftswissenschaften oft erst ab n=200. Grundsätzlich gilt: Je kleiner die Stichprobe, desto geringer die Teststärke, echte Effekte überhaupt nachzuweisen.
Kann eine größere Stichprobe fehlende Signifikanz herstellen?
Ja, im Extremfall kann praktisch jeder noch so kleine, inhaltlich vielleicht irrelevante Effekt signifikant werden, wenn die Stichprobe nur groß genug ist. Statistische Signifikanz bei sehr großen Stichproben sagt deshalb wenig über die praktische Bedeutsamkeit eines Effekts aus, dafür lohnt sich zusätzlich immer ein Blick auf die Effektstärke.
Wo berichte ich eine a-priori Poweranalyse?
Am besten im Methodenteil, entweder im Abschnitt zur Datenerhebung oder direkt bei der Beschreibung der Stichprobe und der Fallzahlplanung. Wichtig ist, dass für Lesende nachvollziehbar wird, mit welchen Annahmen, etwa erwartete Effektstärke, Signifikanzniveau und gewünschte Power, die benötigte Stichprobengröße im Vorfeld berechnet wurde.
Die passende Testverfahren wählen
Wann ist der Kruskal-Wallis-Test geeignet?
Der Kruskal-Wallis-Test eignet sich, wenn du mehr als zwei Gruppen miteinander vergleichen willst und deine Daten nicht normalverteilt sind. Als nicht-parametrisches Verfahren arbeitet er mit Rängen statt mit den Originalwerten und reagiert dadurch robuster auf Ausreißer als eine klassische ANOVA.
Wofür kann ich den Chi-Quadrat-Test anwenden?
Der Chi-Quadrat-Test-Unabhängigkeitstest prüft, ob ein Unterschied zwischen zwei oder mehr Gruppen hinsichtlich einer kategorialen Variable besteht. Er wird auf Basis von Kreuztabellen berechnet, zum Beispiel um zu untersuchen, ob sich der Anteil einer bestimmten Antwortkategorie zwischen verschiedenen Gruppen unterscheidet.
Chi-Quadrat-Test oder Kruskal-Wallis-Test, was ist der Unterschied?
Der Chi-Quadrat-Test behandelt eine ordinale Variable wie eine rein kategoriale ohne Rangordnung und kann deshalb nur Häufigkeiten vergleichen, nicht aber prüfen, ob ein echter Lageunterschied zwischen den Gruppen besteht. Der Kruskal-Wallis-Test dagegen berücksichtigt die Rangordnung und prüft gezielt, ob sich die Gruppen in der Lage der Variable unterscheiden.
Mann-Whitney-U-Test oder Spearman-Korrelation, was ist der Unterschied?
Der Mann-Whitney-U-Test prüft, ob sich zwei unabhängige Gruppen hinsichtlich einer zweiten Variable unterscheiden. Die Spearman-Korrelation dagegen untersucht den Zusammenhang zwischen zwei mindestens ordinalskalierten Variablen, ohne dass eine davon eine Gruppierungsvariable sein muss. Es geht also um zwei unterschiedliche Fragestellungen: Gruppenunterschied versus Zusammenhang.
Ist der Pearson-Korrelationskoeffizient identisch mit Spearmans Rho?
Nein. Der Pearson-Korrelationskoeffizient ist das parametrische, lineare Zusammenhangsmaß für zwei metrische, normalverteilte Variablen. Spearmans Rho ist die nicht-parametrische Alternative und eignet sich besser, wenn mindestens eine der beiden Variablen nicht normalverteilt oder nur ordinal skaliert ist, oder ein nicht-linearer Zusammenhang untersucht wird.
Regression und Zusammenhänge
Was bedeutet ein niedriger R-Quadrat-Wert in einer linearen Regression?
Es gibt keinen festen Grenzwert, ab dem ein Modell als gut genug gilt. Für ein Prognosemodell, das möglichst genaue Vorhersagen liefern soll, ist ein hoher R-Quadrat-Wert, oft ab etwa 0,8, wünschenswert. Geht es dagegen um die Untersuchung von Effekten, was in der Forschung meist der Fall ist, ist ein niedriger R-Quadrat-Wert kein Problem an sich, sondern nur relevant, wenn du verschiedene Modelle direkt miteinander vergleichst.
Wie interpretiere ich Koeffizienten bei einer logtransformierten abhängigen Variable?
Die Richtung des Effekts und die Signifikanz liest du wie gewohnt ab, die Logtransformation ändert daran nichts. Der Betrag des Koeffizienten beschreibt zunächst die Veränderung auf der logarithmierten Skala. Möchtest du den Effekt in der ursprünglichen Einheit ausdrücken, musst du ihn über die Umkehrfunktion des Logarithmus (Exponentialfunktion) zurückrechnen.
Muss ich Ausreißer bei einer linearen Regression unbedingt löschen?
Nein, aber du solltest sie genauer prüfen. Schau dir an, ob es sich um einen inhaltlich plausiblen oder eher fehlerhaften Datenpunkt handelt, und rechne dein Modell testweise einmal mit und einmal ohne diesen Fall, um die Auswirkung zu sehen. Wer mit Bootstrapping arbeitet, bekommt ohnehin robustere Ergebnisse, die weniger empfindlich auf einzelne Ausreißer reagieren.
ANOVA und Gruppenvergleiche
ANCOVA oder gemischte ANOVA, was ist der Unterschied?
Beide Verfahren lassen sich bei einem Prä-Post-Design einsetzen, beantworten aber unterschiedliche Fragen. Die gemischte ANOVA untersucht, wie stark sich die Werte von der Vorher- zur Nachher-Messung durch das Treatment verändern. Die ANCOVA untersucht dagegen, wie sich das Treatment auf den Nachher-Wert auswirkt, wenn für den Vorher-Wert statistisch kontrolliert wird. In der Praxis führen beide Verfahren oft zu ähnlichen Ergebnissen, die konzeptionelle Frage bleibt aber wichtig für die Interpretation.
Muss ich für signifikante Haupteffekte Post-Hoc-Tests durchführen?
Nur wenn du mehr als zwei Gruppen hast und dich die einzelnen Gruppenunterschiede inhaltlich interessieren. Bei nur zwei Gruppen oder zwei Messzeitpunkten reicht es dagegen aus, die Richtung des Effekts anhand der deskriptiven Statistik zu beschreiben.
Welche nicht-parametrischen Alternativen gibt es zur einfaktoriellen ANOVA?
Für eine einfaktorielle Analyse ohne Messwiederholung ist der Kruskal-Wallis-Test die passende nicht-parametrische Alternative. Bei einer Messwiederholungs-Analyse verwendest du stattdessen den Friedman-Test.
Überlebenszeitanalyse und Diagnostik
Kaplan-Meier, Cox-Regression oder Log-Rang-Test, was ist der Unterschied?
Die Kaplan-Meier-Kurve stellt die Überlebensrate über die Zeit grafisch dar. Der Log-Rang-Test vergleicht zwei oder mehr solcher Kurven miteinander, um zu prüfen, ob sich die Gruppen signifikant unterscheiden. Die Cox-Regression geht einen Schritt weiter und untersucht den Einfluss mehrerer Prädiktoren gleichzeitig und kann damit auch Kontrollvariablen berücksichtigen. Gibt es nur einen, kategorialen Prädiktor, reicht der einfachere Log-Rang-Test aus.
Was ist eine ROC-Kurve?
Eine ROC-Kurve (Receiver Operating Characteristic) ist eine grafische Darstellung, wie gut ein diagnostischer Test zwischen zwei Zuständen unterscheidet, zum Beispiel zwischen krank und gesund. Sie zeigt das Verhältnis von richtig-positiven zu falsch-positiven Ergebnissen bei unterschiedlichen Schwellenwerten und wird häufig in der medizinischen Diagnostik verwendet.
Effektstärken
Wie berechne ich Cohens d für einen t-Test?
Cohens d wird meist berechnet, indem man die Differenz der beiden Gruppenmittelwerte durch die gepoolte Standardabweichung beider Gruppen teilt. Alternativ kann man auch durch die Standardabweichung nur einer der beiden Gruppen teilen, je nach Fragestellung ergibt das leicht unterschiedliche Werte. Wichtig ist, dass du angibst, welche der beiden Formeln du verwendet hast.
Wann verwende ich Cohens d und wann Eta-Quadrat als Effektstärkemaß?
Cohens d nutzt du beim Vergleich von genau zwei Gruppen, meist also dort, wo du auch einen t-Test rechnest. Sobald du eine ANOVA mit mehr als zwei Gruppen oder mehreren Faktoren rechnest, verwendest du stattdessen Eta-Quadrat beziehungsweise bei mehrfaktoriellen Designs das partielle Eta-Quadrat.
Stichprobenverfahren und Studiendesign
Ad-hoc-Stichprobe oder Convenience-Sampling, was ist der Unterschied?
Beide Begriffe werden in der Praxis teils synonym verwendet. Manche verstehen Convenience-Sampling als übergeordneten Begriff für verschiedene Stichprobenverfahren, die keine echten Zufallsstichproben sind, wozu dann auch die Ad-hoc-Stichprobe zählt, ebenso wie zum Beispiel das Schneeballverfahren, bei dem befragte Personen weitere Personen aus ihrem Umfeld vermitteln.
Wie kann ich einen Selektionsbias bei einer Online-Umfrage vermeiden?
Ganz vermeiden lässt er sich selten, du kannst ihn aber verringern. Achte darauf, dass möglichst viele passende Personen aus deiner Zielgruppe teilnehmen, erhebe soziodemografische Merkmale, um deine Stichprobe gut beschreiben zu können, und ziehe in Betracht, deine Daten zu gewichten oder Kontrollvariablen in die Analyse aufzunehmen. Eine größere Teilnehmerzahl macht die Ergebnisse zwar präziser, verringert den Selektionsbias selbst aber nicht automatisch.
Du hast hier keine passende Antwort gefunden? Im Basis-Zugang der Statistik-Akademie beantworte ich noch weit mehr Fragen rund um Statistik und Datenanalyse.