Jenseits des p-Werts. Besser forschen.

Workshops · Methoden · Werkzeuge für eine bessere Forschungspraxis

Beyond p-values · HMU Health and Medical University Erfurt

Alles zum Mitlesen

Alles, was heute kommt, steht dauerhaft online.

https://hannesdiemerling.github.io/Frequent-Reformation/

Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.

Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.

Der Hub, Startseite

Ein Test zum Aufwärmen

Mitmachen

Eine Studie berichtet p = .01. Sechs Aussagen. Handzeichen bei jeder, die richtig ist.

Welche dieser Aussagen ist richtig?

Eine Studie vergleicht zwei Gruppen und berichtet p = .01.

  1. Die Nullhypothese ist mit 1 % Wahrscheinlichkeit wahr.
  2. Der Effekt ist real, denn p liegt unter .05.
  3. Der Effekt ist groß, jedenfalls größer als bei p = .04.
  4. Die Wahrscheinlichkeit, dass sich der Befund replizieren lässt, ist 99 %.
  5. Die Wahrscheinlichkeit, dass das Ergebnis reiner Zufall war, ist 1 %.
  6. Wäre p größer als .05, gäbe es keinen Effekt.

Handzeichen bitte. Bei jeder Aussage einzeln.

Alle sechs sind falsch

Keine einzige der sechs Aussagen trifft zu. Sie sind nicht ungenau, sie sind falsch.

~ 90 % der Forschenden interpretieren mindestens eine Aussage zum p-Wert falsch. Haller & Krauss (2002)

auch die Lehrenden Dieselbe Untersuchung zeigt: auch Personen, die Methoden unterrichten, liegen daneben.

Das ist kein Wissensproblem einzelner Personen. Es ist ein strukturelles Problem der Ausbildung.

Was der p-Wert tatsächlich ist

Der p-Wert ist die Wahrscheinlichkeit, ein mindestens so extremes Ergebnis wie das beobachtete zu sehen, wenn die Nullhypothese wahr wäre und alle Modellannahmen zutreffen.

Er beschreibt also eine Eigenschaft der Daten unter einer Annahme. Nicht eine Eigenschaft der Hypothese.

Das klingt nach einer Feinheit. Es ist der ganze Unterschied.

Er sagt nichts darüber,

  • wie wahrscheinlich die Nullhypothese ist,
  • wie wahrscheinlich deine Alternativhypothese ist,
  • wie groß der gefundene Effekt ist,
  • wie wichtig oder bedeutsam der Effekt ist,
  • wie wahrscheinlich es ist, das Ergebnis zu replizieren,
  • oder ob ein Effekt überhaupt existiert.

Genau das sind aber die sechs Fragen, die wir eigentlich stellen wollen.

Kein Randproblem

61 % Falsch-positiv-Rate, wenn übliche fragwürdige Forschungspraktiken (QRPs) zusammenkommen. Simmons et al. (2011)

~ 90 % der Forschenden interpretieren mindestens eine Aussage zum p-Wert falsch. Haller & Krauss (2002)

.05 eine willkürliche Schwelle, die zur Trennung von wahr und falsch geworden ist.

2015 verzichtet Basic and Applied Social Psychology als erstes Journal vollständig auf p-Werte.

The earth is round (p < .05).

Jacob Cohen, 1994

Die Folgekette

Schritt 01

Publikationsbias

Signifikante Ergebnisse werden bevorzugt publiziert. Die Literatur verzerrt sich systematisch, Effekte werden im Mittel überschätzt.

Schritt 02

Fragwürdige Praktiken

Die Jagd nach p < .05 belohnt p-Hacking, optionales Weitertesten, selektives Reporting und HARKing.

Schritt 03

Replikationen scheitern

Weil sie mit realistischeren, also kleineren Effekten arbeiten als die Originalstudien behaupten.

Simmons et al. (2011): durch übliche QRPs steigt die effektive Falsch-positiv-Rate von 5 % auf bis zu 61 %. Im Extremfall ein zwölffach erhöhter Falsch-positiv-Anteil.

Und das bleibt nicht im Journal

The Cult of Statistical Significance: How the Standard Error Costs Us Jobs, Justice, and Lives.

Ziliak und McCloskey, 2008

Therapien, Maßnahmen und politische Entscheidungen stützen sich auf signifikante Ergebnisse, die in Wahrheit Zufallsbefunde sind oder Effekte beschreiben, die für die Praxis irrelevant klein sind.

… one of the worst things that ever happened in the history of psychology.

Paul Meehl über den Signifikanztest, 1978

Kurze Selbstprüfung

Mitmachen, ehrlich und ohne Konsequenzen

Welche dieser Praktiken kennst du aus eigener Arbeit, aus einem Projekt oder aus einem Gutachten?

  • Nach dem ersten Blick in die Daten noch ein paar Fälle erheben.
  • Auffällige Werte entfernen, weil sie ja offensichtlich Messfehler sind.
  • Von mehreren erhobenen Maßen das berichten, das funktioniert hat.
  • Eine Kovariate aufnehmen oder weglassen, je nachdem was passt.
  • Die Hypothese nachträglich an das Ergebnis anpassen.

Handzeichen. Oder auch nicht, das ist gleich gültig.

Die gute Nachricht

Die Wende

Bessere Alternativen existieren seit Jahrzehnten. Sie sind technisch ausgereift, didaktisch gut beschrieben und in moderner Software niederschwellig verfügbar.

Was fehlt, ist die flächendeckende Anwendung.

Drei Fragen, die jede Studie beantworten sollte

Frage 01

Gibt es einen Effekt, und wie groß?

Antwort: Effekte und Effektgrößen. Der p-Wert kann das prinzipbedingt nicht.

Frage 02

Wie verlässlich ist die Schätzung?

Antwort: Stichprobenqualität und Stichprobengröße. Nicht jede pauschale Power-Tabelle.

Frage 03

Was sagen die Daten über die Hypothese?

Antwort: Bayesianische Datenanalyse. Wahrscheinlichkeiten für Hypothesen statt Sieger-Verlierer-Schema.

Praktisch jede empirische Studie versucht, eine dieser drei Fragen zu beantworten. Der klassische Signifikanztest beantwortet keine davon vollständig.

Antwort 01: Effekte berichten

Unstandardisiert. Die Größe in der Einheit der Sache:

die Therapie reduziert Depressionswerte im BDI-II um 4,2 Punkte

Das versteht die Praxis sofort. Es ist die Brücke von der Statistik in die Realität.

Standardisiert. Die Größe auf gemeinsamer Skala:

d = 0.42, 95 % CI [0.18, 0.66]

Vergleichbar über Studien und Skalen hinweg. Immer mit Intervall.

The primary product of a research inquiry is one or more measures of effect size, not p values.

Jacob Cohen, 1994

Aber Vorsicht mit den Faustregeln

Cohen schlug 1988 klein 0.2 · mittel 0.5 · groß 0.8 vor, als grobe Orientierung, wenn keine fachspezifischen Vergleichswerte vorliegen.

In der Praxis wird das häufig als Naturgesetz gelesen.

Domänenwissen schlägt Faustregel. Ein d = 0.2 für eine Suizidpräventions-Intervention ist riesig. Ein d = 0.5 für ein neues Lernformat in einem etablierten Feld ist eher mittelmäßig.

Vergleiche immer mit publizierten Effekten in deiner Subdisziplin.

Schäfer & Schwarz (2019). The meaningfulness of effect sizes in psychological research. Frontiers in Psychology.

Antwort 02: Die Stichprobe ehrlich planen

Erst Qualität, dann Größe.

Eine systematisch verzerrte Stichprobe liefert falsche Ergebnisse, egal wie groß sie ist. Mehr Fälle heilen keine Verzerrung, sie machen den falschen Wert nur präziser.

WEIRD-Stichproben (Western, Educated, Industrialised, Rich, Democratic) dominieren die Forschung bis heute.

Drop-out ist ein Auswahlmechanismus.

Wenn 30 % deiner Stichprobe abbrechen und das nicht zufällig geschieht, hast du keine repräsentative Stichprobe mehr. Egal wie sorgfältig du gezogen hast.

Drei Wege zur Stichprobengröße

Weg 01, verbreitet

Power-Analyse

Wie viele brauche ich, um mit 80 % Wahrscheinlichkeit einen signifikanten p-Wert zu finden, wenn der wahre Effekt d = 0.5 ist?

Setzt genau das voraus, was man wissen will.

Weg 02, empfohlen

Präzisionsplanung

Wie viele brauche ich, damit mein Intervall schmaler wird als ± 0.15?

Direkter, ehrlicher, planbarer.

Weg 03, bayesianisch

Bayes-Faktor-Design

Wie viele brauche ich, damit der Bayes-Faktor mit hoher Wahrscheinlichkeit ≥ 10 wird, falls H₁ stimmt?

Und in allen drei Fällen gilt: mit 10 bis 20 Zeilen Simulationscode bekommst du eine ehrlichere Antwort als aus jeder Tabelle. Um den Fehler zu halbieren, brauchst du die vierfache Stichprobe.

Antwort 03: Die Frage umdrehen

Statt „wie wahrscheinlich sind meine Daten, wenn nichts los ist?“ fragen wir:

Was glaube ich über die Welt, und wie ändert sich dieser Glaube, sobald neue Daten eintreffen?

\[P(\theta \mid D) = \frac{P(D \mid \theta)\, P(\theta)}{P(D)}\]

In Worten: Posterior = (Likelihood × Prior) / Evidenz.

Vorwissen wird nicht versteckt, sondern explizit gemacht und damit angreifbar.

Was du dadurch sagen darfst

Beim Konfidenzintervall ist die intuitive Lesart falsch. Es beschreibt die langfristige Erfolgsquote des Verfahrens, nicht die Lage des wahren Werts.

Beim Glaubwürdigkeitsintervall ist genau die intuitive Lesart richtig:

Mit 95 % Wahrscheinlichkeit liegt der wahre Wert in diesem Bereich.

Oder direkt entscheidungsnah:

Mit 87 % Wahrscheinlichkeit ist der Effekt mindestens d = 0.3.

Bayes-Faktor: Evidenzstärke statt Schwelle

BF₁₀ Evidenz für H₁
1 – 3 anekdotisch
3 – 10 moderat
10 – 30 stark
30 – 100 sehr stark
> 100 extrem

Dieselben Stufen gelten symmetrisch für BF₀₁, also Evidenz für die Nullhypothese. Genau das kann der Signifikanztest nicht.

Stufen nach Lee & Wagenmakers (2013).

Genug Theorie. Schauen wir zu.

Live-Demo

Die Workshops laufen vollständig im Browser. Kein Konto, keine Installation, Python läuft direkt auf deinem Rechner in der Webseite.

Was wir gleich sehen, ist Kapitel 2 aus dem ersten Workshop:

SmartRail verbessert die Pünktlichkeit um 12 Sekunden. Der Effekt ändert sich im Folgenden nicht. Nur die Stichprobengröße wird verschoben, von 20 Fahrten auf 5000.

Frage an den Raum, bevor ich den Schieber bewege: Was passiert mit dem p-Wert? Und was passiert mit dem Effekt?

SmartRail ist ein fiktives Pilot-System der Deutschen Bahn und zieht sich als durchgängiges Beispiel durch alle Kapitel.

p-Wert und Stichprobengröße

Beyond Significance, Kapitel 2 · live im Browser · 15 min

Was wir gerade gesehen haben

Der Effekt hat sich nie geändert. 12 Sekunden, von Anfang bis Ende.

Der p-Wert hat sich völlig geändert. Bei n = 20 unauffällig, bei n = 5000 hochsignifikant.

Die Signifikanz testet primär deine Stichprobengröße, nicht die Größe oder Wichtigkeit des Effekts.

Mit genug Daten wird jeder beliebig kleine Effekt signifikant.

Und die praktische Frage bleibt völlig unbeantwortet: sind 12 Sekunden pro Fahrt es wert? Das entscheidet kein p-Wert, das entscheidet der Kontext.

Das Projekt

Wir vollziehen die Wende: von einem überholten statistischen Ritual zu einer Wissenschaft, die Evidenz wirklich beurteilt.

Beyond p-values, gefördert durch die VolkswagenStiftung

Warum jetzt?

Faktor 01

Reproduzierbarkeitskrise

Seit den 2000er-Jahren ist die Bereitschaft, methodische Praxis ehrlich zu hinterfragen, so hoch wie nie.

Faktor 02

Software-Reife

JASP, Jamovi, brms und Stan haben bayesianische Analysen massentauglich gemacht.

Faktor 03

Erste Vorreiter

Journals wie Basic and Applied Social Psychology zeigen seit 2015, dass Publizieren ohne p-Werte funktioniert.

Das Wissen ist alt. Die Werkzeuge sind neu. Der Moment ist jetzt.

Was wir tun

Stufe 01

Aufklärung und Training

Workshops, Train-the-Trainer-Programme und offene Materialien. Niederschwellig und während der Förderphase kostenfrei.

Stufe 02

Strukturelle Reform

Mit Verlagen, Journals und Fachgesellschaften Richtlinien für Studienberichte ohne p-Werte entwickeln.

Stufe 03

Öffentlichkeitsarbeit

Fact-Sheets nach Vorbild der Faktenboxen des Harding-Zentrums, verständlich für die Praxis.

Stufe 04

Netzwerk und Verstetigung

Eine Online-Plattform und ein Kooperationsnetz halten die Bewegung über das Förderende hinaus aktiv und skalieren auf weitere Disziplinen sowie in den englischsprachigen Raum.

Wer dahintersteht

Projektleitung

Prof. Dr. Thomas Schäfer

Initiator des Vorhabens und wissenschaftliche Leitung. Verantwortlich für Konzeption und Antragstellung.

Umsetzung

Hannes Diemerling

Wissenschaftlicher Mitarbeiter. Entwicklung der Workshops und Materialien, Aufbau und Pflege der Plattform.

Unterstützung

Nina Isaac

Studentische Hilfskraft, Bachelor-Studentin an der HMU Erfurt. Web, Materialien und Datensätze.

In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben. Die Verantwortung für den Inhalt liegt bei den Autorinnen und Autoren.

Das Angebot

Website-Tour

Alles, was jetzt kommt, ist offen zugänglich. Kostenfrei, ohne Anmeldung, vollständig im Browser.

Drei Wege ins Material

Weg 01

Workshops

Strukturiert lernen. Drei Workshops, 18 Kapitel, jedes mit Theorie und einer interaktiven Anwendung.

Weg 02

Fragen

Themenzentriert einsteigen. Zehn konkrete Fragen, jede führt direkt ins passende Kapitel.

Weg 03

Methoden

Vertiefen und nachlesen. p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.

Wähle den Einstieg, der zu dir passt. Wer ein konkretes Problem hat, nimmt die Fragen. Wer systematisch lernen will, nimmt die Workshops.

Starte mit deiner Frage

Live auf der Website · scrollbar und klickbar

Die drei Workshops

Workshop 01 · Grundlagen 01

Beyond Significance

Warum der p-Wert nichts über Bedeutsamkeit aussagt, und wie du Effektgrößen, Praxisrelevanz und Publikationsbias greifbar machst.

6 Kapitel ca. 2 h

Workshop 02 · Methodik 02

Repräsentativität & Stichprobengröße

Von der Stichprobe zur Population: Verzerrung, p-Hacking, Schätzgenauigkeit und Unsicherheit, anschaulich am SmartRail-Szenario.

5 Kapitel ca. 1.5 h

Workshop 03 · Vertiefung 03

Denke Bayesianisch

Vom Wahrscheinlichkeitsbegriff bis zur Posterior-Verteilung. Schritt für Schritt, mit interaktiven Beispielen aus dem SmartRail-Szenario.

7 Kapitel ca. 2 h

Die Reihenfolge ist didaktisch: vom Problem (Effekte) über die Methodik (Stichproben) zur Alternative (Bayes). Jeder Workshop steht aber auch für sich.

Was du morgen anders machen kannst

  1. Berichte Effektgrößen, standardisiert und unstandardisiert, immer mit Intervall.
  2. Plane Präzision statt Power. Frage, wie schmal dein Intervall werden soll.
  3. Schreibe auf, was du vorhast, bevor du in die Daten schaust. Auch ohne formale Präregistrierung.
  4. Vergleiche deinen Effekt mit deinem Feld, nicht mit Cohens Faustregel.
  5. Nutze Nicht-Signifikanz nicht als Beleg für Abwesenheit. Oder rechne bayesianisch und bekomme eine echte Antwort.

Nichts davon braucht neue Software oder ein neues Studiendesign. Punkt 1 bis 4 sind Berichtsentscheidungen.

Danke

Das übergeordnete Ziel ist, zu zeigen und zu erklären, dass der Signifikanztest für die Beurteilung der Evidenz von Forschungsergebnissen ungeeignet ist und dass wesentlich bessere Alternativen zur Verfügung stehen.

Aus dem Antrag zum Pioniervorhaben

Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de

Alles zum Nachlesen

In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben. Inhalte unter Creative Commons CC BY 4.0.

Anhang

Reserve für Fragen

Diese Folien gehören nicht in den Durchlauf. Sie sind für die Diskussion da.

„Aber Priors sind doch subjektiv”

Der Einwand ist berechtigt und trifft zu kurz.

Jede statistische Analyse trifft Annahmen: Verteilungsform, Linearität, Unabhängigkeit, Wahl des Tests, Umgang mit Ausreißern. Priors machen eine dieser Annahmen explizit.

Eine unsichtbare Annahme ist nicht objektiver. Sie ist nur nicht kritisierbar.

Was die Praxis daraus macht

  • Schwach informative Priors schließen Unsinn aus, ohne das Ergebnis zu bestimmen.
  • Bei ausreichend Daten dominieren die Daten den Prior.
  • Sensitivitätsanalyse: dasselbe Modell mit mehreren Priors rechnen und berichten, ob sich die Schlussfolgerung ändert.

„Kann ich beides berichten?”

Ja. Es ist sogar oft sinnvoll, gerade in einem Umfeld, das p-Werte erwartet.

Wenn beide Ergebnisse einander widersprechen, liegt das meist daran, dass der p-Wert die Frage falsch beantwortet, nicht der Bayes-Faktor.

Weitere häufige Fragen und die ausführlichen Antworten stehen auf der Methoden-Seite zur bayesianischen Datenanalyse.

Schlüsselliteratur

Quelle Worum es geht
Cohen (1994). The earth is round (p < .05) Klassische Polemik gegen die Schwellen-Logik
Wasserstein & Lazar (2016) Offizieller ASA-Konsens zu p-Werten
Simmons, Nelson & Simonsohn (2011) Wie QRPs die Falsch-positiv-Rate sprengen
Haller & Krauss (2002) Selbst Methoden-Lehrende interpretieren falsch
Meehl (1978) Der Signifikanztest als historischer Irrweg
Schäfer & Schwarz (2019) Bedeutsamkeit von Effektgrößen, empirisch
Schönbrodt & Wagenmakers (2018) Bayes-Faktor-Design-Analyse
Lee & Wagenmakers (2013) Bayesianische Modellierung, inklusive BF-Stufen
McElreath, Statistical Rethinking Wahrscheinlich der beste Bayes-Einstieg

Werkzeuge, mit denen es sofort geht

Ohne Code

JASP und Jamovi

Grafische Oberfläche, klassische und bayesianische Tests nebeneinander. Ideal für Lehre und den ersten eigenen Versuch.

Mit R

brms

Formel-Syntax wie lme4, darunter Stan. brm(y ~ x + (1|id), ...) und du hast ein bayesianisches Mehrebenenmodell.

Mit Python

PyMC und Stan

Volle Kontrolle über das Modell, moderne Sampler, ArviZ für die Diagnostik.

Alle genannten Werkzeuge sind Open Source und kostenfrei.