Workshops · Methoden · Werkzeuge für eine bessere Forschungspraxis
Alles, was heute kommt, steht dauerhaft online.
https://hannesdiemerling.github.io/Frequent-Reformation/
Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.
Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.
Der Hub, Startseite
Mitmachen
Eine Studie berichtet p = .01. Sechs Aussagen. Handzeichen bei jeder, die richtig ist.
Eine Studie vergleicht zwei Gruppen und berichtet p = .01.
Handzeichen bitte. Bei jeder Aussage einzeln.
Keine einzige der sechs Aussagen trifft zu. Sie sind nicht ungenau, sie sind falsch.
~ 90 % der Forschenden interpretieren mindestens eine Aussage zum p-Wert falsch. Haller & Krauss (2002)
auch die Lehrenden Dieselbe Untersuchung zeigt: auch Personen, die Methoden unterrichten, liegen daneben.
Das ist kein Wissensproblem einzelner Personen. Es ist ein strukturelles Problem der Ausbildung.
Der p-Wert ist die Wahrscheinlichkeit, ein mindestens so extremes Ergebnis wie das beobachtete zu sehen, wenn die Nullhypothese wahr wäre und alle Modellannahmen zutreffen.
Er beschreibt also eine Eigenschaft der Daten unter einer Annahme. Nicht eine Eigenschaft der Hypothese.
Das klingt nach einer Feinheit. Es ist der ganze Unterschied.
Genau das sind aber die sechs Fragen, die wir eigentlich stellen wollen.
61 % Falsch-positiv-Rate, wenn übliche fragwürdige Forschungspraktiken (QRPs) zusammenkommen. Simmons et al. (2011)
~ 90 % der Forschenden interpretieren mindestens eine Aussage zum p-Wert falsch. Haller & Krauss (2002)
.05 eine willkürliche Schwelle, die zur Trennung von wahr und falsch geworden ist.
2015 verzichtet Basic and Applied Social Psychology als erstes Journal vollständig auf p-Werte.
The earth is round (p < .05).
Jacob Cohen, 1994
Schritt 01
Signifikante Ergebnisse werden bevorzugt publiziert. Die Literatur verzerrt sich systematisch, Effekte werden im Mittel überschätzt.
Schritt 02
Die Jagd nach p < .05 belohnt p-Hacking, optionales Weitertesten, selektives Reporting und HARKing.
Schritt 03
Weil sie mit realistischeren, also kleineren Effekten arbeiten als die Originalstudien behaupten.
Simmons et al. (2011): durch übliche QRPs steigt die effektive Falsch-positiv-Rate von 5 % auf bis zu 61 %. Im Extremfall ein zwölffach erhöhter Falsch-positiv-Anteil.
The Cult of Statistical Significance: How the Standard Error Costs Us Jobs, Justice, and Lives.
Ziliak und McCloskey, 2008
Therapien, Maßnahmen und politische Entscheidungen stützen sich auf signifikante Ergebnisse, die in Wahrheit Zufallsbefunde sind oder Effekte beschreiben, die für die Praxis irrelevant klein sind.
… one of the worst things that ever happened in the history of psychology.
Paul Meehl über den Signifikanztest, 1978
Mitmachen, ehrlich und ohne Konsequenzen
Welche dieser Praktiken kennst du aus eigener Arbeit, aus einem Projekt oder aus einem Gutachten?
Handzeichen. Oder auch nicht, das ist gleich gültig.
Die Wende
Bessere Alternativen existieren seit Jahrzehnten. Sie sind technisch ausgereift, didaktisch gut beschrieben und in moderner Software niederschwellig verfügbar.
Was fehlt, ist die flächendeckende Anwendung.
Frage 01
Antwort: Effekte und Effektgrößen. Der p-Wert kann das prinzipbedingt nicht.
Frage 02
Antwort: Stichprobenqualität und Stichprobengröße. Nicht jede pauschale Power-Tabelle.
Frage 03
Antwort: Bayesianische Datenanalyse. Wahrscheinlichkeiten für Hypothesen statt Sieger-Verlierer-Schema.
Praktisch jede empirische Studie versucht, eine dieser drei Fragen zu beantworten. Der klassische Signifikanztest beantwortet keine davon vollständig.
Unstandardisiert. Die Größe in der Einheit der Sache:
die Therapie reduziert Depressionswerte im BDI-II um 4,2 Punkte
Das versteht die Praxis sofort. Es ist die Brücke von der Statistik in die Realität.
Standardisiert. Die Größe auf gemeinsamer Skala:
d = 0.42, 95 % CI [0.18, 0.66]
Vergleichbar über Studien und Skalen hinweg. Immer mit Intervall.
The primary product of a research inquiry is one or more measures of effect size, not p values.
Jacob Cohen, 1994
Cohen schlug 1988 klein 0.2 · mittel 0.5 · groß 0.8 vor, als grobe Orientierung, wenn keine fachspezifischen Vergleichswerte vorliegen.
In der Praxis wird das häufig als Naturgesetz gelesen.
Domänenwissen schlägt Faustregel. Ein d = 0.2 für eine Suizidpräventions-Intervention ist riesig. Ein d = 0.5 für ein neues Lernformat in einem etablierten Feld ist eher mittelmäßig.
Vergleiche immer mit publizierten Effekten in deiner Subdisziplin.
Schäfer & Schwarz (2019). The meaningfulness of effect sizes in psychological research. Frontiers in Psychology.
Erst Qualität, dann Größe.
Eine systematisch verzerrte Stichprobe liefert falsche Ergebnisse, egal wie groß sie ist. Mehr Fälle heilen keine Verzerrung, sie machen den falschen Wert nur präziser.
WEIRD-Stichproben (Western, Educated, Industrialised, Rich, Democratic) dominieren die Forschung bis heute.
Drop-out ist ein Auswahlmechanismus.
Wenn 30 % deiner Stichprobe abbrechen und das nicht zufällig geschieht, hast du keine repräsentative Stichprobe mehr. Egal wie sorgfältig du gezogen hast.
Weg 01, verbreitet
Wie viele brauche ich, um mit 80 % Wahrscheinlichkeit einen signifikanten p-Wert zu finden, wenn der wahre Effekt d = 0.5 ist?
Setzt genau das voraus, was man wissen will.
Weg 02, empfohlen
Wie viele brauche ich, damit mein Intervall schmaler wird als ± 0.15?
Direkter, ehrlicher, planbarer.
Weg 03, bayesianisch
Wie viele brauche ich, damit der Bayes-Faktor mit hoher Wahrscheinlichkeit ≥ 10 wird, falls H₁ stimmt?
Und in allen drei Fällen gilt: mit 10 bis 20 Zeilen Simulationscode bekommst du eine ehrlichere Antwort als aus jeder Tabelle. Um den Fehler zu halbieren, brauchst du die vierfache Stichprobe.
Statt „wie wahrscheinlich sind meine Daten, wenn nichts los ist?“ fragen wir:
Was glaube ich über die Welt, und wie ändert sich dieser Glaube, sobald neue Daten eintreffen?
\[P(\theta \mid D) = \frac{P(D \mid \theta)\, P(\theta)}{P(D)}\]
In Worten: Posterior = (Likelihood × Prior) / Evidenz.
Vorwissen wird nicht versteckt, sondern explizit gemacht und damit angreifbar.
Beim Konfidenzintervall ist die intuitive Lesart falsch. Es beschreibt die langfristige Erfolgsquote des Verfahrens, nicht die Lage des wahren Werts.
Beim Glaubwürdigkeitsintervall ist genau die intuitive Lesart richtig:
Mit 95 % Wahrscheinlichkeit liegt der wahre Wert in diesem Bereich.
Oder direkt entscheidungsnah:
Mit 87 % Wahrscheinlichkeit ist der Effekt mindestens d = 0.3.
Bayes-Faktor: Evidenzstärke statt Schwelle
| BF₁₀ | Evidenz für H₁ |
|---|---|
| 1 – 3 | anekdotisch |
| 3 – 10 | moderat |
| 10 – 30 | stark |
| 30 – 100 | sehr stark |
| > 100 | extrem |
Dieselben Stufen gelten symmetrisch für BF₀₁, also Evidenz für die Nullhypothese. Genau das kann der Signifikanztest nicht.
Stufen nach Lee & Wagenmakers (2013).
Live-Demo
Die Workshops laufen vollständig im Browser. Kein Konto, keine Installation, Python läuft direkt auf deinem Rechner in der Webseite.
Was wir gleich sehen, ist Kapitel 2 aus dem ersten Workshop:
SmartRail verbessert die Pünktlichkeit um 12 Sekunden. Der Effekt ändert sich im Folgenden nicht. Nur die Stichprobengröße wird verschoben, von 20 Fahrten auf 5000.
Frage an den Raum, bevor ich den Schieber bewege: Was passiert mit dem p-Wert? Und was passiert mit dem Effekt?
SmartRail ist ein fiktives Pilot-System der Deutschen Bahn und zieht sich als durchgängiges Beispiel durch alle Kapitel.
Beyond Significance, Kapitel 2 · live im Browser · 15 min
Der Effekt hat sich nie geändert. 12 Sekunden, von Anfang bis Ende.
Der p-Wert hat sich völlig geändert. Bei n = 20 unauffällig, bei n = 5000 hochsignifikant.
Die Signifikanz testet primär deine Stichprobengröße, nicht die Größe oder Wichtigkeit des Effekts.
Mit genug Daten wird jeder beliebig kleine Effekt signifikant.
Und die praktische Frage bleibt völlig unbeantwortet: sind 12 Sekunden pro Fahrt es wert? Das entscheidet kein p-Wert, das entscheidet der Kontext.
Wir vollziehen die Wende: von einem überholten statistischen Ritual zu einer Wissenschaft, die Evidenz wirklich beurteilt.
Beyond p-values, gefördert durch die VolkswagenStiftung
Faktor 01
Seit den 2000er-Jahren ist die Bereitschaft, methodische Praxis ehrlich zu hinterfragen, so hoch wie nie.
Faktor 02
JASP, Jamovi, brms und Stan haben bayesianische Analysen massentauglich gemacht.
Faktor 03
Journals wie Basic and Applied Social Psychology zeigen seit 2015, dass Publizieren ohne p-Werte funktioniert.
Das Wissen ist alt. Die Werkzeuge sind neu. Der Moment ist jetzt.
Stufe 01
Workshops, Train-the-Trainer-Programme und offene Materialien. Niederschwellig und während der Förderphase kostenfrei.
Stufe 02
Mit Verlagen, Journals und Fachgesellschaften Richtlinien für Studienberichte ohne p-Werte entwickeln.
Stufe 03
Fact-Sheets nach Vorbild der Faktenboxen des Harding-Zentrums, verständlich für die Praxis.
Stufe 04
Eine Online-Plattform und ein Kooperationsnetz halten die Bewegung über das Förderende hinaus aktiv und skalieren auf weitere Disziplinen sowie in den englischsprachigen Raum.
Projektleitung
Initiator des Vorhabens und wissenschaftliche Leitung. Verantwortlich für Konzeption und Antragstellung.
Umsetzung
Wissenschaftlicher Mitarbeiter. Entwicklung der Workshops und Materialien, Aufbau und Pflege der Plattform.
Unterstützung
Studentische Hilfskraft, Bachelor-Studentin an der HMU Erfurt. Web, Materialien und Datensätze.
In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben. Die Verantwortung für den Inhalt liegt bei den Autorinnen und Autoren.
Website-Tour
Alles, was jetzt kommt, ist offen zugänglich. Kostenfrei, ohne Anmeldung, vollständig im Browser.
Weg 01
Strukturiert lernen. Drei Workshops, 18 Kapitel, jedes mit Theorie und einer interaktiven Anwendung.
Weg 02
Themenzentriert einsteigen. Zehn konkrete Fragen, jede führt direkt ins passende Kapitel.
Weg 03
Vertiefen und nachlesen. p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.
Wähle den Einstieg, der zu dir passt. Wer ein konkretes Problem hat, nimmt die Fragen. Wer systematisch lernen will, nimmt die Workshops.
Live auf der Website · scrollbar und klickbar
Workshop 01 · Grundlagen 01
Warum der p-Wert nichts über Bedeutsamkeit aussagt, und wie du Effektgrößen, Praxisrelevanz und Publikationsbias greifbar machst.
6 Kapitel ca. 2 h
Workshop 02 · Methodik 02
Von der Stichprobe zur Population: Verzerrung, p-Hacking, Schätzgenauigkeit und Unsicherheit, anschaulich am SmartRail-Szenario.
5 Kapitel ca. 1.5 h
Workshop 03 · Vertiefung 03
Vom Wahrscheinlichkeitsbegriff bis zur Posterior-Verteilung. Schritt für Schritt, mit interaktiven Beispielen aus dem SmartRail-Szenario.
7 Kapitel ca. 2 h
Die Reihenfolge ist didaktisch: vom Problem (Effekte) über die Methodik (Stichproben) zur Alternative (Bayes). Jeder Workshop steht aber auch für sich.
Nichts davon braucht neue Software oder ein neues Studiendesign. Punkt 1 bis 4 sind Berichtsentscheidungen.
Das übergeordnete Ziel ist, zu zeigen und zu erklären, dass der Signifikanztest für die Beurteilung der Evidenz von Forschungsergebnissen ungeeignet ist und dass wesentlich bessere Alternativen zur Verfügung stehen.
Aus dem Antrag zum Pioniervorhaben
Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de
Alles zum Nachlesen
In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben. Inhalte unter Creative Commons CC BY 4.0.
Reserve für Fragen
Diese Folien gehören nicht in den Durchlauf. Sie sind für die Diskussion da.
Der Einwand ist berechtigt und trifft zu kurz.
Jede statistische Analyse trifft Annahmen: Verteilungsform, Linearität, Unabhängigkeit, Wahl des Tests, Umgang mit Ausreißern. Priors machen eine dieser Annahmen explizit.
Eine unsichtbare Annahme ist nicht objektiver. Sie ist nur nicht kritisierbar.
Was die Praxis daraus macht
Ja. Es ist sogar oft sinnvoll, gerade in einem Umfeld, das p-Werte erwartet.
Wenn beide Ergebnisse einander widersprechen, liegt das meist daran, dass der p-Wert die Frage falsch beantwortet, nicht der Bayes-Faktor.
Weitere häufige Fragen und die ausführlichen Antworten stehen auf der Methoden-Seite zur bayesianischen Datenanalyse.
| Quelle | Worum es geht |
|---|---|
| Cohen (1994). The earth is round (p < .05) | Klassische Polemik gegen die Schwellen-Logik |
| Wasserstein & Lazar (2016) | Offizieller ASA-Konsens zu p-Werten |
| Simmons, Nelson & Simonsohn (2011) | Wie QRPs die Falsch-positiv-Rate sprengen |
| Haller & Krauss (2002) | Selbst Methoden-Lehrende interpretieren falsch |
| Meehl (1978) | Der Signifikanztest als historischer Irrweg |
| Schäfer & Schwarz (2019) | Bedeutsamkeit von Effektgrößen, empirisch |
| Schönbrodt & Wagenmakers (2018) | Bayes-Faktor-Design-Analyse |
| Lee & Wagenmakers (2013) | Bayesianische Modellierung, inklusive BF-Stufen |
| McElreath, Statistical Rethinking | Wahrscheinlich der beste Bayes-Einstieg |
Ohne Code
Grafische Oberfläche, klassische und bayesianische Tests nebeneinander. Ideal für Lehre und den ersten eigenen Versuch.
Mit R
Formel-Syntax wie lme4, darunter Stan. brm(y ~ x + (1|id), ...) und du hast ein bayesianisches Mehrebenenmodell.
Mit Python
Volle Kontrolle über das Modell, moderne Sampler, ArviZ für die Diagnostik.
Alle genannten Werkzeuge sind Open Source und kostenfrei.
Beyond p-values · gefördert durch die VolkswagenStiftung