Effekte verstehen statt p-Werte ablesen · Workshop 01 von 03
Alles, was heute kommt, steht dauerhaft online.
https://hannesdiemerling.github.io/Frequent-Reformation/
Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.
Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.
Der Hub, Startseite
Heute · Workshop 01
Warum der p-Wert nichts über Bedeutsamkeit sagt, und was stattdessen zu berichten ist.
Workshop 02
Wie verlässlich verallgemeinert eine Studie überhaupt?
Workshop 03
Die Alternative: Wahrscheinlichkeiten für Hypothesen.
Die Reihenfolge ist didaktisch: vom Problem zur Lösung. Heute klären wir das Problem und den ersten, sofort umsetzbaren Teil der Lösung.
Sechs Kapitel, dazu drei Vertiefungsblöcke, die über das Selbstlern-Material hinausgehen.
00:00 Ankommen und Einordnung · 8 min 00:08 Block A Kapitel plus Vertiefung · 22 min 00:30 Übung 1 am interaktiven Kapitel, dann Auflösung · 20 min 00:50 Pause · 10 min 01:00 Block B Kapitel plus Vertiefung · 22 min 01:22 Übung 2, dann Auflösung · 18 min 01:40 Vertiefung C Praxis und Transfer auf eigene Studien · 15 min 01:55 Abschluss und Wegweiser · 5 min
Die beiden Übungsblöcke laufen an deinem eigenen Gerät, im interaktiven Kapitel. Bring also etwas mit, auf dem ein Browser läuft. Installieren musst du nichts.
00:08 · 22 Minuten
Kapitel 1 und 2: die harte Grenze und was sie wirklich misst.
Kapitel 1 · 15 min
SmartRail auf zwei Strecken. Je 30 Fahrten, beide Strecken sparen rund 2,1 Minuten.
| Strecke | Ersparnis | p | Urteil |
|---|---|---|---|
| München–Frankfurt | ~ 2,1 min | 0.047 | signifikant, Erfolg |
| Hamburg–Berlin | ~ 2,1 min | 0.053 | nicht signifikant, Misserfolg |
Zwei faktisch gleich starke Effekte. Zwei konträre Entscheidungen.
Die Natur zieht keine magische Grenze zwischen p = 0.049 und p = 0.051.
Kapitel 2 · 15 min
Der irrelevante Rekord. SmartRail verbessert die Pünktlichkeit um 12 Sekunden. Dieser Effekt bleibt im Folgenden konstant.
| Stichprobe | p-Wert | Urteil |
|---|---|---|
| n = 20 | deutlich über .05 | nichts gefunden |
| n = 5000 | weit unter .05 | hochsignifikant |
Die Signifikanz testet primär deine Stichprobengröße, nicht die Größe oder Wichtigkeit des Effekts.
Die statistische Signifikanz verdeckt die praktische Irrelevanz.
Das Kapitel behandelt das binäre Denken. Hier die vollständige Liste.
| Aussage | Status | |
|---|---|---|
| 1 | p ist die Wahrscheinlichkeit, dass H₀ wahr ist | falsch |
| 2 | p < .05 heißt, der Effekt ist real | falsch, 5 % Fehlalarme per Konstruktion |
| 3 | p < .05 heißt, der Effekt ist groß oder wichtig | falsch, hängt an n |
| 4 | 1 − p ist die Replikationswahrscheinlichkeit | falsch, und besonders schädlich |
| 5 | p ist die Wahrscheinlichkeit, dass es Zufall war | falsch |
| 6 | Nicht signifikant heißt kein Effekt | falsch |
| 7 | Konfidenzintervalle sind der bessere p-Wert | halb richtig |
Nummer 7 ist der interessante Fall: das Intervall zeigt wenigstens die Effektgröße. Aber die intuitive Lesart, der wahre Wert liege mit 95 % Wahrscheinlichkeit darin, ist auch falsch. Diese Lesart erlaubt erst das Glaubwürdigkeitsintervall, und das kommt in Workshop 03.
00:30 · 20 Minuten
Jetzt du. Am eigenen Gerät, im interaktiven Kapitel 2.
Kapitel 2, Schieber „Anzahl Testfahrten”.
Kapitel 2 auf deinem Gerät
15 Minuten Arbeit, dann 5 Minuten Auflösung im Plenum. Der Effekt bleibt die ganze Zeit bei 12 Sekunden.
Beyond Significance, Kapitel 2 · live im Browser · 15 min
00:50 · 10 Minuten
Weiter um 01:00.
Danach: wie man Effekte tatsächlich berichtet.
01:00 · 22 Minuten
Kapitel 3 und 4: von der Statistik zurück in die Realität.
Kapitel 3 · 15 min
Ein Effekt ist, je nach Forschungsfrage, der Unterschied in der Ausprägung der interessierenden Variable zwischen Gruppen oder Bedingungen oder die Stärke des Zusammenhangs zwischen zwei oder mehr Variablen.
Er ist die Brücke von der Statistik in die Realität.
0,5 Minuten oder 12 Minuten? Dieselbe Analyse, völlig verschiedene Konsequenz. Der p-Wert unterscheidet sie nicht zuverlässig, die Zahl schon.
Zwei Perspektiven, die das Kapitel anbietet:
Baguley (2009) zur Bedeutung unstandardisierter Effektmaße.
Kapitel 4 · 20 min
\[d = \frac{|M_1 - M_2|}{SD}\]
Aspekt 01
Eine Ersparnis von 5 Minuten bei SD = 2 ist ein klares Signal. Dieselben 5 Minuten bei SD = 20 verschwinden im Rauschen.
d ist ein Signal-Rausch-Verhältnis.
Aspekt 02
Team Nord misst auf einer 5-Punkt-Skala, +0,5 Punkte. Team Süd misst auf einer 100-Punkt-Skala, +10 Punkte.
Verschiedene Skalen, identisches d. Erst das macht sie vergleichbar.
Wichtiger Vorbehalt. Die Richtwerte von Cohen (0.2, 0.5, 0.8) sind grobe Orientierungen, keine inhaltlichen Kriterien. Ein d = 0.3 kann in einem Kontext wichtig und in einem anderen trivial sein.
Die Kapitel zeigen d. In Manuskripten begegnen dir mehr Maße.
| Maß | Wofür | Orientierung |
|---|---|---|
| Cohen’s d | Mittelwertsvergleich zweier Gruppen | 0.2 · 0.5 · 0.8 |
| Hedges’ g | wie d, korrigiert für kleine Stichproben | ≈ d ab n > 50 |
| η² / ω² | Varianzaufklärung, ANOVA | .01 · .06 · .14 |
| Pearson’s r | Zusammenhang zweier stetiger Variablen | .10 · .30 · .50 |
| CLES | Wahrscheinlichkeit, dass ein zufälliger Fall besser ist | 0.50 = Zufall, 0.71 ≈ d 0.8 |
| Odds / Risk Ratio | binäre Ergebnisse, Medizin und Epidemiologie | 1 = kein Unterschied |
CLES ist der Kommunikations-Tipp. „In 71 % der Vergleiche geht es der behandelten Person besser” versteht jede Person sofort. „d = 0.8” nicht.
Der Minimalstandard für jeden Ergebnissatz:
Domänenwissen schlägt Faustregel. Ein d = 0.2 für eine Suizidpräventions-Intervention ist riesig. Ein d = 0.5 für ein neues Lernformat in einem etablierten Feld ist eher mittelmäßig.
Schäfer & Schwarz (2019). The meaningfulness of effect sizes in psychological research. Frontiers in Psychology. Liefert empirische Verteilungen von Effektstärken als Vergleichsmaßstab.
01:22 · 18 Minuten
Zwei Skalen, ein d.
Kapitel 4, Ansicht „Vergleichbarkeit”.
Kapitel 4 auf deinem Gerät
Beyond Significance, Kapitel 4 · live im Browser · 15 min
01:40 · 15 Minuten
Kapitel 5 und 6, dann Transfer auf die eigene Arbeit.
Kapitel 5 · 15 min
Das hochsignifikante Nichts.
| Investition | 180 Mio € |
| Fahrten pro Jahr | 500.000 |
| p-Wert | < 0.001 |
| Realer Gewinn | 4 Sekunden pro Fahrt |
Statistisch gesehen ein Triumph. Praktisch gesehen ein teures Nichts.
Die Frage ist nicht „Ist der Effekt von null verschieden?“, sondern „Ist der Effekt groß genug, um die Kosten zu rechtfertigen?”
Die Relevanzschwelle ist eine inhaltliche Entscheidung, keine statistische. Sie muss vorher festgelegt und begründet werden.
Kapitel 6 · 15 min
40 Teams untersuchen unabhängig dasselbe. Der wahre Effekt ist 2,0 Minuten. Publiziert wird nur, was signifikant wurde.
Kein Betrug, kein Vorsatz. Nur ein System, das die falsche Frage belohnt: Ist es signifikant? statt Wie groß ist der Effekt wirklich?
Niemand hat gelogen, aber das Bild ist verzerrt.
Diagnose
Effekt gegen Präzision auftragen. Symmetrischer Trichter heißt unverzerrt, fehlende Ecke heißt Publikationslücke.
Diagnose
Die Verteilung der p-Werte knapp unter .05. Häuft sie sich dort, deutet das auf selektives Reporting.
Struktur
Begutachtung vor der Datenerhebung. Die Annahme hängt am Design, nicht am Ergebnis. Damit verschwindet der Anreiz.
Auf Journal-Ebene ist die Debatte längst offen:
| BASP, seit 2015 | publiziert vollständig ohne p-Werte und ohne Konfidenzintervalle |
| Benjamin et al. (2018) | Vorschlag, die Schwelle auf .005 zu senken, kontrovers |
| McShane et al. (2019) | Vorschlag, Signifikanztests ganz abzuschaffen |
| Wasserstein et al. (2019) | „Moving to a world beyond p < 0.05” |
Nimm einen Satz aus einem eigenen Manuskript, Abstract oder Bericht. Falls du nichts dabei hast, nimm einen Satz aus einem Paper, das du kennst.
Wer mag, liest vor. Vorher und nachher.
Im eigenen Tempo
Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.
Nachlesen
Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.
Einstieg über Fragen
Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.
Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de
Fehler gefunden? Bitte als Issue melden, das hilft am meisten.
In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.
Vertiefung A
Die sieben Fehlannahmen, Publikationsbias, QRPs, Schlüsselliteratur.
Vertiefung B
Alle Maße, Benchmarks im Kontext, Entscheidungstabelle, Reporting-Vorlagen.
Vertiefung C
BASP, Registered Reports, die aktuelle Diskussion um die Schwelle.
Der nächste Schritt: Workshop 02 klärt, wie verlässlich deine Stichprobe überhaupt verallgemeinert. Das ist die andere Hälfte der Antwort.
Workshop 01 · Beyond Significance · gefördert durch die VolkswagenStiftung