Beyond Significance

Effekte verstehen statt p-Werte ablesen · Workshop 01 von 03

Beyond p-values · HMU Health and Medical University Erfurt

Alles zum Mitlesen

Alles, was heute kommt, steht dauerhaft online.

https://hannesdiemerling.github.io/Frequent-Reformation/

Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.

Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.

Der Hub, Startseite

Wo wir stehen

Heute · Workshop 01

Beyond Significance

Warum der p-Wert nichts über Bedeutsamkeit sagt, und was stattdessen zu berichten ist.

Workshop 02

Repräsentativität und Stichprobengröße

Wie verlässlich verallgemeinert eine Studie überhaupt?

Workshop 03

Denke Bayesianisch

Die Alternative: Wahrscheinlichkeiten für Hypothesen.

Die Reihenfolge ist didaktisch: vom Problem zur Lösung. Heute klären wir das Problem und den ersten, sofort umsetzbaren Teil der Lösung.

Was du heute mitnimmst

  • Den p-Wert sauber lesen und die sieben verbreiteten Fehlannahmen vermeiden.
  • Erkennen, wann Signifikanz vor allem Stichprobengröße widerspiegelt.
  • Effekte unstandardisiert und standardisiert berichten, immer mit Intervall.
  • Praktische Bedeutsamkeit von statistischer Signifikanz abgrenzen.
  • Publikationsbias verstehen und seine Folgen für Reviews einschätzen.

Sechs Kapitel, dazu drei Vertiefungsblöcke, die über das Selbstlern-Material hinausgehen.

Der Ablauf heute

00:00 Ankommen und Einordnung · 8 min 00:08 Block A Kapitel plus Vertiefung · 22 min 00:30 Übung 1 am interaktiven Kapitel, dann Auflösung · 20 min 00:50 Pause · 10 min 01:00 Block B Kapitel plus Vertiefung · 22 min 01:22 Übung 2, dann Auflösung · 18 min 01:40 Vertiefung C Praxis und Transfer auf eigene Studien · 15 min 01:55 Abschluss und Wegweiser · 5 min

Die beiden Übungsblöcke laufen an deinem eigenen Gerät, im interaktiven Kapitel. Bring also etwas mit, auf dem ein Browser läuft. Installieren musst du nichts.

Block A

00:08 · 22 Minuten

Kapitel 1 und 2: die harte Grenze und was sie wirklich misst.

Kapitel 1: Die Illusion der harten Grenze

Kapitel 1 · 15 min

SmartRail auf zwei Strecken. Je 30 Fahrten, beide Strecken sparen rund 2,1 Minuten.

Strecke Ersparnis p Urteil
München–Frankfurt ~ 2,1 min 0.047 signifikant, Erfolg
Hamburg–Berlin ~ 2,1 min 0.053 nicht signifikant, Misserfolg

Zwei faktisch gleich starke Effekte. Zwei konträre Entscheidungen.

Die Natur zieht keine magische Grenze zwischen p = 0.049 und p = 0.051.

Kapitel 2: Signifikanz misst vor allem n

Kapitel 2 · 15 min

Der irrelevante Rekord. SmartRail verbessert die Pünktlichkeit um 12 Sekunden. Dieser Effekt bleibt im Folgenden konstant.

Stichprobe p-Wert Urteil
n = 20 deutlich über .05 nichts gefunden
n = 5000 weit unter .05 hochsignifikant

Die Signifikanz testet primär deine Stichprobengröße, nicht die Größe oder Wichtigkeit des Effekts.

Die statistische Signifikanz verdeckt die praktische Irrelevanz.

Vertiefung A: alle sieben Fehlannahmen

Das Kapitel behandelt das binäre Denken. Hier die vollständige Liste.

Aussage Status
1 p ist die Wahrscheinlichkeit, dass H₀ wahr ist falsch
2 p < .05 heißt, der Effekt ist real falsch, 5 % Fehlalarme per Konstruktion
3 p < .05 heißt, der Effekt ist groß oder wichtig falsch, hängt an n
4 1 − p ist die Replikationswahrscheinlichkeit falsch, und besonders schädlich
5 p ist die Wahrscheinlichkeit, dass es Zufall war falsch
6 Nicht signifikant heißt kein Effekt falsch
7 Konfidenzintervalle sind der bessere p-Wert halb richtig

Nummer 7 ist der interessante Fall: das Intervall zeigt wenigstens die Effektgröße. Aber die intuitive Lesart, der wahre Wert liege mit 95 % Wahrscheinlichkeit darin, ist auch falsch. Diese Lesart erlaubt erst das Glaubwürdigkeitsintervall, und das kommt in Workshop 03.

Übung 1

00:30 · 20 Minuten

Jetzt du. Am eigenen Gerät, im interaktiven Kapitel 2.

Übung 1: den Schieber selbst bewegen

Kapitel 2, Schieber „Anzahl Testfahrten”.

  1. Stelle n = 20 ein. Notiere den p-Wert und die Breite des Intervalls.
  2. Schiebe hoch, bis p erstmals unter .05 fällt. Bei welchem n passiert das?
  3. Gehe auf n = 5000. Was ist mit dem Effekt passiert? Was mit dem Intervall?
  4. Diskutiere mit der Person neben dir: Ab welcher Ersparnis würdest du SmartRail ausrollen? Und braucht du dafür den p-Wert?

Kapitel 2 auf deinem Gerät

15 Minuten Arbeit, dann 5 Minuten Auflösung im Plenum. Der Effekt bleibt die ganze Zeit bei 12 Sekunden.

p-Wert und Stichprobengröße

Beyond Significance, Kapitel 2 · live im Browser · 15 min

Pause

00:50 · 10 Minuten

Weiter um 01:00.

Danach: wie man Effekte tatsächlich berichtet.

Block B

01:00 · 22 Minuten

Kapitel 3 und 4: von der Statistik zurück in die Realität.

Kapitel 3: Unstandardisierte Effekte

Kapitel 3 · 15 min

Ein Effekt ist, je nach Forschungsfrage, der Unterschied in der Ausprägung der interessierenden Variable zwischen Gruppen oder Bedingungen oder die Stärke des Zusammenhangs zwischen zwei oder mehr Variablen.

Er ist die Brücke von der Statistik in die Realität.

0,5 Minuten oder 12 Minuten? Dieselbe Analyse, völlig verschiedene Konsequenz. Der p-Wert unterscheidet sie nicht zuverlässig, die Zahl schon.

Zwei Perspektiven, die das Kapitel anbietet:

  • Alltagsrechner: Minuten pro Fahrt, hochgerechnet auf 230 Arbeitstage. Aus Sekunden werden Stunden pro Jahr.
  • Einzelfahrt: wie viel Prozent der Fahrten sind tatsächlich pünktlicher?

Baguley (2009) zur Bedeutung unstandardisierter Effektmaße.

Kapitel 4: Standardisierte Effektgrößen

Kapitel 4 · 20 min

\[d = \frac{|M_1 - M_2|}{SD}\]

Aspekt 01

Entdeckbarkeit

Eine Ersparnis von 5 Minuten bei SD = 2 ist ein klares Signal. Dieselben 5 Minuten bei SD = 20 verschwinden im Rauschen.

d ist ein Signal-Rausch-Verhältnis.

Aspekt 02

Vergleichbarkeit

Team Nord misst auf einer 5-Punkt-Skala, +0,5 Punkte. Team Süd misst auf einer 100-Punkt-Skala, +10 Punkte.

Verschiedene Skalen, identisches d. Erst das macht sie vergleichbar.

Wichtiger Vorbehalt. Die Richtwerte von Cohen (0.2, 0.5, 0.8) sind grobe Orientierungen, keine inhaltlichen Kriterien. Ein d = 0.3 kann in einem Kontext wichtig und in einem anderen trivial sein.

Vertiefung B: der Werkzeugkasten hinter d

Die Kapitel zeigen d. In Manuskripten begegnen dir mehr Maße.

Maß Wofür Orientierung
Cohen’s d Mittelwertsvergleich zweier Gruppen 0.2 · 0.5 · 0.8
Hedges’ g wie d, korrigiert für kleine Stichproben ≈ d ab n > 50
η² / ω² Varianzaufklärung, ANOVA .01 · .06 · .14
Pearson’s r Zusammenhang zweier stetiger Variablen .10 · .30 · .50
CLES Wahrscheinlichkeit, dass ein zufälliger Fall besser ist 0.50 = Zufall, 0.71 ≈ d 0.8
Odds / Risk Ratio binäre Ergebnisse, Medizin und Epidemiologie 1 = kein Unterschied

CLES ist der Kommunikations-Tipp. „In 71 % der Vergleiche geht es der behandelten Person besser” versteht jede Person sofort. „d = 0.8” nicht.

Vertiefung B: so berichtest du es

Der Minimalstandard für jeden Ergebnissatz:

  1. Unstandardisiert, in der Einheit der Sache. 4,2 Punkte im BDI-II.
  2. Standardisiert, für die Einordnung. d = 0.42.
  3. Ein Intervall, immer. 95 % CI [0.18, 0.66] oder bayesianisch HDI [0.20, 0.65].
  4. Ein Vergleich mit dem Feld, nicht mit Cohens Faustregel.

Domänenwissen schlägt Faustregel. Ein d = 0.2 für eine Suizidpräventions-Intervention ist riesig. Ein d = 0.5 für ein neues Lernformat in einem etablierten Feld ist eher mittelmäßig.

Schäfer & Schwarz (2019). The meaningfulness of effect sizes in psychological research. Frontiers in Psychology. Liefert empirische Verteilungen von Effektstärken als Vergleichsmaßstab.

Übung 2

01:22 · 18 Minuten

Zwei Skalen, ein d.

Übung 2: was d leistet und was es verliert

Kapitel 4, Ansicht „Vergleichbarkeit”.

  1. Stelle ein d ein, das dir plausibel erscheint. Lies ab, welche Rohwert-Differenz das bei Team Nord und bei Team Süd bedeutet.
  2. Wechsle auf „Entdeckbarkeit” und schiebe die Streuung hoch. Der Effekt bleibt bei 5 Minuten. Was passiert mit d?
  3. Formuliere zu zweit einen Ergebnissatz für Team Süd, der beides enthält: Rohwert und d, plus eine Einordnung.
  4. Diskutiert: Welche der beiden Zahlen würdet ihr dem Vorstand nennen? Und welche einer Meta-Analyse?

Kapitel 4 auf deinem Gerät

Standardisierte Effektgrößen

Beyond Significance, Kapitel 4 · live im Browser · 15 min

Block C

01:40 · 15 Minuten

Kapitel 5 und 6, dann Transfer auf die eigene Arbeit.

Kapitel 5: Praktische Bedeutsamkeit

Kapitel 5 · 15 min

Das hochsignifikante Nichts.

Investition 180 Mio €
Fahrten pro Jahr 500.000
p-Wert < 0.001
Realer Gewinn 4 Sekunden pro Fahrt

Statistisch gesehen ein Triumph. Praktisch gesehen ein teures Nichts.

Die Frage ist nicht „Ist der Effekt von null verschieden?“, sondern „Ist der Effekt groß genug, um die Kosten zu rechtfertigen?”

Die Relevanzschwelle ist eine inhaltliche Entscheidung, keine statistische. Sie muss vorher festgelegt und begründet werden.

Kapitel 6: Publikationsbias

Kapitel 6 · 15 min

40 Teams untersuchen unabhängig dasselbe. Der wahre Effekt ist 2,0 Minuten. Publiziert wird nur, was signifikant wurde.

  • Die Literatur zeigt einen größeren Effekt als die Realität.
  • Meta-Analysen erben die Verzerrung.
  • Replikationen scheitern, weil sie mit realistischeren Effekten arbeiten.

Kein Betrug, kein Vorsatz. Nur ein System, das die falsche Frage belohnt: Ist es signifikant? statt Wie groß ist der Effekt wirklich?

Niemand hat gelogen, aber das Bild ist verzerrt.

Vertiefung C: Bias erkennen und dagegenhalten

Diagnose

Funnel-Plot

Effekt gegen Präzision auftragen. Symmetrischer Trichter heißt unverzerrt, fehlende Ecke heißt Publikationslücke.

Diagnose

p-Curve

Die Verteilung der p-Werte knapp unter .05. Häuft sie sich dort, deutet das auf selektives Reporting.

Struktur

Registered Reports

Begutachtung vor der Datenerhebung. Die Annahme hängt am Design, nicht am Ergebnis. Damit verschwindet der Anreiz.

Auf Journal-Ebene ist die Debatte längst offen:

BASP, seit 2015 publiziert vollständig ohne p-Werte und ohne Konfidenzintervalle
Benjamin et al. (2018) Vorschlag, die Schwelle auf .005 zu senken, kontrovers
McShane et al. (2019) Vorschlag, Signifikanztests ganz abzuschaffen
Wasserstein et al. (2019) „Moving to a world beyond p < 0.05”

Transfer: dein eigener Ergebnissatz

Nimm einen Satz aus einem eigenen Manuskript, Abstract oder Bericht. Falls du nichts dabei hast, nimm einen Satz aus einem Paper, das du kennst.

  1. Steht dort nur ein p-Wert oder eine Signifikanzaussage?
  2. Schreibe ihn um: Rohwert · standardisiertes Maß · Intervall · Einordnung.
  3. Was fehlt dir dafür an Information? Notiere es. Genau das ist ab jetzt Teil deiner Auswertungsroutine.

Wer mag, liest vor. Vorher und nachher.

Weiterarbeiten

Wie du weiterkommst

Im eigenen Tempo

Die Kapitel noch einmal

Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.

Nachlesen

Die Methoden-Seiten

Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.

Einstieg über Fragen

Zehn konkrete Fragen

Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.

Mitnehmen und weitergeben

  • Alle Inhalte stehen unter Creative Commons CC BY 4.0. Du darfst sie in eigener Lehre verwenden, umbauen und weitergeben, mit Quellenangabe.
  • Auch diese Folien. Sie liegen im Hub unter Folien.
  • Geführte Workshops sind in Planung und noch nicht buchbar. Verfügbar ist alles im eigenen Tempo.

Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de

Fehler gefunden? Bitte als Issue melden, das hilft am meisten.

In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.

Wo du das alles wiederfindest

Vertiefung A

Probleme des p-Werts

Die sieben Fehlannahmen, Publikationsbias, QRPs, Schlüsselliteratur.

Vertiefung B

Effekte und Effektgrößen

Alle Maße, Benchmarks im Kontext, Entscheidungstabelle, Reporting-Vorlagen.

Vertiefung C

Journals und Debatte

BASP, Registered Reports, die aktuelle Diskussion um die Schwelle.

Der nächste Schritt: Workshop 02 klärt, wie verlässlich deine Stichprobe überhaupt verallgemeinert. Das ist die andere Hälfte der Antwort.