Denke Bayesianisch

Bayesianische Intuition aufbauen · Workshop 03 von 03

Beyond p-values · HMU Health and Medical University Erfurt

Alles zum Mitlesen

Alles, was heute kommt, steht dauerhaft online.

https://hannesdiemerling.github.io/Frequent-Reformation/

Kostenfrei, ohne Anmeldung, unter Creative Commons CC BY 4.0.

Ab der nächsten Folie steht oben rechts immer ein QR-Code. Er zeigt jeweils dorthin, wo das gerade Gezeigte nachlesbar ist. Du musst nichts mitschreiben.

Der Hub, Startseite

Wo wir stehen

Workshop 01

Beyond Significance

Effekte berichten statt Signifikanz ablesen.

Workshop 02

Repräsentativität und Stichprobengröße

Ob die Zahlen für die Population tragen.

Heute · Workshop 03

Denke Bayesianisch

Die Frage umdrehen und endlich die Antwort bekommen, die wir wollten.

Zwei offene Rechnungen aus den ersten beiden Workshops werden heute eingelöst: echte Evidenz für die Nullhypothese, und ein Intervall, das man so lesen darf, wie man es intuitiv liest.

Was du heute mitnimmst

  • Den Unterschied zwischen frequentistischer und bayesianischer Wahrscheinlichkeit benennen.
  • Das Bayes-Theorem an einem konkreten Fall nachvollziehen.
  • Prior, Likelihood und Posterior auseinanderhalten und ihr Zusammenspiel erklären.
  • Ein Glaubwürdigkeitsintervall korrekt interpretieren und formulieren.
  • Vorhersagen treffen, die Unsicherheit ehrlich ausweisen.
  • Die Rolle von MCMC verstehen, wenn analytische Lösungen versagen.

Sieben Kapitel in drei Blöcken, dazu drei Vertiefungen, die über das Selbstlern-Material hinausgehen. Darunter der Bayes-Faktor, der in den Kapiteln gar nicht vorkommt.

Der Ablauf heute

00:00 Ankommen und Einordnung · 5 min 00:05 Block A Grundlagen, Kapitel 1 und 2, plus Vertiefung · 22 min 00:27 Übung 1 Basisraten, Kapitel 2 · 20 min 00:47 Pause · 10 min 00:57 Block B Die drei Zutaten, Kapitel 3 bis 5, plus Vertiefungen · 25 min 01:22 Übung 2 Prior gegen Daten, Kapitel 5 · 18 min 01:40 Block C Anwendung, Kapitel 6 und 7, plus Workflow · 15 min 01:55 Abschluss und Wegweiser · 5 min

Sieben Kapitel in zwei Stunden heißt: zügig durch die Theorie, dafür zwei richtige Arbeitsphasen am eigenen Gerät.

Block A: Grundlagen

00:05 · 22 Minuten

Kapitel 1 und 2: zwei Begriffe von Wahrscheinlichkeit, und die Regel, die sie verbindet.

Kapitel 1: Zwei Welten der Wahrscheinlichkeit

Kapitel 1 · 10 min

Frequentistisch

Grenzwert relativer Häufigkeiten

Wahrscheinlichkeit ist der Grenzwert relativer Häufigkeiten bei unendlich vielen Wiederholungen.

Aussagen gelten über Verfahren, nicht über einzelne Fälle.

Bayesianisch

Grad der Überzeugung

Wahrscheinlichkeit ist ein Maß für den Grad der persönlichen Überzeugung, basierend auf dem aktuellen Informationsstand.

Aussagen gelten über Hypothesen.

Ein 95-%-Konfidenzintervall bedeutet nicht, dass der wahre Wert mit 95 % Wahrscheinlichkeit darin liegt. Es beschreibt die langfristige Erfolgsquote des Verfahrens.

SmartRail, München–Stuttgart. Wahre Pünktlichkeit 85 %, niemand weiß das. Stichprobe 1: 7 von 10. Stichprobe 2: 9 von 10.

Kapitel 2: Das Bayes-Theorem

Kapitel 2 · 10 min

\[P(\theta \mid D) = \frac{P(D \mid \theta)\, P(\theta)}{P(D)}\]

Teil Bedeutung
Prior \(P(\theta)\) Deine anfängliche Überzeugung, bevor du neue Daten kennst
Likelihood \(P(D \mid \theta)\) Wahrscheinlichkeit, genau diese Daten zu beobachten, falls die Hypothese wahr ist
Evidenz \(P(D)\) Totale Wahrscheinlichkeit dieser Daten, unabhängig von der Hypothese
Posterior \(P(\theta \mid D)\) Deine aktualisierte Überzeugung, nachdem du die Evidenz integriert hast

Das Bayes-Theorem ist eine mathematische Anleitung dafür, aus neuen Informationen klüger zu werden.

Vertiefung A: das Diagnosemodul

SmartRail-Diagnose meldet eine Weichenstörung. Wie wahrscheinlich liegt wirklich eine vor?

Basisrate einer Störung 3 %
Erkennungsrate bei echter Störung 95 %
Fehlalarmrate ohne Störung 8 %

Die Intuition sagt: über 90 %.

Die Rechnung sagt: deutlich unter 30 %.

Ein System mit vielen Fehlalarmen entwertet jeden einzelnen Alarm.

Warum: von 1000 Fahrten haben 30 eine Störung, davon werden 28 erkannt. Von den 970 ohne Störung schlagen 78 falsch Alarm. Also 28 echte gegen 78 falsche Alarme.

Übung 1

00:27 · 20 Minuten

Drei Schieber, eine Intuition, die kippt.

Übung 1: an der Basisrate drehen

Kapitel 2, drei Schieber: Basisrate, Erkennungsrate, Fehlalarmrate.

  1. Stelle die Ausgangswerte ein: 3 %, 95 %, 8 %. Notiere den Posterior.
  2. Verdopple die Basisrate auf 6 %. Wie ändert sich der Posterior?
  3. Setze die Basisrate zurück und halbiere stattdessen die Fehlalarmrate auf 4 %. Was ist stärker?
  4. Welcher der drei Regler ist der wichtigste? Und was heißt das für ein Screening auf eine seltene Erkrankung?

Kapitel 2 auf deinem Gerät

Das Bayes-Theorem

Denke Bayesianisch, Kapitel 2 · live im Browser · 15 min

Pause

00:47 · 10 Minuten

Weiter um 00:57.

Danach: Prior, Likelihood, Posterior.

Block B: Die drei Zutaten

00:57 · 25 Minuten

Kapitel 3, 4 und 5. Drei Bausteine, ein Ergebnis.

Kapitel 3: Der Prior

Kapitel 3 · 10 min

Der Prior beschreibt, welche Werte eines unbekannten Parameters wir vor Beobachtung der neuen Daten für plausibel halten.

Uninformativ. Alle Werte gleich plausibel. Klingt neutral, ist es nicht: er erlaubt auch absurde Werte, etwa eine Verspätungsreduktion von 30 Minuten auf einer Strecke, die keine 30 Minuten Verspätung hat.

Informativ. Nutzt Vorwissen aus früheren Studien oder Logik, um Unsinn auszuschließen.

Schwach informativ. Der praktische Mittelweg: schließt Unsinn aus, lässt aber den Daten alle Freiheit.

Der Prior macht inhärente und ohnehin vorhandene subjektive Annahmen mathematisch angreifbar und transparent.

Kapitel 4: Die Likelihood

Kapitel 4 · 10 min

Wie wahrscheinlich ist es, exakt die vorliegenden Daten zu beobachten, falls die spezifische Hypothese wahr wäre?

Fünf Testfahrten, gemessene Ersparnis: 3 · 7 · 5 · 9 · 6 Minuten.

Hypothese Likelihood
θ = 0 min praktisch null
θ = 3 min gering
θ = 6 min Maximum
θ = 12 min gering

Die Likelihood ist der Filter, durch den die Daten auf den Prior wirken. Sie ist keine Wahrscheinlichkeitsverteilung über θ, sondern eine Bewertung jeder Hypothese anhand derselben Daten.

Beim Maximum-Likelihood-Verfahren endet man hier: man nimmt den besten Wert. Bayesianisch geht es weiter, die Likelihood wird mit dem Prior verrechnet.

Kapitel 5: Der Posterior

Kapitel 5 · 10 min

Prior gegen Daten. Herstellerangaben und Simulationen sagen 8 Minuten. Die fünf Testfahrten sagen 6 Minuten.

Der Posterior landet dazwischen. Wie nah an den Daten, hängt davon ab, wie sicher der Prior formuliert war:

  • Breiter Prior heißt: die Daten dominieren.
  • Schmaler Prior heißt: es braucht viele Daten, um ihn zu bewegen.
  • Viele Daten heißt: der Prior wird irrelevant.

Das bayesianische Glaubwürdigkeitsintervall liefert exakt die Aussage, die Menschen intuitiv suchen:

Mit 95 % Wahrscheinlichkeit liegt der wahre Wert in genau diesem Bereich.

Damit ist die offene Rechnung aus Workshop 02 beglichen.

Vertiefung B: Evidenz in beide Richtungen

In den sieben Kapiteln kommt er nicht vor. In JASP begegnet er dir zuerst.

BF₁₀ Evidenz für H₁
1 – 3 anekdotisch
3 – 10 moderat
10 – 30 stark
30 – 100 sehr stark
> 100 extrem

Ein Verhältnis: wie viel besser hat die eine Hypothese diese Daten vorhergesagt als die andere?

Dieselben Stufen gelten symmetrisch für BF₀₁, also Evidenz für die Nullhypothese. BF₀₁ = 12 heißt: die Daten sprechen stark dafür, dass SmartRail nichts bringt.

Die Antwort auf Fehlannahme 6 aus Workshop 01. Der Signifikanztest kann keine Evidenz und Evidenz für die Null nicht auseinanderhalten. Der Bayes-Faktor kann es.

Stufen nach Lee & Wagenmakers (2013).

Vertiefung B: HDI, ETI und ROPE

Aus einer Verteilung eine Entscheidung machen, ohne eine neue Schwelle zu ritualisieren.

Intervall

ETI

Equal-Tailed Interval: schneidet unten und oben je 2,5 % ab. Einfach, aber bei schiefen Verteilungen unglücklich.

Intervall

HDI

Highest Density Interval: der schmalste Bereich, der 95 % enthält. Jeder Wert darin ist plausibler als jeder Wert außerhalb.

Entscheidung

ROPE

Region of Practical Equivalence: ein Bereich um Null, der als praktisch bedeutungslos gilt. Liegt das HDI außerhalb, ist die Sache klar.

ROPE ist die Brücke zu Workshop 01. Die Relevanzschwelle, die dort inhaltlich festgelegt wurde, wird hier zum statistischen Kriterium. Nicht „ist der Effekt von null verschieden”, sondern „liegt er außerhalb dessen, was mir egal ist”.

Vertiefung B: Prior-Sensitivität berichten

Die Kapitel zeigen, dass der Prior wirkt. Offen bleibt, wie man damit in einer Publikation umgeht.

Sensitivitätsanalyse, in vier Schritten:

  1. Rechne dasselbe Modell mit mehreren Priors: einem skeptischen, einem schwach informativen, einem am Vorwissen orientierten.
  2. Stelle die Posteriors nebeneinander.
  3. Berichte, ob sich die Schlussfolgerung ändert, nicht nur die Zahlen.
  4. Wenn sie sich ändert, ist das ein Ergebnis: die Daten allein reichen nicht.

Damit dreht sich der Subjektivitätsvorwurf. Wer eine Sensitivitätsanalyse berichtet, hat seine Annahmen offengelegt und geprüft. Eine frequentistische Analyse tut das für ihre Annahmen in der Regel nicht.

Übung 2

01:22 · 18 Minuten

Wann gewinnen die Daten?

Übung 2: Prior gegen Daten

Kapitel 5, Schieber für Prior-Mittelwert und Prior-Streuung.

  1. Setze den Prior auf 8 Minuten mit großer Streuung. Wo liegt der Posterior?
  2. Verkleinere die Streuung schrittweise. Ab wann gewinnt der Prior gegen die Daten?
  3. Setze einen bewusst falschen Prior, etwa 20 Minuten. Wie schmal muss er sein, damit der Posterior unsinnig wird?
  4. Formuliere einen Ergebnissatz mit Glaubwürdigkeitsintervall, so wie du ihn publizieren würdest.

Kapitel 5 auf deinem Gerät

Der Posterior

Denke Bayesianisch, Kapitel 5 · live im Browser · 15 min

Block C: Anwendung

01:40 · 15 Minuten

Kapitel 6 und 7, dann der Weg in die eigene Analyse.

Kapitel 6: Vorhersagen

Kapitel 6 · 10 min

Die Prognose für morgen. Der Posterior sagt: θ liegt bei etwa 6 Minuten. Aber was macht die nächste einzelne Fahrt?

Unsicherheit 01

Epistemisch

Wie sicher bin ich mir über den wahren Parameter θ? Diese Unsicherheit schrumpft mit mehr Daten.

Unsicherheit 02

Aleatorisch

Das natürliche Rauschen der realen Welt. Diese Unsicherheit bleibt, egal wie viele Daten du sammelst.

Deshalb ist die Posterior-Predictive immer breiter als der Posterior. Wer eine Einzelvorhersage mit der Genauigkeit des Mittelwerts angibt, verspricht zu viel.

Kapitel 7: Wenn die Mathematik aufgibt

Kapitel 7 · 10 min

Erinnerung an Kapitel 2: der Nenner \(P(D)\) normiert. Bei realistischen Modellen ist dieses Integral nicht analytisch lösbar.

Der blinde Optimierer. MCMC ist ein Verfahren, das die Verteilung abläuft, statt sie zu berechnen:

  • Start bei θ = 0, Vorschlag θ = 3, annehmen.
  • Immer wieder vorschlagen, meist bergauf annehmen.
  • Gelegentlich bergab gehen, um lokale Maxima zu verlassen.
  • Nach 10.000 Schritten ist die Verteilung abgebildet.

MCMC ist die Brücke von der Theorie zur praktischen Anwendbarkeit. Ohne sie wäre bayesianische Statistik auf Lehrbuchbeispiele beschränkt geblieben.

Und deshalb gibt es Diagnostik: wer approximiert, muss prüfen, ob die Approximation getaugt hat.

Vertiefung C: der vollständige Workflow

  1. Modell spezifizieren. Likelihood und Priors explizit hinschreiben.
  2. Prior-Predictive-Check. Erzeugt das Modell vor jedem Datenkontakt plausible Daten? Wenn nicht, sind die Priors falsch.
  3. Inferenz. MCMC laufen lassen.
  4. Diagnostik. \(\hat{R}\) nahe 1, ausreichende ESS, Trace-Plots ohne Trend und ohne Stufen.
  5. Posterior-Predictive-Check. Sehen die vom Modell erzeugten Daten aus wie die echten?
  6. Schlüsse ziehen. Posterior, HDI, ROPE, Bayes-Faktor, Sensitivität.

Schritt 4 ist nicht optional. Ein nicht konvergiertes Modell liefert Zahlen, und sie sehen genauso aus wie richtige.

Vertiefung C: dasselbe dreimal

Ohne Code

JASP und Jamovi

Klick-Oberfläche. Bayesianischer t-Test, ANOVA, Regression und Korrelation direkt neben den klassischen Verfahren. Gibt Bayes-Faktoren aus.

Der Einstieg für heute Abend.

Mit R

brms

brm(y ~ x + (1|id), ...)

Formel-Syntax wie lme4, darunter Stan. Wer lme4 kennt, kann brms.

Volle Kontrolle

Stan und PyMC

Modell selbst schreiben, moderne Sampler, ArviZ für die Diagnostik. Für alles, was keine Standardform hat.

Empfehlung: rechne deine letzte Analyse noch einmal in JASP, bayesianisch, und vergleiche. Das dauert eine halbe Stunde und ist lehrreicher als jedes weitere Kapitel.

Alle genannten Werkzeuge sind Open Source und kostenfrei.

Transfer: dein Satz

Nimm ein eigenes Ergebnis und formuliere es dreimal:

  1. Wie du es bisher geschrieben hättest. Meist eine Signifikanzaussage.
  2. Mit Effekt und Intervall, so wie in Workshop 01 gelernt.
  3. Bayesianisch: Punktschätzer, HDI, und eine Aussage über die Wahrscheinlichkeit, dass der Effekt praktisch relevant ist.

Satz 3 ist der, den du eigentlich immer sagen wolltest. Er war nur nicht erlaubt.

Weiterarbeiten

Wie du weiterkommst

Im eigenen Tempo

Die Kapitel noch einmal

Alle Kapitel bleiben offen zugänglich, jederzeit, ohne Anmeldung. Sie laufen vollständig im Browser.

Nachlesen

Die Methoden-Seiten

Die Vertiefungen von heute stehen als Text im Hub: p-Werte, Effektgrößen, Stichproben, bayesianische Analyse.

Einstieg über Fragen

Zehn konkrete Fragen

Jede Frage führt direkt in das passende Kapitel. Gut, wenn du später mit einem konkreten Problem zurückkommst.

Mitnehmen und weitergeben

  • Alle Inhalte stehen unter Creative Commons CC BY 4.0. Du darfst sie in eigener Lehre verwenden, umbauen und weitergeben, mit Quellenangabe.
  • Auch diese Folien. Sie liegen im Hub unter Folien.
  • Geführte Workshops sind in Planung und noch nicht buchbar. Verfügbar ist alles im eigenen Tempo.

Fragen, Rückmeldungen, Kooperation: Thomas Schäfer, Thomas.Schaefer@hmu-erfurt.de

Fehler gefunden? Bitte als Issue melden, das hilft am meisten.

In Trägerschaft der HMU Health and Medical University Erfurt, gefördert durch die VolkswagenStiftung im Rahmen der Förderlinie Pioniervorhaben.

Wo du das alles wiederfindest

Vertiefung A bis C

Bayesianische Datenanalyse

Bayes-Faktor-Stufen, HDI und ROPE, der sechsstufige Workflow, häufige Sorgen.

Werkzeuge

Tools und Software

JASP, Jamovi, brms, Stan, PyMC, mit Einstiegshinweisen.

Weiterlesen

Literatur

McElreath, Kruschke, Gelman, Lee und Wagenmakers, plus die frei verfügbare Vorlesungsreihe.

Damit ist die Reihe komplett. Effekte berichten, Stichproben ehrlich planen, Hypothesen bewerten. Drei Fragen, drei Antworten.