Bonferroni, Holm oder Benjamini-Hochberg? Korrekturverfahren für multiples Testen im Vergleich (2026)

Wer mehrere Hypothesen an denselben Daten testet, muss das Signifikanzniveau anpassen. Für wenige geplante Vergleiche ist Bonferroni ausreichend, in fast allen anderen Fällen ist die Holm-Korrektur die bessere Wahl — sie kontrolliert denselben Fehler bei mehr Teststärke. Benjamini-Hochberg gehört in explorative Analysen mit vielen Tests.

Die Vergleichstabelle auf einen Blick

Kriterium Bonferroni Holm Benjamini-Hochberg
Kontrollierter Fehler Familienweise Fehlerrate Familienweise Fehlerrate Falscherkennungsrate (FDR)
Vorgehen Ein fester, geteilter Schwellenwert Schrittweise aufsteigend Schrittweise absteigend
Strenge Am strengsten Mittel Am liberalsten
Teststärke Am niedrigsten Immer mindestens so hoch wie Bonferroni Am höchsten
Typische Zahl an Tests 2 bis 5 3 bis 20 20 und mehr
Analysetyp Konfirmatorisch Konfirmatorisch Explorativ
Erklärungsaufwand im Kolloquium Sehr gering Gering Mittel
Empfehlung für Abschlussarbeiten Nur bei sehr wenigen Tests Standardwahl Bei vielen explorativen Tests

Warum überhaupt korrigieren?

Ein einzelner Test mit α = .05 akzeptiert eine Irrtumswahrscheinlichkeit von fünf Prozent. Rechnest du zwanzig unabhängige Tests, in denen in Wahrheit kein einziger Effekt existiert, liegt die Wahrscheinlichkeit, mindestens einmal fälschlich „signifikant“ zu melden, bei rund 64 Prozent. Bei zehn Tests sind es rund 40 Prozent, bei fünf immer noch etwa 23 Prozent. Nicht die Wahrscheinlichkeit pro Test wächst, sondern die Wahrscheinlichkeit, dass irgendwo in deiner Testfamilie ein Fehlalarm steckt.

Genau das trifft die typische studentische Auswertung: Ein Fragebogen mit sechs Subskalen, verglichen zwischen zwei Gruppen, ergibt sechs Tests. Drei Gruppen paarweise verglichen ergeben drei Tests, vier Gruppen sechs. Eine Korrelationsmatrix aus fünf Variablen enthält zehn Koeffizienten.

Die entscheidende Vorfrage lautet deshalb: Was ist deine Testfamilie? Die Konvention ist, alle Tests zusammenzufassen, die dieselbe inhaltliche Frage beantworten. Sechs Subskalen desselben Instruments bilden eine Familie. Eine Analyse zur Fragestellung A und eine völlig andere zur Fragestellung B bilden zwei getrennte Familien. Diese Abgrenzung triffst du inhaltlich und schreibst sie in den Methodenteil — sie ist begründungspflichtig, weil sie über die Strenge deiner Korrektur entscheidet.

Verfahren 1: Bonferroni — einfach und zu streng

Das Prinzip ist so simpel, dass es sich im Kopf rechnen lässt: Teile α durch die Anzahl der Tests. Bei sechs Tests und α = .05 gilt jeder Einzeltest erst ab p < .0083 als signifikant. Alternativ multiplizierst du jeden p-Wert mit der Testzahl und vergleichst weiterhin mit .05 — die meisten Programme geben die korrigierten p-Werte in dieser Form aus.

Das Verfahren geht auf die Bonferroni-Ungleichung zurück und wurde in der Form, in der es heute in Lehrbüchern steht, von Olive Jean Dunn 1961 im Journal of the American Statistical Association (Band 56, Heft 293, Seiten 52–64) unter dem Titel „Multiple Comparisons among Means“ ausgearbeitet. Deshalb findest du es gelegentlich auch als Dunn-Bonferroni-Korrektur.

Stärken: in einem Satz erklärt, in jeder Software vorhanden, in jedem Fach akzeptiert und mathematisch immer gültig — auch bei abhängigen Tests.

Schwäche: Es ist konservativ, und zwar zunehmend mit der Zahl der Tests. Bei zwanzig Tests liegt die Schwelle bei p < .0025. Reale Effekte mittlerer Größe fallen dabei regelmäßig durch — du tauschst Fehlalarme gegen übersehene Effekte. Wenn deine Fallzahl ohnehin knapp ist, kann Bonferroni deine Auswertung praktisch entwerten; wie du das im Vorfeld einplanst, zeigt der Beitrag zur Fallzahlplanung mit G*Power.

Aufsteigend sortierte Testergebnisse mit ansteigender Vergleichsschwelle
Schrittverfahren vergleichen jeden sortierten Wert mit einer eigenen Schwelle statt alle mit derselben.

Verfahren 2: Holm — dieselbe Sicherheit, mehr Teststärke

Die Holm-Korrektur, 1979 im Scandinavian Journal of Statistics veröffentlicht, behebt die Schwäche des Bonferroni-Verfahrens, ohne dessen Garantie aufzugeben. Sie kontrolliert dieselbe familienweise Fehlerrate, arbeitet aber schrittweise.

So funktioniert sie: Sortiere alle p-Werte aufsteigend. Vergleiche den kleinsten mit α geteilt durch die Testzahl. Ist er kleiner, gilt er als signifikant, und du vergleichst den zweitkleinsten mit α geteilt durch die Testzahl minus eins. Danach mit α geteilt durch die Testzahl minus zwei, und so fort. Sobald ein Vergleich scheitert, endet das Verfahren, und alle verbleibenden Tests gelten als nicht signifikant.

Ein Rechenbeispiel mit sechs Tests und α = .05. Die sortierten p-Werte lauten .002, .009, .021, .038, .140 und .310.

  • .002 gegen .05/6 = .0083 → signifikant
  • .009 gegen .05/5 = .0100 → signifikant
  • .021 gegen .05/4 = .0125 → nicht signifikant, das Verfahren stoppt

Bonferroni hätte nur den ersten Wert stehen lassen, weil .009 die feste Schwelle von .0083 überschreitet. Holm behält zwei Befunde — bei identischer Fehlerkontrolle. Genau das ist der Grund, warum die Methodenliteratur Holm als die generell bessere Wahl bezeichnet: Es gibt keine Situation, in der Bonferroni mehr Befunde liefert.

Der einzige praktische Nachteil: Der Ablauf braucht drei Sätze Erklärung statt einem, und in älteren Ausgabemasken ist die Option nicht immer voreingestellt. In R, jamovi und JASP heißt sie schlicht „holm“ und ist teils sogar Standard.

Verfahren 3: Benjamini-Hochberg — ein anderer Fehler, absichtlich

Benjamini und Hochberg haben 1995 in der Zeitschrift Journal of the Royal Statistical Society Series B (Band 57, Heft 1, Seiten 289–300) unter dem Titel „Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing“ einen anderen Fehlerbegriff eingeführt. Sie kontrollieren nicht mehr die Wahrscheinlichkeit irgendeines Fehlalarms, sondern den erwarteten Anteil von Fehlalarmen unter den als signifikant gemeldeten Befunden — die Falscherkennungsrate.

Der Unterschied in einem Satz: Bei Bonferroni und Holm lautet die Zusage „mit 95-prozentiger Wahrscheinlichkeit ist unter allen meinen Befunden kein einziger falsch“. Bei Benjamini-Hochberg lautet sie „im Mittel sind höchstens fünf Prozent meiner gemeldeten Befunde falsch“. Das ist eine schwächere, aber bei vielen Tests deutlich sinnvollere Zusage.

Rechnerisch arbeitet das Verfahren von hinten: Die p-Werte werden aufsteigend sortiert und mit einer Schwelle verglichen, die mit dem Rang wächst; gesucht wird der größte Rang, der seine Schwelle noch unterschreitet — alle Tests bis dorthin gelten als signifikant.

Wann es passt: bei Korrelationsmatrizen mit vielen Variablen, bei itemweisen Analysen, bei Screening-Auswertungen — also überall dort, wo du nicht wenige vorab formulierte Hypothesen prüfst, sondern breit suchst. Wann es nicht passt: bei drei Paarvergleichen nach einer Varianzanalyse. Dort wirkt es wie eine Ausrede.

Abwägung zwischen wenigen geplanten und vielen explorativen Vergleichen
Die Zahl der Tests entscheidet nicht allein — die Frage ist, ob du prüfst oder suchst.

Die Empfehlung

Für Abschlussarbeiten gilt diese Reihenfolge.

  1. Holm als Standard. Sie ist bei jeder Testzahl mindestens so gut wie Bonferroni, kontrolliert denselben Fehler und ist mit drei Sätzen begründet. Wenn du dich nicht entscheiden willst, nimm Holm.
  2. Bonferroni bei zwei bis drei geplanten Vergleichen. Dort ist der Teststärkeverlust minimal, und die Einfachheit ist ein echter Vorteil in der Verteidigung.
  3. Benjamini-Hochberg bei mehr als etwa zwanzig Tests in einer explorativen Analyse. Nenne dann ausdrücklich, dass du die Falscherkennungsrate und nicht die familienweise Fehlerrate kontrollierst, und kennzeichne die Analyse als explorativ.
  4. Gar keine Korrektur — zulässig nur, wenn du eine einzige, vorab festgelegte Haupthypothese prüfst und alle weiteren Analysen ausdrücklich als explorativ ausweist.

Bei paarweisen Vergleichen nach einer Varianzanalyse gibt es eine spezialisierte Alternative: Verfahren wie Tukey-HSD sind für genau diese Situation konstruiert und dort in der Regel trennschärfer als eine allgemeine p-Wert-Korrektur. Welches Post-hoc-Verfahren zu welcher Varianzsituation passt, behandelt der Beitrag zur einfaktoriellen ANOVA.

So berichtest du die Korrektur

Zwei Sätze im Methodenteil, eine Spalte in der Ergebnistabelle. Im Methodenteil legst du die Testfamilie fest und nennst das Verfahren; in der Tabelle führst du die unkorrigierten und die korrigierten p-Werte, damit der Leser beides sieht.

„Da die sechs Subskalen dieselbe Fragestellung adressieren, wurden sie als eine Testfamilie behandelt. Zur Kontrolle der familienweisen Fehlerrate wurde die Holm-Korrektur angewendet. Tabelle 3 berichtet die unkorrigierten sowie die nach Holm korrigierten p-Werte; die Signifikanzentscheidungen beziehen sich auf die korrigierten Werte.“

Die Effektstärken bleiben von jeder Korrektur unberührt — sie ändern sich nicht, wenn du zusätzliche Tests rechnest, und sind deshalb das stabilere Fundament deiner Interpretation. Welche Maße wann passen, zeigt der Beitrag zu Effektstärken in der Abschlussarbeit; wie du die Tabelle aufbaust, steht im Beitrag zum Ergebnisteil.

Häufige Fragen zur Korrektur bei multiplem Testen

Ab wie vielen Tests muss ich korrigieren?

Ab zwei Tests derselben Familie ist die Frage relevant. Bei zwei oder drei geplanten Vergleichen argumentieren manche Fachkulturen gegen eine Korrektur — dann musst du diese Position aber explizit begründen, nicht stillschweigend einnehmen.

Muss ich alle Tests meiner Arbeit zusammen korrigieren?

Nein. Korrigiert wird innerhalb einer Testfamilie, also innerhalb einer inhaltlichen Fragestellung. Analysen zu verschiedenen Forschungsfragen werden getrennt behandelt.

Was tue ich, wenn nach der Korrektur nichts mehr signifikant ist?

Das ist ein Ergebnis, kein Scheitern. Berichte Effektstärken und Konfidenzintervalle — sie tragen die Interpretation auch ohne Signifikanz. Wie ein solcher Befund geschrieben wird, zeigt der Beitrag Meine Ergebnisse sind nicht signifikant.

Darf ich das Verfahren wechseln, wenn Holm mir zu streng ist?

Nur vor dem Blick auf die Ergebnisse. Die Wahl nachträglich am Ausgang auszurichten, ist eine Form des selektiven Berichtens. Lege das Verfahren im Methodenteil fest, bevor du rechnest.

Gilt die Korrektur auch für Korrelationsmatrizen?

Ja, und dort besonders. Eine Matrix aus zehn Variablen enthält 45 Koeffizienten; ohne Korrektur wären allein durch Zufall mehrere davon signifikant. Bei dieser Testzahl ist Benjamini-Hochberg die passende Wahl.

Beeinflusst die Korrektur meine Konfidenzintervalle?

Streng genommen ja: Wer p-Werte korrigiert, müsste die Intervalle entsprechend verbreitern. In Abschlussarbeiten ist es üblich, die unkorrigierten Intervalle zu berichten und die Korrektur ausdrücklich auf die Signifikanzentscheidungen zu beziehen — sag im Text, welche Variante du gewählt hast.

Wie heißt die Option in meiner Software?

In R übernimmt die Funktion zur p-Wert-Anpassung die Methoden „bonferroni“, „holm“ und „BH“. In jamovi und JASP stehen dieselben Bezeichnungen als Auswahlfelder bei den Post-hoc- und Korrelationsanalysen. In SPSS findest du Bonferroni und verwandte Verfahren in den Post-hoc-Dialogen der Varianzanalyse.

Fazit

Die Korrektur für multiples Testen ist keine Formsache, sondern eine inhaltliche Entscheidung mit zwei Teilen: Erst legst du die Testfamilie fest, dann das Verfahren. Für die große Mehrheit der Abschlussarbeiten ist Holm die richtige Antwort — sie kostet nichts an Sicherheit und liefert mehr Befunde als Bonferroni. Bonferroni bleibt sinnvoll bei zwei bis drei geplanten Vergleichen, Benjamini-Hochberg bei breiten explorativen Analysen. Entschieden wird vor der Auswertung, berichtet wird mit unkorrigierten und korrigierten Werten nebeneinander.

Leg die Testfamilie fest, bevor du die erste Tabelle baust. Mit Tesify hältst du Hypothesen, Methodenentscheidungen und Ergebnistabellen in einem Dokument zusammen — und siehst sofort, welcher Vergleich noch unbegründet ist. Starte deine Abschlussarbeit mit Tesify und schreibe deine Auswertung so auf, dass sie ohne Rückfragen durchgeht.

Schreib deine Arbeit mit KI

Ordne deine Gliederung, schreib Kapitel für Kapitel und halte dein Literaturverzeichnis sauber.

Kostenlos starten → Keine Kreditkarte nötig

Kategorien