Psychologie-Abschlussarbeiten scheitern selten an der Idee, sondern an der Methodik. Die Fragestellung ist nachvollziehbar, das Thema aktuell, die Literatur ordentlich, und trotzdem kommt das Gutachten mit einer Liste von Einwänden zu Stichprobe, Auswertung und Interpretation zurück. Dieser Beitrag beschreibt fünf Einwände, die in der Begutachtung empirischer Psychologie-Arbeiten typisch sind, erklärt, warum sie berechtigt sind, und zeigt, wie du sie vermeidest. Er enthält keine Zahlen darüber, wie oft Arbeiten abgelehnt werden; solche Statistiken gibt es für einzelne Hochschulen nicht belastbar. Stattdessen stützt er sich auf Originalquellen zu Power-Analyse und flexibler Datenanalyse, die du selbst nachlesen kannst. Vergleichbare Beiträge für andere Fächer gibt es zur Jura- und zur Informatik-Abschlussarbeit; hier geht es um die methodischen Fallen der empirischen Psychologie.
Einwand 1: Die Stichprobengröße ist nicht begründet
„Die Stichprobe ist zu klein“ ist einer der häufigsten Sätze in Gutachten, und er trifft oft zu, aber nicht aus dem Grund, den Studierende vermuten. Das Problem ist weniger die absolute Zahl als die fehlende Begründung: Wer nicht vorab berechnet hat, wie viele Teilnehmende für den erwarteten Effekt nötig sind, kann nicht erklären, warum seine Zahl ausreicht. Die Standardlösung ist eine a-priori-Poweranalyse mit einer Software wie G*Power, die Faul, Erdfelder, Lang und Buchner (2007) in Behavior Research Methods (Band 39, Seiten 175 bis 191) als flexibles Programm zur statistischen Poweranalyse für die Sozial-, Verhaltens- und Biomedizinwissenschaften vorgestellt haben.
Für die Berechnung brauchst du vier Angaben: das Signifikanzniveau (meist 0,05), die gewünschte Power (häufig 0,80), den erwarteten Effekt und den Test. Zur Orientierung beim Effekt schlägt Cohen (1992) in „A power primer“ (Psychological Bulletin 112, 155 bis 159) Konventionen für kleine, mittlere und große Effekte vor. Beim t-Test für unabhängige Stichproben sind das Cohens d von 0,2, 0,5 und 0,8. Für einen zweiseitigen Test mit α von 0,05 und einer Power von 0,80 liefert G*Power typischerweise etwa 394 Personen je Gruppe für d gleich 0,2, etwa 64 je Gruppe für d gleich 0,5 und etwa 26 je Gruppe für d gleich 0,8. Diese Werte dienen nur als Größenordnung; berechne sie selbst mit deinen Einstellungen und dokumentiere die Eingaben. Wenn deine Stichprobe kleiner ausfällt, ist das kein Weltuntergang, aber du musst es offen benennen, die erreichte Teststärke berichten und die Ergebnisse vorsichtig interpretieren. Eine ausführliche Anleitung bietet der Beitrag Stichprobengröße mit G*Power berechnen.

So schreibst du die Begründung in den Methodenteil (Muster)
Ein Absatz genügt, wenn er die vier Angaben enthält. Muster (erfunden): „Die erforderliche Stichprobengröße wurde a priori mit G*Power (Faul et al., 2007) für einen zweiseitigen t-Test für unabhängige Stichproben berechnet (α = 0,05, Power = 0,80, erwarteter Effekt d = 0,5 in Anlehnung an die Konventionen von Cohen, 1992). Danach sind 64 Personen je Gruppe erforderlich. Erreicht wurden 52 Personen je Gruppe, sodass die Ergebnisse unter Berücksichtigung der geringeren Teststärke interpretiert werden.“ So sieht der Gutachter, dass du die Frage bedacht hast, und kann die Entscheidung nachvollziehen. Wichtig: Begründe den erwarteten Effekt aus der Literatur und nicht nur mit der Konvention, wenn Vorstudien existieren.
Einwand 2: Die Auswertung ist flexibel und nicht vorab festgelegt
Viele Arbeiten testen so lange verschiedene Kombinationen von Variablen, Gruppen und Verfahren, bis ein signifikantes Ergebnis herauskommt. Simmons, Nelson und Simonsohn (2011) haben in Psychological Science (Band 22, Seiten 1359 bis 1366) gezeigt, dass Flexibilität bei Datenerhebung, Analyse und Berichterstattung die tatsächliche Rate falsch positiver Befunde dramatisch erhöht: In vielen Fällen sei ein Forscher eher dazu geneigt, fälschlich Belege für einen Effekt zu finden, als korrekt Belege für dessen Abwesenheit. Sie schlagen eine offenlegungsbasierte Lösung vor, mit sechs konkreten Anforderungen an Autoren und vier Richtlinien für Gutachter. Für deine Arbeit bedeutet das: Lege Hypothesen, Variablen, Ausschlusskriterien und Auswertungsverfahren vor der Datenerhebung fest und schreibe sie in den Methodenteil. Wenn du Analysen hinzufügst, die nicht geplant waren, kennzeichne sie als explorativ. Wenn du mehrere Hypothesen testest, erkläre, wie du mit dem Problem mehrfachen Testens umgehst. Eine Präregistrierung, auch eine einfache, zeigt Gutachtern, dass du nicht nach dem Ergebnis gesucht hast.
Hilfreich ist außerdem eine kurze Tabelle im Methodenteil: Hypothese, Variablen, Verfahren, Voraussetzungen, Entscheidungsregel. Sie zwingt dich, jede Analyse zu begründen, bevor du die Daten siehst. Für die Standards bei Mediation und Moderation lies DGPs-Standards für Mediation und Moderation.
Einwand 3: Kausalaussagen ohne passendes Design
„Die Nutzung sozialer Medien führt zu Einsamkeit“, geschrieben auf Basis einer Querschnittsbefragung, ist ein Klassiker. Ein Querschnitt zeigt, dass zwei Variablen zusammenhängen, nicht, welche die andere beeinflusst. Kausale Aussagen verlangen ein Design, das sie erlaubt, in der Regel ein randomisiertes Experiment oder zumindest einen Längsschnitt mit überzeugender Begründung. Prüfe deine Formulierungen in Zusammenfassung, Diskussion und Fazit: „hängt zusammen mit“, „geht einher mit“ und „sagt vorher“ sind bei Querschnittsdaten angemessen, „führt zu“ und „verursacht“ nicht. Nenne außerdem mögliche Störvariablen und alternative Erklärungen. Wie du Forschungsfrage und Hypothesen so formulierst, dass sie zum Design passen, zeigt der Beitrag Forschungsfrage und Hypothesen in der Psychologie.
Ein Beispiel für den Unterschied: Eine Befragung von 150 Studierenden ergibt einen Zusammenhang zwischen der täglichen Zeit auf sozialen Netzwerken und der berichteten Einsamkeit. Angemessen ist die Formulierung „Je mehr Zeit Studierende auf sozialen Netzwerken verbringen, desto höher ist ihre berichtete Einsamkeit; die Richtung des Zusammenhangs lässt sich mit den vorliegenden Querschnittsdaten nicht klären.“ Unangemessen ist „Soziale Netzwerke machen einsam“. Der Unterschied wirkt klein, aber Gutachter streichen genau diese Sätze an.
Einwand 4: Instrumente sind nicht geprüft oder dokumentiert
Ein Fragebogen ist nur so gut wie seine Messeigenschaften. Gutachter erwarten, dass du für jede Skala die Quelle, die Itemzahl, das Antwortformat und die Reliabilität in deiner Stichprobe angibst. Selbst entwickelte Items brauchen einen Pretest und eine Begründung. Wenn du eine englischsprachige Skala übersetzt, musst du Übersetzung und Rückübersetzung dokumentieren. Ein häufiger Fehler ist, Skalen zu kombinieren, ohne ihre Struktur zu prüfen, oder Subskalen zu bilden, die die Autoren nicht vorsehen. Wie du Reliabilität und Validität prüfst, steht im Beitrag Reliabilität und Validität von Fragebögen prüfen. Wenn Teilnehmende Gesundheitsdaten oder sensible Informationen angeben, brauchst du außerdem ein Ethikvotum; wie du es beantragst, beschreibt der Beitrag Ethikvotum in der Psychologie beantragen.
Einwand 5: Berichtsstandards und Interpretation
Der fünfte Einwand betrifft das Berichten: Es fehlen Effektstärken, Konfidenzintervalle, Angaben zu Voraussetzungen der Verfahren oder zum Umgang mit fehlenden Werten, oder ein nicht signifikantes Ergebnis wird als „kein Effekt“ interpretiert. Ein nicht signifikantes Ergebnis zeigt zunächst nur, dass die Daten keinen Effekt nachweisen; bei geringer Teststärke ist das kaum aussagekräftig. Berichte deshalb zu jedem Test die Prüfgröße, die Freiheitsgrade, den p-Wert und eine Effektstärke mit Konfidenzintervall, wie es die APA-Konventionen vorsehen. Wie du Effektstärken wie Cohens d und Eta-Quadrat berechnest und berichtest, steht im Beitrag Effektstärke berechnen und berichten. Achte auch auf die Diskussion: Sie soll Befunde in die Literatur einordnen, Einschränkungen nennen (Stichprobe, Design, Messung) und Schlussfolgerungen auf das beschränken, was die Daten tragen.

Beispiel für eine vollständige Ergebniszeile (illustrativ)
Eine korrekte Berichtszeile enthält alle Angaben in einem Satz. Beispiel mit erfundenen Zahlen: „Die Gruppe mit Intervention (M = 4,2; SD = 0,9) unterschied sich von der Kontrollgruppe (M = 3,6; SD = 1,0), t(102) = 3,19; p = 0,002; d = 0,63; 95 %-Konfidenzintervall für d [0,23; 1,03].“ Der Leser sieht die Mittelwerte, die Streuung, die Teststatistik mit Freiheitsgraden, den p-Wert, die Effektstärke und ihre Unsicherheit. Fehlt eine dieser Angaben, wird sie im Gutachten häufig nachgefragt. Prüfe die Konventionen deines Instituts, denn Details wie die Schreibweise der Zahlen oder die Reihenfolge der Angaben unterscheiden sich.
Voraussetzungen der Verfahren prüfen und berichten
Jedes statistische Verfahren setzt etwas voraus: Der t-Test und die Varianzanalyse verlangen zum Beispiel annähernd normalverteilte Werte in den Gruppen und vergleichbare Varianzen, die Regression unabhängige Fehler und einen linearen Zusammenhang. Prüfe diese Voraussetzungen, bevor du die Ergebnisse berichtest, und schreibe in einem Satz, was du geprüft hast und wie du mit Verletzungen umgegangen bist, etwa durch ein robustes Verfahren oder eine Transformation. Gutachter erwarten keine seitenlangen Tests, aber sie erwarten, dass du weißt, was ein Verfahren voraussetzt und warum es zu deinen Daten passt. Dokumentiere außerdem Ausreißer und Ausschlüsse mit der Begründung und, wenn möglich, einer Analyse mit und ohne die betroffenen Fälle. Das zeigt, dass deine Ergebnisse nicht von einzelnen Datenpunkten abhängen.
Wie schreibst du den Einschränkungsabschnitt?
Gutachter lesen die Einschränkungen genau, weil sie zeigen, ob du die Grenzen deiner Studie verstehst. Ein guter Abschnitt nennt konkret, was nicht geklärt werden konnte, und erklärt, was das für die Aussagekraft bedeutet. Muster (erfunden): „Die Stichprobe bestand überwiegend aus Studierenden einer Hochschule und war mit 104 Personen kleiner als geplant, sodass die Teststärke für kleine Effekte begrenzt war. Aufgrund des Querschnittsdesigns lassen sich keine Aussagen über die Richtung der Zusammenhänge treffen. Alle Angaben beruhen auf Selbstauskunft und können durch soziale Erwünschtheit beeinflusst sein. Zukünftige Studien sollten Längsschnittdaten und Verhaltensmaße einbeziehen.“ Vermeide Floskeln wie „Die Ergebnisse sind nicht repräsentativ“ ohne Begründung, und vermeide, Einschränkungen so groß zu machen, dass der Leser den Ergebnissen nicht mehr traut. Gute Einschränkungen sind präzise, begründet und enthalten einen Vorschlag für die weitere Forschung.
Wie reagierst du auf ein Gutachten mit methodischen Einwänden?
Wenn ein Einwand kommt, ist das kein Urteil über dich, sondern eine Information, wie die Arbeit gelesen wurde. Lies das Gutachten vollständig, sortiere die Einwände nach Gewicht und frage nach, was unklar bleibt. Bei einer mündlichen Verteidigung bereitest du für jeden der fünf Bereiche eine kurze Antwort vor: Wie hast du die Stichprobe begründet, was war vorab festgelegt, welche Aussagen erlaubt dein Design, wie sind die Instrumente belegt, was zeigen die Effektstärken? Wenn du eine Schwäche zugeben musst, tue es sachlich und zeige, wie du sie in einer nächsten Studie vermeiden würdest. Das wirkt kompetenter als der Versuch, die Schwäche zu bestreiten.
Wie nutzt du die fünf Einwände als Checkliste?
Gehe Methodenteil und Ergebnisteil vor der Abgabe mit den fünf Fragen durch. Lies die Arbeit dann einmal aus der Sicht der Gutachterin: Würde ich als Leser Stichprobe, Verfahren und Schlussfolgerungen glauben? Lasse Mitstudierende die Methodik gegenlesen, denn Fehler fallen anderen schneller auf als dir selbst. Frage deine Betreuung rechtzeitig, ob Power-Analyse, Präregistrierung und Berichtsstandards in deinem Institut erwartet werden; Anforderungen unterscheiden sich zwischen Instituten.
Checkliste vor der Abgabe
- Stichprobengröße mit a-priori-Poweranalyse begründet, Eingaben dokumentiert.
- Hypothesen, Variablen und Verfahren vor der Erhebung festgelegt, explorative Analysen gekennzeichnet.
- Kausalaussagen nur bei geeignetem Design, Formulierungen geprüft.
- Instrumente mit Quelle, Itemzahl, Reliabilität und Pretest dokumentiert.
- Ethikvotum und Datenschutz geklärt.
- Effektstärken, Konfidenzintervalle und Voraussetzungen berichtet.
- Einschränkungen in der Diskussion benannt.
Häufige Fragen zu Gutachter-Einwänden in der Psychologie
Wie viele Teilnehmende brauche ich mindestens?
Eine feste Mindestzahl gibt es nicht. Berechne sie vorab mit einer Poweranalyse für deinen Test und den erwarteten Effekt und dokumentiere die Eingaben.
Was ist ein Effekt von d gleich 0,5?
Nach den Konventionen von Cohen (1992) ein mittlerer Effekt beim t-Test für unabhängige Stichproben. Kleine und große Effekte entsprechen 0,2 und 0,8.
Muss ich meine Studie präregistrieren?
Das hängt von deinem Institut ab. Auch ohne offizielle Präregistrierung solltest du Hypothesen und Auswertung vorab festlegen und im Methodenteil beschreiben.
Warum sind flexible Analysen ein Problem?
Weil sie die Rate falsch positiver Befunde erhöhen. Simmons, Nelson und Simonsohn (2011) zeigen das mit Simulationen und Experimenten und schlagen Offenlegung als Lösung vor.
Darf ich bei einer Korrelation von Ursache und Wirkung sprechen?
Nein. Querschnittsdaten zeigen Zusammenhänge. Kausale Aussagen brauchen ein Design, das sie erlaubt, etwa ein randomisiertes Experiment.
Was heißt ein nicht signifikantes Ergebnis?
Dass die Daten keinen Effekt nachweisen. Bei geringer Teststärke sagt das wenig über das Fehlen eines Effekts. Berichte Effektstärke und Konfidenzintervall.
Reicht Cronbachs Alpha als Beleg für Validität?
Nein. Alpha ist ein Maß der Reliabilität. Für Validität brauchst du zusätzliche Belege, etwa Quellen zur Validierung, Faktorenstruktur oder Zusammenhänge mit verwandten Maßen.
Brauche ich ein Ethikvotum?
Das hängt von Institut und Studie ab. Bei sensiblen Daten oder besonderen Gruppen ist es üblich. Kläre es früh mit deiner Betreuung.
