Themen für die Data-Science-Abschlussarbeit 2026: 30 Vorschläge mit Forschungsfrage und Datenzugang

„Ich will etwas mit Machine Learning machen“ ist der Satz, mit dem die meisten Data-Science-Abschlussarbeiten beginnen — und der Satz, an dem die meisten hängen bleiben. Ein Modell zu trainieren ist nicht das Problem; das Problem ist, ein Thema zu finden, zu dem es einen zugänglichen Datensatz, eine beantwortbare Forschungsfrage und einen erkennbaren wissenschaftlichen oder praktischen Beitrag gibt. Wer diese drei Zutaten vor der ersten Codezeile klärt, erspart sich Wochen der Sackgasse.

Dieser Leitfaden liefert dreißig Themenvorschläge aus acht Anwendungsfeldern, jeder mit einer konkreten Forschungsfrage und einem realistischen Datenzugang, und zeigt vorab, woran ein tragfähiges Data-Science-Thema überhaupt zu erkennen ist.

Woran ein tragfähiges Data-Science-Thema zu erkennen ist

Drei Kriterien entscheiden, ob ein Data-Science-Thema in der verfügbaren Zeit realistisch zu bearbeiten ist — deutlich früher, als die meisten Studierenden sie prüfen.

  • Datenzugang vor Interesse. Ein faszinierendes Thema ohne zugänglichen Datensatz ist kein Thema, sondern eine Idee. Prüfe zuerst, ob ein öffentliches Dataset, eine offene API oder ein Unternehmenszugang tatsächlich existiert, bevor du dich auf die Fragestellung festlegst.
  • Eine Aufgabe, kein Forschungsprogramm. „KI in der Medizin“ ist ein Forschungsfeld, kein Bachelorarbeitsthema. „Vorhersage von Wiedereinweisungen aus strukturierten Entlassungsdaten mit Gradient Boosting“ ist eines. Die Verengung auf eine konkrete Vorhersage- oder Klassifikationsaufgabe ist der wichtigste Schritt der Themenfindung.
  • Ein Vergleichsmaßstab ist erkennbar. Ein gutes Thema lässt sich gegen eine Baseline oder ein alternatives Verfahren vergleichen — sonst fehlt am Ende die Grundlage für eine Bewertung des eigenen Ergebnisses.

Wie du die Aufgabe methodisch sauber aufbaust — Vorgehensmodell, Datensplit, Metrikwahl, Reproduzierbarkeit —, sobald das Thema steht, ist ausführlich im Leitfaden zum Methodenkapitel der Data-Science-Abschlussarbeit beschrieben. Dieser Beitrag hier setzt eine Stufe davor an: bei der Themenwahl selbst.

Dreißig Themen aus acht Anwendungsfeldern

1. Vorhersage und Klassifikation im Gesundheitswesen

Thema Forschungsfrage Datenzugang
Wiedereinweisungsrisiko Wie genau lässt sich das 30-Tage-Wiedereinweisungsrisiko aus strukturierten Entlassungsdaten vorhersagen? Öffentliche klinische Benchmark-Datensätze (z. B. MIMIC-III, mit Zugangsantrag)
Diabetesrisiko-Screening Welche Merkmalskombination sagt ein erhöhtes Diabetesrisiko am zuverlässigsten voraus, und wie verändert sich die Modellgüte bei reduziertem Merkmalssatz? Öffentliche epidemiologische Trainingsdatensätze (z. B. Kaggle-Gesundheitsdatensätze)
Medikationsfehler-Erkennung Lassen sich anomale Verordnungsmuster in synthetischen Verordnungsdaten zuverlässig als Ausreißer erkennen? Synthetische/anonymisierte Verordnungsdaten oder simulierte Datensätze
Wartezeitprognose Wie genau lässt sich die Wartezeit in einer Notaufnahme aus historischen Belegungsdaten vorhersagen? Kooperationspartner-Klinik oder öffentlich verfügbare Notaufnahme-Benchmarks

2. E-Commerce und Kundenverhalten

Thema Forschungsfrage Datenzugang
Kundenabwanderung (Churn) Welches Modell sagt Kundenabwanderung in einem Abo-Geschäftsmodell am genauesten voraus, und welche Merkmale tragen am stärksten bei? Öffentliche Telekom-/Streaming-Churn-Datensätze (z. B. Kaggle, UCI Repository)
Empfehlungssysteme Wie unterscheiden sich kollaboratives Filtern und inhaltsbasierte Empfehlung in Precision@k auf einem öffentlichen Rezensionsdatensatz? Öffentliche Bewertungsdatensätze (z. B. MovieLens, Amazon-Rezensionsdaten)
Preiselastizität Wie verändert sich die Kaufwahrscheinlichkeit in Abhängigkeit von Preisänderungen in historischen Transaktionsdaten? Öffentliche Retail-Transaktionsdatensätze oder Unternehmenskooperation
Warenkorbanalyse Welche Produktkombinationen lassen sich mit Assoziationsregeln zuverlässig aus Transaktionsdaten ableiten, und wie stabil sind sie über Zeiträume? Öffentliche Warenkorb-Datensätze (z. B. Instacart, Online-Retail-Datensatz)

3. Finanzen und Betrugserkennung

Thema Forschungsfrage Datenzugang
Kreditkartenbetrug Wie verändert sich die Erkennungsrate von Betrugstransaktionen bei stark unbalancierten Klassen durch unterschiedliche Resampling-Strategien? Öffentlicher, anonymisierter Kreditkarten-Betrugsdatensatz (z. B. auf Kaggle)
Kreditausfallrisiko Welche Merkmalskombination sagt einen Kreditausfall am zuverlässigsten voraus, und wie interpretierbar ist das resultierende Modell? Öffentliche Kredit-Scoring-Datensätze (z. B. Lending-Club-artige Datensätze)
Aktienkursvolatilität Lässt sich kurzfristige Kursvolatilität aus historischen Handelsdaten mit einem Zeitreihenmodell besser vorhersagen als mit einer naiven Baseline? Öffentliche historische Kursdaten über frei zugängliche Finanzdaten-APIs
Geldwäscheerkennung Wie gut lassen sich verdächtige Transaktionsmuster in synthetischen Transaktionsnetzwerken mit graphbasierten Methoden erkennen? Synthetische Transaktionsdatensätze für AML-Forschung (öffentlich verfügbar)

4. Textanalyse und Natural Language Processing

Thema Forschungsfrage Datenzugang
Sentimentanalyse von Produktrezensionen Wie unterscheidet sich die Klassifikationsgüte eines klassischen Bag-of-Words-Modells von einem vortrainierten Transformer-Modell auf deutschsprachigen Rezensionen? Öffentliche deutschsprachige Rezensionsdatensätze
Fake-News-Erkennung Welche linguistischen Merkmale unterscheiden verifiziert falsche von verifiziert korrekten Nachrichtenartikeln in einem öffentlichen Referenzkorpus? Öffentliche Fake-News-Benchmark-Korpora
Automatische Themenextraktion Welche Themencluster lassen sich mit Topic-Modeling aus einem Korpus von Kundenbeschwerden extrahieren, und wie stabil sind sie bei wiederholter Modellierung? Öffentliche Beschwerde-/Support-Ticket-Datensätze
Named-Entity-Recognition für Fachtexte Wie gut erkennt ein feinabgestimmtes NER-Modell fachspezifische Entitäten in einer Domäne, die im ursprünglichen Trainingskorpus nicht vorkam? Öffentliche Fachkorpora plus eigene annotierte Teilstichprobe

5. Computer Vision

Thema Forschungsfrage Datenzugang
Bilderkennung defekter Bauteile Wie genau erkennt ein Convolutional-Neural-Network-Modell Oberflächendefekte auf industriellen Bauteilbildern im Vergleich zu klassischer Bildverarbeitung? Öffentliche Datensätze zur industriellen Fehlererkennung
Verkehrsschilderkennung Wie robust bleibt ein Klassifikationsmodell für Verkehrsschilder bei künstlich hinzugefügten Bildstörungen (Regen, Unschärfe, Verdeckung)? Öffentlicher Verkehrsschilder-Benchmark-Datensatz
Pflanzenkrankheitserkennung Wie gut lässt sich Transfer Learning für die Erkennung von Pflanzenkrankheiten aus Blattbildern nutzen, wenn nur wenige gelabelte Beispiele vorliegen? Öffentliche landwirtschaftliche Bilddatensätze

6. Mobilität und Umwelt

Thema Forschungsfrage Datenzugang
Verkehrsstauvorhersage Wie genau lässt sich Verkehrsaufkommen auf einem Streckenabschnitt aus historischen Sensordaten für die nächste Stunde vorhersagen? Öffentliche Verkehrssensordaten von Städten oder Forschungsprojekten
Fahrrad-Sharing-Nachfrage Welche Wetter- und Kalendermerkmale erklären die Nachfrage nach Leihfahrrädern am stärksten, und wie gut generalisiert das Modell auf einen neuen Zeitraum? Öffentliche Bike-Sharing-Datensätze
Luftqualitätsprognose Wie genau lässt sich die Feinstaubbelastung an einer Messstation aus meteorologischen und Verkehrsdaten für den Folgetag vorhersagen? Öffentliche Umweltbundesamt- und Wetterdienstdaten
Energieverbrauchsprognose Welches Zeitreihenmodell prognostiziert den stündlichen Energieverbrauch eines Gebäudes am genauesten im Vergleich zu einer saisonalen Baseline? Öffentliche Gebäude-Energiedatensätze oder Smart-Meter-Benchmarks

7. Personalwesen und Organisationen

Thema Forschungsfrage Datenzugang
Mitarbeiterfluktuationsvorhersage Welche Merkmale sagen freiwillige Kündigung am zuverlässigsten voraus, und wie fair verteilt sich die Modellgüte über verschiedene Abteilungen? Öffentliche HR-Analytics-Datensätze oder Unternehmenskooperation
Bewerbungsscreening-Bias Zeigt ein automatisiertes Vorauswahlmodell auf einem synthetischen Bewerbungsdatensatz systematische Verzerrungen gegenüber bestimmten Gruppen? Öffentliche synthetische HR-Fairness-Datensätze
Skill-Gap-Analyse Welche Kompetenzcluster lassen sich mit Textanalyse aus Stellenanzeigen extrahieren, und wie verschieben sie sich über einen mehrjährigen Zeitraum? Öffentliche Stellenanzeigen-Datensätze oder Web-Scraping mit Genehmigung

8. Sport und Freizeit

Thema Forschungsfrage Datenzugang
Spielausgangsvorhersage Wie genau schlägt ein Machine-Learning-Modell aus historischen Spieldaten eine einfache Quoten-basierte Baseline bei der Vorhersage von Fußballergebnissen? Öffentliche Ligadatenbanken und Spielstatistik-APIs
Verletzungsrisiko im Leistungssport Welche Trainingsbelastungsmerkmale sagen ein erhöhtes Verletzungsrisiko in einem öffentlichen Trainingsdatensatz am zuverlässigsten voraus? Öffentliche Sportwissenschafts-Trainingsdatensätze
Streaming-Empfehlung nach Musikgeschmack Wie verändert sich die Empfehlungsqualität eines kollaborativen Filters, wenn nur implizites statt explizites Feedback vorliegt? Öffentliche Musik-Hördatensätze (z. B. Last.fm-artige Datensätze)

Sensible Domänen: Datenschutz von Anfang an mitdenken

Ein auffällig großer Teil der oben genannten Anwendungsfelder — Gesundheitsdaten, Personaldaten, Finanztransaktionen — zählt zu den sensiblen Datenkategorien. Das ist kein Zufall: Gerade dort, wo Vorhersagen eine reale Wirkung auf Menschen haben, ist die Fragestellung wissenschaftlich am interessantesten und die Datenlage gleichzeitig am schwierigsten. Für ein Thema in einer dieser Domänen gilt deshalb eine zusätzliche Vorprüfung, bevor die Themenanmeldung erfolgt: Sind die verwendeten Daten bereits vollständig anonymisiert oder synthetisch, oder verarbeitest du personenbezogene Daten, die ein Ethikvotum oder eine datenschutzrechtliche Grundlage erfordern? Die Grundprinzipien informierter Einwilligung, Ethikantrag und DSGVO-konformer Datenverarbeitung, die für jede Form empirischer Arbeit gelten, sind im Leitfaden zu Forschungsethik und Ethikkommission ausführlich beschrieben — für Data-Science-Arbeiten mit realen Personendaten lohnt sich zusätzlich eine frühzeitige Rücksprache mit der Betreuung, ob dein Fachbereich für automatisierte Datenverarbeitung ein eigenes Ethikverfahren verlangt.

Ein praktischer Ausweg, der in mehreren der oben genannten Themen bereits mitgedacht ist: Wo ein sensibler Datensatz nicht frei zugänglich ist, existieren für viele Konstrukte inzwischen synthetische oder öffentlich anonymisierte Referenzdatensätze, die für eine Bachelorarbeit ausreichende Aussagekraft besitzen, ohne eine eigene Genehmigung zu erfordern. Prüfe diese Option immer zuerst, bevor du einen aufwendigen Zugangsantrag stellst — sie ist in der Bearbeitungszeit einer Bachelorarbeit fast immer der realistischere Weg.

Schild mit Vorhängeschloss umgeben von Symbolen für Anonymisierung, Dokumentation und gesicherte Datenbank als Sinnbild für Datenschutz bei sensiblen Themen
Bei sensiblen Domänen entscheidet die Datenschutzstrategie oft schon über die Machbarkeit des Themas.

Vom Thema zum Arbeitstitel: ein Formulierungsmuster

Ein Data-Science-Arbeitstitel folgt meist einem wiederkehrenden Muster, das sich direkt aus den drei Kriterien der Themenwahl ableitet: [Vorhersage-/Klassifikationsaufgabe] aus [Datenquelle] mit [Verfahren]: ein Vergleich mit [Baseline/Alternativverfahren]. Für das Beispiel der Kundenabwanderung ergibt das etwa: „Vorhersage von Kundenabwanderung aus Nutzungs- und Vertragsdaten mit Gradient Boosting: ein Vergleich mit logistischer Regression als Baseline.“ Dieses Muster erzwingt automatisch, dass Aufgabe, Datenquelle, Verfahren und Vergleichsmaßstab schon im Titel benannt sind — und macht sofort sichtbar, ob eines der vier Elemente in deiner eigenen Themenidee noch fehlt.

Acht Themenkacheln für Gesundheitswesen, E-Commerce, Finanzen, Textanalyse, Computer Vision, Mobilität, Personalwesen und Sport
Acht Anwendungsfelder, in denen sich Datenzugang und Forschungsfrage besonders gut verbinden lassen.

Fünf Fallen bei der Themenwahl

  1. Ein Kaggle-Datensatz ohne eigene Fragestellung. Denselben Datensatz mit demselben Standardmodell zu bearbeiten wie hundert andere Kaggle-Notebooks ist kein wissenschaftlicher Beitrag. Verenge das Thema auf eine Fragestellung, die über die reine Modellgüte hinausgeht — etwa Interpretierbarkeit, Fairness oder Robustheit.
  2. Sensible Daten ohne geklärten Zugang. Gesundheits-, Personal- oder Finanzdaten brauchen fast immer eine Anonymisierungs- oder Genehmigungsstrategie, die du vor der Themenanmeldung klärst, nicht danach.
  3. Zu ambitionierte Modellarchitektur für die verfügbare Zeit. Ein state-of-the-art Transformer-Modell von Grund auf zu trainieren, sprengt fast jede Bachelorarbeit. Fine-Tuning eines vortrainierten Modells ist fast immer die realistischere und methodisch ebenso anerkannte Alternative.
  4. Kein Vergleichsmaßstab eingeplant. Ein Thema ohne erkennbare Baseline oder Alternativverfahren lässt sich am Ende schwer bewerten — plane den Vergleich schon in der Themenformulierung mit ein.
  5. Datensatzgröße nicht vorab geprüft. Ein Thema, das zehntausende gelabelte Beispiele braucht, aber nur wenige hundert verfügbar sind, scheitert nicht an der Idee, sondern an der Datenlage — prüfe die tatsächliche Stichprobengröße, bevor du dich festlegst.

Vom Thema zur Forschungsfrage: eine kurze Checkliste

Bevor du ein Thema aus der Liste übernimmst oder ein eigenes Thema danach modellierst, prüfe es gegen vier Punkte: Existiert ein konkret benannter, zugänglicher Datensatz? Ist die Aufgabe auf eine einzelne Vorhersage- oder Klassifikationsfrage verengt? Gibt es eine sinnvolle Baseline zum Vergleich? Und lässt sich die Frage in einem Satz mit einem Fragewort („Wie genau …“, „Welches Verfahren …“, „Wie robust …“) formulieren? Wenn alle vier Punkte erfüllt sind, ist das Thema tragfähig — die allgemeine Systematik einer guten Forschungsfrage ist zusätzlich im Leitfaden zum Forschungsfrage formulieren beschrieben.

Häufige Fragen zur Themenwahl in Data Science

Muss der Datensatz öffentlich verfügbar sein?

Nicht zwingend, aber öffentliche Datensätze sind der risikoärmere Weg, weil sie keine Zugangsverhandlung und keine Anonymisierungspflicht mit sich bringen. Ein Unternehmensdatensatz ist möglich, verlangt aber eine frühzeitig geklärte Nutzungsvereinbarung.

Wie groß sollte der Datensatz für eine Bachelorarbeit mindestens sein?

Das hängt stark vom Verfahren ab. Für klassische Modelle wie Gradient Boosting oder logistische Regression reichen oft schon wenige tausend Beobachtungen; für Deep-Learning-Ansätze mit Fine-Tuning eines vortrainierten Modells reichen teils schon einige hundert bis wenige tausend gelabelte Beispiele, sofern die Vortrainingsbasis bereits umfangreich war.

Darf ich ein Thema aus dieser Liste wörtlich übernehmen?

Ja, alle Themen sind bewusst als Ausgangspunkt formuliert. Verenge die Forschungsfrage trotzdem auf deinen konkret verfügbaren Datensatz und deine Zeitspanne, statt sie unverändert zu übernehmen.

Ist ein Vergleich zweier Modelle ein ausreichender wissenschaftlicher Beitrag?

Ja, sofern der Vergleich systematisch, mit klarer Metrik und einer nachvollziehbaren Begründung der Modellwahl durchgeführt wird. Ein methodisch sauberer Vergleich ist oft aussagekräftiger als ein einzelnes, unkritisch berichtetes Modell.

Was mache ich, wenn sich während der Arbeit herausstellt, dass der Datensatz zu klein oder zu verzerrt ist?

Dokumentiere das Problem transparent und diskutiere es als Limitation, statt es zu verschweigen. Wenn genug Zeit bleibt, ist ein Wechsel auf eine kleinere, aber methodisch saubere Fragestellung besser als ein Modell auf ungeeigneten Daten zu erzwingen.

Sind Themen mit synthetischen Daten für eine Bachelorarbeit akzeptabel?

Ja, besonders bei sensiblen Domänen wie Finanzbetrug oder Gesundheitsdaten sind synthetische Datensätze eine anerkannte Alternative. Benenne im Methodenkapitel explizit, dass die Daten synthetisch sind, und diskutiere, welche Aussagekraft das für die Übertragbarkeit auf reale Daten hat.

Wie unterscheide ich ein Data-Science-Thema von einem Informatik-Thema?

Ein Data-Science-Thema stellt eine datengetriebene Erkenntnis- oder Vorhersagefrage in den Mittelpunkt; ein allgemeines Informatik-Thema kann sich stärker auf Systemarchitektur, Softwareentwicklung oder Implementierung konzentrieren, ohne dass eine Modellgüte im Zentrum steht. Viele Themen lassen sich in beide Richtungen verschieben, je nachdem, ob der Schwerpunkt auf der Datenanalyse oder dem System liegt.

Kurz zusammengefasst

Ein tragfähiges Data-Science-Thema entsteht nicht aus einer Modellidee, sondern aus einem zugänglichen Datensatz, einer eng verengten Vorhersage- oder Klassifikationsaufgabe und einem klaren Vergleichsmaßstab. Die dreißig Themen aus acht Anwendungsfeldern in diesem Beitrag sind bewusst so formuliert, dass alle drei Kriterien erfüllt sind — sie sind ein Ausgangspunkt, den du auf deinen konkreten Datenzugang und deine Zeitspanne zuschneidest, bevor du ins Methodenkapitel gehst.

Schreib deine Arbeit mit KI

Ordne deine Gliederung, schreib Kapitel für Kapitel und halte dein Literaturverzeichnis sauber.

Kostenlos starten → Keine Kreditkarte nötig

Kategorien