Wo finden Data-Science-Studierende Datensätze für die Abschlussarbeit? 12 Quellen 2026

Die Methodik steht, das Modell ist ausgewählt — und dann scheitert die Data-Science-Abschlussarbeit an der banalsten Frage: Woher kommen die Daten? Ein selbst erhobener Datensatz ist in zwölf Wochen selten realistisch, ein ungeeigneter Kaggle-Datensatz ohne Dokumentation macht später beim Methodikteil Probleme. Dieser Artikel ordnet zwölf verlässliche Datenquellen nach Kategorie, zeigt, worauf du bei der Auswahl achten musst, wie du eine Datenquelle korrekt zitierst und versionierst, und wie du die Herkunft deiner Daten im Methodikkapitel sauber dokumentierst.

Kurze Antwort: Für eine Data-Science-Abschlussarbeit eignen sich vier Kategorien von Datenquellen: offene ML-Repositorien (Kaggle, UCI, OpenML, Hugging Face), amtliche Statistikportale (Destatis GENESIS, Eurostat, data.europa.eu), domänenspezifische wissenschaftliche Repositorien (PhysioNet, World Bank Open Data, NASA Earthdata) und Suchmaschinen für Datensätze (Google Dataset Search). Prüfe vor der Wahl immer Lizenz, Aktualität, Dokumentation und Stichprobengröße — nicht nur das Thema.

Warum die Datenquelle über den Erfolg deiner Arbeit entscheidet

Anders als in vielen anderen Fächern ist der Datensatz in der Data-Science-Abschlussarbeit nicht nur Material, sondern Teil der methodischen Leistung: Du musst begründen können, warum genau dieser Datensatz für deine Fragestellung geeignet ist, welche Verzerrungen er enthalten könnte und wie repräsentativ er ist. Ein Datensatz ohne Dokumentation zur Erhebungsmethode lässt sich im Methodikkapitel kaum rechtfertigen — selbst wenn das Modell am Ende gut performt. Prüfende unterscheiden explizit zwischen einer Arbeit, die eine Datenquelle unreflektiert übernimmt, und einer, die deren Grenzen selbst benennt — Letzteres wird in der Bewertung honoriert, auch wenn das Modellergebnis dadurch bescheidener ausfällt. Diese Sorgfalt bei der Quellenwahl ist genau der Punkt, an dem sich eine überdurchschnittliche von einer durchschnittlichen Data-Science-Abschlussarbeit unterscheidet.

Wie du die Datenquelle schon im Exposé absicherst

Kläre die Verfügbarkeit deiner Datenquelle, bevor du dein Exposé einreichst, nicht danach. Nenne im Exposé die konkrete Quelle (nicht nur „ein offener Datensatz“), einen Link oder eine DOI, und einen Satz zur Lizenz. Betreuende lehnen Exposés überdurchschnittlich oft ab, wenn die Datenquelle nur vage umrissen ist — „ich finde sicher etwas auf Kaggle“ überzeugt nicht. Wer bereits im Exposé den exakten Datensatz benennt und dessen Eignung kurz begründet, spart sich in der Bearbeitungszeit spätere Rückfragen und mögliche Themenänderungen mitten in der Bearbeitungsphase.

Bachelor- oder Master-Arbeit: Wie viel Eigenleistung bei der Datenquelle wird erwartet?

Auf Bachelorniveau ist die Nutzung eines gut dokumentierten offenen Datensatzes ohne Weiteres akzeptiert, solange die Eignung begründet wird. Auf Masterniveau erwarten viele Betreuende zusätzlich eine eigene Datenaufbereitung, die über einfaches Bereinigen hinausgeht — etwa die Verknüpfung mehrerer Quellen, eine eigene Feature-Konstruktion oder die Anreicherung eines offenen Datensatzes mit zusätzlichen, selbst recherchierten Variablen. Ein reiner „Download und Modell trainieren“-Ansatz gilt auf Masterniveau meist als zu dünn für den methodischen Anspruch.

Zwölf Datenquellen für die Data-Science-Abschlussarbeit

Offene ML-Repositorien

  • Kaggle Datasets — eine der größten Sammlungen nutzergenerierter Datensätze mit Notebooks und Diskussionen; Lizenz und Datenqualität variieren stark, immer einzeln prüfen. Die Community-Diskussion unter jedem Datensatz verrät oft bereits bekannte Datenqualitätsprobleme.
  • UCI Machine Learning Repository — kuratierte, akademisch etablierte Datensätze, viele davon seit Jahrzehnten Referenzstandard in Lehrbüchern und Publikationen, mit stabilen, zitierfähigen Links.
  • OpenML — Datensätze mit standardisierten Metadaten und direkter Anbindung an Benchmark-Pipelines, gut geeignet, wenn du Modellvergleiche durchführst oder Reproduzierbarkeit betonen willst.
  • Hugging Face Datasets — der Standard für Text-, Bild- und Audiodaten im Deep-Learning-Umfeld, mit Versionierung und Lizenzangabe je Datensatz, ideal für NLP- oder Computer-Vision-Themen.

Amtliche und institutionelle Statistikportale

  • Destatis GENESIS-Online — die zentrale Datenbank des Statistischen Bundesamtes, gut dokumentiert, mit klaren Erhebungsmethoden je Tabelle und langen Zeitreihen für Deutschland.
  • Eurostat — EU-weite amtliche Statistiken, praktisch für Ländervergleiche und makroökonomische Fragestellungen mit einheitlicher Methodik über alle Mitgliedstaaten.
  • data.europa.eu — das zentrale Portal für offene Verwaltungsdaten aus allen EU-Mitgliedstaaten, durchsuchbar nach Thema und Land, mit Metadaten zu Lizenz und Aktualisierungsfrequenz.
  • GovData.de — das deutsche Open-Data-Portal von Bund, Ländern und Kommunen, besonders für lokal- oder verwaltungsnahe Fragestellungen wie Mobilität oder Stadtplanung.

Domänenspezifische wissenschaftliche Repositorien

  • PhysioNet — klinische und physiologische Datensätze (EKG, Vitaldaten) für Machine-Learning-Anwendungen im Gesundheitsbereich, mit strengen Zugangsbedingungen und einem verpflichtenden Ethik-Training bei sensiblen Daten.
  • World Bank Open Data — globale sozioökonomische Indikatoren über Jahrzehnte, gut dokumentiert und frei nutzbar, praktisch für Entwicklungs- und Wirtschaftsfragestellungen.
  • NASA Earthdata — Klima- und Erdbeobachtungsdaten für Umwelt- und Nachhaltigkeitsthemen mit Data-Science-Bezug, inklusive Satellitenbilddaten für Computer-Vision-Anwendungen.

Suchmaschinen für Datensätze

  • Google Dataset Search — indiziert Datensätze aus tausenden Repositorien weltweit und ist der schnellste Startpunkt, wenn noch keine konkrete Quelle feststeht, da es Metadaten vieler der oben genannten Portale gleichzeitig durchsucht.
Forscher durchsucht offene Datenkataloge und Repositorien für die Abschlussarbeit
Vor der Datenerhebung steht die systematische Suche nach einer geeigneten, dokumentierten Quelle.

Zwei durchgerechnete Beispiele: Von der Fragestellung zur Datenquelle

Beispiel 1 — Erneuerbare Energien: Forschungsfrage: Wie genau lässt sich mit öffentlich verfügbaren Wetterdaten die Energieerzeugung einer Photovoltaikanlage vorhersagen? Passende Quellen: NASA Earthdata für Strahlungs- und Wetterdaten, kombiniert mit einem Kaggle-Datensatz zu historischen Solarertragsdaten. Keine der beiden Quellen liefert allein genug Variablen — erst die Verknüpfung über Zeitstempel macht ein Vorhersagemodell möglich, und beide Quellen sind stabil und dauerhaft referenzierbar.

Beispiel 2 — Gesundheitswesen: Forschungsfrage: Welche Vitalparameter sagen einen kritischen Verlauf bei Intensivpatienten am zuverlässigsten voraus? Passende Quelle: PhysioNet mit einem anonymisierten Intensivpflege-Datensatz. Hier ist eine einzelne, aber hochwertig kuratierte Quelle ausreichend, weil PhysioNet die Datenqualität und ethische Freigabe bereits selbst dokumentiert — die Eigenleistung liegt in der Feature-Auswahl und Modellwahl, nicht in der Datenbeschaffung.

Vitaldatenmonitor auf einer Intensivstation als Beispiel für einen klinischen Datensatz
PhysioNet stellt anonymisierte klinische Vitaldaten für Machine-Learning-Anwendungen bereit.

Checkliste: Ist dieser Datensatz für deine Abschlussarbeit geeignet?

  • Lizenz: Ist die Nutzung für akademische Zwecke und Veröffentlichung in der Bachelorarbeit ausdrücklich erlaubt (z. B. CC-BY, ODbL)?
  • Dokumentation: Gibt es ein Datenblatt oder README, das Erhebungsmethode, Zeitraum und bekannte Einschränkungen beschreibt?
  • Aktualität: Passt der Erhebungszeitraum zur Fragestellung, oder ist der Datensatz für dein Thema bereits veraltet?
  • Stichprobengröße und Vollständigkeit: Reicht die Fallzahl für dein geplantes Verfahren, und wie hoch ist der Anteil fehlender Werte?
  • Reproduzierbarkeit: Lässt sich der Datensatz über einen stabilen Link oder eine DOI dauerhaft referenzieren, statt nur über eine sich ändernde Webseite?

Wie du eine Datenquelle korrekt zitierst und versionierst

Ein Datensatz wird wie eine eigenständige Publikation zitiert, nicht wie eine gewöhnliche Webseite. Nach APA 7 gehören dazu: Autor oder Institution, Jahr, Titel des Datensatzes (kursiv), Version (falls vorhanden), Herausgeber/Repositorium und DOI oder URL. Ein Beispiel: „Statistisches Bundesamt. (2026). Bevölkerung nach Altersgruppen 2015–2025 [Datensatz]. GENESIS-Online. https://www-genesis.destatis.de/…“. Hat der Datensatz keine DOI, nutze die stabilste verfügbare URL und notiere zusätzlich dein Zugriffsdatum. Ergänzend solltest du die exakte Version deines Datensatzes lokal sichern (z. B. per Git oder einem einfachen Zeitstempel-Ordner), da sich viele Online-Repositorien laufend aktualisieren — ohne eigene Kopie lässt sich dein Ergebnis später nicht mehr reproduzieren, selbst wenn der Link noch funktioniert.

Datenschutz und DSGVO bei der Zweitnutzung offener Datensätze

Auch wenn ein Datensatz öffentlich bereitgestellt wird, bist du als Nutzer nicht automatisch von datenschutzrechtlicher Verantwortung befreit. Prüfe insbesondere, ob der Datensatz als vollständig anonymisiert dokumentiert ist (dann greift die DSGVO nicht mehr) oder nur pseudonymisiert (dann bleibt er personenbezogen und die Zweitnutzung muss durch die ursprüngliche Einwilligung oder eine Forschungsausnahme gedeckt sein). Bei Datensätzen mit Gesundheits-, Standort- oder anderen sensiblen Daten lohnt sich vor Nutzungsbeginn eine kurze Rückfrage beim Betreuer, auch wenn der Datensatz öffentlich zugänglich ist — „öffentlich verfügbar“ ist nicht gleichbedeutend mit „datenschutzrechtlich unbedenklich“. Im Zweifel gilt: Je sensibler die vermutete Datenkategorie, desto früher solltest du diese Rückfrage stellen, nicht erst kurz vor Abgabe.

Wann ein offener Datensatz NICHT geeignet ist

Drei Warnsignale solltest du ernst nehmen: Erstens, wenn ein Datensatz personenbezogene Daten enthält, ohne dass eine klare Rechtsgrundlage oder Anonymisierung dokumentiert ist. Zweitens, wenn die Diskussion auf der Plattform (etwa bei Kaggle) auf bekannte Datenqualitätsprobleme hinweist, die im Datenblatt nicht erwähnt werden. Drittens, wenn ein Datensatz so populär ist, dass er in Dutzenden anderen Abschlussarbeiten bereits verwendet wurde (z. B. der Titanic- oder Iris-Datensatz) — für Lernzwecke geeignet, für eine eigenständige wissenschaftliche Leistung in der Bachelorarbeit dagegen zu wenig originell.

Häufige Fehler bei der Datenquellenwahl

  • Thema zuerst, Datenquelle nie geprüft: Eine spannende Forschungsfrage wird formuliert, bevor geklärt ist, ob überhaupt Daten dazu verfügbar sind.
  • Lizenz übersehen: Ein Datensatz mit einer nicht-kommerziellen oder forschungsbeschränkten Lizenz wird verwendet, ohne die Bedingungen zu prüfen.
  • Keine Begründung der Eignung: Der Datensatz wird einfach übernommen, ohne im Methodikteil zu begründen, warum er für die Fragestellung geeignet ist.
  • Datenqualität ignoriert: Fehlende Werte, Duplikate oder Ausreißer werden nicht dokumentiert, obwohl sie das Ergebnis beeinflussen.
  • Übernutzte Standarddatensätze: Titanic, Iris oder MNIST ohne eigene Erweiterung wirken auf Prüfende wenig originell.

FAQ zu Datenquellen für die Data-Science-Abschlussarbeit

Darf ich mehrere Datensätze kombinieren?

Ja, das ist sogar häufig methodisch wertvoller — dokumentiere aber für jeden Datensatz Quelle und Lizenz separat und beschreibe genau, wie die Verknüpfung (Join, Merge) erfolgt ist.

Was, wenn mein Wunschthema keinen passenden offenen Datensatz hat?

Prüfe, ob sich die Fragestellung leicht anpassen lässt, um einen vorhandenen Datensatz zu nutzen, oder ob ein Praxispartner (Unternehmen, Praktikumsstelle) anonymisierte interne Daten zur Verfügung stellen kann.

Muss ich für Kaggle-Datensätze eine Ethikkommission einschalten?

Bei vollständig anonymisierten, öffentlich bereitgestellten Datensätzen ist das an den meisten Hochschulen nicht nötig. Enthält der Datensatz jedoch sensible personenbezogene Daten, lohnt sich eine kurze Rückfrage beim Betreuer.

Wie aktuell muss mein Datensatz sein?

Das hängt von der Fragestellung ab — für ein methodisches Thema ist die Aktualität der Daten zweitrangig, für ein inhaltliches Thema mit Gegenwartsbezug sollte der Datensatz nicht älter als zwei bis drei Jahre sein.

Reicht ein einzelner Kaggle-Datensatz für eine Bachelorarbeit?

Ja, sofern er ausreichend groß, gut dokumentiert und für die Fragestellung inhaltlich passend ist. Wichtiger als die Anzahl der Datensätze ist eine nachvollziehbare Begründung der Eignung im Methodikteil.

Wie gehe ich mit fehlenden Werten in einem offenen Datensatz um?

Dokumentiere den Anteil fehlender Werte je Variable transparent und begründe dein gewähltes Verfahren im Methodikteil — eine unkommentierte Bereinigung wirkt bei Prüfenden schnell wie ein verschwiegenes Problem.

Darf ich einen Datensatz nutzen, der in einer wissenschaftlichen Publikation bereits verwendet wurde?

Ja, das ist sogar ein Qualitätsmerkmal — ein bereits publizierter Datensatz gilt oft als methodisch geprüft. Grenze deine eigene Arbeit dann klar ab, indem du eine andere Fragestellung, ein anderes Modell oder eine andere Teilmenge der Daten untersuchst als die Originalpublikation.

Was mache ich, wenn sich mein Datensatz während der Bearbeitungszeit ändert oder offline geht?

Genau deshalb gehört das lokale Sichern der genutzten Datenversion direkt zu Beginn der Bearbeitung zum Pflichtprogramm. Falls die Originalquelle später offline geht, kannst du mit deiner gesicherten Kopie weiterarbeiten und dies im Methodikteil kurz vermerken.

Darf ich einen Datensatz nutzen, der ursprünglich zu kommerziellen Zwecken erhoben wurde?

Grundsätzlich ja, solange die Lizenzbedingungen die akademische Nutzung und die Veröffentlichung in einer Bachelor- oder Masterarbeit ausdrücklich erlauben. Viele kommerziell erhobene Datensätze werden nur mit einer eingeschränkten Lizenz freigegeben, die etwa eine kommerzielle Weiterverwendung ausschließt, akademische Zwecke aber zulässt — lies die Lizenzbedingungen deshalb vollständig, statt sie nur zu überfliegen. Prüfe außerdem, ob die Nutzungsbedingungen eine Veröffentlichung der Ergebnisse in einer öffentlich zugänglichen Hochschularbeit gesondert regeln, da das bei kommerziell erhobenen Daten häufiger vorkommt als bei rein akademischen Repositorien. Im Zweifel lohnt sich eine kurze Nachfrage beim Anbieter, bevor du deine gesamte Methodik auf diesen einen Datensatz aufbaust.

Datenquellen sauber dokumentieren mit Tesify

Tesify hilft dir, jede Datenquelle korrekt zu zitieren und die Datenherkunft strukturiert in deinen Methodikteil zu übernehmen.

Kostenlos ausprobieren →

Für Maschinenbau-Studierende mit vergleichbarem Bedarf: Datenquellen für die Maschinenbau-Abschlussarbeit. Zum Methodenkapitel deiner Data-Science-Arbeit: Methodenkapitel Data-Science-Abschlussarbeit: CRISP-DM, Datensplit und Reproduzierbarkeit. Für die Themenfindung davor: Themen für die Data-Science-Abschlussarbeit: 30 Vorschläge mit Forschungsfrage und Datenzugang. Zum Kapitelaufbau danach: Aufbau der Data-Science-Abschlussarbeit: Kapitel für Kapitel. Und für einen Blick auf ein anderes Fach: Sieben Wege zu Mediendaten für die Abschlussarbeit in Kommunikationswissenschaft.

Schreib deine Arbeit mit KI

Ordne deine Gliederung, schreib Kapitel für Kapitel und halte dein Literaturverzeichnis sauber.

Kostenlos starten → Keine Kreditkarte nötig

Kategorien