Zum Hauptinhalt springen
DATASET DOCTOR

Open-Source-Datensatz-Diagnostik

Kenne deinen Datensatz,
bevor du dein
Modell trainierst.

Fange Datenqualitätsprobleme ab, bevor sie zu Modellproblemen werden. Dataset Doctor macht fehlende Werte, Duplikate, Ungleichgewichte, verdächtige Merkmale und andere häufige Datensatz-Probleme in einem klaren Bericht sichtbar.

Ein Designkonzept — ein Open-Source-Python-Toolkit im Entstehen. Alle Werte hier sind illustrativ.

Open source
Python-freundlich
Für ML-Workflows gebaut
Datensatz-BerichtBeispielausgabe
12458 Zeilen · 31 SpaltenBeispielanalyse: 1.2s
BefundSchweregrad
  • Fehlende Werte4 SpaltenWarnung
  • Duplikate218Information
  • Klassen-Ungleichgewicht87 / 13Warnung
  • Mögliche Leakagecustomer_statusKritisch
Datensatzqualität
68 / 100Handlungsbedarf

Illustrativer Beispielbericht · report.html

Entwickelt für moderne Machine-Learning-Workflows.

Warum es zählt

Modellprobleme beginnen oft, bevor das Training startet.

Die meisten Teams entdecken Datensatz-Probleme zu spät — nach stundenlangem Tuning von Architekturen und Hyperparametern, die nie der Engpass waren. Bis dahin gehört die Korrektur in die Datenaufbereitung, und die Experimente müssen neu durchlaufen.

“Ein Modell, das auf einem kranken Datensatz trainiert, lernt die Krankheit.”

SymptomindexS-01 — S-06
  1. 01Fehlende DatenStiller NaN-Drift in 4 Spalten
  2. 02Doppelte Beobachtungen218 Zeilen doppelt erfasst
  3. 03Klassen-Ungleichgewicht87 / 13 Aufteilung zwischen den Klassen
  4. 04Verdächtige MerkmaleVerschleierte Ziel-Proxies
  5. 05Falsche DatentypenNumerisches als Strings geparst
  6. 06Data LeakageAntwortschlüssel im Trainingsframe

Die Checkliste

Alles, was es zu prüfen gilt,
bevor model.fit() läuft

Acht Durchgänge über Schema, Statistiken und die Beziehungen dazwischen — die leisen Checks, die darüber entscheiden, ob ein Modell generalisiert.

Durchgang 01 · Vollständigkeit

Fehlende-Werte-Analyse

Nullmuster gruppiert nach Spalte, dtype und Zeilensegment — nicht nur eine traurige Gesamtzahl.

Gefüllte Quadrate zeigen vorhandene Werte, rote Umrisse Nullwerte — 4 von 31 Spalten enthalten Nullwerte · 0,8 % der Zellen

Durchgang 02 · Eindeutigkeit

dup

Duplikat-Erkennung

Exakte und nahe Duplikate, gefangen über Fingerprint-Hashing, über jedes Spaltenpaar hinweg.

Zeilenbalken zeigen Datensatz-Fingerprints; übereinstimmende Zeilen leuchten bernsteinfarben — 218 Zeilen fallen auf 109 eindeutige Datensätze zusammen

Durchgang 03

Klassenverteilung

Mehrheits- und Minderheits-Priors, sichtbar bevor sie Kennzahlen verzerren.

Durchgang 04

Ausreißererkennung

Werte, die weit außerhalb des erwarteten Bereichs ihrer Spalte liegen.

Durchgang 05

Datentyp-Validierung

Numerisches als Strings gespeichert, Daten als alles außer Datumsangaben.

Durchgang 06

Leakage-Warnungen

Merkmale, die Antworten halten, auf die sie keinen Zugriff haben sollten.

Durchgang 07 · Beziehungen

Korrelationsanalyse

Welche Merkmale sich gemeinsam bewegen — und welche zufällig mit dem Ziel mitbewegt sind.

Illustrative KorrelationskarteBeispielbefund: field_12 und field_27 haben ρ 0.94 — auf Leakage prüfen

Überblick

Datensatz-Zusammenfassung

Die faktische Form deiner Daten, vor jeder Modellierungsentscheidung.

Zeilen
12,458
Spalten
31
Numerisch
22
Kategorisch
9
Speicher
14.2 MB

Datensatz-Health

Ein Score. Ein klarerer Startpunkt.

Dataset Health fasst gängige Qualitätssignale zusammen, um zu zeigen, welche Bereiche vor dem Training Aufmerksamkeit brauchen.

68/ 100Gesamtscore
Handlungsbedarf
DiagnosekategorienScore

Vollständigkeit

Nullwerte in 4 von 31 Spalten

92

Konsistenz

gemischte Kodierungen in region

81

Klassen-Balance

87 / 13 Klassen-Prior

44

Duplikat-Qualität

218 doppelte Zeilen

76

Leakage-Risiko

customer_status · ρ 0.94

55
  • 80–100 stark
  • 50–79 beobachten
  • 0–49 handeln

Vorschau-Konzept — diese Seite ist ein Produktkonzept. Scores und Befunde hier sind illustrativ, nicht aus echten Daten berechnet.

Beispielbericht

Probleme, priorisiert.

Jeder Befund liefert Belege und einen empfohlenen nächsten Schritt — nach Schweregrad sortiert, damit die erste Stunde dem größten Risiko gilt.

Ausgewählte Befunde — der vollständige Bericht listet jeden Check samt Belegen.

LEAK-001

Potenzielles Target Leakage

Kritisch

Das Merkmal "customer_status" hat eine verdächtig starke Beziehung zum Ziel.

Belege

customer_statusMedian-Merkmal

Empfohlener Schritt

Prüfe, ob diese Spalte zum Zeitpunkt der Vorhersage überhaupt verfügbar wäre.

BAL-004

Klassen-Ungleichgewicht erkannt

Warnung

Training auf dieser Aufteilung wird das Modell zugunsten der Mehrheitsklasse verzerren, sofern nicht gewichtet oder resampelt wird.

Belege

Klasse A · 87%Klasse B · 13%

Empfohlener Schritt

Gewichte die Klassen oder resample den Trainings-Split vor dem Fitten; berichte Präzision und Recall je Klasse statt bloßer Genauigkeit.

DUP-012

Doppelte Beobachtungen

Information

218 doppelte Zeilen gefunden.

Belege

218

doppelte Zeilen · 1,75 % des Datensatzes

Empfohlener Schritt

Behalte nur eine Kopie jedes Duplikats und regeneriere den Split vor dem Training — oder kläre, warum Duplikate weiter oben in die Pipeline geraten.

So funktioniert's

Vom Datensatz zur Erkenntnis
in drei Schritten.

  1. 01csv · parquet

    Upload

    CSV- oder Parquet-Datensatz.

  2. 02Beispielprüfungen

    Prüfen

    Automatisierte Qualitäts- und ML-Readiness-Checks.

  3. 03report.html

    Verbessern

    Probleme vor dem Training beheben.

Workflow-Integration

Passt in den Workflow, den du schon nutzt.

Führe einen Befehl in CI aus oder importiere den Analyzer neben deinem Notebook. So oder so kommt der Bericht als eine einzige eigenständige HTML-Datei.

Gezeigter Befehl und API sind illustrativ — die Oberfläche wird noch geformt.

Beispielsitzung
$ dataset-doctor inspect dataset.csvAnalysiere Datensatz...✓ 12458 Zeilen✓ 31 Merkmale! 3 Warnungen✕ 2 kritische ProblemeDataset-Health: 68 / 100✓ report.html erstellt

Open source

Transparent von Grund auf.

Dataset Doctor ist als Open-Source-Toolkit gedacht, das Entwickler:innen prüfen, erweitern und in bestehende Workflows integrieren können.

Open Source

Jeden Check lesen, jede Heuristik auditen, den eigenen Fork shippen.

MIT-Lizenz

Python First

Eine geplante Schnittstelle für Notebooks, Skripte und Pipelines.

Geplante Python-Schnittstelle

Erweiterbare Checks

Ein geplanter Prüfkatalog mit Platz für eigene Validierungen.

Konzept für eigene Prüfungen

Erst inspizieren.Dann trainieren.

Fange offensichtliche Datensatz-Probleme ab, bevor du Zeit mit dem Optimieren des falschen Modells verbringst.

Produktkonzept · durchgehend Beispieldaten