IBM

Reproducible Training Data and ML-Ready Data Pipelines

Zum Labor Day gibt es bei Coursera Plus Rabatte von über 70 $. Sparen Sie 3 Monate lang 40 %.

kurs ist nicht verfügbar in Deutsch (Deutschland)

Wir übersetzen es in weitere Sprachen.
IBM

Reproducible Training Data and ML-Ready Data Pipelines

Ruslan Podgaets
Antonio Cangiano

Dozenten: Ruslan Podgaets

Bei Coursera PlusMehr erfahren enthalten

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.
Stufe Mittel

Empfohlene Erfahrung

2 Wochen zu vervollständigen
unter 10 Stunden pro Woche
Flexibler Zeitplan
In Ihrem eigenen Lerntempo lernen
Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.
Stufe Mittel

Empfohlene Erfahrung

2 Wochen zu vervollständigen
unter 10 Stunden pro Woche
Flexibler Zeitplan
In Ihrem eigenen Lerntempo lernen

Was Sie lernen werden

  • 1.Build reproducible dataset pipelines with versioning, lineage, and release controls.

  • 2.Detect leakage, contamination, and point-in-time correctness issues in training data.

  • 3.Design feature and label workflows with drift monitoring and validation checks.

  • 4.Apply CI gates for schema, slice, distribution, bias, and reproducibility validation.

Kompetenzen, die Sie erwerben

  • Kategorie: Taxonomy
  • Kategorie: Feature Engineering
  • Kategorie: Responsible AI
  • Kategorie: Continuous Monitoring
  • Kategorie: Data Validation
  • Kategorie: Data Pipelines
  • Kategorie: Record Keeping
  • Kategorie: Data Preprocessing
  • Kategorie: Verification And Validation
  • Kategorie: Metadata Management
  • Kategorie: Model Evaluation
  • Kategorie: Data Integrity
  • Kategorie: Release Management
  • Kategorie: Data Governance
  • Kategorie: Data Quality
  • Kategorie: Quality Assurance
  • Kategorie: MLOps (Machine Learning Operations)

Werkzeuge, die Sie lernen werden

  • Kategorie: Risking

Wichtige Details

Zertifikat zur Vorlage

Zu Ihrem LinkedIn-Profil hinzufügen

Kürzlich aktualisiert!

August 2026

Bewertungen

32 Aufgaben

Unterrichtet in Englisch

Erfahren Sie, wie Mitarbeiter führender Unternehmen gefragte Kompetenzen erwerben.

 Logos von Petrobras, TATA, Danone, Capgemini, P&G und L'Oreal

Erweitern Sie Ihr Fachwissen im Bereich Data Management

Dieser Kurs ist Teil der Spezialisierung IBM AI-Native Data Engineering (berufsbezogenes Zertifikat)
Wenn Sie sich für diesen Kurs anmelden, werden Sie auch für dieses berufsbezogene Zertifikat angemeldet.
  • Lernen Sie neue Konzepte von Branchenexperten
  • Gewinnen Sie ein Grundverständnis bestimmter Themen oder Tools
  • Erwerben Sie berufsrelevante Kompetenzen durch praktische Projekte
  • Erwerben Sie ein Berufszertifikat von IBM zur Vorlage

In diesem Kurs gibt es 9 Module

This welcome module introduces Course 6 and explains why reproducible, governed, ML-ready training data is essential for trustworthy AI and ML work. Learners get a high-level view of the course goals, recommended prerequisites, and the learning journey ahead before starting the technical modules.

Das ist alles enthalten

1 Video2 Plug-ins

This module teaches learners to treat training data as a governed data product with explicit ownership, contracts, service expectations, documentation, and release-readiness checks. Through applied labs, learners create core artifacts such as a product brief, dataset contract, acceptance criteria, dataset card draft, and readiness checklist for an ML-ready training dataset release.

Das ist alles enthalten

4 Videos5 Aufgaben2 App-Elemente4 Plug-ins

This module teaches learners how to make training datasets reproducible, auditable, and release ready through versioning, snapshots, hashing, deterministic builds, lineage, and reconstruction evidence. Learners create practical release artifacts that help teams identify exactly what data trained a model, explain what changed, and rebuild a dataset release with confidence.

Das ist alles enthalten

4 Videos5 Aufgaben2 App-Elemente4 Plug-ins

This module teaches learners how to detect and control leakage and contamination risks that can invalidate model evaluation and undermine reproducible training data releases. Learners practice identifying temporal, target, cross-split, and semantic risks, validating split integrity and point-in-time correctness, and documenting mitigation and escalation decisions as release evidence.

Das ist alles enthalten

4 Videos5 Aufgaben2 App-Elemente4 Plug-ins

This module teaches learners to design feature engineering pipelines that produce ML-ready data with reproducibility, freshness, quality, lineage, and training/inference consistency. Learners create practical artifacts such as a feature pipeline specification, freshness rules, quality checks, and a drift monitoring plan to support trustworthy dataset releases.

Das ist alles enthalten

4 Videos5 Aufgaben2 App-Elemente4 Plug-ins

This module teaches learners how to design governed label pipelines and ground truth workflows for supervised ML, including source selection, taxonomy design, review policies, quality checks, drift monitoring, and versioning. Learners produce project-ready artifacts and validation evidence that make labels auditable, reproducible, and ready for release decisions.

Das ist alles enthalten

4 Videos5 Aufgaben2 App-Elemente4 Plug-ins

This module teaches learners to implement CI-style validation gates that verify AI-grade training data quality before release. Learners build repeatable checks for schema, distributions, slices, bias-related risks, leakage, reproducibility, and release readiness, then package the resulting evidence into a governed final dataset release package.

Das ist alles enthalten

4 Videos5 Aufgaben4 Plug-ins

This Final Exam assesses your ability to apply the course’s release oriented approach to reproducible training data and ML ready data pipelines. You will complete a quiz focused on evidence backed release decisions and a case study that tests your judgment on governance, leakage, reproducibility, and release controls in realistic scenarios.

Das ist alles enthalten

2 Aufgaben1 Plug-in

This closing module wraps up Course 6 by helping you reflect on what you have accomplished and reinforce the course's core themes around reproducibility, governance, and ML ready data quality. It also previews how these skills carry forward into Course 7, where you will apply them in an integrated capstone experience.

Das ist alles enthalten

1 Video2 Plug-ins

Erwerben Sie ein Karrierezertifikat.

Fügen Sie dieses Zeugnis Ihrem LinkedIn-Profil, Lebenslauf oder CV hinzu. Teilen Sie sie in Social Media und in Ihrer Leistungsbeurteilung.

Dozenten

Ruslan Podgaets
IBM
7 Kurse1.579 Lernende
Antonio Cangiano
IBM
15 Kurse773.777 Lernende

von

IBM

Mehr von Data Management entdecken

Warum entscheiden sich Menschen für Coursera für ihre Karriere?

Felipe M.

Lernender seit 2018
„Es ist eine großartige Erfahrung, in meinem eigenen Tempo zu lernen. Ich kann lernen, wenn ich Zeit und Nerven dazu habe.“

Jennifer J.

Lernender seit 2020
„Bei einem spannenden neuen Projekt konnte ich die neuen Kenntnisse und Kompetenzen aus den Kursen direkt bei der Arbeit anwenden.“

Larry W.

Lernender seit 2021
„Wenn mir Kurse zu Themen fehlen, die meine Universität nicht anbietet, ist Coursera mit die beste Alternative.“

Chaitanya A.

„Man lernt nicht nur, um bei der Arbeit besser zu werden. Es geht noch um viel mehr. Bei Coursera kann ich ohne Grenzen lernen.“

Häufig gestellte Fragen