IBM

Reproducible Training Data and ML-Ready Data Pipelines

La Fête du Travail commence avec plus de 70 $ d'économies sur Coursera Plus. Bénéficiez de 40 % de réduction pendant 3 mois.

Ce cours n'est pas disponible en Français (France)

Nous sommes actuellement en train de le traduire dans plus de langues.
IBM

Reproducible Training Data and ML-Ready Data Pipelines

Ruslan Podgaets
Antonio Cangiano

Instructeurs : Ruslan Podgaets

Inclus avec Coursera PlusEn savoir plus

Obtenez un aperçu d'un sujet et apprenez les principes fondamentaux.
niveau Intermédiaire

Expérience recommandée

2 semaines à compléter
à 10 heures par semaine
Planning flexible
Apprenez à votre propre rythme
Obtenez un aperçu d'un sujet et apprenez les principes fondamentaux.
niveau Intermédiaire

Expérience recommandée

2 semaines à compléter
à 10 heures par semaine
Planning flexible
Apprenez à votre propre rythme

Ce que vous apprendrez

  • 1.Build reproducible dataset pipelines with versioning, lineage, and release controls.

  • 2.Detect leakage, contamination, and point-in-time correctness issues in training data.

  • 3.Design feature and label workflows with drift monitoring and validation checks.

  • 4.Apply CI gates for schema, slice, distribution, bias, and reproducibility validation.

Compétences que vous acquerrez

  • Catégorie : Data Pipelines
  • Catégorie : Release Management
  • Catégorie : Feature Engineering
  • Catégorie : Model Training
  • Catégorie : Metadata Management
  • Catégorie : Data Integrity
  • Catégorie : Data Quality
  • Catégorie : Quality Assurance
  • Catégorie : MLOps (Machine Learning Operations)
  • Catégorie : Record Keeping
  • Catégorie : Data Collection
  • Catégorie : Continuous Monitoring
  • Catégorie : Model Evaluation
  • Catégorie : Data Validation
  • Catégorie : Taxonomy
  • Catégorie : Responsible AI
  • Catégorie : Verification And Validation
  • Catégorie : Test Data
  • Catégorie : Data Governance

Outils que vous découvrirez

  • Catégorie : AI Workflows

Détails à connaître

Certificat partageable

Ajouter à votre profil LinkedIn

Récemment mis à jour !

août 2026

Évaluations

32 devoirs

Enseigné en Anglais

Découvrez comment les employés des entreprises prestigieuses maîtrisent des compétences recherchées

 logos de Petrobras, TATA, Danone, Capgemini, P&G et L'Oreal

Élaborez votre expertise en Data Management

Ce cours fait partie de la Certificat Professionnel IBM AI-Native Data Engineering
Lorsque vous vous inscrivez à ce cours, vous êtes également inscrit(e) à ce Certificat Professionnel.
  • Apprenez de nouveaux concepts auprès d'experts du secteur
  • Acquérez une compréhension de base d'un sujet ou d'un outil
  • Développez des compétences professionnelles avec des projets pratiques
  • Obtenez un certificat professionnel partageable auprès de IBM

Il y a 9 modules dans ce cours

This welcome module introduces Course 6 and explains why reproducible, governed, ML-ready training data is essential for trustworthy AI and ML work. Learners get a high-level view of the course goals, recommended prerequisites, and the learning journey ahead before starting the technical modules.

Inclus

1 vidéo2 plugins

This module teaches learners to treat training data as a governed data product with explicit ownership, contracts, service expectations, documentation, and release-readiness checks. Through applied labs, learners create core artifacts such as a product brief, dataset contract, acceptance criteria, dataset card draft, and readiness checklist for an ML-ready training dataset release.

Inclus

4 vidéos5 devoirs2 éléments d'application4 plugins

This module teaches learners how to make training datasets reproducible, auditable, and release ready through versioning, snapshots, hashing, deterministic builds, lineage, and reconstruction evidence. Learners create practical release artifacts that help teams identify exactly what data trained a model, explain what changed, and rebuild a dataset release with confidence.

Inclus

4 vidéos5 devoirs2 éléments d'application4 plugins

This module teaches learners how to detect and control leakage and contamination risks that can invalidate model evaluation and undermine reproducible training data releases. Learners practice identifying temporal, target, cross-split, and semantic risks, validating split integrity and point-in-time correctness, and documenting mitigation and escalation decisions as release evidence.

Inclus

4 vidéos5 devoirs2 éléments d'application4 plugins

This module teaches learners to design feature engineering pipelines that produce ML-ready data with reproducibility, freshness, quality, lineage, and training/inference consistency. Learners create practical artifacts such as a feature pipeline specification, freshness rules, quality checks, and a drift monitoring plan to support trustworthy dataset releases.

Inclus

4 vidéos5 devoirs2 éléments d'application4 plugins

This module teaches learners how to design governed label pipelines and ground truth workflows for supervised ML, including source selection, taxonomy design, review policies, quality checks, drift monitoring, and versioning. Learners produce project-ready artifacts and validation evidence that make labels auditable, reproducible, and ready for release decisions.

Inclus

4 vidéos5 devoirs2 éléments d'application4 plugins

This module teaches learners to implement CI-style validation gates that verify AI-grade training data quality before release. Learners build repeatable checks for schema, distributions, slices, bias-related risks, leakage, reproducibility, and release readiness, then package the resulting evidence into a governed final dataset release package.

Inclus

4 vidéos5 devoirs4 plugins

This Final Exam assesses your ability to apply the course’s release oriented approach to reproducible training data and ML ready data pipelines. You will complete a quiz focused on evidence backed release decisions and a case study that tests your judgment on governance, leakage, reproducibility, and release controls in realistic scenarios.

Inclus

2 devoirs1 plugin

This closing module wraps up Course 6 by helping you reflect on what you have accomplished and reinforce the course's core themes around reproducibility, governance, and ML ready data quality. It also previews how these skills carry forward into Course 7, where you will apply them in an integrated capstone experience.

Inclus

1 vidéo2 plugins

Obtenez un certificat professionnel

Ajoutez ce titre à votre profil LinkedIn, à votre curriculum vitae ou à votre CV. Partagez-le sur les médias sociaux et dans votre évaluation des performances.

Instructeurs

Ruslan Podgaets
IBM
7 Cours1 657 apprenants
Antonio Cangiano
IBM
15 Cours775 731 apprenants

Offert par

IBM

En savoir plus sur Data Management

Pour quelles raisons les étudiants sur Coursera nous choisissent-ils pour leur carrière ?

Felipe M.

Étudiant(e) depuis 2018
’Pouvoir suivre des cours à mon rythme à été une expérience extraordinaire. Je peux apprendre chaque fois que mon emploi du temps me le permet et en fonction de mon humeur.’

Jennifer J.

Étudiant(e) depuis 2020
’J'ai directement appliqué les concepts et les compétences que j'ai appris de mes cours à un nouveau projet passionnant au travail.’

Larry W.

Étudiant(e) depuis 2021
’Lorsque j'ai besoin de cours sur des sujets que mon université ne propose pas, Coursera est l'un des meilleurs endroits où se rendre.’

Chaitanya A.

’Apprendre, ce n'est pas seulement s'améliorer dans son travail : c'est bien plus que cela. Coursera me permet d'apprendre sans limites.’

Foire Aux Questions