Coursera

Certificat Professionnel Multimodal Intelligence - Vision, Audio & Language in Action

La Fête du Travail commence avec plus de 70 $ d'économies sur Coursera Plus. Bénéficiez de 40 % de réduction pendant 3 mois.

Ce certificat professionnel n'est pas disponible en Français (France)

Nous sommes actuellement en train de le traduire dans plus de langues. Consultez les langues disponibles.
Coursera

Certificat Professionnel Multimodal Intelligence - Vision, Audio & Language in Action

Build and Deploy Multimodal AI Systems.

Design, train, evaluate, and deploy multimodal AI systems that process text, images, and audio.

Inclus avec Coursera PlusEn savoir plus

Demander à Coursera

Obtenez une qualification professionnelle qui traduit votre expertise
niveau Intermédiaire

Expérience recommandée

4 semaines à compléter
à 10 heures par semaine
Planning flexible
Apprenez à votre propre rythme
Obtenez une qualification professionnelle qui traduit votre expertise
niveau Intermédiaire

Expérience recommandée

4 semaines à compléter
à 10 heures par semaine
Planning flexible
Apprenez à votre propre rythme

Ce que vous apprendrez

  • Design end-to-end multimodal AI architectures that integrate image, audio, and text data streams into scalable production pipelines.

  • Fine-tune transformer-based multimodal models using transfer learning and evaluate performance with cross-modal and ethical AI metrics.

  • Build automated ETL pipelines and unified data schemas to ingest, validate, and store multimodal features for model training and inference.

  • Deploy versioned, secured, and documented inference APIs on containerized Kubernetes infrastructure with real-time performance optimization.

Compétences que vous acquerrez

  • Catégorie : Natural Language Processing
  • Catégorie : Transfer Learning
  • Catégorie : Data Pipelines
  • Catégorie : API Design
  • Catégorie : CI/CD
  • Catégorie : Multimodal Prompts
  • Catégorie : Data Processing
  • Catégorie : Solution Architecture
  • Catégorie : Computer Vision
  • Catégorie : Ethical Standards And Conduct
  • Catégorie : Data Preprocessing
  • Catégorie : Deep Learning
  • Catégorie : Model Evaluation
  • Catégorie : MLOps (Machine Learning Operations)
  • Catégorie : Responsible AI

Outils que vous découvrirez

  • Catégorie : Apache Airflow
  • Catégorie : PyTorch (Machine Learning Library)
  • Catégorie : Restful API
  • Catégorie : Kubernetes
  • Catégorie : Docker (Software)

Détails à connaître

Certificat partageable

Ajouter à votre profil LinkedIn

Enseigné en Anglais
Récemment mis à jour !

mars 2026

Découvrez comment les employés des entreprises prestigieuses maîtrisent des compétences recherchées

 logos de Petrobras, TATA, Danone, Capgemini, P&G et L'Oreal

Faites progresser votre carrière avec des compétences recherchées

  • Recevez une formation professionnelle par Coursera
  • Démontrez vos compétences techniques
  • Obtenez un certificat reconnu par les employeurs auprès de Coursera

Certificat professionnel - série de 5 cours

Solution Architecture and Ethical AI Design

Solution Architecture and Ethical AI Design

COURS 1, 4 heures

Ce que vous apprendrez

  • Design end-to-end multimodal AI architectures that integrate image, audio, and text pipelines into scalable, production-ready systems.

  • Evaluate multimodal model performance using cross-modal metrics including FID, CLIP scores, recall@k, and Visual Question Answering accuracy.

  • Apply ethical AI frameworks to assess model bias using demographic parity and equalized odds across sensitive population subgroups.

  • Generate model interpretability reports using LIME and SHAP to explain AI predictions and communicate findings to technical stakeholders.

Compétences que vous acquerrez

Catégorie : Solution Architecture
Catégorie : Responsible AI
Catégorie : Technical Documentation
Catégorie : Data Ethics
Catégorie : Model Evaluation
Catégorie : AI Integrations
Catégorie : Natural Language Processing
Catégorie : Systems Architecture
Catégorie : Algorithms
Catégorie : Software Documentation
Catégorie : Generative Model Architectures
Catégorie : Solution Design
Catégorie : Computer Science
Catégorie : AI Orchestration
Catégorie : Artificial Intelligence and Machine Learning (AI/ML)
Catégorie : Image Quality
Catégorie : Scalability
Catégorie : Data Science
Catégorie : Machine Learning
Catégorie : Enterprise Architecture

Ce que vous apprendrez

  • Fine-tune transformer-based multimodal models using transfer learning in PyTorch and TensorFlow.

  • Build cross-modal retrieval systems using FAISS and attention-based fusion of visual and text embeddings.

  • Automate ML pipelines with drift monitoring, hyperparameter tuning, and retraining using MLflow and Ray Tune.

  • Design and document versioned multimodal inference APIs with FastAPI, OAuth2, and OpenAPI specifications.

Compétences que vous acquerrez

Catégorie : MLOps (Machine Learning Operations)
Catégorie : Model Optimization
Catégorie : API Design
Catégorie : Transfer Learning
Catégorie : Fine-tuning
Catégorie : Model Training
Catégorie : Model Deployment
Catégorie : Vision Transformer (ViT)
Catégorie : Machine Learning Algorithms
Catégorie : Machine Learning Software
Catégorie : Data Architecture
Catégorie : OAuth
Catégorie : Application Programming Interface (API)
Catégorie : Machine Learning
Catégorie : Data Science
Catégorie : Artificial Intelligence and Machine Learning (AI/ML)
Catégorie : Model Evaluation
Catégorie : Technical Communication
Catégorie : Restful API
Catégorie : Solution Architecture

Ce que vous apprendrez

  • Preprocess images and video using normalization, color-space conversion, and motion extraction techniques.

  • Build audio feature extraction and augmentation pipelines using MFCCs and spectral transforms.

  • Fine-tune transformer models and construct text preprocessing pipelines for NLP applications.

  • Evaluate and debug multimodal AI models using automatic metrics and human-in-the-loop frameworks.

Compétences que vous acquerrez

Catégorie : Data Preprocessing
Catégorie : Computer Vision
Catégorie : Data Transformation
Catégorie : Model Evaluation
Catégorie : Model Training
Catégorie : Image Quality
Catégorie : Feature Engineering
Catégorie : Data Pipelines
Catégorie : Natural Language Processing
Catégorie : Machine Learning Algorithms
Catégorie : Image Analysis
Catégorie : Data Architecture
Catégorie : Data Processing
Catégorie : Machine Learning Software
Catégorie : Fine-tuning
Catégorie : Artificial Neural Networks
Catégorie : Large Language Modeling
Catégorie : Hugging Face
Catégorie : Machine Learning Methods
Catégorie : Artificial Intelligence and Machine Learning (AI/ML)
Production-Ready Multimodal ML Engineering

Production-Ready Multimodal ML Engineering

COURS 4, 12 heures

Ce que vous apprendrez

  • Design a multimodal feature store and build automated ETL pipelines using BigQuery and Airflow.

  • Write test-driven ML training code and validate multimodal datasets for production readiness.

  • Optimize model inference with TensorRT and manage ML codebases using GitFlow and CI/CD tools.

  • Deploy GPU-accelerated services on Kubernetes and tune autoscaling for real-time performance.

Compétences que vous acquerrez

Catégorie : Data Pipelines
Catégorie : Containerization
Catégorie : Test Driven Development (TDD)
Catégorie : Apache Airflow
Catégorie : Kubernetes
Catégorie : Model Training
Catégorie : Data Validation
Catégorie : Extract, Transform, Load
Catégorie : Algorithms
Catégorie : Data Infrastructure
Catégorie : Machine Learning Algorithms
Catégorie : Artificial Intelligence and Machine Learning (AI/ML)
Catégorie : Artificial Intelligence
Catégorie : MLOps (Machine Learning Operations)
Catégorie : Data Collection
Catégorie : Artificial Neural Networks
Catégorie : Model Optimization
Catégorie : Machine Learning Software
Catégorie : Natural Language Processing
Catégorie : Model Deployment
Career Development for Multimodal Intelligence

Career Development for Multimodal Intelligence

COURS 5, 2 heures

Ce que vous apprendrez

  • Build multimodal AI systems that integrate vision, audio, and language using cross-attention fusion and transformer architectures.

  • Deploy production-ready multimodal models with optimized inference pipelines, containerization, and automated MLOps workflows.

  • Architect cross-modal retrieval and fusion systems using contrastive learning and embedding alignment for real-world applications.

Compétences que vous acquerrez

Catégorie : Model Deployment
Catégorie : Tensorflow
Catégorie : PyTorch (Machine Learning Library)
Catégorie : Embeddings
Catégorie : Generative Model Architectures
Catégorie : Deep Learning
Catégorie : Natural Language Processing
Catégorie : AI Integrations
Catégorie : Computer Vision
Catégorie : Vision Transformer (ViT)
Catégorie : Model Optimization
Catégorie : Image Analysis
Catégorie : Applied Machine Learning
Catégorie : Generative AI
Catégorie : MLOps (Machine Learning Operations)
Catégorie : Large Language Modeling
Catégorie : Multimodal Prompts
Catégorie : Machine Learning
Catégorie : Retrieval-Augmented Generation

Obtenez un certificat professionnel

Ajoutez ce titre à votre profil LinkedIn, à votre curriculum vitae ou à votre CV. Partagez-le sur les médias sociaux et dans votre évaluation des performances.

Instructeur

Professionals from the Industry
514 Cours142 511 apprenants

Offert par

Coursera

Pour quelles raisons les étudiants sur Coursera nous choisissent-ils pour leur carrière ?

Felipe M.

Étudiant(e) depuis 2018
’Pouvoir suivre des cours à mon rythme à été une expérience extraordinaire. Je peux apprendre chaque fois que mon emploi du temps me le permet et en fonction de mon humeur.’

Jennifer J.

Étudiant(e) depuis 2020
’J'ai directement appliqué les concepts et les compétences que j'ai appris de mes cours à un nouveau projet passionnant au travail.’

Larry W.

Étudiant(e) depuis 2021
’Lorsque j'ai besoin de cours sur des sujets que mon université ne propose pas, Coursera est l'un des meilleurs endroits où se rendre.’

Chaitanya A.

’Apprendre, ce n'est pas seulement s'améliorer dans son travail : c'est bien plus que cela. Coursera me permet d'apprendre sans limites.’
  • cplus logo

    Profitez de plus de 10 000 programmes grâce à notre offre spéciale pour la Fête du Travail

  • Coursera for teams logo

    Commencez par réaliser des économies simples pour vos équipes qui travaillent dur

    30% off team training

Foire Aux Questions

¹Basé sur les réponses au sondage sur les résultats des étudiants Coursera, États-Unis, 2021.