Packt

Transformers for Vision AI, Multimodal & Generative AI

Ce cours n'est pas disponible en Français (France)

Nous sommes actuellement en train de le traduire dans plus de langues.
Packt

Transformers for Vision AI, Multimodal & Generative AI

Inclus avec Coursera PlusEn savoir plus

Demander à Coursera

Obtenez un aperçu d'un sujet et apprenez les principes fondamentaux.
niveau Intermédiaire

Expérience recommandée

5 heures à compléter
Planning flexible
Apprenez à votre propre rythme
Obtenez un aperçu d'un sujet et apprenez les principes fondamentaux.
niveau Intermédiaire

Expérience recommandée

5 heures à compléter
Planning flexible
Apprenez à votre propre rythme

Ce que vous apprendrez

  • Understand and compare major transformer models like BERT, GPT, and ViT

  • Fine-tune and pretrain large language models for specific tasks

  • Implement retrieval augmented generation to improve model reliability

Compétences que vous acquerrez

  • Catégorie : Large Language Modeling
  • Catégorie : AI powered creativity
  • Catégorie : Artificial Intelligence and Machine Learning (AI/ML)
  • Catégorie : Image Analysis
  • Catégorie : Computer Vision
  • Catégorie : Responsible AI
  • Catégorie : Multimodal Prompts
  • Catégorie : Model Evaluation
  • Catégorie : Model Training
  • Catégorie : Embeddings
  • Catégorie : Generative Model Architectures
  • Catégorie : Generative AI Agents

Outils que vous découvrirez

  • Catégorie : AI Orchestration
  • Catégorie : Vision Transformer (ViT)
  • Catégorie : Prompt Engineering
  • Catégorie : ChatGPT
  • Catégorie : OpenAI
  • Catégorie : Generative AI
  • Catégorie : AI Workflows
  • Catégorie : Hugging Face

Détails à connaître

Certificat partageable

Ajouter à votre profil LinkedIn

Récemment mis à jour !

juillet 2026

Évaluations

6 devoirs

Enseigné en Anglais

Découvrez comment les employés des entreprises prestigieuses maîtrisent des compétences recherchées

 logos de Petrobras, TATA, Danone, Capgemini, P&G et L'Oreal

Élaborez votre expertise du sujet

Ce cours fait partie de la Spécialisation "Transformers for NLP and Computer Vision"
Lorsque vous vous inscrivez à ce cours, vous êtes également inscrit(e) à cette Spécialisation.
  • Apprenez de nouveaux concepts auprès d'experts du secteur
  • Acquérez une compréhension de base d'un sujet ou d'un outil
  • Développez des compétences professionnelles avec des projets pratiques
  • Obtenez un certificat professionnel partageable

Il y a 5 modules dans ce cours

This module introduces learners to vision transformers and multimodal AI models, including ViT, CLIP, and DALL-E. You will explore how images are processed as input for transformers, understand the architecture and configuration of feature extractors, and examine real-world applications of these models in creative and mainstream contexts.

Inclus

1 vidéo7 lectures1 devoir

This module introduces the fundamentals of Stable Diffusion for generating images and videos from text prompts. Learners will explore the underlying architecture, practical implementations using Keras and Hugging Face, and the adaptation of OpenAI CLIP for text-to-video synthesis. By the end, participants will gain hands-on experience running diffusion models and understanding their creative potential.

Inclus

1 vidéo3 lectures1 devoir

This module guides learners through the process of training and deploying vision models using Hugging Face AutoTrain, all without writing code. You will explore data preparation, model selection, and evaluation techniques, while gaining hands-on experience with popular architectures like ViT, BEiT, and ConvNext.

Inclus

1 vidéo5 lectures1 devoir

This module introduces learners to the concept of Functional Artificial General Intelligence (F-AGI) and demonstrates how advanced AI platforms like HuggingGPT and Google Cloud Vision can be integrated for complex task automation. Learners will explore model chaining, cross-platform AI pipelines, and practical approaches to enhancing computer vision accuracy in challenging scenarios.

Inclus

1 vidéo6 lectures1 devoir

This module introduces automated generative ideation systems, demonstrating how AI tools like ChatGPT, Llama 2, Midjourney, and Microsoft Designer can streamline content and image creation without manual prompts. Learners will explore practical workflows, ethical considerations, and integration strategies for efficient, scalable ideation. By the end, you'll be equipped to implement and extend automated pipelines for creative tasks.

Inclus

1 vidéo6 lectures2 devoirs

Obtenez un certificat professionnel

Ajoutez ce titre à votre profil LinkedIn, à votre curriculum vitae ou à votre CV. Partagez-le sur les médias sociaux et dans votre évaluation des performances.

Instructeur

Packt - Course Instructors
Packt
2 090 Cours620 777 apprenants

Offert par

Packt

En savoir plus sur Software Development

Pour quelles raisons les étudiants sur Coursera nous choisissent-ils pour leur carrière ?

Felipe M.

Étudiant(e) depuis 2018
’Pouvoir suivre des cours à mon rythme à été une expérience extraordinaire. Je peux apprendre chaque fois que mon emploi du temps me le permet et en fonction de mon humeur.’

Jennifer J.

Étudiant(e) depuis 2020
’J'ai directement appliqué les concepts et les compétences que j'ai appris de mes cours à un nouveau projet passionnant au travail.’

Larry W.

Étudiant(e) depuis 2021
’Lorsque j'ai besoin de cours sur des sujets que mon université ne propose pas, Coursera est l'un des meilleurs endroits où se rendre.’

Chaitanya A.

’Apprendre, ce n'est pas seulement s'améliorer dans son travail : c'est bien plus que cela. Coursera me permet d'apprendre sans limites.’

Foire Aux Questions