Packt

Transformers for Vision AI, Multimodal & Generative AI

kurs ist nicht verfügbar in Deutsch (Deutschland)

Wir übersetzen es in weitere Sprachen.
Packt

Transformers for Vision AI, Multimodal & Generative AI

Bei Coursera PlusMehr erfahren enthalten

Fragen Sie Coursera

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.
Stufe Mittel

Empfohlene Erfahrung

5 Stunden zu vervollständigen
Flexibler Zeitplan
In Ihrem eigenen Lerntempo lernen
Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.
Stufe Mittel

Empfohlene Erfahrung

5 Stunden zu vervollständigen
Flexibler Zeitplan
In Ihrem eigenen Lerntempo lernen

Was Sie lernen werden

  • Understand and compare major transformer models like BERT, GPT, and ViT

  • Fine-tune and pretrain large language models for specific tasks

  • Implement retrieval augmented generation to improve model reliability

Kompetenzen, die Sie erwerben

  • Kategorie: Responsible AI
  • Kategorie: Image Analysis
  • Kategorie: AI powered creativity
  • Kategorie: Model Training
  • Kategorie: Model Evaluation
  • Kategorie: Generative Model Architectures
  • Kategorie: Multimodal Prompts
  • Kategorie: Embeddings
  • Kategorie: Artificial Intelligence and Machine Learning (AI/ML)
  • Kategorie: Generative AI Agents
  • Kategorie: Computer Vision
  • Kategorie: Large Language Modeling

Werkzeuge, die Sie lernen werden

  • Kategorie: Generative AI
  • Kategorie: Prompt Engineering
  • Kategorie: ChatGPT
  • Kategorie: OpenAI
  • Kategorie: AI Workflows
  • Kategorie: AI Orchestration
  • Kategorie: Vision Transformer (ViT)
  • Kategorie: Hugging Face

Wichtige Details

Zertifikat zur Vorlage

Zu Ihrem LinkedIn-Profil hinzufügen

Kürzlich aktualisiert!

Juli 2026

Bewertungen

6 Aufgaben

Unterrichtet in Englisch

Erfahren Sie, wie Mitarbeiter führender Unternehmen gefragte Kompetenzen erwerben.

 Logos von Petrobras, TATA, Danone, Capgemini, P&G und L'Oreal

Erweitern Sie Ihre Fachkenntnisse

Dieser Kurs ist Teil der Spezialisierung Spezialisierung „Transformers for NLP and Computer Vision“
Wenn Sie sich für diesen Kurs anmelden, werden Sie auch für diese Spezialisierung angemeldet.
  • Lernen Sie neue Konzepte von Branchenexperten
  • Gewinnen Sie ein Grundverständnis bestimmter Themen oder Tools
  • Erwerben Sie berufsrelevante Kompetenzen durch praktische Projekte
  • Erwerben Sie ein Berufszertifikat zur Vorlage

In diesem Kurs gibt es 5 Module

This module introduces learners to vision transformers and multimodal AI models, including ViT, CLIP, and DALL-E. You will explore how images are processed as input for transformers, understand the architecture and configuration of feature extractors, and examine real-world applications of these models in creative and mainstream contexts.

Das ist alles enthalten

1 Video7 Lektüren1 Aufgabe

This module introduces the fundamentals of Stable Diffusion for generating images and videos from text prompts. Learners will explore the underlying architecture, practical implementations using Keras and Hugging Face, and the adaptation of OpenAI CLIP for text-to-video synthesis. By the end, participants will gain hands-on experience running diffusion models and understanding their creative potential.

Das ist alles enthalten

1 Video3 Lektüren1 Aufgabe

This module guides learners through the process of training and deploying vision models using Hugging Face AutoTrain, all without writing code. You will explore data preparation, model selection, and evaluation techniques, while gaining hands-on experience with popular architectures like ViT, BEiT, and ConvNext.

Das ist alles enthalten

1 Video5 Lektüren1 Aufgabe

This module introduces learners to the concept of Functional Artificial General Intelligence (F-AGI) and demonstrates how advanced AI platforms like HuggingGPT and Google Cloud Vision can be integrated for complex task automation. Learners will explore model chaining, cross-platform AI pipelines, and practical approaches to enhancing computer vision accuracy in challenging scenarios.

Das ist alles enthalten

1 Video6 Lektüren1 Aufgabe

This module introduces automated generative ideation systems, demonstrating how AI tools like ChatGPT, Llama 2, Midjourney, and Microsoft Designer can streamline content and image creation without manual prompts. Learners will explore practical workflows, ethical considerations, and integration strategies for efficient, scalable ideation. By the end, you'll be equipped to implement and extend automated pipelines for creative tasks.

Das ist alles enthalten

1 Video6 Lektüren2 Aufgaben

Erwerben Sie ein Karrierezertifikat.

Fügen Sie dieses Zeugnis Ihrem LinkedIn-Profil, Lebenslauf oder CV hinzu. Teilen Sie sie in Social Media und in Ihrer Leistungsbeurteilung.

Dozent

Packt - Course Instructors
Packt
2.090 Kurse618.495 Lernende

von

Packt

Mehr von Software Development entdecken

Warum entscheiden sich Menschen für Coursera für ihre Karriere?

Felipe M.

Lernender seit 2018
„Es ist eine großartige Erfahrung, in meinem eigenen Tempo zu lernen. Ich kann lernen, wenn ich Zeit und Nerven dazu habe.“

Jennifer J.

Lernender seit 2020
„Bei einem spannenden neuen Projekt konnte ich die neuen Kenntnisse und Kompetenzen aus den Kursen direkt bei der Arbeit anwenden.“

Larry W.

Lernender seit 2021
„Wenn mir Kurse zu Themen fehlen, die meine Universität nicht anbietet, ist Coursera mit die beste Alternative.“

Chaitanya A.

„Man lernt nicht nur, um bei der Arbeit besser zu werden. Es geht noch um viel mehr. Bei Coursera kann ich ohne Grenzen lernen.“

Häufig gestellte Fragen