Introduction to Multimodal AI with Hugging Face
Completed by Emmanuel Ajayi
August 26, 2026
5 hours (approximately)
Emmanuel Ajayi's account is verified. Coursera certifies their successful completion of Introduction to Multimodal AI with Hugging Face
What you will learn
Use vision-language models for image understanding and document extraction.
Build audio transcription, image generation, and agentic VLM/MCP workflows.
Apply multimodal safety filtering for responsible AI deployment.
Skills you will gain
- Category: AI Security
- Category: Agentic systems
- Category: Vision Transformer (ViT)
- Category: Model Context Protocol
- Category: Image Analysis
- Category: Generative AI Agents
- Category: Retrieval-Augmented Generation
- Category: Generative AI
- Category: Large Language Modeling
- Category: Agentic Workflows
- Category: Fine-tuning
- Category: Computer Vision

