AI Engineering / Working with LLMs
Multimodal & Advanced Model Capabilities
82 lessons in AI Engineering / Working with LLMs
- Choosing the Right Multimodal ModelSlides / Video
- Audio Input and TranscriptionQuiz
- Text-to-Speech / Audio OutputQuiz
- Video Input HandlingQuiz
- Prompting for Image GenerationQuiz
- Image Detail/Resolution SettingsQuiz
- What Multimodal Models AreQuiz
- Vision-Language Models OverviewQuiz
- Passing Images to a ModelQuiz
- Image Understanding and CaptioningQuiz
- OCR via Multimodal ModelsQuiz
- Document and Chart UnderstandingQuiz
- Multiple Images in One RequestQuiz
- Multimodal Safety RisksQuiz
- Selecting a Multimodal ModelQuiz
- Reasoning Models and Extended ThinkingQuiz
- Vision with Function CallingQuiz
- Multimodal Failure ModesQuiz
- Long-Context ModelsQuiz
- Structuring Multimodal MessagesQuiz
- Image Generation Models OverviewQuiz
- Image Token Cost and SizingQuiz
- Common Input ModalitiesQuiz
- Multimodal Embeddings (CLIP-style)Quiz
- Multimodal RAGQuiz
- Embedding Models for Multimodal SearchSlides / Video
- Long-Context Models and Their Trade-offsSlides / Video
- Reasoning Models and Extended ThinkingSlides / Video
- Multimodal Model Failure ModesSlides / Video
- Context Window and Multimodal InputsSlides / Video
- Token Cost of Image and Audio InputsSlides / Video
- Reading Reasoning Token UsageCode Quiz
- Parsing to a Pydantic SchemaCode Quiz
- JSON Mode Structured OutputCode Quiz
- Extracting Reasoning ContentCode Quiz
- Setting Reasoning EffortCode Quiz
- Decoding Generated Image OutputCode Quiz
- Generating Text EmbeddingsCode Quiz
- Requesting Image GenerationCode Quiz
- Multimodal Prompting TechniquesSlides / Video
- Document and PDF UnderstandingSlides / Video
- Text-to-Speech CapabilitiesSlides / Video
- Speech-to-Text Transcription CapabilitiesSlides / Video
- Image Generation and Text-to-Image APIsSlides / Video
- Image Understanding Use CasesSlides / Video
- Passing Images to a Multimodal APISlides / Video
- How Vision-Language Models See ImagesSlides / Video
- Common LLM ModalitiesSlides / Video
- Audio as a Base64 Content BlockCode Quiz
- Image Detail and Token CostCode Quiz
- Vision Input with Tool CallingCode Quiz
- Cosine Similarity of EmbeddingsCode Quiz
- What Multimodal Models AreSlides / Video
- Mixing Text and Image BlocksCode Quiz
- Passing an Image URLCode Quiz
- Setting Image Detail LevelCode Quiz
- Text-to-Speech OutputCode Quiz
- Audio Transcription InputCode Quiz
- Encode Local Image to Base64Code Quiz
- Sending Multiple ImagesCode Quiz
- Selecting a Vision ModelCode Quiz
- Latency and Cost of Multimodal InputsFlashcard
- Image Generation ModelsFlashcard
- Video Understanding and Frame SamplingFlashcard
- Multimodal Use Cases in ApplicationsFlashcard
- Long Context Models and Their CapabilitiesFlashcard
- Limitations of Multimodal ModelsFlashcard
- Text-to-Image Prompting BasicsFlashcard
- Reasoning Models and Extended ThinkingFlashcard
- Combining Text and Images in a PromptFlashcard
- Document and Chart UnderstandingFlashcard
- Visual Question AnsweringFlashcard
- How Images Are Tokenized and CostFlashcard
- Image Detail/Resolution SettingsFlashcard
- Passing Images to an APIFlashcard
- Text-to-Speech (Audio Generation)Flashcard
- What Multimodal Models AreFlashcard
- Vision-Language Models (VLMs)Flashcard
- Image Input FormatsFlashcard
- OCR with Multimodal ModelsFlashcard
- Audio Input and TranscriptionFlashcard
- Common ModalitiesFlashcard