82 items
Choosing the Right Multimodal Model
Slides / VideoAudio Input and Transcription
QuizText-to-Speech / Audio Output
QuizVideo Input Handling
QuizPrompting for Image Generation
QuizImage Detail/Resolution Settings
QuizWhat Multimodal Models Are
QuizVision-Language Models Overview
QuizPassing Images to a Model
QuizImage Understanding and Captioning
QuizOCR via Multimodal Models
QuizDocument and Chart Understanding
QuizMultiple Images in One Request
QuizMultimodal Safety Risks
QuizSelecting a Multimodal Model
QuizReasoning Models and Extended Thinking
QuizVision with Function Calling
QuizMultimodal Failure Modes
QuizLong-Context Models
QuizStructuring Multimodal Messages
QuizImage Generation Models Overview
QuizImage Token Cost and Sizing
QuizCommon Input Modalities
QuizMultimodal Embeddings (CLIP-style)
QuizMultimodal RAG
QuizEmbedding Models for Multimodal Search
Slides / VideoLong-Context Models and Their Trade-offs
Slides / VideoReasoning Models and Extended Thinking
Slides / VideoMultimodal Model Failure Modes
Slides / VideoContext Window and Multimodal Inputs
Slides / VideoToken Cost of Image and Audio Inputs
Slides / VideoReading Reasoning Token Usage
Code QuizParsing to a Pydantic Schema
Code QuizJSON Mode Structured Output
Code QuizExtracting Reasoning Content
Code QuizSetting Reasoning Effort
Code QuizDecoding Generated Image Output
Code QuizGenerating Text Embeddings
Code QuizRequesting Image Generation
Code QuizMultimodal Prompting Techniques
Slides / VideoDocument and PDF Understanding
Slides / VideoText-to-Speech Capabilities
Slides / VideoSpeech-to-Text Transcription Capabilities
Slides / VideoImage Generation and Text-to-Image APIs
Slides / VideoImage Understanding Use Cases
Slides / VideoPassing Images to a Multimodal API
Slides / VideoHow Vision-Language Models See Images
Slides / VideoCommon LLM Modalities
Slides / VideoAudio as a Base64 Content Block
Code QuizImage Detail and Token Cost
Code QuizVision Input with Tool Calling
Code QuizCosine Similarity of Embeddings
Code QuizWhat Multimodal Models Are
Slides / VideoMixing Text and Image Blocks
Code QuizPassing an Image URL
Code QuizSetting Image Detail Level
Code QuizText-to-Speech Output
Code QuizAudio Transcription Input
Code QuizEncode Local Image to Base64
Code QuizSending Multiple Images
Code QuizSelecting a Vision Model
Code QuizLatency and Cost of Multimodal Inputs
FlashcardImage Generation Models
FlashcardVideo Understanding and Frame Sampling
FlashcardMultimodal Use Cases in Applications
FlashcardLong Context Models and Their Capabilities
FlashcardLimitations of Multimodal Models
FlashcardText-to-Image Prompting Basics
FlashcardReasoning Models and Extended Thinking
FlashcardCombining Text and Images in a Prompt
FlashcardDocument and Chart Understanding
FlashcardVisual Question Answering
FlashcardHow Images Are Tokenized and Cost
FlashcardImage Detail/Resolution Settings
FlashcardPassing Images to an API
FlashcardText-to-Speech (Audio Generation)
FlashcardWhat Multimodal Models Are
FlashcardVision-Language Models (VLMs)
FlashcardImage Input Formats
FlashcardOCR with Multimodal Models
FlashcardAudio Input and Transcription
FlashcardCommon Modalities
FlashcardDocument and Chart Understanding
Interpreting structured visuals.
What can a capable multimodal model do with an image of a bar chart?