Explore Library

82 items

1

Choosing the Right Multimodal Model

Slides / Video
2

Audio Input and Transcription

Quiz
3

Text-to-Speech / Audio Output

Quiz
4

Video Input Handling

Quiz
5

Prompting for Image Generation

Quiz
6

Image Detail/Resolution Settings

Quiz
7

What Multimodal Models Are

Quiz
8

Vision-Language Models Overview

Quiz
9

Passing Images to a Model

Quiz
10

Image Understanding and Captioning

Quiz
11

OCR via Multimodal Models

Quiz
12

Document and Chart Understanding

Quiz
13

Multiple Images in One Request

Quiz
14

Multimodal Safety Risks

Quiz
15

Selecting a Multimodal Model

Quiz
16

Reasoning Models and Extended Thinking

Quiz
17

Vision with Function Calling

Quiz
18

Multimodal Failure Modes

Quiz
19

Long-Context Models

Quiz
20

Structuring Multimodal Messages

Quiz
21

Image Generation Models Overview

Quiz
22

Image Token Cost and Sizing

Quiz
23

Common Input Modalities

Quiz
24

Multimodal Embeddings (CLIP-style)

Quiz
25

Multimodal RAG

Quiz
26

Embedding Models for Multimodal Search

Slides / Video
27

Long-Context Models and Their Trade-offs

Slides / Video
28

Reasoning Models and Extended Thinking

Slides / Video
29

Multimodal Model Failure Modes

Slides / Video
30

Context Window and Multimodal Inputs

Slides / Video
31

Token Cost of Image and Audio Inputs

Slides / Video
32

Reading Reasoning Token Usage

Code Quiz
33

Parsing to a Pydantic Schema

Code Quiz
34

JSON Mode Structured Output

Code Quiz
35

Extracting Reasoning Content

Code Quiz
36

Setting Reasoning Effort

Code Quiz
37

Decoding Generated Image Output

Code Quiz
38

Generating Text Embeddings

Code Quiz
39

Requesting Image Generation

Code Quiz
40

Multimodal Prompting Techniques

Slides / Video
41

Document and PDF Understanding

Slides / Video
42

Text-to-Speech Capabilities

Slides / Video
43

Speech-to-Text Transcription Capabilities

Slides / Video
44

Image Generation and Text-to-Image APIs

Slides / Video
45

Image Understanding Use Cases

Slides / Video
46

Passing Images to a Multimodal API

Slides / Video
47

How Vision-Language Models See Images

Slides / Video
48

Common LLM Modalities

Slides / Video
49

Audio as a Base64 Content Block

Code Quiz
50

Image Detail and Token Cost

Code Quiz
51

Vision Input with Tool Calling

Code Quiz
52

Cosine Similarity of Embeddings

Code Quiz
53

What Multimodal Models Are

Slides / Video
54

Mixing Text and Image Blocks

Code Quiz
55

Passing an Image URL

Code Quiz
56

Setting Image Detail Level

Code Quiz
57

Text-to-Speech Output

Code Quiz
58

Audio Transcription Input

Code Quiz
59

Encode Local Image to Base64

Code Quiz
60

Sending Multiple Images

Code Quiz
61

Selecting a Vision Model

Code Quiz
62

Latency and Cost of Multimodal Inputs

Flashcard
63

Image Generation Models

Flashcard
64

Video Understanding and Frame Sampling

Flashcard
65

Multimodal Use Cases in Applications

Flashcard
66

Long Context Models and Their Capabilities

Flashcard
67

Limitations of Multimodal Models

Flashcard
68

Text-to-Image Prompting Basics

Flashcard
69

Reasoning Models and Extended Thinking

Flashcard
70

Combining Text and Images in a Prompt

Flashcard
71

Document and Chart Understanding

Flashcard
72

Visual Question Answering

Flashcard
73

How Images Are Tokenized and Cost

Flashcard
74

Image Detail/Resolution Settings

Flashcard
75

Passing Images to an API

Flashcard
76

Text-to-Speech (Audio Generation)

Flashcard
77

What Multimodal Models Are

Flashcard
78

Vision-Language Models (VLMs)

Flashcard
79

Image Input Formats

Flashcard
80

OCR with Multimodal Models

Flashcard
81

Audio Input and Transcription

Flashcard
82

Common Modalities

Flashcard
Code QuizIntermediate

Setting Reasoning Effort

Find the invalid reasoning effort value passed to the model.

Codepython
resp = client.chat.completions.create(
    model="o3-mini",
    reasoning_effort="maximum",
    messages=[{"role": "user", "content": "Solve this logic puzzle..."}]
)

print(resp.choices[0].message.content)

What is the bug with the reasoning effort setting?