Explore Library
AI FundamentalsData Preprocessing and Feature Engineering

36 items

1

Coalesce Won't Increase Spark Partitions

Code Quiz
2

Distributed Feature Scaling and Shuffles in Spark

Quiz
3

Imputation Leakage and Downstream Bias

Code Quiz
4

Imputation Leakage and Downstream Bias

Quiz
5

Shuffles and Joins in Distributed Feature Engineering

Flashcard
6

Imputation Bias and Missingness Mechanisms

Flashcard
7

Partitioning, Shuffles, and Joins in Spark

Slides / Video
8

Imputation Bias in Missing Data

Slides / Video
9

Imputing Sentinel-Coded Missing Values

Code Quiz
10

Missing Data Mechanisms and Imputation

Quiz
11

Scaling Before the Train/Test Split

Code Quiz
12

Preventing Leakage in Scaled Feature Pipelines

Quiz
13

Feature Pipelines at Scale

Flashcard
14

Missing Data, Outliers & Data Quality

Flashcard
15

Feature Pipelines at Scale

Slides / Video
16

Missing Data, Outliers & Data Quality

Slides / Video
17

Mean Imputation With Sentinel Values

Code Quiz
18

Preventing Data Leakage in Imputation

Quiz
19

Scaling Train and Test Data

Code Quiz
20

Encoding High-Cardinality Categorical Features

Quiz
21

Feature Engineering & Encoding Essentials

Flashcard
22

Feature Engineering & Encoding Essentials

Slides / Video
23

Dropping Missing Rows in Pandas

Code Quiz
24

Handling Missing Data in Pandas

Quiz
25

Filtering a DataFrame with two conditions

Code Quiz
26

Filtering Rows in Pandas

Quiz
27

Handling Missing Data & Duplicates

Slides / Video
28

Pandas: Load, Filter & Select Data

Slides / Video
29

Handling Missing Data & Duplicates

Flashcard
30

Pandas: Loading, Filtering & Selecting Data

Flashcard
31

Encoding, Scaling & Transformations

Slides / Video
32

Handling Missing Data & Outliers

Slides / Video
33

Encoding, Scaling & Transformations

Flashcard
34

Handling Missing Data & Outliers

Flashcard
35

One-Hot Encoding a Category Column

Code Quiz
36

Detecting Outliers with IQR

Code Quiz
Slides / Video

Partitioning, Shuffles, and Joins in Spark

How partitioning strategy, shuffle boundaries, and join types decide whether distributed feature engineering scales or stalls.

Slide 1
1 / 6