Explore Library
AI FundamentalsAI Safety, Alignment, and Governance

78 items

1

International Coordination and AI Policy

Slides / Video
2

Model Cards and Documentation for Accountability

Slides / Video
3

AI Standards and Risk Frameworks

Slides / Video
4

AI Governance Frameworks and Principles

Slides / Video
5

Dual-Use and Misuse Risks of AI

Slides / Video
6

Near-Term vs Long-Term AI Risks

Slides / Video
7

Corrigibility and Human Control

Slides / Video
8

Hallucination and Truthfulness in LLMs

Slides / Video
9

Guardrails and Safety Layers

Slides / Video
10

Red Teaming AI Systems

Slides / Video
11

Scalable Oversight and Supervision Limits

Slides / Video
12

Distributional Shift and Robustness Failures

Slides / Video
13

Instrumental Convergence and Goal Misgeneralization

Slides / Video
14

Reinforcement Learning from Human Feedback

Slides / Video
15

Value Alignment and Human Preferences

Slides / Video
16

Specification Gaming and Reward Hacking

Slides / Video
17

Outer vs Inner Alignment

Slides / Video
18

The AI Alignment Problem Defined

Slides / Video
19

What AI Safety Is and Why It Matters

Slides / Video
20

Compute Governance

Flashcard
21

AI Incident Reporting and Monitoring

Flashcard
22

Safety-Capability Tradeoffs

Flashcard
23

Frontier Model Risks and Evaluations

Flashcard
24

Watermarking and Provenance of AI Content

Flashcard
25

Open vs Closed Model Release Decisions

Flashcard
26

Content Safety and Guardrails

Quiz
27

Safety vs Capabilities

Quiz
28

Mechanistic Interpretability

Quiz
29

Existential and Catastrophic Risk

Quiz
30

Instrumental Convergence

Quiz
31

Model Cards

Quiz
32

Risk-Based Regulation

Quiz
33

Power Concentration from AI

Quiz
34

Outer vs Inner Alignment

Quiz
35

Robustness and Distributional Shift

Quiz
36

Specification Gaming

Quiz
37

Frontier Model Evaluations

Quiz
38

Scalable Oversight

Quiz
39

Corrigibility and Interruptibility

Quiz
40

Goal Misgeneralization

Quiz
41

Value Alignment

Quiz
42

Adversarial Attacks

Quiz
43

AI Governance Frameworks

Quiz
44

Reward Misspecification

Quiz
45

Responsible AI Principles

Quiz
46

Orthogonality Thesis

Quiz
47

Constitutional AI

Quiz
48

Interpretability for Safety

Quiz
49

Staged Release

Quiz
50

Dual-Use and Misuse

Quiz
51

Near-Term vs Long-Term Safety

Quiz
52

Red Teaming AI Systems

Quiz
53

The AI Alignment Problem

Quiz
54

AI Safety Organizations

Quiz
55

Constitutional AI and AI Feedback

Flashcard
56

Near-Term vs Long-Term AI Risks

Flashcard
57

Responsible AI Principles

Flashcard
58

Dual-Use and Misuse of AI

Flashcard
59

Model Cards and Documentation

Flashcard
60

Scalable Oversight

Flashcard
61

Robustness and Distribution Shift

Flashcard
62

Risk-Based Regulatory Approaches

Flashcard
63

Red Teaming AI Systems

Flashcard
64

AI Standards and Frameworks

Flashcard
65

AI Governance Definition and Scope

Flashcard
66

Adversarial Attacks and Robustness

Flashcard
67

Orthogonality Thesis

Flashcard
68

Value Alignment and Human Values

Flashcard
69

What is AI Safety

Flashcard
70

The Alignment Problem

Flashcard
71

Specification Gaming / Reward Hacking

Flashcard
72

Corrigibility and Shutdown Problem

Flashcard
73

Existential and Catastrophic Risk from AI

Flashcard
74

AI Control Problem

Flashcard
75

Goal Misgeneralization

Flashcard
76

Outer vs Inner Alignment

Flashcard
77

Instrumental Convergence

Flashcard
78

What is AI Alignment

Flashcard
QuizIntermediate

Responsible AI Principles

Common values guiding trustworthy AI development.

Which set of values is most representative of Responsible AI principles?