78 items
International Coordination and AI Policy
Slides / VideoModel Cards and Documentation for Accountability
Slides / VideoAI Standards and Risk Frameworks
Slides / VideoAI Governance Frameworks and Principles
Slides / VideoDual-Use and Misuse Risks of AI
Slides / VideoNear-Term vs Long-Term AI Risks
Slides / VideoCorrigibility and Human Control
Slides / VideoHallucination and Truthfulness in LLMs
Slides / VideoGuardrails and Safety Layers
Slides / VideoRed Teaming AI Systems
Slides / VideoScalable Oversight and Supervision Limits
Slides / VideoDistributional Shift and Robustness Failures
Slides / VideoInstrumental Convergence and Goal Misgeneralization
Slides / VideoReinforcement Learning from Human Feedback
Slides / VideoValue Alignment and Human Preferences
Slides / VideoSpecification Gaming and Reward Hacking
Slides / VideoOuter vs Inner Alignment
Slides / VideoThe AI Alignment Problem Defined
Slides / VideoWhat AI Safety Is and Why It Matters
Slides / VideoCompute Governance
FlashcardAI Incident Reporting and Monitoring
FlashcardSafety-Capability Tradeoffs
FlashcardFrontier Model Risks and Evaluations
FlashcardWatermarking and Provenance of AI Content
FlashcardOpen vs Closed Model Release Decisions
FlashcardContent Safety and Guardrails
QuizSafety vs Capabilities
QuizMechanistic Interpretability
QuizExistential and Catastrophic Risk
QuizInstrumental Convergence
QuizModel Cards
QuizRisk-Based Regulation
QuizPower Concentration from AI
QuizOuter vs Inner Alignment
QuizRobustness and Distributional Shift
QuizSpecification Gaming
QuizFrontier Model Evaluations
QuizScalable Oversight
QuizCorrigibility and Interruptibility
QuizGoal Misgeneralization
QuizValue Alignment
QuizAdversarial Attacks
QuizAI Governance Frameworks
QuizReward Misspecification
QuizResponsible AI Principles
QuizOrthogonality Thesis
QuizConstitutional AI
QuizInterpretability for Safety
QuizStaged Release
QuizDual-Use and Misuse
QuizNear-Term vs Long-Term Safety
QuizRed Teaming AI Systems
QuizThe AI Alignment Problem
QuizAI Safety Organizations
QuizConstitutional AI and AI Feedback
FlashcardNear-Term vs Long-Term AI Risks
FlashcardResponsible AI Principles
FlashcardDual-Use and Misuse of AI
FlashcardModel Cards and Documentation
FlashcardScalable Oversight
FlashcardRobustness and Distribution Shift
FlashcardRisk-Based Regulatory Approaches
FlashcardRed Teaming AI Systems
FlashcardAI Standards and Frameworks
FlashcardAI Governance Definition and Scope
FlashcardAdversarial Attacks and Robustness
FlashcardOrthogonality Thesis
FlashcardValue Alignment and Human Values
FlashcardWhat is AI Safety
FlashcardThe Alignment Problem
FlashcardSpecification Gaming / Reward Hacking
FlashcardCorrigibility and Shutdown Problem
FlashcardExistential and Catastrophic Risk from AI
FlashcardAI Control Problem
FlashcardGoal Misgeneralization
FlashcardOuter vs Inner Alignment
FlashcardInstrumental Convergence
FlashcardWhat is AI Alignment
FlashcardAI Control Problem
The control problem is how to keep a powerful AI under meaningful human oversight and direction.
What is the AI control problem?