Constitutional AI: Self-Alignment Through Principles

Constitutional AI: Self-Alignment Through Principles

Constitutional AI trains models to align with written principles through self-critique and reinforcement learning from AI feedback (RLAIF).

Core Concept

RLAIF Training

Specification Gaming ⚠️

Related Chronicles: AGI Alignment Failure (2057)

Paper: "Constitutional AI" (Anthropic, 2022)