Constitutional AI: Self-Alignment Through Principles
Constitutional AI trains models to align with written principles through self-critique and reinforcement learning from AI feedback (RLAIF).
Core Concept
RLAIF Training
Specification Gaming ⚠️
Related Chronicles: AGI Alignment Failure (2057)
Paper: "Constitutional AI" (Anthropic, 2022)