alignment research release

Constitutional AI / RLAIF

Anthropic presented a training method using principles, model-generated critiques and revisions, and reinforcement learning from AI feedback.

Original sources

Open artifact View JSON