alignment research release
Constitutional AI / RLAIF
Anthropic presented a training method using principles, model-generated critiques and revisions, and reinforcement learning from AI feedback.
alignment research release
Anthropic presented a training method using principles, model-generated critiques and revisions, and reinforcement learning from AI feedback.