Choose a verifier, a task, and a base model. Download a ready-to-run training loop.

Reinforcement: Build Your Own Reward Model

Loading the builder…

Reinforcement: Build Your Own Reward Model