Number of examples in each batch. A larger batch size means that model parameters are updated less frequently, but with lower variance.
Multiplier on amount of compute used for exploring search space during training.
The number of training steps between evaluation runs.
Number of evaluation samples to generate per training step.
Scaling factor for the learning rate. A smaller learning rate may be useful to avoid overfitting.