Model
BERT Large Model trained with NeMo on uncased Wikipedia and Bookcorpus on a sequence length 512.
Use the NGC CLI to download:
Copied!
1 Version
1Selected03/26/2020 8:33 PM UTC1.37 GBAccuracy: 00 EpochsBatch Size: 0GPU: V100 Copied!
1Selected
03/26/2020 8:33 PM UTC1.37 GBAccuracy: 00 EpochsBatch Size: 0GPU: V100
Copied!
Finetuning Results
| Key | Value |
|---|---|
| GLUE MRPC ACCURACY | 88.72 |
| GLUE MRPC F1 | 91.96 |
| SQUADV1.1 EM | 85.79 |
| SQUADV1.1 F1 | 92.28 |
| SQUADV2.0 EM | 80.17 |
| SQUADV2.0 F1 | 83.32 |
Pretraining Setup
| Key | Value |
|---|---|
| AMP OPTIMIZATION LEVEL | O1 |
| BATCH SIZE PER GPU | 8 |
| LEARNING RATE | 0.4375E-4 |
| NUMBER OF GPUS | 8 |
| NUMBER OF ITERATIONS | 2285714 |
| ONLY MASKED LANGUAGE MODEL LOSS | True |