Model
BERT Base Model trained with NeMo on cased Wikipedia and BookCorpus on a sequence length of 512.
Use the NGC CLI to download:
Copied!
2 Versions
1Selected03/26/2020 8:38 PM UTC500.54 MBAccuracy: 00 EpochsBatch Size: 0GPU: V100 Copied!
1Selected
03/26/2020 8:38 PM UTC500.54 MBAccuracy: 00 EpochsBatch Size: 0GPU: V100
Copied!
Finetuning Results
| Key | Value |
|---|---|
| GLUE MRPC ACCURACY | 85.05 |
| GLUE MRPC F1 | 89.32 |
| SQUADV1.1 EM | 77.42 |
| SQUADV1.1 F1 | 84.86 |
| SQUADV2.0 EM | 66.87 |
| SQUADV2.0 F1 | 69.82 |
Pretraining Setup
| Key | Value |
|---|---|
| AMP OPTIMIZATION LEVEL | O1 |
| BATCH SIZE PER GPU | 8 |
| LEARNING RATE | 0.4375E-4 |
| NUMBER OF GPUS | 8 |
| NUMBER OF ITERATIONS | 2285714 |
| ONLY MASKED LANGUAGE MODEL LOSS | YES |
03/21/2020 12:42 AM UTC500.54 MBGPU: V100 Copied!
03/21/2020 12:42 AM UTC500.54 MBGPU: V100
Copied!
Metrics
| Key | Value |
|---|---|
| Batch size per GPU | 8 |
| Number of GPUs used for training | 8 |
| Number of training steps | 2285714 |
| SQuADv1.1 EM | 77.42 |
| SQuADv1.1 F1 | 84.86 |
| SQuADv2.0 EM | 66.87 |
| SQuADv2.0 F1 | 69.82 |