NVIDIA
NVIDIA
BertBaseCasedForNeMo
Model
NVIDIA
NVIDIA
BertBaseCasedForNeMo

BERT Base Model trained with NeMo on cased Wikipedia and BookCorpus on a sequence length of 512.

2 Versions
1Selected
03/26/2020 8:38 PM UTC500.54 MBAccuracy: 00 EpochsBatch Size: 0GPU: V100
Finetuning Results
KeyValue
GLUE MRPC ACCURACY85.05
GLUE MRPC F189.32
SQUADV1.1 EM77.42
SQUADV1.1 F184.86
SQUADV2.0 EM66.87
SQUADV2.0 F169.82
Pretraining Setup
KeyValue
AMP OPTIMIZATION LEVELO1
BATCH SIZE PER GPU8
LEARNING RATE0.4375E-4
NUMBER OF GPUS8
NUMBER OF ITERATIONS2285714
ONLY MASKED LANGUAGE MODEL LOSSYES
03/21/2020 12:42 AM UTC500.54 MBGPU: V100
Metrics
KeyValue
Batch size per GPU8
Number of GPUs used for training8
Number of training steps2285714
SQuADv1.1 EM77.42
SQuADv1.1 F184.86
SQuADv2.0 EM66.87
SQuADv2.0 F169.82