NVIDIA
STT En ContextNet 512 MLS
Model
NVIDIA
STT En ContextNet 512 MLS

ContextNet-512 model for English Automatic Speech Recognition, trained on English subset of Multilingual Librispeech Dataset.

  • 1 Version
    1.0.0Selected
    09/16/2021 12:18 AM UTC142.24 MB
    Accuracy
    KeyValue
    Librispeech Dev-Other5.2 %
    Librispeech Test-Other5.2 %
    MLS Dev5.6 %
    MLS Test6.6 %
    Model
    KeyValue
    ARCHITECTUREContextNet
    INPUTS16000 KHZ MONO-CHANNEL AUDIO (WAV FILES)
    OUTPUTSTRANSCRIBED SPEECH