NVIDIA
STT En ContextNet 1024 MLS
Model
NVIDIA
STT En ContextNet 1024 MLS

ContextNet-1024 model for English Automatic Speech Recognition, trained on English subset of Multilingual Librispeech Dataset.

  • 1 Version
    1.0.0Selected
    09/16/2021 12:17 AM UTC453.91 MB
    Accuracy
    KeyValue
    Librispeech Dev-Other4.1 %
    Librispeech Test-Other4.2 %
    MLS Dev4.6 %
    MLS Test5.6 %
    Model
    KeyValue
    ARCHITECTUREContextNet
    INPUTS16000 KHZ MONO-CHANNEL AUDIO (WAV FILES)
    OUTPUTSTRANSCRIBED SPEECH