Frame-VAD Multilingual MarbleNet
Model
Frame-VAD Multilingual MarbleNet

Frame-based VAD model using MarbleNet model trained with real multilingual data and synthetic English data.

1 Version
1.20.0Selected
05/02/2023 6:40 PM UTC490 KB
Accuracy
KeyValue
AMI AUROC95.83
CH109 AUROC92.43
AVA AUROC93.77
VoxConv AUROC96.45
Model
KeyValue
ArchitectureMarbleNet-3x2x64-20ms
OutputsSequence of speech probability for each 20ms frame
InputsAudio
Number of Weights94K