РАЗРАБОТКА СИСТЕМЫ АВТОМАТИЧЕСКОГО РАСПОЗНАВАНИЯ РЕЧИ ДЛЯ КАРАКАЛПАКСКОГО ЯЗЫКА С ИСПОЛЬЗОВАНИЕМ Wav2Vec

Authors

  • Н.У. Утеулиев

    Нукусский филиал Ташкентского университета информационных технологии

  • Ж.К. Кудайбергенов

    Нукусский филиал Ташкентского университета информационных технологии

  • Т.К. Кудайбергенов

    Нукусский филиал Ташкентского университета информационных технологии

Keywords: ASR, Wav2Vec, recognition, model, frequency, metrics

Abstract

This paper presents a new approach to Automatic Speech Recognition (ASR) for the Karakalpak language, leveraging deep learning techniques, specifically the Wav2Vec model. The study outlines the methodology for capturing audio streams from a microphone, processing these audio files.

References

1. Steffen Schneider, Alexei Baevski, Ronan Collobert, Michael Auli. Wav2Vec: Unsupervised Pre-training for Speech Recognition. 2019.

2. Hamza Kheddara, Mustapha Hemisb and Yassine Himeurc. Automatic Speech Recognition using Advanced Deep Learning Approaches: A survey. 2024.

3. Ethnologue. Languages of the World: Karakalpak. 2023.

4. Zhenyu Zhou, Shibiao Xu1, Shi Yin, Lantian Li, Dong Wang. A Comprehensive Investigation on Speaker Augmentation for Speaker Recognition. 2024.

5. Jinyu Li. Recent Advances in End-to-End Automatic. 2020. Speech Recognition A Review of Recent Advances.