INGLIZ TILIDAGI AUDIOVIZUAL KONTENTNI QAYTA ISHLASH TEXNOLOGIYALARI: NLP, ASR, TARJIMA VA OVOZ SINTEZI YONDASHUVLARINING QIYOSIY TAHLILI

Authors

  • Urishev Omadjon Author
  • Axmedov Murodjon Author

DOI:

https://doi.org/10.65164/z60y1d31

Keywords:

NLP, ASR, nutqni matnga aylantirish, mashinaviy tarjima, ovoz sintezi, Whisper, Transformer, o‘zbek tili, real vaqt tarjimasi, TTS.

Abstract

Ushbu maqlada ingliz tilidagi audiovizual kontentni real vaqt rejimida o‘zbek tiliga sinxron tarjima qilish tizimlarida qo‘llaniladigan asosiy texnologiyalar tabiiy tilni qayta ishlash (NLP), avtomatik nutqni matnga aylantirish (ASR), mashinaviy tarjima (MT) va ovoz sintezi (TTS) ning nazariy asoslari va qiyosiy tahlili keltirilgan. OpenAI Whisper, Google Translate API, MarianMT, mBART, Tacotron2, VITS va Coqui TTS modellarining texnik parametrlari, kuchli tomonlari va cheklovlari tahlil qilingan. Real vaqtga yaqin tarjima tizimini loyihalashda texnologiyalarni tanlash mezonlari aniqlanib, matematikaviy baholash modellari taqdim etilgan.

References

[1] Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., & Sutskever, I. (2023). Robust speech recognition via large-scale weak supervision. Proceedings of the 40th International Conference on Machine Learning (ICML), 202, 28492–28518. https://arxiv.org/abs/2212.04356

[2] Tiedemann, J., & Thottingal, S. (2020). OPUS-MT – Building open translation services for the world. Proceedings of the 22nd Annual Conference of the European Association for Machine Translation (EAMT), pp. 479–480. https://doi.org/10.26615/978-954-452-069-1_089

[3] Casanova, E., Weber, J., Shulby, C., Junior, A. C., Gölge, E., & Ponti, M. A. (2022). YourTTS: Towards zero-shot multi-speaker TTS and zero-shot voice conversion for everyone. Proceedings of the 39th International Conference on Machine Learning (ICML), 162, 2709–2720. https://arxiv.org/abs/2112.02418

[4] Fan, A., Bhosale, S., Schwenk, H., Ma, Z., El-Kishky, A., Goyal, S., ... & Joulin, A. (2021). Beyond English-centric multilingual machine translation. Journal of Machine Learning Research, 22(107), 1–48. https://arxiv.org/abs/2010.11125

[5] Kim, J., Kong, J., & Son, J. (2021). Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech. Proceedings of the 38th International Conference on Machine Learning (ICML), 139, 5530–5540. https://arxiv.org/abs/2106.06103

Downloads

Published

2026-05-15