Оглавление секции
-
-
Inteligența artificială în recunoașterea și sinteza vorbiriiASR • TTS • Procesare Audio • Deep Learning • Sisteme VocaleCadru didactic: lect.univ., dr. Bumbu Tudor
-
DESCRIEREA CURSULUI
Această disciplină oferă o imagine generală despre sistemele de Inteligență Artificială dedicate interacțiunii vocale dintre om și mașină, cu accent pe recunoașterea automată a vorbirii (ASR) și sinteza text-vorbire (TTS). Pe parcursul cursului vom discuta ce reprezintă semnalul audio digital, vom analiza metodele de preprocesare și extragere a trăsăturilor acustice, modelele statistice clasice, arhitecturile neuronale moderne, aplicațiile practice în asistenți vocali și sisteme de dialog, metodele de evaluare, precum și aspecte de etică, biometrie și securitate în utilizarea sistemelor vocale.Scopul disciplinei este formarea competențelor necesare pentru proiectarea, implementarea și evaluarea sistemelor inteligente bazate pe procesarea, recunoașterea și sinteza vorbirii.Sunt date 10 teme de curs, iar materialul teoretic este completat de 5 lucrări de laborator, cu exerciții practice, iar după fiecare lucrare este inclus un test (quiz).La nivel de curs sunt prevăzute și două teste de evaluare.Vă recomandăm parcurgerea consecventă a materialelor, respectarea structurii propuse și utilizarea activă a resurselor practice. -
BIBLIOGRAFIE
Bibliografie- Almutairi, Z. (2022). A review of modern audio deepfake detection methods. Algorithms, 15(5), 155. https://www.mdpi.com/1999-4893/15/5/155
- Alzantot, M., Srivastava, M., & Shi, Y. (2023). Battling voice spoofing. ACM Computing Surveys.
- Ardila, R., et al. (2019). Common Voice corpus. https://arxiv.org/abs/1912.06670
- Baevski, A., et al. (2021). Unsupervised speech recognition.
- Baevski, A., et al. (2020). Wav2vec 2.0. https://arxiv.org/abs/2006.11477
- Barrington, L., et al. (2025). Speech deepfake detection limits. https://www.nature.com/articles/s41598-025-94170-3
- Blocker, A., et al. (2025). Benchmarking IsiXhosa ASR.
- Bockl, N., et al. (2020). Rasa framework. https://arxiv.org/abs/2002.11025
- Carlini, N., & Wagner, D. (2018). Audio adversarial examples. https://arxiv.org/abs/1801.01944
- Casanova, E., et al. (2022). YourTTS. https://arxiv.org/abs/2112.02418
- Chan, W., et al. (2016). Listen, attend and spell. https://arxiv.org/abs/1508.01211
- Chen, Q., et al. (2019). BERT for Intent & Slot Filling. https://arxiv.org/abs/1902.10909
- Choi, H., & Choi, D. (2025). Fairness of ASR. https://doi.org/10.1007/s00146-025-01689-y
- Conneau, A., et al. (2021). Cross-lingual representation learning.
- Jurafsky, D., & Martin, J. H. (2025). Speech and Language Processing. https://web.stanford.edu/~jurafsky/slp3/
- Davis, K. H., et al. (1952). Automatic Recognition of Spoken Digits.
- Davis, S., & Mermelstein, P. (1980). MFCC study. https://doi.org/10.1109/TASSP.1980.1163420
- Fant, G. (1960). Acoustic Theory of Speech Production.
- Hinton, G., et al. (2012). DNN for acoustic modeling.
- Hochreiter, S., & Schmidhuber, J. (1997). LSTM.
- Rabiner, L. R. (1989). Hidden Markov Models tutorial. https://ieeexplore.ieee.org/document/18626
- Ren, Y., et al. (2020). FastSpeech 2. https://arxiv.org/abs/2006.04558
- Wang, Y., et al. (2017). Tacotron. https://arxiv.org/abs/1703.10135
- Yang, S. W., et al. (2021). SUPERB benchmark. https://arxiv.org/abs/2105.01051
- Zhang, Y., Li, J., & Liu, S. (2025). Audio deepfake detection. https://www.frontiersin.org/articles/10.3389/frai.2025.102511/full
-
TEME
01. Recunoașterea și sinteza vorbirii în interfața om–calculatorVideoPrezentăriVideoPrezentări03. Trăsături acusticeVideoPrezentăriVideoPrezentăriVideoPrezentări06. Sinteza vorbirii (TTS)VideoPrezentări07. Aplicații și evaluarea sistemelor vocaleVideoPrezentăriVideoPrezentări -
LUCRĂRI PRACTICE
01. Primii pași în analiza audio cu Python📝 Lucrarea practică 1Predare lucrare📤 Încărcați lucrarea practică nr. 102. Extragerea de trăsături acustice: MFCC și LPC📝 Lucrarea practică 2Predare lucrare📤 Încărcați lucrarea practică nr. 203. Modele moderne de recunoaștere a vorbirii (ASR)📝 Lucrarea practică 3Predare lucrare📤 Încărcați lucrarea practică nr. 304. Modele moderne de sinteză a vorbirii (TTS)📝 Lucrarea practică 4Predare lucrare📤 Încărcați lucrarea practică nr. 4 -
TEST DE EVALUARE FINALĂ
01. Evaluarea 1📄Test nr.102. Evaluarea 2📄Test nr.2
-
