Changes between Version 3 and Version 4 of VoiceModelDevelopment


Ignore:
Timestamp:
09/28/26 23:27:09 (3 days ago)
Author:
226140
Comment:

--

Legend:

Unmodified
Added
Removed
Modified
  • VoiceModelDevelopment

    v3 v4  
    44Првата фаза се фокусираше на развивање на прилагоден модел на говорен глас користејќи ги сопствените снимки на корисникот. Платформата Applio беше користена преку тетратка (notebook) на Google Colab, со монтиран Google Drive за да се обезбеди пристап до збирот на податоци за обука. Обуката беше извршена со помош на Tesla T4 GPU со 14 GB VRAM. Notebook-от на Google Colab за Applio што се користеше за процесот е достапен тука: https://colab.research.google.com/github/iahispano/applio/blob/master/assets/Applio.ipynb
    55
    6 Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals. Во Applio, обработката (preprocess) беше извршена со помош на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум.
     6Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals.
    77
    8 По обработката, екстракцијата на карактеристики беше извршена со помош на RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука.
     8За успешен развој на модел, потребно е да се поминат 3-те процеси редоследно и тие се:
     91. Preprocess
     102. Extract
     113. Training (Како Бонус е и Export,кој може да се искористи откако е веќе истрениран моделот, за да може да се зачуваат на Drive .pth и .index датотеките; генерираниот индекс беше создаден автоматски без кликање на Generate Index и беше последица од Training-от)
     12
     13Во Applio, обработката (preprocess) беше извршена со поставката на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум.
     14
     15По обработката, екстракцијата на карактеристики беше извршена со поставката RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука.
    916
    1017Моделот на convoxai-speech потоа беше обучен во Applio користејќи големина на серија од 8, вкупно 30 епохи и зачувување на моделот на секои 5 епохи. Претходно обучениот и свежиот тренинг беа овозможени, додека кеш-податоци во GPU и контролното подесување беа оневозможени.
    1118
    12 Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth, а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза.
     19Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth (го земавме последниот, односно .pth датотеката од 30-та епоха), а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза.
    1320
    1421Подолу се слики од сите поставки кои беа искористени.