Changes between Version 3 and Version 4 of VoiceModelDevelopment
- Timestamp:
- 09/28/26 23:27:09 (3 days ago)
Legend:
- Unmodified
- Added
- Removed
- Modified
-
VoiceModelDevelopment
v3 v4 4 4 Првата фаза се фокусираше на развивање на прилагоден модел на говорен глас користејќи ги сопствените снимки на корисникот. Платформата Applio беше користена преку тетратка (notebook) на Google Colab, со монтиран Google Drive за да се обезбеди пристап до збирот на податоци за обука. Обуката беше извршена со помош на Tesla T4 GPU со 14 GB VRAM. Notebook-от на Google Colab за Applio што се користеше за процесот е достапен тука: https://colab.research.google.com/github/iahispano/applio/blob/master/assets/Applio.ipynb 5 5 6 Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals. Во Applio, обработката (preprocess) беше извршена со помош на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум.6 Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals. 7 7 8 По обработката, екстракцијата на карактеристики беше извршена со помош на RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука. 8 За успешен развој на модел, потребно е да се поминат 3-те процеси редоследно и тие се: 9 1. Preprocess 10 2. Extract 11 3. Training (Како Бонус е и Export,кој може да се искористи откако е веќе истрениран моделот, за да може да се зачуваат на Drive .pth и .index датотеките; генерираниот индекс беше создаден автоматски без кликање на Generate Index и беше последица од Training-от) 12 13 Во Applio, обработката (preprocess) беше извршена со поставката на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум. 14 15 По обработката, екстракцијата на карактеристики беше извршена со поставката RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука. 9 16 10 17 Моделот на convoxai-speech потоа беше обучен во Applio користејќи големина на серија од 8, вкупно 30 епохи и зачувување на моделот на секои 5 епохи. Претходно обучениот и свежиот тренинг беа овозможени, додека кеш-податоци во GPU и контролното подесување беа оневозможени. 11 18 12 Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth , а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза.19 Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth (го земавме последниот, односно .pth датотеката од 30-та епоха), а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза. 13 20 14 21 Подолу се слики од сите поставки кои беа искористени.
