Changes between Version 2 and Version 3 of VoiceModelDevelopment
- Timestamp:
- 09/28/26 22:05:21 (3 days ago)
Legend:
- Unmodified
- Added
- Removed
- Modified
-
VoiceModelDevelopment
v2 v3 2 2 = Развој на моделот на говорен глас 3 3 4 Првата фаза на развој се фокусираше на креирање на прилагоден модел на говорен глас користејќи го снимениот говор на корисникот. Збирот податоци се состоеше од приближно 15 минути говор на македонски и англиски јазик, снимен користејќи го природниот говорен глас на корисникот. Снимките беа подготвени како збир на податоци за обука и беа наменети да обезбедат доволна варијација во изговорот и шемите на говорење на двата јазика. За снимање на гласот беше искорестен микрофонот Audio-Technica AT2020 појачан од Scarlett-solo и снимките беа denoise-ирани.4 Првата фаза се фокусираше на развивање на прилагоден модел на говорен глас користејќи ги сопствените снимки на корисникот. Платформата Applio беше користена преку тетратка (notebook) на Google Colab, со монтиран Google Drive за да се обезбеди пристап до збирот на податоци за обука. Обуката беше извршена со помош на Tesla T4 GPU со 14 GB VRAM. Notebook-от на Google Colab за Applio што се користеше за процесот е достапен тука: https://colab.research.google.com/github/iahispano/applio/blob/master/assets/Applio.ipynb 5 5 6 Платформата Applio беше користена за претходна обработка на збирот на податоци, екстракција на карактеристики и обука на моделот. За време на претходната обработка, снимките беа автоматски сегментирани во пократки аудио примероци. RMVPE беше користен за екстракција на висината на тонот, а ContentVec беше користен за екстракција на карактеристиките на говорникот. Резултирачките карактеристики потоа беа користени за обука на моделот на говорен глас базиран на RVC. 6 Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals. Во Applio, обработката (preprocess) беше извршена со помош на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум. 7 7 8 Обуката беше извршена со користење на Tesla T4 GPU преку Google Colab, овозможувајќи моделот да се обучи со поголема количина на GPU меморија отколку што беше достапна на локалниот систем GTX 1650. Моделот беше обучен 30 епохи користејќи претходно обучени тежини. Обуката беше успешно завршена, а добиениот модел беше зачуван заедно со неговата генерирана индексна датотека за употреба за време на конверзија на глас.8 По обработката, екстракцијата на карактеристики беше извршена со помош на RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука. 9 9 10 По обуката, моделот беше тестиран со помош на надворешни снимки на говор. Поставките за инференција беа прилагодени за да се зачуваат оригиналните карактеристики на говорот, додека се пренесуваат карактеристиките на гласот научени од базата на податоци за обука. Конечниот обучен модел, ConVoxAI-говор, потоа беше користен како компонента за говор на системот за конверзија на глас. 10 Моделот на convoxai-speech потоа беше обучен во Applio користејќи големина на серија од 8, вкупно 30 епохи и зачувување на моделот на секои 5 епохи. Претходно обучениот и свежиот тренинг беа овозможени, додека кеш-податоци во GPU и контролното подесување беа оневозможени. 11 11 12 == Тренирање на говорен глас 12 Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth, а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза. 13 14 Подолу се слики од сите поставки кои беа искористени. 15 16 == Тренирање на говорен глас 13 17 14 18 [[Image(speech-training1.png)]]
