Changes between Version 2 and Version 3 of VoiceModelDevelopment


Ignore:
Timestamp:
09/28/26 22:05:21 (3 days ago)
Author:
226140
Comment:

--

Legend:

Unmodified
Added
Removed
Modified
  • VoiceModelDevelopment

    v2 v3  
    22= Развој на моделот на говорен глас
    33
    4 Првата фаза на развој се фокусираше на креирање на прилагоден модел на говорен глас користејќи го снимениот говор на корисникот. Збирот податоци се состоеше од приближно 15 минути говор на македонски и англиски јазик, снимен користејќи го природниот говорен глас на корисникот. Снимките беа подготвени како збир на податоци за обука и беа наменети да обезбедат доволна варијација во изговорот и шемите на говорење на двата јазика. За снимање на гласот беше искорестен микрофонот  Audio-Technica AT2020 појачан од Scarlett-solo и снимките беа denoise-ирани.
     4Првата фаза се фокусираше на развивање на прилагоден модел на говорен глас користејќи ги сопствените снимки на корисникот. Платформата Applio беше користена преку тетратка (notebook) на Google Colab, со монтиран Google Drive за да се обезбеди пристап до збирот на податоци за обука. Обуката беше извршена со помош на Tesla T4 GPU со 14 GB VRAM. Notebook-от на Google Colab за Applio што се користеше за процесот е достапен тука: https://colab.research.google.com/github/iahispano/applio/blob/master/assets/Applio.ipynb
    55
    6 Платформата Applio беше користена за претходна обработка на збирот на податоци, екстракција на карактеристики и обука на моделот. За време на претходната обработка, снимките беа автоматски сегментирани во пократки аудио примероци. RMVPE беше користен за екстракција на висината на тонот, а ContentVec беше користен за екстракција на карактеристиките на говорникот. Резултирачките карактеристики потоа беа користени за обука на моделот на говорен глас базиран на RVC.
     6Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals. Во Applio, обработката (preprocess) беше извршена со помош на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум.
    77
    8 Обуката беше извршена со користење на Tesla T4 GPU преку Google Colab, овозможувајќи моделот да се обучи со поголема количина на GPU меморија отколку што беше достапна на локалниот систем GTX 1650. Моделот беше обучен 30 епохи користејќи претходно обучени тежини. Обуката беше успешно завршена, а добиениот модел беше зачуван заедно со неговата генерирана индексна датотека за употреба за време на конверзија на глас.
     8По обработката, екстракцијата на карактеристики беше извршена со помош на RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука.
    99
    10 По обуката, моделот беше тестиран со помош на надворешни снимки на говор. Поставките за инференција беа прилагодени за да се зачуваат оригиналните карактеристики на говорот, додека се пренесуваат карактеристиките на гласот научени од базата на податоци за обука. Конечниот обучен модел, ConVoxAI-говор, потоа беше користен како компонента за говор на системот за конверзија на глас.
     10Моделот на convoxai-speech потоа беше обучен во Applio користејќи големина на серија од 8, вкупно 30 епохи и зачувување на моделот на секои 5 епохи. Претходно обучениот и свежиот тренинг беа овозможени, додека кеш-податоци во GPU и контролното подесување беа оневозможени.
    1111
    12 == Тренирање на говорен глас
     12Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth, а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза.
     13
     14Подолу се слики од сите поставки кои беа искористени.
     15
     16== Тренирање на говорен глас
    1317
    1418[[Image(speech-training1.png)]]