wiki:VoiceModelDevelopment

Version 5 (modified by 226140, 3 days ago) ( diff )

--

Развој на моделот на говорен глас

Првата фаза се фокусираше на развивање на прилагоден модел на говорен глас користејќи ги сопствените снимки на корисникот. Платформата Applio беше користена преку тетратка (notebook) на Google Colab, со монтиран Google Drive за да се обезбеди пристап до збирот на податоци за обука. Обуката беше извршена со помош на Tesla T4 GPU со 14 GB VRAM. Notebook-от на Google Colab за Applio што се користеше за процесот е достапен тука: ​https://colab.research.google.com/github/iahispano/applio/blob/master/assets/Applio.ipynb

Конечниот збир на податоци содржеше 15 минути и 7 секунди македонски и англиски говор, снимени со помош на микрофон Audio-Technica AT2020 со Focusrite Scarlett Solo. Снимките беа подготвени со отстранување на несакана бучава и беа зачувани во /content/drive/MyDrive/convoxai-speech-vocals.

За успешен развој на модел, потребно е да се поминат следните 3 процеси редоследно:

  1. Preprocess
  2. Extract
  3. Training (Како Бонус е и Export,кој може да се искористи откако е веќе истрениран моделот, за да може да се зачуваат на Drive .pth и .index датотеките; генерираниот индекс беше создаден автоматски без кликање на Generate Index и беше последица од Training-от)

Во Applio, обработката (preprocess) беше извршена со поставката на автоматско сечење на аудио, со Нормализација поставена на нула и оневозможени филтер за шум и намалување на шум.

По обработката, екстракцијата на карактеристики беше извршена со поставката RMVPE за екстракција на висината на звукот и ContentVec за екстракција на вградување, со 0 датотеки за тишина за обука.

Моделот на convoxai-speech потоа беше обучен во Applio користејќи големина на серија од 8, вкупно 30 епохи и зачувување на моделот на секои 5 епохи. Претходно обучениот и свежиот тренинг беа овозможени, додека кеш-податоци во GPU и контролното подесување беа оневозможени.

Конечниот модел беше зачуван како convoxai-speech_30e_1470s.pth (го земавме последниот, односно .pth датотеката од 30-та епоха), а Applio автоматски ја генерираше соодветната датотека convoxai-speech.index. Овие датотеки потоа беа користени за конверзија на говор во следната фаза.

Подолу се слики од сите поставки кои беа искористени.

Тренирање на говорен глас

Attachments (5)

Download all attachments as: .zip

Note: See TracWiki for help on using the wiki.