| | 1 | |
| | 2 | = Развој на конверзија на говорен глас |
| | 3 | |
| | 4 | Втората фаза се фокусираше на имплементација на процесот на конверзија на гласот користејќи го моделот на говорен глас развиен во F1. Обучениот модел ConVoxAI-speech со RVC беше користен за конвертирање на надворешни говорни снимки во целниот глас, додека се одржуваше оригиналната говорна содржина и вокалниот тајминг. |
| | 5 | |
| | 6 | Конверзијата беше извршена преку функционалноста за инференција на Applio. Обучениот .pth модел и соодветната .index датотека беа вчитани во системот, по што надворешни говорни снимки беа обезбедени како влез. Различни параметри за инференција беа тестирани за да се постигне природна конверзија, а воедно да се зачува висината, изговорот и карактеристиките на оригиналната изведба. |
| | 7 | |
| | 8 | Завршениот процес на конверзија успешно произведе говор конвертиран кон целниот глас. Резултатите од оваа фаза потоа беа искористени како дел од тестирањето и евалуацијата извршени во F4. |
| | 9 | |
| | 10 | == Конверзија на говорен глас |
| | 11 | |
| | 12 | [[Image(conversion1.png)]] |
| | 13 | [[Image(conversion2.png)]] |
| | 14 | [[Image(conversion3.png)]] |
| | 15 | [[Image(conversion4.png)]] |
| | 16 | |
| | 17 | |
| | 18 | |
| | 19 | |
| | 20 | |
| | 21 | |