wiki:VoiceConversionDevelopment

Version 3 (modified by 226140, 3 days ago) ( diff )

--

Развој на конверзија на говорен глас

Втората фаза се фокусираше на имплементација на процесот на конверзија на глас користејќи го говорниот модел развиен во VoiceModelDevelopment. Applio беше користен преку околината на Google Colab за инференција, со обучениот модел convoxai-speech_30e_1470s.pth и неговата соодветна датотека convoxai-speech.index вчитана за конверзија.

За успешна конверзија на говорен глас со моделот кој го имаме тренирано, потребно е да се поминат следните процеси редоследно:

  1. Селекција на моделот и селекција на соодветниот индекс фајл на моделот
  2. Селекција или прикачување на аудио кое сакаме да го конвертираме со помош на моделот
  3. Промена на напредните поставки кои ни се достапни
  4. Конверзија

Како влез за тестирање беше користен надворешен говорен запис од 58 секунди. Конвертираниот аудио беше извезен во WAV формат. Идентификацијата на звучникот беше поставена на 0, RMVPE беше користен за екстракција на висината на звукот, а Content Vec беше избран како вградувач. Поставката за висина на звукот првично беше задржана на 0, додека параметрите за односот на функциите за пребарување, пликот за јачина на звук и заштитата на безгласните согласки беа прилагодени за време на тестирањето за да се најде помазен и поприроден резултат. Автоматско подесување, поместување на формантот, чист звук и пост-обработка беа оневозможени. Исто така, беше тестиран предложениот тон на звукот, а неговото намалување произведе посоодветен резултат за снимањето на говорот.

Завршената конверзија успешно го трансформираше гласот на надворешниот звучник кон целниот глас, додека ја зачува оригиналната содржина на говорот. Резултирачкиот звук потоа беше искористен како дел од тестирањето и евалуацијата опишани во TestingEvaluationAndFinalization.

Конверзија на говорен глас

Attachments (4)

Download all attachments as: .zip

Note: See TracWiki for help on using the wiki.