GPT-SoVITS 使用指南

news2025/4/21 1:33:56

一、简介

TTS（Text-to-Speech，文本转语音）：是一种将文字转换为自然语音的技术，通过算法生成人类可听的语音输出，广泛应用于语音助手、无障碍服务、导航系统等场景。类似的还有SVC（歌声转换）、SVS（歌声合成）等。

GPT-SoVITS：是一个开源的TTS（文本到语音）项目，它是基于生成式预训练模型GPT（Generative Pre-trained Transformer）与语音克隆技术SoVITS（Speech-to-Video Voice Transformation System）结合的语音合成工具。这个项目允许用户仅通过少量的样本数据，例如1分钟的音频文件，就可以克隆声音。它支持将汉语、英语、日语三种语言的文本转为克隆声音，并且部署方便，训练速度快，效果显著。

项目地址：https://github.com/RVC-Boss/GPT-SoVITS

在线试用地址（各种游戏600多个角色）：AI Hobbyist TTS

官方教程：GPT-SoVITS指南 · 语雀

二、入门指南

详细见官方教程：整合包教程 · 语雀

下载GPT-SoVITS：访问整合包及模型下载链接 · 语雀，下载整合包

解压缩：使用7-Zip解压缩压缩包

运行Web UI：双击go-webui.bat打开，不要以管理员身份运行！打开的bat不可以关闭！这个黑色的bat框就是控制台。

如下图所示，小黑框会显示网址并弹出网页，如果没有弹出网页可以复制http://localhost:9874/到浏览器打开

素材准备：我这里是从喜马拉雅下载的邓紫棋的声音日记。将其保存到本地目录。喜马拉雅-国内专业音频分享平台,随时随地,听我想听！

人声伴奏分离&去混响去延迟：使用UVR5工具处理原音频，如下图一点击“开启人声分离WebUI”后，会弹出下图二网页。

先用model_bs_roformer_ep_317_sdr_12.9755模型（已经是目前最好的模型）处理一遍（提取人声），然后将输出的干声音频再用onnx_dereverb最后用DeEcho-Aggressive（去混响），输出格式选wav。输出的文件默认在GPT-SoVITS-beta\output\uvr5_opt这个文件夹下。处理完的音频（vocal）的是人声，(instrument)是伴奏，(_vocal_main_vocal)的没混响的，（others）的是混响。（vocal）(_vocal_main_vocal)才是要用的文件，其他都可以删除。结束后记得到WebUI关闭UVR5节省显存。

音频切割：作用是去除冗余部分（如静音、背景杂音），保留有效人声；分割语音段落，便于模型学习发音、语调等细节特征。

首先输入原音频的文件夹路径（不要有中文），如果刚刚经过了UVR5处理那么就是uvr5_opt这个文件夹。然后建议可以调整的参数有min_length、min_interval和max_sil_kept单位都是ms。min_length根据显存大小调整，显存越小调越小。min_interval根据音频的平均间隔调整，如果音频太密集可以适当调低。max_sil_kept会影响句子的连贯性，不同音频不同调整，不会调的话保持默认。其他参数不建议调整。点击开启语音切割，马上就切割好了。默认输出路径在output/slicer_opt。

音频降噪：可消除背景噪声（如杂音、电流声、环境音），保留纯净人声，并增强语音的清晰度。

如果你觉得你的音频足够清晰可以跳过这步（我这里下载的音频没杂音，跳过），降噪对音质的破坏挺大的，谨慎使用。输入刚才切割完音频的文件夹，默认是output/slicer_opt文件夹。然后点击开启语音降噪。默认输出路径在output/denoise_opt。

打标：打标就是给每个音频配上文字，这样才能让AI学习到每个字该怎么读。这里的标指的是标注。

如果你上一步切分了或者降噪了，那么已经自动帮你填充好路径了。然后选择达摩ASR或者fast whisper。达摩ASR只能用于识别汉语和粤语，效果也最好。fast whisper可以标注99种语言，是目前最好的英语和日语识别，模型尺寸选large，语种选auto自动。whisper可以选择精度，建议选float16，float16比float32快。然后点开始语音识别就好了，默认输出是output/asr_opt这个路径。