分享
AI数字人通用学习手册
输入“/”快速插入内容
📖
AI数字人通用学习手册
用户2838
用户2838
用户9797
用户9797
2024年5月22日修改
✍️ 作者:
华泽的个人说明书
学前须知
📌
•
学习时间
:1~3天
•
学习难度
:如果直接使用商业工具,难度低,如果使用开源方案,难度较高
•
学习方式
:
a.
根据技术能力和需求选择开源/闭源的工具
b.
选择想要做的数字人,跟着案例自己尝试做一遍。
c.
熟悉流程后,发挥想象力,应用到自己需要的数字人场景制作中
打卡核实后
「可获得证书」
,优秀打卡内容将被
「展出」
,特别优秀者会邀请来
「一起完善学习文档」
具体打卡要求详见:
【说明文档】打卡(非必须)
数字人制作主要分为以下三个阶段:
从开源的技术来看, 主要分为声音克隆和面部重建两部分; 肢体动作控制和表情控制这方面突破较少,暂不过多讨论
开源部分介绍:
1.
声音克隆
好消息:有支持win、mac的启动包,支持webui
坏消息:需要显卡,好的效果需要抽卡, 无法直接商用
1.1
so-vits-svc-fork
https://github.com/voicepaw/so-vits-svc-fork
支持一键安装和gui,好的效果需要抽卡,提供的音频质量和长度越高--相对效果越好
1.2
GPT-SoVITS
https://github.com/RVC-Boss/GPT-SoVITS/blob/main/docs/cn/README.md
GPT-SoVITS主页的功能介绍:
1.
零样本文本到语音(TTS):
输入 5 秒的声音样本,即刻体验文本到语音转换。
2.
少样本 TTS:
仅需 1 分钟的训练数据即可微调模型,提升声音相似度和真实感。
3.
跨语言支持:
支持与训练数据集不同语言的推理,目前支持英语、日语和中文。
4.
WebUI 工具:
集成工具包括声音伴奏分离、自动训练集分割、中文自动语音识别(ASR)和文本标注,协助初学者创建训练数据集和 GPT/SoVITS 模型。
a.
如果你是 Windows 用户(已在 win>=10 上测试),可以直接下载
预打包文件
,解压后双击 go-webui.bat 即可启动 GPT-SoVITS-WebUI。
更多演示可以参考:
•
GPT-SoVITS-WebUI一键整合包及使用教程
•
GPT-SOVITS进阶使用(webui篇)_哔哩哔哩_bilibili
以下不做学习要求,了解即可。
1.3 fish-speech
https://github.com/fishaudio/fish-speech