Files
Retrieval-based-Voice-Conve…/docs/jp/README.ja.md

11 KiB
Raw Blame History

Retrieval-based-Voice-Conversion-WebUI

シンプルで使いやすい声質変換/ボイスチェンジャーフレームワーク。

madewithlove


Licence Huggingface

更新日誌 | よくある質問 | AutoDL·5 円で AI 歌手をトレーニング | 対照実験記録 | オンラインデモ

English | 中文简体 | 日本語 | 한국어 (韓國語) | Français | Türkçe | Português

デモ動画はこちらでご覧ください。

RVC によるリアルタイム音声変換: w-okada/voice-changer

著作権侵害を心配することなく使用できるように、基底モデルは約 50 時間の高品質なオープンソースデータセットで訓練されています。

RVCv3 の基底モデルルをご期待ください。より大きなパラメータ、より大きなデータ、より良い効果を提供し、基本的に同様の推論速度を維持しながら、トレーニングに必要なデータ量はより少なくなります。

トレーニングと推論インターフェース リアルタイム音声変換インターフェース
go-webui.bat go-realtime_gui.bat
実行したい操作を自由に選択できます。 既に端から端までの170msの遅延を実現しました。ASIO入出力デバイスを使用すれば、端から端までの90msの遅延を達成できますが、ハードウェアドライバーのサポートに非常に依存しています。

はじめに

本リポジトリには下記の特徴があります。

  • Top1 検索を用いることで、生の特徴量を訓練用データセット特徴量に変換し、トーンリーケージを削減します。
  • 比較的貧弱な GPU でも、高速かつ簡単に訓練できます。
  • 少量のデータセットからでも、比較的良い結果を得ることができます。10 分以上のノイズの少ない音声を推奨します。)
  • モデルを融合することで、音声を混ぜることができます。ckpt processing タブの、ckpt merge を使用します。)
  • 使いやすい WebUI。
  • UVR5 Model も含んでいるため、人の声と BGM を素早く分離できます。
  • 最先端の人間の声のピッチ抽出アルゴリズム InterSpeech2023-RMVPEを使用して無声音問題を解決します。効果は最高著しくで、crepe_full よりも速く、リソース使用が少ないです。
  • A カードと I カードの加速サポート

私たちのデモビデオをチェックしてください!

環境構築

このブランチは Python 3.12 x64 を対象としています。すべてのコマンドはリポジトリのルートで実行してください。Ubuntu 24.04 x86_64 を推奨します。

Ubuntu 24.04

sudo apt update
sudo apt install -y python3.12 python3.12-venv python3.12-dev ffmpeg unzip libsndfile1 libportaudio2

python3.12 -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade pip setuptools wheel

Windows

Python 3.12 x64 をインストールし、仮想環境を作成します。

py -3.12 -m venv .venv
.venv\Scripts\activate
python -m pip install --upgrade pip setuptools wheel

ハードウェア別の依存関係

ハードウェア インストール方法
CPU、AMD、Intel requirments_cpu_py312.txt を使用。Windows は DirectML、Linux は CPU を使用
NVIDIA RTX 50 シリーズ CUDA 12.8 版 Torch を先にインストールし、その後 requirments_cu128_py312.txt
RTX 50 シリーズより前の NVIDIA CUDA 11.8 版 Torch を先にインストールし、その後 requirments_cu118_py312.txt

CPU、AMD、Intel

python -m pip install -r requirments_cpu_py312.txt

NVIDIA RTX 50 シリーズ2 段階

python -m pip install torch==2.7.1+cu128 torchaudio==2.7.1+cu128 \
  --index-url https://download.pytorch.org/whl/cu128 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu128_py312.txt

RTX 50 シリーズより前の NVIDIA2 段階

python -m pip install torch==2.7.1+cu118 torchaudio==2.7.1+cu118 \
  --index-url https://download.pytorch.org/whl/cu118 \
  --extra-index-url https://pypi.org/simple
python -m pip install -r requirments_cu118_py312.txt

Torch と CUDA を確認します。

python -c "import torch; print('torch:', torch.__version__); print('cuda:', torch.version.cuda); print('cuda available:', torch.cuda.is_available())"

アプリは NVIDIA GPU のメモリと計算能力も確認します。約 4 GiB 未満、または SM 5.3 未満の場合は CPU を使用します。

パッケージのダウンロード元

3 つの requirments_*.txt の先頭にダウンロード元があります。公式の配布元を使用する場合は --index-url--extra-index-url だけを置き換え、バージョン、CUDA 接尾辞、2 段階の順序は維持してください。

Default mirror Official source
https://mirrors.pku.edu.cn/pypi/simple https://pypi.org/simple
https://mirrors.nju.edu.cn/pytorch/whl/cpu https://download.pytorch.org/whl/cpu
https://mirrors.nju.edu.cn/pytorch/whl/cu118 https://download.pytorch.org/whl/cu118
https://mirrors.nju.edu.cn/pytorch/whl/cu128 https://download.pytorch.org/whl/cu128

モデルと実行ディレクトリ

WebUI は実行ディレクトリを自動作成します。Hugging Face モデルリポジトリからモデルをダウンロードし、次の構成を維持してください。

assets/
├── hubert_base/
│   ├── config.json
│   ├── preprocessor_config.json
│   └── pytorch_model.bin
├── rmvpe/rmvpe.pt
├── pretrained/
├── pretrained_v2/
├── uvr5_weights/
├── weights/        # user RVC .pth models
└── indices/        # user .index files
logs/
└── mute/           # training silence samples

# Exact paths used by the code
assets/hubert_base/config.json
assets/hubert_base/preprocessor_config.json
assets/hubert_base/pytorch_model.bin
assets/rmvpe/rmvpe.pt
assets/pretrained/*.pth
assets/pretrained_v2/*.pth
assets/uvr5_weights/*
assets/weights/*.pth
assets/indices/*.index
logs/mute/*

モデルのダウンロード

python -m pip install --upgrade huggingface_hub

# Required for inference and feature extraction
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "hubert_base/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI rmvpe.pt --revision main \
  --local-dir assets/rmvpe

# Required for v1/v2 training
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "pretrained/*" "pretrained_v2/*" --local-dir assets
hf download lj1995/VoiceConversionWebUI mute.zip --revision main \
  --local-dir .model-downloads
python -m zipfile -e .model-downloads/mute.zip logs

# Required only for UVR5 vocal separation
hf download lj1995/VoiceConversionWebUI --revision main \
  --include "uvr5_weights/*" --local-dir assets

Windows の AMD/Intel DirectML 環境では、さらに次のファイルが必要です。

hf download lj1995/VoiceConversionWebUI rmvpe.onnx --revision main \
  --local-dir assets/rmvpe

旧形式の hubert_base.pt はこのブランチでは使用しません。現在は assets/hubert_base/ の Transformers モデルを使用します。FCPE は torchfcpe に含まれます。

FFmpeg

上記の Ubuntu コマンドで FFmpeg がインストールされます。Windows では次のファイルをリポジトリのルートに配置します。

WebUI の起動

python webui.py

画面のない Ubuntu サーバー:

python webui.py --noautoopen

既定のポートは 7865 です。.pth モデルは assets/weights/.index ファイルは assets/indices/ に配置します。

参考プロジェクト

すべての貢献者の努力に感謝します