RVC(AIボイスチェンジャー)の使い方|VRChat・配信で使う設定方法
「RVCを使ってみたいけれど、変換した声をVRChatや配信でどう使えばいいか分からない」という方は多いのではないでしょうか。
この記事は、RVCをVRChatや配信で実際に使いたい人に向けて、配布されているボイスモデルを使って声を変換し、VRChatや配信で使えるようにするまでの手順を順番に解説します。
ポイントは、変換した声を仮想オーディオデバイスでVRChatやOBSにつなぐことです。
この記事でわかること
- RVCは、AIで声質(声の質感)を別の声に変換するボイスチェンジャーです。配布されている変換する声のサンプル(ボイスモデル)を使えば、プログラミングなしで、話し方の抑揚や感情表現はそのままに、声質だけをリアルタイムに変えられます。
- VRChatや配信で使うには、VC Client、仮想オーディオデバイス(VB-CABLE)、ボイスモデル、マイク・ヘッドセットが必要になります。VC Clientの出力を「CABLE Input」、VRChatやOBSのマイク入力を「CABLE Output」にすれば、変換した声を相手に届けられます。
- RVCは話している間ずっとGPUで声を変換し続けるため、VRChatや配信ソフトと同時に使うとGPUへの負荷が重なります。配信やVRChatで常用するなら、PCの性能は、NVIDIA製GPUのGeForce RTX 5070(VRAM 12GB)以上、メモリ16GB以上、SSD 1TB以上が目安です。
目次
RVCとは|配布モデルを読み込むだけで声質を変えられる
RVC(Retrieval-based Voice Conversion)は、AIが声質(声の質感)を別の声へ変換するオープンソースのボイスチェンジャーです。配布されているボイスモデルを専用ソフト(VC Client)に読み込めば、プログラミングなしで、話し方の抑揚や感情表現を保ちながら声質をリアルタイムに変換できます。
ボイスモデルを用意すれば、自分の声を学習させなくても使い始められます。
用意するもの
まずは以下を用意しておきましょう。それぞれ何のために必要かも合わせて説明します。
| もの | 何に使うか |
|---|---|
| PC本体(Windows・NVIDIA製GPU搭載がおすすめ) | RVCの変換処理に使います。NVIDIA製GPUが最も安定して使えます。AMD・Intel製GPUでは専用の版(DirectML版)を使い、GPUで動くモデルの形式が限られます。 |
| マイク | 自分の声をRVCに入力するために使います。VR機器に内蔵されているマイクでも動作します。 |
| ヘッドセットまたはイヤホン | 変換された後の自分の声を、話しながら確認するために使います。 |
| VC Client | 配布されているボイスモデルを読み込み、声をリアルタイムに変換するために使います。 |
| 仮想オーディオデバイス(VB-CABLEなど) | 変換後の声をVRChatやOBSなどへ橋渡しするために使います。 |
| ボイスモデル(.pthファイル) | 変換後の声のもとになるモデルです。 |
配布されているボイスモデルを使えば、自分の声を録音して学習させたり、Pythonなどのプログラミングの知識を身につけたりする必要はありません。まずは無料モデルで試してみて、気に入ったら有料モデルの購入を検討する、という進め方がおすすめです。
VB-CABLEとVC Clientをインストールする
VB-CABLEを入れる
まず、変換した声をVRChatや配信ソフトへ届けるためにVB-CABLEをインストールします。
- VB-CABLEの配布元からWindows用ファイルをダウンロードします。
- ZIPファイルを展開し、インストーラーを管理者として実行します。
- ドライバーをインストールし、PCを再起動します。
注意:再起動後、音声デバイスに「CABLE Input」「CABLE Output」が追加されているか確認します。
VC Clientを起動してボイスモデルを読み込む
次にVC Clientを起動し、使いたいボイスモデルを読み込みます。
- VC Clientの公式リポジトリ(GitHub)の案内から、PC環境に合う版をダウンロードします。
- 半角英数字だけの名前のフォルダ(例:C:\vcclient)に展開します。日本語などを含むフォルダだと、エラーで起動しないことがあります。
- 展開したフォルダの中の「start_http.bat」を実行します。初回は必要なデータのダウンロードに少し時間がかかります。
- 開いた画面の「編集」からモデルを設定する枠を選び、「Model」に.pthファイル、.indexファイルがある場合は「Index」にそのファイルを読み込みます。
注意:Indexデータがないモデルは、Modelのみを読み込みます。
VC Clientの入出力を設定して、声が変わるか確かめる
声の通り道|CABLE Inputに出して、CABLE Outputで受け取る
VB-CABLEでは、CABLE Input(再生デバイス)へ送った音が、CABLE Output(録音デバイス)から受け取れる仕組みになっています。
そのため、VC Clientで変換した声をCABLE Inputへ出し、VRChatやOBS側ではCABLE Outputをマイクとして選びます。
VC Clientの入力・出力・モニターを設定する
- 設定欄の「AUDIO」を「server」にします。serverにすると、VC Clientがマイクとスピーカーを直接扱うため遅延が小さくなり、モニターの欄も使えるようになります。
- 「input」に、使うマイクを選びます。
- 「output」に「CABLE Input」を選びます。
- 「monitor」に、自分が聞くヘッドセットまたはイヤホンを選びます。
注意:serverにした場合、input・output・monitorに選ぶデバイスは、サンプリングレートをそろえる必要があります。そろっていないと声が出ないことがあります。
変換後の声が出ているか確認する
設定後はVC Clientで変換を開始し、マイクに向かって話して変換後の声を確認します。モニターから変換後の声が聞こえれば、VC Client側の基本設定は完了です。
声が聞こえない場合は、入力マイク・CABLE Input・モニターの選択を順番に確認します。
声を調整する|最初に触るのはTUNE・INDEX・CHUNKの3つ
VC Clientの画面には、音質や遅延(声が変換されて届くまでの時間差)を調整するための項目がたくさん並んでいます。全部を覚える必要はありません。最初はこの3つだけ調整すれば、実用的に使い始められます。
- TUNE(声の高さ):数値を上げるほど声が高くなり、下げるほど低くなります。自分の声とモデルの声のバランスを見ながら、実際に話して確認しつつ調整しましょう。男性の声から女性の声へ変換するときは+12前後、女性の声から男性の声へ変換するときは-12前後から試します。(VC Client公式チュートリアルの目安)
- INDEX(声質のなじみ具合):読み込んだモデルの声にどれだけ近づけるかを調整します。上げすぎると声が機械っぽくなりやすいため、少しずつ試すのがおすすめです。
- CHUNK(処理の区切りサイズ):声を変換する際、どれくらいの長さごとに区切って処理するかの設定です。数値を小さくすると遅延が減る(声がすぐ届く)代わりにPCへの負荷が増え、音が途切れやすくなります。逆に大きくすると遅延は増えますが安定します。まずは初期値のまま使い、音が途切れる場合は1024など大きめの値にします。あわせてF0検出アルゴリズムを軽い方式(dio)にすると、負荷が下がります(VC Client公式チュートリアルの案内)。
慣れてきたら、以下のような項目も調整できます(最初は初期設定のままで問題ありません)。
| 項目 | 内容 |
|---|---|
| GAIN | マイクの入力音量・変換後の出力音量の調整 |
| NOISE | エコーや環境ノイズを抑える設定(AUDIOが「client」のときのみ使えます) |
| F0検出アルゴリズム | 声の高さを検出する方式(精度と処理負荷のバランスが変わる) |
| 無音判定のしきい値 | 小さな声を拾うか、ノイズを拾いにくくするかの調整 |
| GPU選択 | 複数GPU搭載時に、処理させるGPUを指定 |
| REC | 変換後の音声をそのまま録音する機能 |
VRChat・OBS・Discordで使う
VRChatで使う
- VRChatの設定(Settings)メニューを開きます。
- 使用するマイクを「CABLE Output」に変更します。
- ミュートになっていないか確認します。デスクトップではVキー(トグルトークの場合)、VRでは左コントローラーのXボタンでミュートを切り替えられます。クイックメニューのマイクアイコンに斜線が入っていればミュート中です。
OBSで配信に使う
- OBSの「ソース」欄の「+」をクリックし、「音声入力キャプチャ」を追加します。
- デバイスで「CABLE Output」を選びます。
- 「設定」→「音声」で、元のマイクが選ばれている場合は「無効」にします。元の声と変換後の声が両方配信に入り、重なって聞こえるのを防ぐためです。
- 話したときに、追加した音声入力キャプチャのメーターが動けば完了です。
Discordで使う
Discordでは、設定の「音声・ビデオ」で、「マイク」を「CABLE Output」にします。VC Clientで変換を開始した状態で「マイクテスト」を押し、変換後の声が聞こえれば完了です。
うまく変換できないときの対処法
声が届かない、途切れる、遅れるときは、まず音声の入出力先とPCの負荷を確認します。音質に関する調整は「声を調整する|最初に触るのはTUNE・INDEX・CHUNKの3つ」を参照してください。
| 症状 | よくある原因 | 確認するところ |
|---|---|---|
| 相手に声が届かない | VC Clientまたはアプリ側の入出力先が合っていない | VC Clientの出力がCABLE Input、VRChat・OBS・Discordの入力がCABLE Outputになっているか確認します。 |
| 元の声も一緒に聞こえる | 元のマイクとCABLE Outputの両方がアプリへ入力されている | アプリ側で元のマイクをミュートし、CABLE Outputだけを使います。 |
| VRChatとOBSの片方だけ声が出ない | 片方のアプリだけ入力デバイスが違う。または、複数のアプリが同じCABLE Outputを使ったときに、片方のアプリが独占している | 各アプリの入力デバイスを確認します。それでも片方だけ出ない場合は、VB-CABLEは本来2つのアプリをつなぐ仕組みのため、使うアプリを1つずつにして確認します。 |
| 音が途切れる・プツプツする | CHUNKが小さすぎる、またはPCの負荷が高い | 「声を調整する」を参照し、CHUNKとPC負荷を見直します。 |
| 遅延が大きい | CHUNKやPC負荷、オーディオ環境の影響 | AUDIOが「server」になっているか確認し、CHUNKを小さくしすぎない範囲で調整します。ASIO対応のオーディオインターフェースを使うと短縮できる場合があります(RVC公式では、端から端まで170ms程度、ASIO使用時で90ms程度という目安が示されています)。 |
| 声が機械っぽい | TUNEやINDEXなどの設定がモデルや声に合っていない | 「声を調整する」を参照し、TUNE・INDEXを少しずつ調整します。 |
| 話していないのにノイズが入る | マイクが環境音を拾っている、またはノイズ関連設定が合っていない | マイクの周りの環境音を確認し、「声を調整する」の無音判定のしきい値を調整します。NOISEは、AUDIOが「client」のときのみ使えます。 |
自分の声でモデルを作りたい人向け|公式WebUI
ここまで紹介したVC Clientは「配布されているモデルを使ってすぐに変換したい」人向けのルートでした。一方で、自分の声を学習させて“自分だけのボイスモデル”を作りたい場合や、音声ファイルをまとめて変換したい場合は、RVCの「公式WebUI」という、より発展的な導入ルートを使います。
公式WebUIとVC Clientの違いは、次のとおりです。
| 項目 | VC Client(ここまで紹介した方法) | 公式WebUI(発展編) |
|---|---|---|
| 向いている人 | すぐにボイスチェンジャーを試したい人、VRChatですぐ使いたい人 | 自分の声でモデルを学習したい人、音声ファイルをまとめて変換したい人 |
| 導入の手間 | 実行ファイルを起動するだけ | Gitやプログラミング環境(Python)の準備が必要で、やや手間がかかる |
| モデル学習機能 | なし(配布・購入済みモデルを読み込んで使う) | あり(トレーニング画面から自分の声のモデルを作成できる) |
| 音声ファイルの一括変換 | リアルタイム変換向け(ファイルの一括変換は公式WebUIが向いています) | 推論タブから複数ファイルをまとめて変換できる |
公式WebUIの詳しい導入手順は、RVCの公式リポジトリで確認してください。
利用時の注意点
声の利用条件や相手への配慮を確認する
- 他人の声を無断で学習・公開しない:本人の許諾を得ていない声を学習・配布すると、パブリシティ権などの権利侵害やトラブルにつながる可能性があります。
- 配布モデルの利用規約を確認する:すでに公開されているボイスモデルを使う場合も、商用利用の可否や再配布条件など、配布元が定める範囲を守って使用してください。
- なりすまし・詐欺目的での利用は避ける:本人になりすます目的や、相手を欺く目的での利用は、社会的なトラブルにつながる可能性があります。
- 相手や場所への配慮を忘れない:ボイスチェンジャーの声を苦手に感じる人もいます。VRChatや通話など人と接する場面では、周囲の反応にも気を配りながら使いましょう。
- 処理はローカル環境で完結する:自分のPCだけで変換する通常の使い方では、話した音声が外部サーバーへ送られることはありません(初回起動時に、必要なデータのダウンロードは行われます)。
RVCを快適に使うためのPC選びのポイント
RVCのリアルタイム変換は、「話している間ずっと」グラフィックボード(GPU)とCPUに負荷がかかり続ける処理です。
同時に動かすソフトと、主に負荷がかかる場所
| 同時に動かすもの | 主に負荷がかかる場所 | どんな処理か |
|---|---|---|
| RVC(VC Client) | GPU(声の高さの検出方式によってはCPUも) | 話している間ずっと、声を変換し続ける |
| VRChat | GPU(VRAMも多く使う) | ワールドやアバターの映像を描き続ける。人が多いワールドほど重くなる |
| OBS(配信) | GPUまたはCPU(エンコーダーの設定による) | 画面を合成し、配信用に圧縮する(エンコード)。NVIDIA製GPUの専用回路(NVENC)を使うとCPUの負荷を抑えられる |
| Discord | 比較的軽い | 通話の音声を送受信する |
VRChatとRVCはどちらもGPUを使い続けるため、同時に使うとGPUの性能とVRAMの余裕が、そのまま快適さの差になります。
快適に使うためのスペックの目安は以下のとおりです(下記の目安は2026年9月時点のGPUラインアップをもとにしています。GPUは世代交代があるため、実際の製品選定時は最新のスペックをご確認ください)。
| 用途・目的 | GPU(VRAM)の目安 | メモリ(RAM) | ストレージ(SSD) |
|---|---|---|---|
| お試し・単発での声質変換 | RTX 5060/RTX 5060 Ti 8GB(8GB前後) | 8〜16GB | 500GB〜 |
| 配信・ゲーム実況・VRChatで常用 | RTX 5060 Ti 16GB/RTX 5070/RTX 5070 Ti(12〜16GB) | 16GB | 1TB |
| モデル学習・複数モデル運用 | RTX 5080/RTX 5090(16GB以上) | 32GB〜 | 1TB〜 |
グラフィックボードの「VRAM」は、AIモデルを一時展開する作業スペースのようなもので、少ないと配信・ゲームとの同時使用で音切れや遅延が起きやすくなります。常用するならまずGPU性能を優先し、単発で試すだけなら必ずしもハイエンドである必要はありません。上のリンクから、条件に合うモデルを絞り込んで確認できます。
配信やVRChatと同時に高負荷なゲームも動かしたい場合は、1台のPCにグラフィックボードを2枚搭載して「ゲーム描画」と「RVC変換」を分担させる構成も選択肢です。その場合は増設対応のケース・電源容量を備えたモデルを選びましょう。
第一候補はGeForce RTX搭載のゲーミングPCやクリエイター向けPCです。既存PCへの増設・換装なら、グラフィックボード単体の購入も検討できます。マイクやヘッドセット、ASIO対応のオーディオインターフェースなど周辺機器の見直しも、遅延短縮には有効です。
関連記事:画像生成AI(Stable Diffusion)推奨PCの選び方|快適さはVRAM容量で変わる
まとめ
RVCは、配布されているボイスモデルをVC Clientに読み込めば、プログラミングなしで話し方はそのままに声質だけをリアルタイムに変換できます。
VRChatやOBSへ変換後の声を届けるときは、VC Clientの出力をCABLE Input、各アプリのマイク入力をCABLE Outputに設定します。音が途切れる・遅れる場合はCHUNKとPC負荷を見直し、配信やVRChatで常用するならGeForce RTX 5070(VRAM 12GB)以上を目安にPC構成を検討してください。
よくある質問(FAQ)
-
Q1RVCは無料で使えますか?
RVC自体はオープンソースソフトウェアのため無料で利用できます。ただし、変換に使うボイスモデルはBOOTHなどで無料・有料の両方が配布されており、精度の高いモデルは有料の場合があります。 -
Q2プログラミングの知識がなくても使えますか?
この記事で紹介したVC Clientのルートであれば、実行ファイルをダウンロードして起動するだけなので、プログラミングの知識は不要です。自分の声を学習させたい場合に使う公式WebUIのルートは、Pythonなどの環境構築が必要になります。 -
Q3VRChat以外の用途でも使えますか?
はい。配信・ゲーム実況、Discordなどでのボイスチャット、歌ってみた・AIカバー制作、動画のアフレコ・吹き替えなど、幅広い用途で使われています。 -
Q4どのくらいの音声データがあればモデルを作れますか?
公式リポジトリによると、10分程度のノイズが少ない音声データからでも、実用的なボイスモデルを作成できるとされています。ただし、データの質によって必要な量は変わるため、目安として捉えてください。 -
Q5WindowsとMacどちらでも使えますか?
VC ClientにはWindows版とMac版があります。ただし、GPUを使って快適にリアルタイム変換できる環境は、WindowsとNVIDIA製GPUの組み合わせが中心です。AMD・Intel製GPUでは専用の版(DirectML版)を使い、GPUで動くモデルの形式が限られます。 -
Q6遅延はどのくらいですか?
RVC公式では、端から端まで170ms程度、ASIO対応のオーディオインターフェースを使った場合は90ms程度という目安が示されています。実際の遅延はPCスペックや設定によって変わります。 -
Q7PCのゲーム音やBGMまで変換されてしまうのはなぜですか?
Windowsの既定の再生デバイスをCABLE Inputにしていると、PCのすべての音がCABLE Outputに流れ、VRChatや配信にゲーム音やBGMが入ってしまいます。既定の再生デバイスは普段使うスピーカーやヘッドセットに戻し、CABLE InputはVC Clientの出力先としてだけ使います。 -
Q8VC Clientを起動しても画面が開かないときは、どうすればいいですか?
ウイルス対策ソフトがファイルを確認している間は、画面が開かないことがあります。しばらく待つか、自己責任でVC Clientのフォルダをウイルス対策ソフトの除外対象にしてください。また、フォルダの場所に日本語などが含まれているとエラーになることがあるため、半角英数字だけのフォルダに展開し直します(VC Client公式チュートリアルの案内)。 -
Q9ボイスモデルは途中で切り替えられますか?
VC Clientでは、複数のボイスモデルをモデルスロットに登録しておけば、画面のモデル選択から使うモデルを選び直せます。登録や削除は、モデル選択エリアの『編集』から行います。
