Whisperとは?ローカル文字起こしの使い方
Whisper(ウィスパー)は、音声を文章へ変換でき、日本語を含む多言語に対応する音声認識モデルとして注目されています。会議の議事録、取材音源の書き起こし、動画の字幕作成など、録音を聞きながら文章を入力する作業を効率化する強い味方です。
Whisperは、クラウドサービスに組み込まれた形でも、自分のPCへ導入するローカルAIとしても利用できます。ローカルで使えば、会議や取材の音声を文字起こしサービスへアップロードせずにPC内で処理できるため、音声の外部送信を避けたい場合に有効です。ただし、端末側の情報管理は別途必要です。
この記事では、Whisperをクラウドで使う場合とローカルで使う場合の違いを起点に、保存済み音声とマイク音声を文字起こしする方法を説明します。そのうえで、処理時間と修正量を測ってAIモデルを選び、必要なPCスペックへ落とし込む手順まで解説します。専門用語は本文で説明し、記事後半の「Whisperで使う基本用語」にもまとめています。
この記事でわかること
- 機密情報を含む音声を外部へ送りたくない場合はローカル、インストール作業をせずに始めたい場合はクラウドを選び、利用前に保存期間・学習利用・削除方法を確認する
- ローカル文字起こしでは、Whisperを動かすPythonと音声を読み込むFFmpegを準備し、4段階で日本語音声から文章用のTXTまたは字幕用のSRT・VTTを作成する
- 同じ5~10分の音声をsmall・medium・turboで処理し、処理時間と修正時間を比べてから、VRAM約2GB・5GB・6GBという目安に合うモデルとPC構成を選ぶ
目次
Whisperとは
Whisperは、OpenAIが公開している音声認識モデルです。音声認識モデルとは、人が話した音声を解析し、文章へ変換するAIを意味します。日本語を含む多言語の文字起こし、話している言語の識別、外国語音声から英語への翻訳に対応しています。
Whisperは、クラウドサービスやAPIへ組み込んで利用する方法と、公開されているコードとAIモデルのデータを自分のPCへ導入して動かす方法があります。後者が、処理を自分のPC内で行うローカルAIとしての使い方です。次の章では、この2つの違いを処理場所・導入方法・料金・データ管理に分けて整理します。
Whisperは、音声を認識するAIの仕組みそのものを指し、ボタンを押すだけで使える一つの完成アプリを指す名称ではありません。実際に利用するには、コマンドで操作するOpenAI公式Whisper、処理方法を最適化したfaster-whisper(ファスター・ウィスパー)やwhisper.cpp(ウィスパー・シーピーピー)、またはWhisperを組み込んだ画面操作型のソフトを選びます。
Whisperでできること
- 会議や取材で保存した音声ファイルを文章へ変換する
- 動画の音声から、時間情報付きの字幕ファイルを作成する
- 日本語を含む多言語を判別して文字起こしする
- 対応ソフトを組み合わせ、マイク音声を順次文字にする
Whisperが出力する文章は完成原稿ではありません。人名、製品名、金額、日付、否定表現は元音声と照合する必要があります。また、Whisperの基本機能に、話者を自動で特定する機能や文章を要約する機能は含まれません。
Whisperをクラウドとローカルで使う違い
AIによる文字起こしは、音声をサービス事業者の環境へ送るクラウド型と、自分のPC内で処理するローカル型に分けられます。Whisperはモデルなので、クラウドサービスやAPIへ組み込んで使うことも、自分のPCへ導入して使うこともできます。
クラウド型文字起こしとローカルWhisperの比較
| 比較項目 | クラウド型 | ローカル型 |
|---|---|---|
| 処理場所 | サービス事業者の環境 | 自分のPC内 |
| 始めやすさ | アカウント作成後に使いやすい | 実行ソフトとモデルの準備が必要 |
| 音声の送信 | インターネット経由でサービス側へ送信 | 構築後はPC内だけで処理できる |
| 処理速度 | サービス側の設備と混雑状況に左右される | 自分のCPU・GPU、モデル、実装に左右される |
| 料金 | 月額・時間・容量などの料金を確認 | Whisperは無料。PC購入費・電気代・管理作業は必要 |
| 付加機能 | 話者分離、要約、共有に対応する場合がある | 別ソフトや追加モデルが必要な場合がある |
クラウドで使う場合は導入しやすさとデータの取り扱いを確認する
クラウド型は、アカウントを作成して音声をアップロードするだけで始めやすく、話者分離、要約、共有まで一つの画面で行えるサービスもあります。一方、音声と文字起こし結果はサービス事業者の環境で処理されるため、利用前にどこへ送られ、どのくらい保存され、誰が管理できるかを確認します。
クラウド型文字起こしを利用する前の確認項目
| 確認項目 | 確認する内容 |
|---|---|
| 送信先・保存先 | 音声と文字起こし結果を処理・保存する国や地域、再委託先 |
| 保存期間 | アップロードした音声と生成された文章が削除される時期 |
| 学習利用 | 入力データがモデル改善へ使われるか、拒否設定があるか |
| 削除方法 | 利用者が即時削除できるか、バックアップにも削除が反映されるか |
| アクセス管理 | 管理者権限、共有範囲、多要素認証、操作履歴を設定できるか |
| 契約・規程 | 秘密保持契約、個人情報の扱い、所属先の情報管理規程に合うか |
| 事故時の対応 | 障害や漏えい時の通知方法、問い合わせ窓口、データの復旧方針 |
機密情報や個人情報を含む音声は、サービス名だけで利用可否を決めません。利用中のプランに適用される規約と管理画面を確認し、所属先の承認を得てからアップロードします。規約や機能は変更されるため、導入時だけでなく契約更新時にも見直してください。
ローカルで使う場合は外部送信を避けられるが自分で環境を管理する
ローカル型は、実行ソフトとWhisperのAIモデルをPCへ保存し、音声の読み込みから結果保存までPC内で処理します。文字起こしサービスへ音声をアップロードせずに済む一方、ソフトの導入、PC性能の確保、データの保存・削除を利用者側で管理します。
初回の準備にはインターネット接続が必要
ローカルで使えることは、最初から一切通信しないことを意味しません。初回は、実行ソフト、関連ライブラリ、WhisperのAIモデルをダウンロードします。準備後はオフラインで文字起こしできる構成もありますが、GUIソフトの更新確認や外部の要約機能が通信する場合があります。
オフライン運用が必要な場合は、必要なデータを取得したあとにネットワークを切り、音声の読み込みから結果保存まで完了できるかテストします。
PCと音声データの管理方法を決める
ローカル処理は外部サービスへの送信経路を減らせますが、PCの紛失、不正アクセス、マルウェア、共有設定の誤りまでは防ぎません。運用前に次の項目を決めます。
- 元音声、作業中データ、完成した文章の保存先
- PCと保存先へアクセスできる利用者
- ストレージとバックアップの暗号化方法
- 音声と中間ファイルを削除する時期
- 実行ソフトとAIモデルの更新担当者
クラウドとローカルは音声の扱いと運用負担で選ぶ
インストール作業をせずに始めたい場合や、話者分離・要約・共有をまとめて使いたい場合はクラウド型が候補です。機密情報を含む音声を外部サービスへ送りたくない場合や、処理量に応じた利用料金を避けたい場合はローカル型が候補です。
文字起こし精度は処理場所だけでは決まりません。候補を絞ったら、実際の会議や取材から同じ5~10分を使い、固有名詞・数字・否定表現の誤り数、処理時間、修正時間を比較します。費用はクラウドの月額・従量料金と、ローカルのPC費用・導入・更新にかかる作業時間まで含めて比べます。
Whisperをローカルで使うために必要なPCスペック
PC選びでは、最初からすべてのパーツを高性能にする必要はありません。まず既存PCで、実際に使う音声を5~10分だけ処理します。完了までの時間が業務上問題なければ、そのPCを使い続けられます。処理が遅く、待ち時間を短縮したい場合にGPU対応の実行環境を検討します。
GPUを使う場合は、使用したいWhisperのAIモデルがグラフィックボードのVRAMへ収まることが最初の条件です。次に、会議ソフトや文書編集ソフトを同時に使えるメモリ容量と、AIモデル・音声ファイルを保存できるSSD容量を確認します。
- 既存PCで5~10分の音声を処理する
CPUだけでも実行できます。まず処理時間と修正時間を記録し、1時間分の音声を期限までに処理できるか判断します。 - 待ち時間が長い場合はGPU対応を確認する
使用するWhisper実装がGPUに対応しているかを公式ページで確認します。グラフィックボードを搭載するだけでは高速化されません。 - 使うAIモデルに合わせてVRAMを選ぶ
smallなら約2GB、mediumなら約5GB、turboなら約6GBが公式Whisperの目安です。VRAM容量を確認してからグラフィックボードを絞り込みます。 - 同時作業と保存量からメモリ・SSDを決める
文字起こしと会議・録音・文書編集を同時に行うならメモリ32GBを候補にします。SSDは保存するAIモデルと月間の音声量を基に空き容量を確保します。
モデル別のVRAM目安
AIモデルとは、学習した情報を基に入力データを処理するAIの中核部分です。Whisperでは、音声から文章を推定するために使います。tiny(タイニー)、base(ベース)、small(スモール)、medium(ミディアム)、large(ラージ)、turbo(ターボ)という規模や処理特性の異なるAIモデルが用意されており、選んだAIモデルによって必要なVRAMと処理時間が変わります。
グラフィックボードを選ぶときは、使いたいAIモデルのVRAM目安以上の容量があるかを確認します。続いて、利用する実行ソフトの公式ページで、使用予定のOS、GPU、GPUドライバー、CUDAなどの必要条件を確認してください。VRAM容量を満たしていても、実行ソフトがGPUやライブラリへ対応していなければGPU処理を利用できない場合があります。
Whisperモデルの規模とVRAM目安
| モデル | VRAM目安 | 選び方の目安 |
|---|---|---|
| tiny / base | 約1GB | 導入確認や速度を優先する場合。日本語では多言語版を選ぶ |
| small | 約2GB | 既存PCで精度と速度を比較し始める候補 |
| medium | 約5GB | smallで修正が多い場合に比較する候補 |
| turbo | 約6GB | large-v3を基に文字起こし速度を高めたモデル |
| large | 約10GB | 大きいモデルを検証したい場合。処理負荷も確認する |
出典:OpenAI Whisper公式リポジトリ「Available models and languages」(2026年9月17日確認)。速度は言語、音声、PC、実行ソフトによって変わるため、モデル名だけでは確定しません。
CPU・メモリ・SSDの考え方
| 部品 | 確認するポイント |
|---|---|
| CPU | CPUだけで処理する場合の中心となる部品。コア数だけでなく、使用ソフトが対応する命令や最適化も確認する |
| メモリ | 文字起こしだけなら16GBから検討できる。オンライン会議、録音、文書編集を同時に行う業務では32GBを候補にする |
| SSD | モデル、元音声、中間ファイル、出力結果を保存する。案件ごとの音声量を計算し、空き容量を残す |
| グラフィックボード | 使用ソフトがGPUに対応する場合に処理時間を短縮しやすい。VRAM容量と対応ライブラリを確認する |
メモリ16GB・32GBは業務の同時利用を含む構成目安であり、Whisper公式の必須要件ではありません。導入する実行ソフトの要件を優先してください。
Whisperで音声ファイルを文字起こしする手順
Whisperの使い方は、文字で命令を入力するコマンド操作と、ボタンやメニューをクリックするGUIソフトに分けられます。ここでは、必要な構成を把握しやすいOpenAI公式Whisperのコマンド操作を例にします。会社のPCへソフトを追加できない場合は、作業を始める前に管理者へ確認してください。
- 目的と操作方法から導入方法を決める
保存済みの音声ファイルを処理するだけなら公式Whisperを選べます。マイク音声を順次表示したい場合はリアルタイム入力対応ソフト、コマンド操作を避けたい場合はWhisper対応GUIソフトを選びます。候補を決めたら、そのソフトの公式ページで対応OSとGPU利用の可否を確認します。 - Python・FFmpeg・Whisperを準備する
公式WhisperではPythonと、音声を読み込むためのFFmpeg(エフエフエムペグ)が必要です。Pythonはプログラムを動かす環境、FFmpegは音声や動画を変換・読み込みするソフトウェアです。 - 音声ファイルとモデルを指定する
日本語音声であることと、使用するモデルを指定して処理します。初回はモデルのダウンロードが発生します。 - 結果を確認して保存する
TXTは文章の確認、SRT・VTTは字幕の時間情報を使う場合に向きます。固有名詞、数字、否定表現を中心に元音声と照合します。
公式Whisperをインストールする
PythonとFFmpegを準備したうえで、Windowsでは「コマンドプロンプト」または「PowerShell」、macOSやLinuxでは「ターミナル」を開き、次のコマンドを入力します。これらはPythonのダッシュボードではなく、文字でOSへ命令を送るための画面です。
pip install -U openai-whisper
FFmpegの導入方法はOSによって異なります。組織で管理されているPCでは、個人判断でパッケージ管理ソフトを追加せず、管理者が指定する方法を利用します。
日本語音声を文字起こしする
例として、会議音声のファイル名をmeeting.m4a、モデルをsmallにする場合は次のように指定します。
whisper meeting.m4a --model small --language Japanese --task transcribe
--language Japaneseで日本語を指定し、--task transcribeで聞こえた言語のまま文字起こしします。音声を英語へ翻訳する指定とは役割が違います。
TXT・SRT・VTTを使い分ける
文字起こし結果は、用途に合わせてファイル形式を選びます。議事録や原稿として文章を編集するならTXT、動画の字幕として「何秒から何秒まで表示するか」という時間情報も必要ならSRTまたはVTTを使います。
| 形式 | 中に保存される情報 | 主な用途 |
|---|---|---|
| TXT | 文字起こしした文章 | 議事録や原稿へコピーして編集する |
| SRT | 字幕の文章と表示開始・終了時刻 | 動画編集ソフトへ字幕を読み込む |
| VTT | 字幕の文章と表示時刻、Web向けの付加情報 | Web動画プレーヤーなどで字幕を表示する |
Whisperの結果は完成原稿ではありません。人名、製品名、金額、日付、「する/しない」のように意味が反転する箇所は、必ず元音声で確認します。
Whisperをリアルタイム文字起こしへ使う方法
Whisper単体は会議用リアルタイムツールではない
公式Whisperの基本的な使い方は、保存済みの音声ファイルを読み込む方法です。内部では音声を30秒単位の窓で順に処理します。マイクの発言を画面へ逐次表示するには、マイク音声の取得、短い単位への分割、Whisperへの受け渡し、結果の連結を行う実行ソフトが必要です。
たとえばwhisper.cppには、マイク音声を一定間隔で取り込み、継続して認識するwhisper-streamの例があります。ただし公式説明でも基本的な実装例として位置づけられており、議事録の話者分離や確定文の編集まで備えた会議サービスとは役割が違います。
リアルタイム文字起こしを始める4段階
- リアルタイム入力に対応する実行ソフトを選ぶ
公式Whisperの音声ファイル処理ではなく、マイク入力へ対応するWhisper実装やGUIソフトを選びます。対応OS、GPUの利用可否、保存先、外部通信の有無を公式情報で確認します。 - 文字起こしする音声の入力元を決める
対面会議なら使用するマイク、オンライン会議なら自分のマイク音声と相手側のシステム音声を取り込めるか確認します。録音レベルを見ながら30秒間テストし、声が小さすぎないか、音割れがないかを確認します。 - 日本語の多言語モデルを設定する
日本語では名前に.enが付かないモデルを選びます。まずsmallまたはturboを候補にし、音声を区切る間隔や計算精度は実行ソフトの設定項目に合わせます。 - 5分間の会話で表示速度と誤認識を測る
発言から表示までの時間、固有名詞の誤り、文末が書き換わった回数を記録します。会話に追いつかない場合は、モデルを小さくする、音声の分割設定を見直す、GPU対応の実装を使う順で比較します。
マイク音声とオンライン会議の音声は入力方法が違う
PCのマイクを指定すると、自分の声や室内でスピーカーから再生された音を取り込めます。一方、ヘッドセットを使うオンライン会議では、相手の声はPC内部で再生されるため、マイク入力だけでは取り込めない場合があります。
自分と相手の音声を同時に記録する場合は、会議ソフトの録音機能、OSの音声入力設定、オーディオインターフェースなどを確認します。会議ソフトやOSによって方法が違うため、使用環境を決めてから入力テストを行います。
表示速度と認識結果のどちらを優先するか決める
リアルタイム表示では、音声を短く区切るほど表示は早くなりますが、前後の文脈が少なくなり、文章が不安定になる場合があります。長く区切ると文脈を使いやすい一方、結果が表示されるまでの待ち時間が増えます。
会議中に内容を追うことが目的なら表示の早さ、会議後の議事録作成が目的なら修正箇所の少なさを優先します。両方を同時に改善できない場合は、リアルタイム表示用と会議後の再処理用でモデルを分ける方法もあります。
録音と文字起こしの同意を確認する
ローカル処理であっても、会話を録音・保存すること自体への配慮は必要です。会議参加者や取材相手へ利用目的と保存方法を伝え、所属先の規程や案件の契約条件に沿って同意を確認します。
会議用途に向いたWhisperモデルの選び方
tiny・baseは動作確認や速度優先で試す
tinyとbaseは必要なメモリが少なく、導入後の動作確認に使いやすいモデルです。ただし、雑音のある会議や固有名詞が多い音声では、修正箇所が増える可能性があります。日本語では、名前に.enが付かない多言語版を選びます。
small・mediumは実際の会議音声で比較する
smallは約2GB、mediumは約5GBのVRAMが公式目安です。まずsmallで処理時間と修正量を測り、誤認識の修正に時間がかかる場合にmediumを同じ音声で比較します。モデルを大きくしても、マイクが遠い、反響が強い、複数人が同時に話すといった録音上の問題がすべて解消されるわけではありません。
large・turboは目的の違いを確認する
largeは約10GB、turboは約6GBのVRAMが公式目安です。turboはlarge-v3を基に文字起こし速度を高めたモデルで、公式資料では精度低下を小さく抑えつつ高速化した位置づけです。ただし、turboは音声から英語への翻訳用モデルではありません。
PCスペックだけでモデルを決めない
AIモデルは、次の手順で同じ音声を比較して決めます。
- 実際の用途に近い音声を5~10分切り出す
会議なら複数人の発言、取材なら固有名詞、動画ならBGMが含まれる部分を選びます。モデルごとに音声が違うと比較できないため、同じファイルを使います。 - smallで処理時間と修正時間を測る
文字起こし開始から完了までの時間を測り、出力後は固有名詞・数字・否定表現を元音声と照合します。文章を実用できる状態へ直すまでの時間も記録します。 - mediumまたはturboでも同じ測定を行う
smallより処理が遅くても修正時間が大きく減るなら、全体の作業時間は短くなる場合があります。反対に修正時間がほとんど変わらなければ、より大きいモデルを選ぶ効果は限定的です。 - 1時間分と1日分へ換算する
10分の音声を処理・修正する合計時間を6倍し、1時間分の所要時間を出します。さらに1日の処理本数を掛け、終業時刻など必要な期限までに完了できるモデルを選びます。
この比較でモデルを決めたあと、そのモデルのVRAM目安を満たすグラフィックボードを候補にします。録音状態が悪い場合は、大きいモデルへ替える前にマイクの距離や反響も見直してください。
GPUや高速実装でWhisperの文字起こし時間を短縮する
GPUに対応した実行環境を使う
NVIDIA製GPUとCUDA(クーダ)対応の実行環境は、Whisperの処理時間を短縮する代表的な選択肢です。CUDAは、NVIDIA製GPUを計算に使うための基盤です。グラフィックボードを搭載するだけで自動的に高速化されるわけではなく、実行ソフト、GPUドライバー、CUDA関連ライブラリの組み合わせが対応している必要があります。
faster-whisperなどの実装を比較する
faster-whisperは、CTranslate2(シートランスレートツー)という推論エンジンでWhisperを動かす互換実装です。公式Whisperとは別のプロジェクトで、導入方法や必要なGPUライブラリが違います。
faster-whisperの公開ベンチマークでは、同じモデルでも実装や計算精度によって処理時間とメモリ使用量が変わります。ただし、掲載値は特定のCPU・GPU・音声・設定で測った結果です。自分のPCで同じ速度になるとは限らないため、同じ音声で比較します。
量子化で計算負荷を抑える
量子化(りょうしか)は、モデルの計算に使う数値の精度を下げ、必要なメモリや計算量を抑える方法です。対応する実装ではint8などを選べます。速度やメモリ使用量を改善できる場合がありますが、音声や設定によって認識結果が変わる可能性があるため、元の設定と比較します。
録音環境を先に改善する
マイクを発言者へ近づけ、空調音、キーボード音、室内の反響を減らすと、認識後の修正時間を抑えやすくなります。PCを高性能にしても、入力音声に含まれていない言葉を復元できるわけではありません。会議前に30秒録音し、声が小さすぎないか、音割れしていないかを確認します。
VADで無音部分の処理を減らす
VAD(ブイエーディー、音声区間検出)は、音声がある区間と無音区間を判別する仕組みです。VADに対応する実装では、無音の多い録音で処理対象を減らせる場合があります。ただし、「あー」「えー」は発声された音声なので、VADで必ず削除できるわけではありません。
処理する音声量に合わせたPCの選び方
ここでの基準は「業務用か個人用か」ではなく、1回の録音時間、1日の本数、処理完了までに待てる時間です。まず既存PCで実音声を測り、待ち時間が業務を止める場合にGPUやメモリを増やします。
| 使い方 | 構成の考え方 | 導入前の確認 |
|---|---|---|
| 短い音声をときどき処理 | 既存PCのCPUとsmall以下から試す。グラフィックボードを必須にしない | 10分の音声を処理する時間と修正量 |
| 会議・取材を継続処理 | GPU搭載PC、メモリ32GB、SSDを候補にする | 1回の録音時間、1日の本数、完了させたい時刻 |
| 長時間・複数ファイル | VRAMに余裕のあるGPU、メモリ32GB以上、十分なSSD容量と冷却を比較する | 同時処理数、連続稼働時間、月間の保存容量 |
| リアルタイム表示 | 使用ソフトが対応するGPUと、遅延を抑えられるモデルを組み合わせる | マイク入力、会議音声の取り込み、表示の遅れ |
上表は選定を始めるための目安です。メモリ容量やGPUの効果は、使用する実装と同時に動かすソフトによって変わります。PCを購入する前に、導入予定のソフトがOS・GPU・ドライバーへ対応しているか確認してください。
ノートパソコンとデスクトップPCの違い
会議室や取材先へ持ち運び、その場で録音と文字起こしを行うならノートパソコンが候補です。購入時はGPU名だけでなく、AC電源接続時の性能、ファンの動作音、バッテリー駆動時の処理速度も確認します。
決まった場所で長時間音声や複数ファイルを処理するなら、冷却性能と増設性を確保しやすいデスクトップPCが候補です。将来グラフィックボードを交換する場合は、電源容量、補助電源、ケース内の寸法も確認します。
使用ソフトを決めてからPCを選ぶ
公式Whisper、faster-whisper、whisper.cpp、GUIソフトでは、対応するOSとGPU、必要なライブラリが違います。先に「使いたいモデル」「音声ファイルかリアルタイムか」「1日に処理する量」を決め、その条件を満たすPCを比較します。
パーツを購入する前にソフトウェアの対応条件を確認する
グラフィックボード、メモリ、SSDを探す前に、利用予定のWhisper実装やGUIソフトの公式ページで次の項目を確認します。
- OS:Windows、macOS、Linuxのうち、使用するPCのOSとバージョンに対応しているか
- GPU:NVIDIA・AMD・Appleシリコンなど、使用したいGPUで高速化できるか
- GPUドライバー・CUDA:指定されたバージョンや組み合わせがあるか
- AIモデルとVRAM:small約2GB、medium約5GB、turbo約6GBなど、使いたいモデルの目安を満たすか
- メモリ・SSD:ソフトの必要容量に加え、会議ソフトとの同時利用と保存する音声量に余裕があるか
対応条件を満たしたうえで、必要なパーツがある場合は以下から比較できます。
Whisperで使う基本用語
| 用語 | この記事での意味 |
|---|---|
| Whisper | 音声を文章へ変換するOpenAIの音声認識モデル。利用時は、コマンドで動かす実装またはWhisper対応GUIソフトを組み合わせる |
| Python | 公式Whisperなどのプログラムを動かすために使うプログラミング言語と実行環境 |
| FFmpeg | 音声・動画ファイルを読み込み、変換するソフトウェア。読み方はエフエフエムペグ |
| GUI | ボタンやメニューをクリックして操作する画面。読み方はジーユーアイ |
| tiny / base / small / medium / large / turbo | Whisperモデルの種類。必要な計算量、VRAM、処理速度、認識結果が異なる |
| VRAM | GPUが計算に使う専用メモリ。大きいモデルほど多く必要になる傾向がある |
| CUDA | NVIDIA製GPUを計算に使うための基盤。読み方はクーダ |
| 量子化 | 計算に使う数値の精度を下げ、メモリ使用量や計算負荷を抑える方法 |
| TXT / SRT / VTT | TXTは文章だけ、SRTとVTTは字幕本文と表示時刻を保存するファイル形式 |
| VAD | 音声のある区間と無音区間を判別する音声区間検出。読み方はブイエーディー |
| 話者分離 | 「誰が話したか」を分ける処理。Whisperの基本機能とは別に追加する |
主な確認先
- OpenAI Whisper公式リポジトリ
- OpenAI「Introducing Whisper」
- faster-whisper公式リポジトリ
- whisper.cpp公式リポジトリ
- pyannote.audio公式リポジトリ
数値・対応環境・コマンドは2026年9月17日に確認しました。公開前に各プロジェクトの最新版で再確認してください。
Whisperのローカル文字起こしについてまとめ
WhisperをPC内で実行すれば、会議や取材の音声をクラウド型の文字起こしサービスへアップロードせずに処理できます。ただし、初回のソフト・モデル取得には通信が必要で、ローカル運用でもPCの暗号化、アクセス制限、保存・削除ルールは必要です。
まずは既存PCとsmallなどのモデルで5~10分の実音声を処理し、処理時間と修正量を確認します。長時間音声を継続的に処理する、またはリアルタイム表示で会話に追いつかない場合は、GPU対応の実装、モデル、PC構成を順に見直してください。
Whisperに関するよくあるご質問(FAQ)
-
Q1Whisperは無料で使えますか?
OpenAIが公開するコードとモデルはMITライセンスです。ローカル実行ではAPI料金は発生しませんが、PC、電気、構築・管理の費用は必要です。他社ソフトの料金と条件は別に確認します。 -
Q2Whisperは完全にオフラインで使えますか?
ソフトとモデルを事前に保存し、外部機能を使わない構成なら文字起こしをオフラインで実行できます。初回のインストールとモデル取得には通信が必要です。 -
Q3Whisperを使うにはグラフィックボードが必要ですか?
必須ではなく、CPUだけでも実行できます。長時間音声の待ち時間を短くする場合やリアルタイム表示では、利用ソフトに対応するGPUが候補です。 -
Q4日本語会議ではどのモデルから試せばよいですか?
smallの多言語版から始め、5~10分の実音声で処理時間と修正時間を測ります。smallで修正が多ければmediumやturboを同じ音声で比較します。 -
Q5「あー」「えー」などの不要な言葉やノイズを自動で消せますか?
Whisper本体に、すべての不要語やノイズを安全に削除する共通機能はありません。「あー」「えー」のようなフィラーは人が発声した音声なので、無音区間を除くVADだけでは削除できません。Whisper対応アプリの機能や文字起こし後の文章処理で削除できる場合はありますが、相づちや言い直しまで消して発言の意味を変えないよう、元音声と照合してください。無音部分の処理については「VADで無音部分の処理を減らす」で説明しています。 -
Q6Whisperは話者を自動で分けられますか?
Whisper単体は発話内容を文章へ変換しますが、「話者A」「話者B」のように誰が話したかを判定する話者分離は基本機能に含まれません。話者別の議事録を作るには、話者分離に対応するアプリ、またはpyannote.audioなどの追加モデルを組み合わせ、Whisperの文字起こし時刻と話者ごとの発話時刻を対応させます。参加者の声が重なる場面や録音チャンネルが一つの場合は誤判定も起こるため、重要な会議では元音声を確認してください。 -
Q7オンライン会議をリアルタイムで文字起こしできますか?
マイク入力、音声の短い単位への分割、Whisperでの認識、画面表示を行うリアルタイム対応ソフトを使えば可能です。ただし、自分のマイク音声と、ヘッドセットから聞こえる相手の音声では取り込み経路が異なります。利用前に会議ソフトの録音機能またはOSの音声入力設定を確認し、30秒間の会話で両者の声が記録されるか、発言から表示までの遅れが許容範囲かをテストしてください。詳しい流れは「Whisperをリアルタイム文字起こしへ使う方法」で説明しています。 -
Q8ローカルで処理すれば情報漏洩対策は不要ですか?
不要にはなりません。ストレージ暗号化、権限管理、画面ロック、保存期限、削除方法を決め、紛失・不正アクセス・誤共有へ備えます。
