Whisper
本ページの内容はデジタルヒューマン株式会社の正式サポート対象外です。参考情報としてご利用ください。
Fast Whisper: faster-whisper をベースにした GPU アクセラレーション対応の音声認識サービスです。リアルタイム文字起こしには WebSocket エンドポイント ws://localhost:9000/ws、ファイルアップロードによる文字起こしには REST API http://localhost:9000/transcribe を利用します。
ミニプレム(MiniPrem)は、OpenAI の Whisper 音声認識モデルを最適化した実装である faster-whisper を統合し、高精度なリアルタイム文字起こし機能を提供します。本ガイドでは、MiniPrem プラットフォーム内で Fast Whisper サービスを利用および設定する方法を説明します。
概要
Fast Whisper は、オリジナルの Whisper 実装よりもパフォーマンスを向上させた自動音声認識(ASR)機能を提供します。主な機能は以下のとおりです。
WebSocket によるリアルタイム音声文字起こし
ファイルベースの文字起こし用 REST API
多言語音声認識
高速処理のための GPU アクセラレーション
ダークモード対応のテスト用インターフェース
Web インターフェース
Fast Whisper には、以下の URL からアクセス可能なブラウザベースのテスト用インターフェースが付属しています。
http://localhost:9000/static/index.htmlこのインターフェースでは以下の操作が可能です。
マイク入力のリアルタイムテスト
発話中の文字起こし結果の確認
文字起こし履歴のクリア
接続状態のモニタリング
API の利用
ベース URL
Fast Whisper API は以下の URL で利用できます。
WebSocket によるリアルタイム文字起こし
リアルタイム音声認識を行うには、以下の WebSocket エンドポイントに接続してください。
音声データは、以下の形式で base64 エンコードしたチャンクとして送信します。
文字起こし結果は、処理が完了次第以下の形式で受信できます。
ファイル文字起こし API
POST リクエストを送信することで、音声ファイルを文字起こしできます。
API パラメータ
file
文字起こし対象の音声ファイル
必須
language
言語コード(例: en、fr)
自動検出
initial_prompt
文字起こしをガイドするためのオプションのプロンプト
なし
設定
Fast Whisper サービスは、docker-compose.yml ファイルで以下のオプションを使って設定されます。
環境変数
MODEL_SIZE
Whisper モデルサイズ(tiny.en、base.en、small.en など)
tiny.en
COMPUTE_TYPE
GPU 演算タイプ(float16、float32、int8)
float16
NUM_WORKERS
ワーカースレッド数
1
CPU_THREADS
CPU スレッド数(CPU フォールバック時)
4
モデルサイズの変更
デフォルト設定では tiny.en モデルが使用されており、適度な精度で高速な処理が可能です。MODEL_SIZE 環境変数を更新することで、モデルサイズを変更できます。
利用可能なモデルサイズ:
tiny.en: 最速・最低精度(VRAM 約 1GB)base.en: 高速で妥当な精度(VRAM 約 1GB)small.en: 速度と精度のバランス(VRAM 約 2GB)medium.en: 良好な精度(VRAM 約 5GB)large-v3: 最高精度(VRAM 約 10GB)
他サービスとの連携
デスクトップ音声入力
以下のスクリプト例のように、Fast Whisper を音声入力(Voice-to-Text)の入力手段として利用できます。
Flowise との連携
HTTP リクエストノードから文字起こし API を呼び出すか、リアルタイム文字起こし用のカスタム WebSocket ノードを作成することで、Fast Whisper を Flowise ワークフローに統合できます。
トラブルシューティング
WebSocket 接続の問題
インターフェース上で WebSocket 接続エラーが表示される場合は、以下を確認してください。
Fast Whisper サービスが稼働しているかを確認:
docker ps | grep fastwhisperサービスを再起動:
docker restart fastwhisperログでエラーを確認:
docker logs fastwhisperご利用のブラウザが WebSocket に対応しているかを確認
サービスが起動しない
Fast Whisper サービスの起動に失敗する場合は、以下を確認してください。
利用可能な GPU メモリが十分にあるかを確認
Docker 用に NVIDIA ランタイムが適切に設定されているかを確認
MODEL_SIZE環境変数をより小さいモデルに変更して試行
文字起こし品質が低い
文字起こしの品質が低い場合は、以下を試してください。
より大きなモデル(例:
MODEL_SIZE=medium.en)を使用する音声入力の品質が良好で、背景ノイズが最小限であることを確認する
専門用語のコンテキストを与えるために
initial_promptパラメータを利用する
ログの確認
Fast Whisper サービスのログを確認するには、以下を実行してください。
または、ドキュメントポータルのログビューアーをご利用ください。
最終更新
