利用できる言語と音声認識・音声合成
多言語対応
デジタルヒューマンのプラットフォームで標準的に利用できる言語は下記の通りです。多言語対応させるには会話AI等によって様々なアプローチがありますので、エキスパートにご相談ください。
システムとしては、標準的に以下の機能に対応していますが、拡張すると対応可能言語が利用可能です。ご利用になる音声認識(STT)や音声合成(TTS)の多言語対応状況、バックエンドの会話AI(NLP・LLM)の多言語対応状況によって利用できるかどうかが変わります。
使用出来る音声認識、音声合成
日本語向け拡張として、以下のサードパーティー音声認識と音声合成との接続実績があります。その他のサービスでもAPIが公開されている場合、ほとんどの場合で接続が可能です。
音声認識(音声文字変換)
プラットフォーム標準
Google Cloud Speech-to-Text (標準) 対応している言語 ※ホステッドエクスペリエンスで使用する場合はspeechToTextLocalesパラメータにロケールコード(言語タグ)を設定してください。
オプション・接続実績あり
Microsoft Azure Speech-to-Text AmiVoice API NTTドコモ AIエージェントAPI 音声認識 NTTレゾナント AISuite 音声認識 OpenAI Speech to text(含むRealtimeAPI)
音声合成(文字音声変換)
P2では現時点では音声合成はMicrosoft Azure / Text to SpeechとGoogle Cloud Platform / Text-to-Speech 、ElevenLabsにのみ対応しています。
P2対応状況
NAVER Cloud Platform / CLOVA Voice
IBM Watson / Text to Speech
CoeFontAITalk® WebAPI
VoiceText Web API
ReadSpeaker
NTT FutureVoice Crayon (SynAnim対応)

TTSアカウント追加

プラットフォーム標準TTS設定
STT プロバイダの比較と選び方
デジタルヒューマンが音声認識に使用するプロバイダは、ホステッドエクスペリエンスの speechRecognitionProvider オプションで選択します。
多言語対応が必要
Google Speech
英語専用・低レイテンシ重視
Deepgram
地域別アクセント指定が必要
Google Speech
リアルタイム部分書き起こし
Deepgram
Google Speech(デフォルト)の設定例
Deepgram の設定例
各パラメータの詳細は 設定オプション を参照してください。
Deepgram の言語コード
Deepgram は简略化された言語コードを使用します(地域アクセントは自動対応)。
ja
日本語
en
英語(US・UK・AU すべて対応)
zh
中国語
ko
韓国語
fr
フランス語
de
ドイツ語
es
スペイン語
pt
ポルトガル語
STT トラブルシューティング
書き起こし精度が低い
ユーザーの言語に合ったロケールが設定されているか確認
デジタルヒューマンが割り込みすぎる
sttDeepgramInterruptionWordThreshold を大きくする
音声が検出されない
マイク許可と enableMicrophone: true を確認
発話後の応答が遅い
sttDeepgramUtteranceEndMs / sttDeepgramEndpointing を小さくする
固有名詞が誤認識される
sttDeepgramKeyterms / speechRecognitionHintPhrases に登録する
書き起こしのレイテンシを下げたい
sttDeepgramNoDelay: true を有効化する
TTS プロバイダの比較と選び方
ペルソナの音声(TTS)は DIP のペルソナ設定から選択・設定します。代表的なプロバイダの特徴は以下のとおりです。
音声品質
高品質(ニューラル)
非常に高品質(AI・自然)
言語対応
140言語以上
英語中心
ボイス数
400以上
30以上のプレミアムボイス
レイテンシ
低
低
向いている用途
多言語・エンタープライズ
英語の自然な会話
オンプレミス(MiniPrem)環境では、GPU で動作する低レイテンシの NVIDIA RIVA TTS も利用できます。詳細は NVIDIA RIVA を参照してください(DIP のプラットフォーム標準 TTS では未対応です)。
ボイスの選び方
Azure TTS
Azure はニューラル音声で、多言語・SSML・複数の話し方(明るい / 共感的 / ニュースキャスター 等)に対応します。設定時には以下を指定します。
ボイス名: 完全なボイス識別子(例: 日本語
ja-JP-NanamiNeural、英語en-US-JennyNeural)言語: ボイスが対応する言語に一致させる
代表的なボイス:
ja-JP-NanamiNeural
日本語
女性
ja-JP-KeitaNeural
日本語
男性
en-US-JennyNeural
英語(米国)
女性
en-US-GuyNeural
英語(米国)
男性
en-GB-SoniaNeural
英語(英国)
女性
全ボイスの試聴・ボイス名の確認: Azure Voice Gallery / 対応言語・ボイス一覧
ElevenLabs
ElevenLabs は自然で表現力の高い AI 音声を提供し、感情表現や低レイテンシのストリーミングに対応します。ボイスの試聴・選択は ElevenLabs で行えます。設定時はペルソナにボイス名を指定します。
Custom TTS(独自 TTS の持ち込み)
独自の TTS ソリューションを利用したい場合は、DHKK ゲートウェイ経由の BYO TTS に対応しています。詳細は BYO TTSを利用する(DHKKゲートウェイ) を参照してください。
最終更新
