> For the complete documentation index, see [llms.txt](https://docs.digitalhumans.jp/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.digitalhumans.jp/ops/persona-dip/languages-and-speech-synthesis.md).

# 利用できる言語と音声認識・音声合成

## 多言語対応

デジタルヒューマンのプラットフォームで標準的に利用できる言語は下記の通りです。多言語対応させるには会話AI等によって様々なアプローチがありますので、エキスパートにご相談ください。

{% hint style="info" %}
システムとしては、標準的に以下の機能に対応していますが、拡張すると[対応可能言語](https://cloud.google.com/speech-to-text/docs/speech-to-text-supported-languages?hl=ja)が利用可能です。ご利用になる音声認識（STT）や音声合成（TTS）の多言語対応状況、バックエンドの会話AI（NLP・LLM）の多言語対応状況によって利用できるかどうかが変わります。
{% endhint %}

## 使用出来る音声認識、音声合成

日本語向け拡張として、以下のサードパーティー音声認識と音声合成との接続実績があります。その他のサービスでもAPIが公開されている場合、ほとんどの場合で接続が可能です。

**音声認識（音声文字変換）**

| プラットフォーム標準   | <p>Google Cloud Speech-to-Text （標準）<br><a href="https://cloud.google.com/speech-to-text/docs/languages?hl=ja">対応している言語</a> ※ホステッドエクスペリエンスで使用する場合は<a href="https://gitlab.digitalhumans.jp/docs/docs-digitalhumansjp/-/blob/main/development/README.md#speechtotextlocalesstring">speechToTextLocales</a>パラメータにロケールコード（言語タグ）を設定してください。</p> |
| ------------ | ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| オプション・接続実績あり | <p>Microsoft Azure Speech-to-Text<br>AmiVoice API<br>NTTドコモ AIエージェントAPI 音声認識<br>NTTレゾナント AISuite 音声認識<br>OpenAI Speech to text（含むRealtimeAPI）</p>                                                                                                                                                                                         |

**音声合成（文字音声変換）**

P2では現時点では音声合成は[Microsoft Azure / Text to Speech](https://learn.microsoft.com/ja-jp/azure/ai-services/speech-service/language-support?tabs=stt#prebuilt-neural-voices)と[Google Cloud Platform / Text-to-Speech](https://cloud.google.com/text-to-speech?hl=ja) 、[ElevenLabs](https://elevenlabs.io/)にのみ対応しています。

| プラットフォーム標準 | <p><a href="https://learn.microsoft.com/ja-jp/azure/ai-services/speech-service/language-support?tabs=stt#prebuilt-neural-voices">Microsoft Azure / Text to Speech</a><br><a href="https://cloud.google.com/text-to-speech?hl=ja">Google Cloud Platform / Text-to-Speech</a><br><a href="https://elevenlabs.io/">ElevenLabs</a></p> |
| ---------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| P2対応状況     | <p><del>NAVER Cloud Platform / CLOVA Voice</del><br><del>IBM Watson / Text to Speech</del><br><del>CoeFontAITalk® WebAPI</del><br><del>VoiceText Web API</del><br><del>ReadSpeaker</del><br><a href="https://www.futurevoice.jp/"><strong>NTT FutureVoice Crayon</strong></a> <strong>(SynAnim対応）</strong></p>                     |

![TTSアカウント追加](/files/xnt9MRawVnBHUFntEVKt)

TTSアカウント追加

![プラットフォーム標準TTS設定](/files/kfQEcEetECkF083q3NlA)

プラットフォーム標準TTS設定

## STT プロバイダの比較と選び方

デジタルヒューマンが音声認識に使用するプロバイダは、ホステッドエクスペリエンスの `speechRecognitionProvider` オプションで選択します。

| 用途            | 推奨プロバイダ       |
| ------------- | ------------- |
| 多言語対応が必要      | Google Speech |
| 英語専用・低レイテンシ重視 | Deepgram      |
| 地域別アクセント指定が必要 | Google Speech |
| リアルタイム部分書き起こし | Deepgram      |

### Google Speech（デフォルト）の設定例

```jsx
const uneeq = new Uneeq({
  connectionUrl: "https://api.uneeq.io",
  personaId: "your-persona-id",
  speechRecognitionLocales: "ja-JP:en-US",   // コロン区切り・最大4ロケール
  speechRecognitionHintPhrases: "デジタルヒューマン,Renny",  // 認識精度を上げたい語
  speechRecognitionHintPhrasesBoost: 10      // 0〜20
});
```

### Deepgram の設定例

```jsx
const uneeq = new Uneeq({
  connectionUrl: "https://api.uneeq.io",
  personaId: "your-persona-id",
  speechRecognitionProvider: "deepgram",
  sttDeepgramModel: "nova-3",
  sttDeepgramLanguage: "en",
  sttDeepgramUtteranceEndMs: 1200,           // 発話終了判定を早める
  sttDeepgramInterruptionWordThreshold: 5,   // 5語以上で割り込みを許可
  sttDeepgramKeyterms: "digital human,DHOP", // 固有名詞を優先認識
  sttDeepgramNoDelay: true                   // 低レイテンシ配信
});
```

各パラメータの詳細は [設定オプション](/dev/hosted-experience/hosted-experience-configuration-options.md) を参照してください。

### Deepgram の言語コード

Deepgram は简略化された言語コードを使用します（地域アクセントは自動対応）。

| コード  | 言語                 |
| ---- | ------------------ |
| `ja` | 日本語                |
| `en` | 英語（US・UK・AU すべて対応） |
| `zh` | 中国語                |
| `ko` | 韓国語                |
| `fr` | フランス語              |
| `de` | ドイツ語               |
| `es` | スペイン語              |
| `pt` | ポルトガル語             |

### STT トラブルシューティング

| 症状                | 対処                                                            |
| ----------------- | ------------------------------------------------------------- |
| 書き起こし精度が低い        | ユーザーの言語に合ったロケールが設定されているか確認                                    |
| デジタルヒューマンが割り込みすぎる | `sttDeepgramInterruptionWordThreshold` を大きくする                 |
| 音声が検出されない         | マイク許可と `enableMicrophone: true` を確認                           |
| 発話後の応答が遅い         | `sttDeepgramUtteranceEndMs` / `sttDeepgramEndpointing` を小さくする |
| 固有名詞が誤認識される       | `sttDeepgramKeyterms` / `speechRecognitionHintPhrases` に登録する  |
| 書き起こしのレイテンシを下げたい  | `sttDeepgramNoDelay: true` を有効化する                             |

## TTS プロバイダの比較と選び方

ペルソナの音声（TTS）は DIP のペルソナ設定から選択・設定します。代表的なプロバイダの特徴は以下のとおりです。

| 項目      | Azure TTS    | ElevenLabs    |
| ------- | ------------ | ------------- |
| 音声品質    | 高品質（ニューラル）   | 非常に高品質（AI・自然） |
| 言語対応    | 140言語以上      | 英語中心          |
| ボイス数    | 400以上        | 30以上のプレミアムボイス |
| レイテンシ   | 低            | 低             |
| 向いている用途 | 多言語・エンタープライズ | 英語の自然な会話      |

{% hint style="info" %}
オンプレミス（MiniPrem）環境では、GPU で動作する低レイテンシの NVIDIA RIVA TTS も利用できます。詳細は [NVIDIA RIVA](/dev/miniprem/services/riva.md) を参照してください（DIP のプラットフォーム標準 TTS では未対応です）。
{% endhint %}

## ボイスの選び方

### Azure TTS

Azure はニューラル音声で、多言語・SSML・複数の話し方（明るい / 共感的 / ニュースキャスター 等）に対応します。設定時には以下を指定します。

* **ボイス名**: 完全なボイス識別子（例: 日本語 `ja-JP-NanamiNeural`、英語 `en-US-JennyNeural`）
* **言語**: ボイスが対応する言語に一致させる

代表的なボイス:

| ボイス名               | 言語     | 性別 |
| ------------------ | ------ | -- |
| ja-JP-NanamiNeural | 日本語    | 女性 |
| ja-JP-KeitaNeural  | 日本語    | 男性 |
| en-US-JennyNeural  | 英語（米国） | 女性 |
| en-US-GuyNeural    | 英語（米国） | 男性 |
| en-GB-SoniaNeural  | 英語（英国） | 女性 |

> 全ボイスの試聴・ボイス名の確認: [Azure Voice Gallery](https://speech.microsoft.com/portal/voicegallery) ／ [対応言語・ボイス一覧](https://learn.microsoft.com/ja-jp/azure/ai-services/speech-service/language-support?tabs=tts)

### ElevenLabs

ElevenLabs は自然で表現力の高い AI 音声を提供し、感情表現や低レイテンシのストリーミングに対応します。ボイスの試聴・選択は [ElevenLabs](https://elevenlabs.io/) で行えます。設定時はペルソナにボイス名を指定します。

### Custom TTS（独自 TTS の持ち込み）

独自の TTS ソリューションを利用したい場合は、DHKK ゲートウェイ経由の BYO TTS に対応しています。詳細は [BYO TTSを利用する（DHKKゲートウェイ）](/dev/byo-stt-tts/byo-tts-integration.md) を参照してください。
