vLLM
本ページの内容はデジタルヒューマン株式会社の正式サポート対象外です。参考情報としてご利用ください。
vLLM: ミニプレム(MiniPrem)の対話型インテリジェンスを支える高性能なオープンソース LLM 推論エンジンです。Mistral-7B-Instruct-v0.3 を稼働させ、http://localhost:8000/v1 で OpenAI 互換 API を提供します。
本ガイドでは、ミニプレム(MiniPrem)プラットフォームにおける vLLM 大規模言語モデル(LLM)連携について説明します。vLLM は、デジタルヒューマンの自然言語理解機能を提供し、Renny(レンダラー:開発コード Renny)と連携して対話体験を実現します。
2026年6月現在、デジタルヒューマン株式会社の正式サポート対象はデフォルト(Default Install)の Renny のみです。フルインストール(Full Install)に含まれる Renny 以外のサービス(vLLM、Flowise、RIME AI、NVIDIA RIVA、Whisper など)はサポート対象外です。
概要
vLLM は、大規模言語モデル向けの高性能なオープンソース推論エンジンです。MiniPrem プラットフォームでは、命令追従とチャット用途に最適化された最先端のオープンソース言語モデルである Mistral-7B-Instruct-v0.3 を用いて、vLLM が対話型インテリジェンスを支えています。
vLLM はフルインストール(Full Install)の構成に含まれており、デフォルト(Default Install)には含まれません。デジタルヒューマンとの対話で外部 LLM API ではなくオンプレミスの LLM を利用したい場合に有効化します。
前提条件
HuggingFace アカウント
Mistral モデル利用規約への同意
読み取り権限を持つ HuggingFace API トークン
初期セットアップ
インストール時には、次のステップを順に案内します。
HuggingFace アカウントの作成またはログインの案内
Mistral モデル利用規約への同意のサポート
HuggingFace API トークンの作成と設定のサポート
Mistral モデルのダウンロードと設定
アクセス情報
API エンドポイント:
http://localhost:8000/v1コンテナ名:
vllmモデルパス:
facebook/opt-125m
デフォルトモデル
MiniPrem には以下があらかじめ設定されています。
モデル:
Mistral-7B-Instruct-v0.3コンテキスト長: 8,192 トークン
パラメータ数: 70 億
最適化: 効率的な GPU 推論向けに事前設定済み
OpenAI 互換 API の利用
vLLM の OpenAI 互換 API を通じて、直接やり取りできます。
Renny との連携
vLLM は Renny(レンダラー:開発コード Renny)と連携し、デジタルヒューマンとの対話における自然言語応答を担います。複数の Renny(Multiple Rennys)構成を取る場合も、共通の vLLM エンドポイントを参照することで、対話モデルを一元管理できます。
参考資料
最終更新
