For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM

本ページの内容はデジタルヒューマン株式会社の正式サポート対象外です。参考情報としてご利用ください。

vLLM: ミニプレム(MiniPrem)の対話型インテリジェンスを支える高性能なオープンソース LLM 推論エンジンです。Mistral-7B-Instruct-v0.3 を稼働させ、http://localhost:8000/v1 で OpenAI 互換 API を提供します。

本ガイドでは、ミニプレム(MiniPrem)プラットフォームにおける vLLM 大規模言語モデル(LLM)連携について説明します。vLLM は、デジタルヒューマンの自然言語理解機能を提供し、Renny(レンダラー:開発コード Renny)と連携して対話体験を実現します。

概要

vLLM は、大規模言語モデル向けの高性能なオープンソース推論エンジンです。MiniPrem プラットフォームでは、命令追従とチャット用途に最適化された最先端のオープンソース言語モデルである Mistral-7B-Instruct-v0.3 を用いて、vLLM が対話型インテリジェンスを支えています。

vLLM はフルインストール(Full Install)の構成に含まれており、デフォルト(Default Install)には含まれません。デジタルヒューマンとの対話で外部 LLM API ではなくオンプレミスの LLM を利用したい場合に有効化します。

前提条件

  • HuggingFace アカウント

  • Mistral モデル利用規約への同意

  • 読み取り権限を持つ HuggingFace API トークン

初期セットアップ

インストール時には、次のステップを順に案内します。

  1. HuggingFace アカウントの作成またはログインの案内

  2. Mistral モデル利用規約への同意のサポート

  3. HuggingFace API トークンの作成と設定のサポート

  4. Mistral モデルのダウンロードと設定

アクセス情報

  • API エンドポイント: http://localhost:8000/v1

  • コンテナ名: vllm

  • モデルパス: facebook/opt-125m

デフォルトモデル

MiniPrem には以下があらかじめ設定されています。

  • モデル: Mistral-7B-Instruct-v0.3

  • コンテキスト長: 8,192 トークン

  • パラメータ数: 70 億

  • 最適化: 効率的な GPU 推論向けに事前設定済み

OpenAI 互換 API の利用

vLLM の OpenAI 互換 API を通じて、直接やり取りできます。

Renny との連携

vLLM は Renny(レンダラー:開発コード Renny)と連携し、デジタルヒューマンとの対話における自然言語応答を担います。複数の Renny(Multiple Rennys)構成を取る場合も、共通の vLLM エンドポイントを参照することで、対話モデルを一元管理できます。

参考資料

最終更新