For the complete documentation index, see llms.txt. This page is also available as Markdown.

vLLM API

本ページの内容はデジタルヒューマン株式会社の正式サポート対象外です。参考情報としてご利用ください。

本ページでは、ミニプレム(MiniPrem)に同梱される vLLM の OpenAI 互換 API について解説します。

OpenAI 互換 API: vLLM はテキスト生成およびチャット補完のための OpenAI 互換 API を提供しており、既存アプリケーションとの統合が容易です。

ベース URL

http://localhost:8000/v1

コンテナからのアクセス: Docker コンテナ内(例: Flowise)から呼び出す場合は、localhost ではなく http://vllm:8000/v1 を使用してください。


チャット補完(Chat Completions)

チャット形式で対話型のレスポンスを生成します。

エンドポイント

POST /v1/chat/completions

リクエストヘッダー

ヘッダー
必須

Content-Type

application/json

はい

リクエストボディ

フィールド
デフォルト
説明

model

string

必須

モデル識別子

messages

array

必須

会話メッセージ

temperature

number

1.0

ランダム性(0.0〜2.0)

max_tokens

number

モデル最大値

レスポンスの最大トークン数

stream

boolean

false

ストリーミングの有効化

top_p

number

1.0

Nucleus サンプリング

frequency_penalty

number

0.0

繰り返しの抑制

presence_penalty

number

0.0

新しいトピックの推奨

stop

array

null

停止シーケンス

メッセージのロール

ロール
説明

system

AI の振る舞いとコンテキストを設定します

user

ユーザー入力メッセージ

assistant

これまでの AI のレスポンス

レスポンス

使用例


テキスト補完(Text Completions)

プロンプトからテキスト補完を生成します。

エンドポイント

リクエストボディ

レスポンス


モデル一覧(List Models)

vLLM にロードされている利用可能なモデルを取得します。

エンドポイント

レスポンス


ストリーミングレスポンス

チャット補完でリアルタイムなストリーミングを有効化します。

ストリーミングレスポンス形式(SSE):


エラーレスポンス

400 Bad Request

404 Model Not Found

503 Service Unavailable


統合例

Python(OpenAI SDK)

Python(Requests)

JavaScript / Node.js

JavaScript でのストリーミング


パフォーマンスのヒント

項目
推奨値
用途

推奨 Temperature

0.7

バランスの取れた創造性

最大トークン数

1000

レスポンス長の標準上限

ストリーミング

有効化

リアルタイム用途向け

  • Temperature: バランスの取れた創造性には 0.7、事実に基づくレスポンスにはより低い値(0.1〜0.3)を使用します

  • 最大トークン数: レスポンス長とコストを制御するため、適切な上限を設定します

  • ストリーミング: リアルタイムアプリケーションで体感レイテンシを改善するために有効化します

  • システムプロンプト: モデルの挙動を誘導するため、詳細なシステムプロンプトを使用します


関連ドキュメント

vLLMFlowise API

最終更新