推奨 vLLM ランタイム構成

IBM Bob セルフホスト向けにサポートされているファウンデーションモデルをデプロイする際に推奨される vLLM 起動パラメーターを使用します。

IBM Bob セルフホスト向けにサポートされているファウンデーションモデルをデプロイする際に推奨される vLLM 起動パラメーターを使用します。

推奨構成が注力する点:

  • レイテンシーを削減するための投機的デコード。
  • 長いコンテキストのパフォーマンスを向上させるためのプレフィックスキャッシングとチャンク化プリフィル。
  • 最適なスループットのためのモデル固有のアクセラレーションバックエンド。
  • 大きなコンテキストウィンドウと高い同時実行をサポートするための効率的なメモリ利用。
注意:

このセクションの vLLM 起動引数は、NVIDIA H200 GPU を使用した内部検証テストに基づいており、推奨設定値として提供されています。これらの設定はハードコードされた要件ではなく、すべてのデプロイメントシナリオに適しているとは限りません。本番環境にデプロイする前に、お客様の環境の特定のハードウェアプラットフォーム、モデルバリアント、パフォーマンス目標、およびワークロードの特性に合わせて設定値を評価・調整してください。

重要:

このページに記載されているモデルはテキストベースの入力のみをサポートしており、画像処理またはマルチモーダル画像分析はサポートしていません。スクリーンショット、アーキテクチャ図、アプリケーション図、スキャンされたドキュメント、その他の画像ベースのコンテンツをモデルの入力としてアップロードしないでください。画像に情報が含まれている場合は、モデルに送信する前にテキストに変換してください。

Nvidia Nemotron 3 Ultra (FP8、NV-FP4)

Nemotron 3 Ultra 550B は、ハイブリッド状態空間モデル (SSM) とアテンションベースモデルです。FP8 と NV-FP4 バリアントは同じ vLLM 構成を使用します。バリアント間で異なるのはモデルの場所と提供されるモデル名のみです。

最適なパフォーマンスのために、投機的デコードと Mamba 固有の最適化を有効にしてください。

FP8 構成

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

NV-FP4 構成

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

これらの設定を使用する理由

  • 投機的デコード: nemotron_h_mtp 投機的デコード方式はドラフトトークンを生成し、1 回のパスで検証します。この構成により、同時ワークロード下でのレスポンスレイテンシーが改善し、最初のトークンまでの時間 (TTFT) が短縮される可能性があります。
  • Mamba バックエンド: flashinfer バックエンドは Nemotron ハイブリッド SSM レイヤーに推奨されます。確率的丸め処理と組み合わせることで、安定したスループットと予測可能なメモリ消費を実現します。
  • チャンク化プリフィルとプレフィックスキャッシング: チャンク化プリフィルは大きなプロンプトを小さなセグメントで処理し、プレフィックスキャッシングは以前に計算されたプロンプトプレフィックスを再利用します。これらのオプションは長いコンテキストのワークロードのパフォーマンス向上に役立ちます。
  • マルチスレッドモデルロード: 64 個のロードスレッドを使用することで、モデルの重みが永続ストレージに保存されている場合のモデル起動時間を短縮できます。この設定はモデルがロードされた後の推論パフォーマンスには影響しません。

Laguna S 2.1 (FP8)

Laguna S 2.1 は、dFlash 投機的デコードを使用するミクスチャー・オブ・エキスパート (MoE) モデルです。以下の構成は 8 つの GPU 上で FP8 量子化された重みで検証されました。

構成

args:
  - --trust-remote-code
  - --tensor-parallel-size=8
  - --tool-call-parser=poolside_v1
  - --enable-auto-tool-choice
  - --reasoning-parser=poolside_v1
  - --enable-prompt-tokens-details
  - --max-num-batched-tokens=16384
  - --enable-prefix-caching
  - '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
  - '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
  - --moe-backend=triton

これらの設定を使用する理由

  • dFlash 投機的デコード: dFlash ドラフトモデルはデコードステップごとに 7 つの投機的トークンを生成します。プライマリモデルはこれらのトークンを 1 回のパスで検証し、レイテンシーを削減してスループットを向上させます。
  • Triton MoE バックエンド: triton バックエンドはミクスチャー・オブ・エキスパートワークロード向けに最適化されており、同時負荷下でより安定したパフォーマンスを提供できます。
  • プレフィックスキャッシング: プレフィックスキャッシングは複数のリクエスト間で共通のプロンプトプレフィックスを再利用することで、冗長な計算を削減します。

Mistral Medium 3.5 (FP8)

Mistral Medium 3.5 は Eagle 投機的デコードを使用する密なモデルです。

構成

args:
  - --tensor-parallel-size=8
  - --tool-call-parser=mistral
  - --enable-auto-tool-choice
  - --reasoning-parser=mistral
  - --max-num-batched-tokens=32768
  - --max-num-seqs=32
  - --kv-cache-dtype=fp8
  - --max-model-len=234800
  - --gpu-memory-utilization=0.92
  - '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'

これらの設定を使用する理由

  • FP8 KV キャッシュ圧縮: --kv-cache-dtype=fp8 設定は KV キャッシュのメモリ要件を削減し、モデルの重みを変更せずに大きなコンテキストウィンドウのサポートを可能にします。
  • Eagle 投機的デコード: Eagle ドラフトモデルはプライマリモデルより 3 トークン先を予測します。プライマリモデルは生成されたトークンを 1 回のパスで検証し、最初のトークンまでの時間とレスポンスレイテンシーの削減に役立ちます。
  • GPU メモリ利用率: 92% の GPU メモリ利用率目標により、テスト済みワークロードの安定した動作を維持しながら利用可能な GPU リソースを最大化します。

パフォーマンスチューニング

パフォーマンスと容量の要件を満たすために、以下のパラメーターを調整する必要がある場合があります。

パラメーター説明
--tensor-parallel-size複数の GPU に推論をスケールします。
--max-model-lenサポートされる最大コンテキスト長を制御します。
--max-num-seqs同時リクエスト容量を増減します。
--max-num-batched-tokensバッチング動作を制御します。
--gpu-memory-utilizationメモリ使用量と安定性のバランスを取ります。
--speculative-configレイテンシーとスループットを最適化します。
--enable-prefix-caching繰り返しプロンプトのパフォーマンスを向上させます。
--enable-chunked-prefill大きなプロンプトの処理を向上させます。

デプロイ後は、レイテンシー、スループット、GPU 使用率、およびメモリ消費を監視し、ワークロードに応じて設定値を調整してください。

このトピックはいかがですか?