Configuration vLLM runtime recommandée

Utilise les paramètres de démarrage vLLM recommandés lors du déploiement des modèles de fondation pris en charge pour IBM Bob auto-hébergé.

Utilise les paramètres de démarrage vLLM recommandés lors du déploiement des modèles de fondation pris en charge pour IBM Bob auto-hébergé.

Les configurations recommandées se concentrent sur :

  • Le décodage spéculatif pour réduire la latence.
  • Le prefix caching et le chunked prefill pour améliorer les performances sur les contextes longs.
  • Les backends d'accélération spécifiques aux modèles pour un débit optimal.
  • Une utilisation efficace de la mémoire pour prendre en charge les grandes fenêtres de contexte et une concurrence plus élevée.
Remarque :

Les arguments de démarrage vLLM de cette section sont basés sur des tests de validation internes effectués avec des GPU NVIDIA H200 et sont fournis comme valeurs de configuration recommandées. Ces paramètres ne sont pas des exigences codées en dur et peuvent ne pas convenir à tous les scénarios de déploiement. Évalue et ajuste les valeurs de configuration en fonction de la plateforme matérielle, de la variante du modèle, des objectifs de performance et des caractéristiques de charge de travail de ton environnement avant de déployer en production.

Important :

Les modèles listés sur cette page prennent en charge uniquement les entrées textuelles et ne prennent pas en charge le traitement d'images ni l'analyse d'images multimodales. Ne charge pas de captures d'écran, de diagrammes d'architecture, de diagrammes d'application, de documents numérisés ou tout autre contenu basé sur des images comme entrée du modèle. Si des informations sont contenues dans une image, convertis-les en texte avant de les soumettre au modèle.

Nvidia Nemotron 3 Ultra (FP8, NV-FP4)

Nemotron 3 Ultra 550B est un modèle hybride à espace d'états (SSM) et basé sur l'attention. Les variantes FP8 et NV-FP4 utilisent la même configuration vLLM. Seuls l'emplacement du modèle et le nom du modèle servi diffèrent entre les variantes.

Pour des performances optimales, active le décodage spéculatif et les optimisations spécifiques à Mamba.

Configuration FP8

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Configuration NV-FP4

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Pourquoi ces paramètres sont utilisés

  • Décodage spéculatif : La méthode de décodage spéculatif nemotron_h_mtp génère des tokens brouillon et les vérifie en une seule passe. Cette configuration peut améliorer la latence des réponses et réduire le temps jusqu'au premier token (TTFT) sous des charges de travail simultanées.
  • Backend Mamba : Le backend flashinfer est recommandé pour les couches SSM hybrides de Nemotron. Combiné avec l'arrondi stochastique, il contribue à fournir un débit stable et une consommation mémoire prévisible.
  • Chunked prefill et prefix caching : Le chunked prefill traite les grands prompts en segments plus petits, tandis que le prefix caching réutilise les préfixes de prompts précédemment calculés. Ces options aident à améliorer les performances pour les charges de travail à contexte long.
  • Chargement du modèle multi-thread : L'utilisation de 64 threads de chargement peut réduire les temps de démarrage du modèle lorsque les poids du modèle sont stockés sur un stockage persistant. Ce paramètre n'affecte pas les performances d'inférence après le chargement du modèle.

Laguna S 2.1 (FP8)

Laguna S 2.1 est un modèle mixture-of-experts (MoE) qui utilise le décodage spéculatif dFlash. La configuration suivante a été validée avec des poids quantifiés en FP8 sur huit GPU.

Configuration

args:
  - --trust-remote-code
  - --tensor-parallel-size=8
  - --tool-call-parser=poolside_v1
  - --enable-auto-tool-choice
  - --reasoning-parser=poolside_v1
  - --enable-prompt-tokens-details
  - --max-num-batched-tokens=16384
  - --enable-prefix-caching
  - '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
  - '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
  - --moe-backend=triton

Pourquoi ces paramètres sont utilisés

  • Décodage spéculatif dFlash : Le modèle brouillon dFlash génère sept tokens spéculatifs pour chaque étape de décodage. Le modèle principal valide ces tokens en une seule passe, réduisant la latence et améliorant le débit.
  • Backend MoE Triton : Le backend triton est optimisé pour les charges de travail mixture-of-experts et peut fournir des performances plus stables sous charge simultanée.
  • Prefix caching : Le prefix caching réduit les calculs redondants en réutilisant les préfixes de prompts communs sur plusieurs requêtes.

Mistral Medium 3.5 (FP8)

Mistral Medium 3.5 est un modèle dense qui utilise le décodage spéculatif Eagle.

Configuration

args:
  - --tensor-parallel-size=8
  - --tool-call-parser=mistral
  - --enable-auto-tool-choice
  - --reasoning-parser=mistral
  - --max-num-batched-tokens=32768
  - --max-num-seqs=32
  - --kv-cache-dtype=fp8
  - --max-model-len=234800
  - --gpu-memory-utilization=0.92
  - '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'

Pourquoi ces paramètres sont utilisés

  • Compression KV-cache FP8 : Le paramètre --kv-cache-dtype=fp8 réduit les besoins en mémoire du KV-cache, permettant la prise en charge de grandes fenêtres de contexte sans modifier les poids du modèle.
  • Décodage spéculatif Eagle : Le modèle brouillon Eagle prédit trois tokens en avance par rapport au modèle principal. Le modèle principal vérifie les tokens générés en une seule passe, contribuant à réduire le temps jusqu'au premier token et la latence des réponses.
  • Utilisation de la mémoire GPU : Un objectif d'utilisation de la mémoire GPU de 92 % maximise les ressources GPU disponibles tout en maintenant un fonctionnement stable pour la charge de travail testée.

Réglage des performances

Tu devras peut-être ajuster les paramètres suivants pour répondre à tes exigences de performance et de capacité :

ParamètreDescription
--tensor-parallel-sizeMet à l'échelle l'inférence sur plusieurs GPU.
--max-model-lenContrôle la longueur de contexte maximale prise en charge.
--max-num-seqsAugmente ou diminue la capacité de requêtes simultanées.
--max-num-batched-tokensContrôle le comportement de batching.
--gpu-memory-utilizationÉquilibre l'utilisation de la mémoire et la stabilité.
--speculative-configOptimise la latence et le débit.
--enable-prefix-cachingAméliore les performances pour les prompts répétés.
--enable-chunked-prefillAméliore le traitement des grands prompts.

Après le déploiement, surveille la latence, le débit, l'utilisation du GPU et la consommation mémoire, et ajuste les valeurs de configuration en fonction de ta charge de travail.

Comment trouvez-vous ce sujet ?