Empfohlene vLLM-Runtime-Konfiguration

Verwende die empfohlenen vLLM-Startparameter beim Deployment unterstützter Foundation-Modelle für IBM Bob Self-Hosted.

Verwende die empfohlenen vLLM-Startparameter beim Deployment unterstützter Foundation-Modelle für IBM Bob Self-Hosted.

Die empfohlenen Konfigurationen fokussieren sich auf:

  • Speculative Decoding zur Reduzierung der Latenz.
  • Prefix Caching und Chunked Prefill zur Verbesserung der Long-Context-Leistung.
  • Modellspezifische Beschleunigungsbackends für optimalen Durchsatz.
  • Effiziente Speichernutzung zur Unterstützung großer Kontextfenster und höherer Parallelität.
Hinweis:

Die vLLM-Startargumente in diesem Abschnitt basieren auf internen Validierungstests, die mit NVIDIA H200 GPUs durchgeführt wurden, und werden als empfohlene Konfigurationswerte bereitgestellt. Diese Einstellungen sind keine fest codierten Anforderungen und eignen sich möglicherweise nicht für alle Deployment-Szenarien. Evaluiere und passe Konfigurationswerte an die spezifische Hardwareplattform, die Modellvariante, die Leistungsziele und die Workload-Eigenschaften deiner Umgebung an, bevor du in der Produktion deployest.

Wichtig:

Die auf dieser Seite aufgeführten Modelle unterstützen ausschließlich textbasierte Eingaben und keine Bildverarbeitung oder multimodale Bildanalyse. Lade keine Screenshots, Architekturdiagramme, Anwendungsdiagramme, gescannte Dokumente oder andere bildbasierte Inhalte als Modelleingabe hoch. Wenn Informationen in einem Bild enthalten sind, konvertiere sie in Text, bevor du sie an das Modell übermittelst.

Nvidia Nemotron 3 Ultra (FP8, NV-FP4)

Nemotron 3 Ultra 550B ist ein hybrides State-Space-Modell (SSM) und aufmerksamkeitsbasiertes Modell. Die FP8- und NV-FP4-Varianten verwenden dieselbe vLLM-Konfiguration. Zwischen den Varianten unterscheiden sich nur der Modellspeicherort und der bereitgestellte Modellname.

Für optimale Leistung aktiviere Speculative Decoding und Mamba-spezifische Optimierungen.

FP8-Konfiguration

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

NV-FP4-Konfiguration

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Warum diese Einstellungen verwendet werden

  • Speculative Decoding: Die Methode nemotron_h_mtp generiert Draft-Tokens und verifiziert sie in einem einzigen Durchlauf. Diese Konfiguration kann die Antwortlatenz verbessern und die Time to First Token (TTFT) unter parallelen Workloads reduzieren.
  • Mamba-Backend: Das flashinfer-Backend wird für Nemotron-Hybrid-SSM-Schichten empfohlen. In Kombination mit stochastischem Rounding trägt es zu stabilem Durchsatz und vorhersehbarem Speicherverbrauch bei.
  • Chunked Prefill und Prefix Caching: Chunked Prefill verarbeitet große Prompts in kleineren Segmenten, während Prefix Caching zuvor berechnete Prompt-Präfixe wiederverwendet. Diese Optionen helfen, die Leistung für Long-Context-Workloads zu verbessern.
  • Multi-threaded Model Loading: Die Verwendung von 64 Lade-Threads kann die Modell-Startzeiten reduzieren, wenn Modellgewichte auf persistentem Storage gespeichert sind. Diese Einstellung hat keinen Einfluss auf die Inferenzleistung nach dem Laden des Modells.

Laguna S 2.1 (FP8)

Laguna S 2.1 ist ein Mixture-of-Experts-Modell (MoE), das dFlash Speculative Decoding verwendet. Die folgende Konfiguration wurde mit FP8-quantisierten Gewichten auf acht GPUs validiert.

Konfiguration

args:
  - --trust-remote-code
  - --tensor-parallel-size=8
  - --tool-call-parser=poolside_v1
  - --enable-auto-tool-choice
  - --reasoning-parser=poolside_v1
  - --enable-prompt-tokens-details
  - --max-num-batched-tokens=16384
  - --enable-prefix-caching
  - '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
  - '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
  - --moe-backend=triton

Warum diese Einstellungen verwendet werden

  • dFlash Speculative Decoding: Das dFlash-Draft-Modell generiert sieben spekulative Tokens für jeden Dekodierungsschritt. Das primäre Modell validiert diese Tokens in einem einzigen Durchlauf, wodurch die Latenz reduziert und der Durchsatz verbessert wird.
  • Triton MoE-Backend: Das triton-Backend ist für Mixture-of-Experts-Workloads optimiert und kann unter paralleler Last stabilere Leistung bieten.
  • Prefix Caching: Prefix Caching reduziert redundante Berechnungen durch Wiederverwendung gemeinsamer Prompt-Präfixe über mehrere Anfragen hinweg.

Mistral Medium 3.5 (FP8)

Mistral Medium 3.5 ist ein dichtes Modell, das Eagle Speculative Decoding verwendet.

Konfiguration

args:
  - --tensor-parallel-size=8
  - --tool-call-parser=mistral
  - --enable-auto-tool-choice
  - --reasoning-parser=mistral
  - --max-num-batched-tokens=32768
  - --max-num-seqs=32
  - --kv-cache-dtype=fp8
  - --max-model-len=234800
  - --gpu-memory-utilization=0.92
  - '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'

Warum diese Einstellungen verwendet werden

  • FP8-KV-Cache-Komprimierung: Die Einstellung --kv-cache-dtype=fp8 reduziert den KV-Cache-Speicherbedarf und ermöglicht die Unterstützung großer Kontextfenster ohne Änderung der Modellgewichte.
  • Eagle Speculative Decoding: Das Eagle-Draft-Modell sagt drei Tokens vor dem primären Modell voraus. Das primäre Modell verifiziert die generierten Tokens in einem einzigen Durchlauf und hilft dabei, die Time to First Token und die Antwortlatenz zu reduzieren.
  • GPU-Speichernutzung: Ein GPU-Speichernutzungsziel von 92 % maximiert die verfügbaren GPU-Ressourcen und gewährleistet dabei einen stabilen Betrieb für den getesteten Workload.

Performance-Tuning

Möglicherweise musst du die folgenden Parameter anpassen, um deine Leistungs- und Kapazitätsanforderungen zu erfüllen:

ParameterBeschreibung
--tensor-parallel-sizeSkaliert die Inferenz über mehrere GPUs.
--max-model-lenSteuert die maximal unterstützte Kontextlänge.
--max-num-seqsErhöht oder verringert die Kapazität für parallele Anfragen.
--max-num-batched-tokensSteuert das Batching-Verhalten.
--gpu-memory-utilizationBalanciert Speichernutzung und Stabilität.
--speculative-configOptimiert Latenz und Durchsatz.
--enable-prefix-cachingVerbessert die Leistung für wiederholte Prompts.
--enable-chunked-prefillVerbessert die Verarbeitung großer Prompts.

Überwache nach dem Deployment Latenz, Durchsatz, GPU-Auslastung und Speicherverbrauch und passe Konfigurationswerte entsprechend den Anforderungen deines Workloads an.

Wie ist dieses Thema?