Empfohlene vLLM-Runtime-Konfiguration
Verwende die empfohlenen vLLM-Startparameter beim Deployment unterstützter Foundation-Modelle für IBM Bob Self-Hosted.
Verwende die empfohlenen vLLM-Startparameter beim Deployment unterstützter Foundation-Modelle für IBM Bob Self-Hosted.
Die empfohlenen Konfigurationen fokussieren sich auf:
- Speculative Decoding zur Reduzierung der Latenz.
- Prefix Caching und Chunked Prefill zur Verbesserung der Long-Context-Leistung.
- Modellspezifische Beschleunigungsbackends für optimalen Durchsatz.
- Effiziente Speichernutzung zur Unterstützung großer Kontextfenster und höherer Parallelität.
Die vLLM-Startargumente in diesem Abschnitt basieren auf internen Validierungstests, die mit NVIDIA H200 GPUs durchgeführt wurden, und werden als empfohlene Konfigurationswerte bereitgestellt. Diese Einstellungen sind keine fest codierten Anforderungen und eignen sich möglicherweise nicht für alle Deployment-Szenarien. Evaluiere und passe Konfigurationswerte an die spezifische Hardwareplattform, die Modellvariante, die Leistungsziele und die Workload-Eigenschaften deiner Umgebung an, bevor du in der Produktion deployest.
Die auf dieser Seite aufgeführten Modelle unterstützen ausschließlich textbasierte Eingaben und keine Bildverarbeitung oder multimodale Bildanalyse. Lade keine Screenshots, Architekturdiagramme, Anwendungsdiagramme, gescannte Dokumente oder andere bildbasierte Inhalte als Modelleingabe hoch. Wenn Informationen in einem Bild enthalten sind, konvertiere sie in Text, bevor du sie an das Modell übermittelst.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B ist ein hybrides State-Space-Modell (SSM) und aufmerksamkeitsbasiertes Modell. Die FP8- und NV-FP4-Varianten verwenden dieselbe vLLM-Konfiguration. Zwischen den Varianten unterscheiden sich nur der Modellspeicherort und der bereitgestellte Modellname.
Für optimale Leistung aktiviere Speculative Decoding und Mamba-spezifische Optimierungen.
FP8-Konfiguration
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeNV-FP4-Konfiguration
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeWarum diese Einstellungen verwendet werden
- Speculative Decoding: Die Methode
nemotron_h_mtpgeneriert Draft-Tokens und verifiziert sie in einem einzigen Durchlauf. Diese Konfiguration kann die Antwortlatenz verbessern und die Time to First Token (TTFT) unter parallelen Workloads reduzieren. - Mamba-Backend: Das
flashinfer-Backend wird für Nemotron-Hybrid-SSM-Schichten empfohlen. In Kombination mit stochastischem Rounding trägt es zu stabilem Durchsatz und vorhersehbarem Speicherverbrauch bei. - Chunked Prefill und Prefix Caching: Chunked Prefill verarbeitet große Prompts in kleineren Segmenten, während Prefix Caching zuvor berechnete Prompt-Präfixe wiederverwendet. Diese Optionen helfen, die Leistung für Long-Context-Workloads zu verbessern.
- Multi-threaded Model Loading: Die Verwendung von 64 Lade-Threads kann die Modell-Startzeiten reduzieren, wenn Modellgewichte auf persistentem Storage gespeichert sind. Diese Einstellung hat keinen Einfluss auf die Inferenzleistung nach dem Laden des Modells.
Laguna S 2.1 (FP8)
Laguna S 2.1 ist ein Mixture-of-Experts-Modell (MoE), das dFlash Speculative Decoding verwendet. Die folgende Konfiguration wurde mit FP8-quantisierten Gewichten auf acht GPUs validiert.
Konfiguration
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=tritonWarum diese Einstellungen verwendet werden
- dFlash Speculative Decoding: Das dFlash-Draft-Modell generiert sieben spekulative Tokens für jeden Dekodierungsschritt. Das primäre Modell validiert diese Tokens in einem einzigen Durchlauf, wodurch die Latenz reduziert und der Durchsatz verbessert wird.
- Triton MoE-Backend: Das
triton-Backend ist für Mixture-of-Experts-Workloads optimiert und kann unter paralleler Last stabilere Leistung bieten. - Prefix Caching: Prefix Caching reduziert redundante Berechnungen durch Wiederverwendung gemeinsamer Prompt-Präfixe über mehrere Anfragen hinweg.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5 ist ein dichtes Modell, das Eagle Speculative Decoding verwendet.
Konfiguration
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'Warum diese Einstellungen verwendet werden
- FP8-KV-Cache-Komprimierung: Die Einstellung
--kv-cache-dtype=fp8reduziert den KV-Cache-Speicherbedarf und ermöglicht die Unterstützung großer Kontextfenster ohne Änderung der Modellgewichte. - Eagle Speculative Decoding: Das Eagle-Draft-Modell sagt drei Tokens vor dem primären Modell voraus. Das primäre Modell verifiziert die generierten Tokens in einem einzigen Durchlauf und hilft dabei, die Time to First Token und die Antwortlatenz zu reduzieren.
- GPU-Speichernutzung: Ein GPU-Speichernutzungsziel von 92 % maximiert die verfügbaren GPU-Ressourcen und gewährleistet dabei einen stabilen Betrieb für den getesteten Workload.
Performance-Tuning
Möglicherweise musst du die folgenden Parameter anpassen, um deine Leistungs- und Kapazitätsanforderungen zu erfüllen:
| Parameter | Beschreibung |
|---|---|
--tensor-parallel-size | Skaliert die Inferenz über mehrere GPUs. |
--max-model-len | Steuert die maximal unterstützte Kontextlänge. |
--max-num-seqs | Erhöht oder verringert die Kapazität für parallele Anfragen. |
--max-num-batched-tokens | Steuert das Batching-Verhalten. |
--gpu-memory-utilization | Balanciert Speichernutzung und Stabilität. |
--speculative-config | Optimiert Latenz und Durchsatz. |
--enable-prefix-caching | Verbessert die Leistung für wiederholte Prompts. |
--enable-chunked-prefill | Verbessert die Verarbeitung großer Prompts. |
Überwache nach dem Deployment Latenz, Durchsatz, GPU-Auslastung und Speicherverbrauch und passe Konfigurationswerte entsprechend den Anforderungen deines Workloads an.