Configurazione runtime vLLM consigliata
Utilizza i parametri di avvio vLLM consigliati durante il deployment dei foundation model supportati per IBM Bob self-hosted.
Utilizza i parametri di avvio vLLM consigliati durante il deployment dei foundation model supportati per IBM Bob self-hosted.
Le configurazioni consigliate si concentrano su:
- Decodifica speculativa per ridurre la latenza.
- Caching dei prefissi e prefill a blocchi (chunked prefill) per migliorare le prestazioni con contesti estesi.
- Backend di accelerazione specifici per modello per un throughput ottimale.
- Utilizzo efficiente della memoria per supportare finestre di contesto ampie e una maggiore concorrenza.
Gli argomenti di avvio vLLM in questa sezione si basano su test di convalida interni condotti con GPU NVIDIA H200 e sono forniti come valori di configurazione consigliati. Queste impostazioni non sono requisiti hardcoded e potrebbero non essere adatte a tutti gli scenari di deployment. Valuta e adatta i valori di configurazione per soddisfare la piattaforma hardware specifica, la variante del modello, gli obiettivi di prestazioni e le caratteristiche del carico di lavoro del tuo ambiente prima del deployment in produzione.
I modelli elencati in questa pagina supportano solo input basati su testo e non supportano l'elaborazione di immagini o l'analisi di immagini multimodale. Non caricare screenshot, diagrammi di architettura, diagrammi applicativi, documenti scansionati o altri contenuti basati su immagini come input del modello. Se le informazioni sono contenute in un'immagine, convertile in testo prima di inviarle al modello.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B è un modello ibrido basato su state-space model (SSM) e attenzione. Le varianti FP8 e NV-FP4 utilizzano la stessa configurazione vLLM. Solo la posizione del modello e il nome del modello servito differiscono tra le varianti.
Per prestazioni ottimali, abilita la decodifica speculativa e le ottimizzazioni specifiche per Mamba.
Configurazione FP8
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeConfigurazione NV-FP4
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codePerché vengono utilizzate queste impostazioni
- Decodifica speculativa: Il metodo di decodifica speculativa
nemotron_h_mtpgenera token di bozza e li verifica in un unico passaggio. Questa configurazione può migliorare la latenza di risposta e ridurre il time to first token (TTFT) sotto carichi di lavoro concorrenti. - Backend Mamba: Il backend
flashinferè consigliato per i layer SSM ibridi di Nemotron. Combinato con lo stochastic rounding, contribuisce a fornire un throughput stabile e un consumo di memoria prevedibile. - Prefill a blocchi e caching dei prefissi: Il prefill a blocchi (chunked prefill) elabora prompt di grandi dimensioni in segmenti più piccoli, mentre il caching dei prefissi riutilizza i prefissi di prompt precedentemente calcolati. Queste opzioni aiutano a migliorare le prestazioni per carichi di lavoro con contesti estesi.
- Caricamento del modello multithread: L'utilizzo di 64 thread di caricamento può ridurre i tempi di avvio del modello quando i pesi del modello sono archiviati su storage persistente. Questa impostazione non influisce sulle prestazioni di inference dopo il caricamento del modello.
Laguna S 2.1 (FP8)
Laguna S 2.1 è un modello mixture-of-experts (MoE) che utilizza la decodifica speculativa dFlash. La seguente configurazione è stata convalidata con pesi quantizzati in FP8 su otto GPU.
Configurazione
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=tritonPerché vengono utilizzate queste impostazioni
- Decodifica speculativa dFlash: Il modello di bozza dFlash genera sette token speculativi per ciascun passaggio di decodifica. Il modello primario convalida questi token in un unico passaggio, riducendo la latenza e migliorando il throughput.
- Backend MoE Triton: Il backend
tritonè ottimizzato per carichi di lavoro mixture-of-experts e può fornire prestazioni più stabili sotto carico concorrente. - Caching dei prefissi: Il caching dei prefissi riduce il calcolo ridondante riutilizzando i prefissi comuni dei prompt tra più richieste.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5 è un modello denso che utilizza la decodifica speculativa Eagle.
Configurazione
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'Perché vengono utilizzate queste impostazioni
- Compressione KV-cache FP8: L'impostazione
--kv-cache-dtype=fp8riduce i requisiti di memoria della KV-cache, consentendo il supporto per finestre di contesto ampie senza modificare i pesi del modello. - Decodifica speculativa Eagle: Il modello di bozza Eagle predice tre token prima del modello primario. Il modello primario verifica i token generati in un unico passaggio, contribuendo a ridurre il time to first token e la latenza di risposta.
- Utilizzo della memoria GPU: Un obiettivo di utilizzo della memoria GPU del 92% massimizza le risorse GPU disponibili mantenendo un funzionamento stabile per il carico di lavoro testato.
Ottimizzazione delle prestazioni
Potrebbe essere necessario regolare i seguenti parametri per soddisfare i requisiti di prestazioni e capacità:
| Parametro | Descrizione |
|---|---|
--tensor-parallel-size | Scala l'inference su più GPU. |
--max-model-len | Controlla la lunghezza massima del contesto supportata. |
--max-num-seqs | Aumenta o diminuisce la capacità di richieste concorrenti. |
--max-num-batched-tokens | Controlla il comportamento di batching. |
--gpu-memory-utilization | Bilancia l'utilizzo della memoria e la stabilità. |
--speculative-config | Ottimizza latenza e throughput. |
--enable-prefix-caching | Migliora le prestazioni per i prompt ripetuti. |
--enable-chunked-prefill | Migliora l'elaborazione di prompt di grandi dimensioni. |
Dopo il deployment, monitora latenza, throughput, utilizzo della GPU e consumo di memoria, e adatta i valori di configurazione come richiesto per il tuo carico di lavoro.