Configurazione runtime vLLM consigliata

Utilizza i parametri di avvio vLLM consigliati durante il deployment dei foundation model supportati per IBM Bob self-hosted.

Utilizza i parametri di avvio vLLM consigliati durante il deployment dei foundation model supportati per IBM Bob self-hosted.

Le configurazioni consigliate si concentrano su:

  • Decodifica speculativa per ridurre la latenza.
  • Caching dei prefissi e prefill a blocchi (chunked prefill) per migliorare le prestazioni con contesti estesi.
  • Backend di accelerazione specifici per modello per un throughput ottimale.
  • Utilizzo efficiente della memoria per supportare finestre di contesto ampie e una maggiore concorrenza.
Nota:

Gli argomenti di avvio vLLM in questa sezione si basano su test di convalida interni condotti con GPU NVIDIA H200 e sono forniti come valori di configurazione consigliati. Queste impostazioni non sono requisiti hardcoded e potrebbero non essere adatte a tutti gli scenari di deployment. Valuta e adatta i valori di configurazione per soddisfare la piattaforma hardware specifica, la variante del modello, gli obiettivi di prestazioni e le caratteristiche del carico di lavoro del tuo ambiente prima del deployment in produzione.

Importante:

I modelli elencati in questa pagina supportano solo input basati su testo e non supportano l'elaborazione di immagini o l'analisi di immagini multimodale. Non caricare screenshot, diagrammi di architettura, diagrammi applicativi, documenti scansionati o altri contenuti basati su immagini come input del modello. Se le informazioni sono contenute in un'immagine, convertile in testo prima di inviarle al modello.

Nvidia Nemotron 3 Ultra (FP8, NV-FP4)

Nemotron 3 Ultra 550B è un modello ibrido basato su state-space model (SSM) e attenzione. Le varianti FP8 e NV-FP4 utilizzano la stessa configurazione vLLM. Solo la posizione del modello e il nome del modello servito differiscono tra le varianti.

Per prestazioni ottimali, abilita la decodifica speculativa e le ottimizzazioni specifiche per Mamba.

Configurazione FP8

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Configurazione NV-FP4

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Perché vengono utilizzate queste impostazioni

  • Decodifica speculativa: Il metodo di decodifica speculativa nemotron_h_mtp genera token di bozza e li verifica in un unico passaggio. Questa configurazione può migliorare la latenza di risposta e ridurre il time to first token (TTFT) sotto carichi di lavoro concorrenti.
  • Backend Mamba: Il backend flashinfer è consigliato per i layer SSM ibridi di Nemotron. Combinato con lo stochastic rounding, contribuisce a fornire un throughput stabile e un consumo di memoria prevedibile.
  • Prefill a blocchi e caching dei prefissi: Il prefill a blocchi (chunked prefill) elabora prompt di grandi dimensioni in segmenti più piccoli, mentre il caching dei prefissi riutilizza i prefissi di prompt precedentemente calcolati. Queste opzioni aiutano a migliorare le prestazioni per carichi di lavoro con contesti estesi.
  • Caricamento del modello multithread: L'utilizzo di 64 thread di caricamento può ridurre i tempi di avvio del modello quando i pesi del modello sono archiviati su storage persistente. Questa impostazione non influisce sulle prestazioni di inference dopo il caricamento del modello.

Laguna S 2.1 (FP8)

Laguna S 2.1 è un modello mixture-of-experts (MoE) che utilizza la decodifica speculativa dFlash. La seguente configurazione è stata convalidata con pesi quantizzati in FP8 su otto GPU.

Configurazione

args:
  - --trust-remote-code
  - --tensor-parallel-size=8
  - --tool-call-parser=poolside_v1
  - --enable-auto-tool-choice
  - --reasoning-parser=poolside_v1
  - --enable-prompt-tokens-details
  - --max-num-batched-tokens=16384
  - --enable-prefix-caching
  - '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
  - '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
  - --moe-backend=triton

Perché vengono utilizzate queste impostazioni

  • Decodifica speculativa dFlash: Il modello di bozza dFlash genera sette token speculativi per ciascun passaggio di decodifica. Il modello primario convalida questi token in un unico passaggio, riducendo la latenza e migliorando il throughput.
  • Backend MoE Triton: Il backend triton è ottimizzato per carichi di lavoro mixture-of-experts e può fornire prestazioni più stabili sotto carico concorrente.
  • Caching dei prefissi: Il caching dei prefissi riduce il calcolo ridondante riutilizzando i prefissi comuni dei prompt tra più richieste.

Mistral Medium 3.5 (FP8)

Mistral Medium 3.5 è un modello denso che utilizza la decodifica speculativa Eagle.

Configurazione

args:
  - --tensor-parallel-size=8
  - --tool-call-parser=mistral
  - --enable-auto-tool-choice
  - --reasoning-parser=mistral
  - --max-num-batched-tokens=32768
  - --max-num-seqs=32
  - --kv-cache-dtype=fp8
  - --max-model-len=234800
  - --gpu-memory-utilization=0.92
  - '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'

Perché vengono utilizzate queste impostazioni

  • Compressione KV-cache FP8: L'impostazione --kv-cache-dtype=fp8 riduce i requisiti di memoria della KV-cache, consentendo il supporto per finestre di contesto ampie senza modificare i pesi del modello.
  • Decodifica speculativa Eagle: Il modello di bozza Eagle predice tre token prima del modello primario. Il modello primario verifica i token generati in un unico passaggio, contribuendo a ridurre il time to first token e la latenza di risposta.
  • Utilizzo della memoria GPU: Un obiettivo di utilizzo della memoria GPU del 92% massimizza le risorse GPU disponibili mantenendo un funzionamento stabile per il carico di lavoro testato.

Ottimizzazione delle prestazioni

Potrebbe essere necessario regolare i seguenti parametri per soddisfare i requisiti di prestazioni e capacità:

ParametroDescrizione
--tensor-parallel-sizeScala l'inference su più GPU.
--max-model-lenControlla la lunghezza massima del contesto supportata.
--max-num-seqsAumenta o diminuisce la capacità di richieste concorrenti.
--max-num-batched-tokensControlla il comportamento di batching.
--gpu-memory-utilizationBilancia l'utilizzo della memoria e la stabilità.
--speculative-configOttimizza latenza e throughput.
--enable-prefix-cachingMigliora le prestazioni per i prompt ripetuti.
--enable-chunked-prefillMigliora l'elaborazione di prompt di grandi dimensioni.

Dopo il deployment, monitora latenza, throughput, utilizzo della GPU e consumo di memoria, e adatta i valori di configurazione come richiesto per il tuo carico di lavoro.

Come valuti questo argomento?