Configuración de runtime vLLM recomendada

Usa los parámetros de inicio de vLLM recomendados al desplegar los modelos fundacionales compatibles con IBM Bob self-hosted.

Usa los parámetros de inicio de vLLM recomendados al desplegar los modelos fundacionales compatibles con IBM Bob self-hosted.

Las configuraciones recomendadas se centran en:

  • Decodificación especulativa para reducir la latencia.
  • Prefix caching y chunked prefill para mejorar el rendimiento en contextos largos.
  • Backends de aceleración específicos por modelo para un rendimiento óptimo.
  • Utilización eficiente de la memoria para soportar ventanas de contexto grandes y mayor concurrencia.
Nota:

Los argumentos de inicio de vLLM de esta sección están basados en pruebas de validación interna realizadas con GPUs NVIDIA H200 y se proporcionan como valores de configuración recomendados. Estos ajustes no son requisitos fijos y pueden no ser adecuados para todos los escenarios de despliegue. Evalúa y ajusta los valores de configuración para adaptarlos a la plataforma de hardware específica, la variante del modelo, los objetivos de rendimiento y las características de la carga de trabajo de tu entorno antes de desplegar en producción.

Importante:

Los modelos listados en esta página solo admiten entradas de texto y no admiten procesamiento de imágenes ni análisis de imágenes multimodal. No subas capturas de pantalla, diagramas de arquitectura, diagramas de aplicaciones, documentos escaneados ni otro contenido basado en imágenes como entrada del modelo. Si la información está contenida en una imagen, conviértela a texto antes de enviarla al modelo.

Nvidia Nemotron 3 Ultra (FP8, NV-FP4)

Nemotron 3 Ultra 550B es un modelo híbrido de estado-espacio (SSM) y basado en atención. Las variantes FP8 y NV-FP4 usan la misma configuración de vLLM. Solo la ubicación del modelo y el nombre del modelo servido difieren entre variantes.

Para un rendimiento óptimo, habilita la decodificación especulativa y las optimizaciones específicas de Mamba.

Configuración FP8

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Configuración NV-FP4

args:
  - --tensor-parallel-size=8
  - --enable-expert-parallel
  - --max-model-len=262144
  - --max-num-seqs=32
  - --max-num-batched-tokens=32768
  - --gpu-memory-utilization=0.90
  - --enable-chunked-prefill
  - --enable-prefix-caching
  - --mamba-cache-mode=align
  - --mamba-ssm-cache-dtype=float16
  - --mamba-backend=flashinfer
  - --enable-mamba-cache-stochastic-rounding
  - --mamba-cache-philox-rounds=5
  - '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
  - '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
  - --reasoning-parser=nemotron_v3
  - --tool-call-parser=qwen3_coder
  - --enable-auto-tool-choice
  - --enable-prompt-tokens-details
  - --trust-remote-code

Por qué se usan estos ajustes

  • Decodificación especulativa: El método de decodificación especulativa nemotron_h_mtp genera tokens borrador y los verifica en un único paso. Esta configuración puede mejorar la latencia de respuesta y reducir el tiempo hasta el primer token (TTFT) bajo cargas de trabajo concurrentes.
  • Backend Mamba: El backend flashinfer es el recomendado para las capas SSM híbridas de Nemotron. Combinado con el redondeo estocástico, ayuda a proporcionar un rendimiento estable y un consumo de memoria predecible.
  • Chunked prefill y prefix caching: El chunked prefill procesa prompts grandes en segmentos más pequeños, mientras que el prefix caching reutiliza prefijos de prompts calculados previamente. Estas opciones ayudan a mejorar el rendimiento para cargas de trabajo con contextos largos.
  • Carga de modelo multihilo: Usar 64 hilos de carga puede reducir los tiempos de inicio del modelo cuando los pesos del modelo están almacenados en almacenamiento persistente. Este ajuste no afecta al rendimiento de la inferencia una vez cargado el modelo.

Laguna S 2.1 (FP8)

Laguna S 2.1 es un modelo de mezcla de expertos (MoE) que usa decodificación especulativa dFlash. La siguiente configuración fue validada con pesos cuantizados FP8 en ocho GPUs.

Configuración

args:
  - --trust-remote-code
  - --tensor-parallel-size=8
  - --tool-call-parser=poolside_v1
  - --enable-auto-tool-choice
  - --reasoning-parser=poolside_v1
  - --enable-prompt-tokens-details
  - --max-num-batched-tokens=16384
  - --enable-prefix-caching
  - '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
  - '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
  - --moe-backend=triton

Por qué se usan estos ajustes

  • Decodificación especulativa dFlash: El modelo borrador dFlash genera siete tokens especulativos por cada paso de decodificación. El modelo principal valida estos tokens en un único paso, reduciendo la latencia y mejorando el rendimiento.
  • Backend Triton MoE: El backend triton está optimizado para cargas de trabajo de mezcla de expertos y puede proporcionar un rendimiento más estable bajo carga concurrente.
  • Prefix caching: El prefix caching reduce el cómputo redundante reutilizando prefijos de prompts comunes entre múltiples solicitudes.

Mistral Medium 3.5 (FP8)

Mistral Medium 3.5 es un modelo denso que usa decodificación especulativa Eagle.

Configuración

args:
  - --tensor-parallel-size=8
  - --tool-call-parser=mistral
  - --enable-auto-tool-choice
  - --reasoning-parser=mistral
  - --max-num-batched-tokens=32768
  - --max-num-seqs=32
  - --kv-cache-dtype=fp8
  - --max-model-len=234800
  - --gpu-memory-utilization=0.92
  - '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'

Por qué se usan estos ajustes

  • Compresión FP8 del KV-cache: El ajuste --kv-cache-dtype=fp8 reduce los requisitos de memoria del KV-cache, permitiendo el soporte de ventanas de contexto grandes sin modificar los pesos del modelo.
  • Decodificación especulativa Eagle: El modelo borrador Eagle predice tres tokens por delante del modelo principal. El modelo principal verifica los tokens generados en un único paso, ayudando a reducir el tiempo hasta el primer token y la latencia de respuesta.
  • Utilización de memoria de GPU: Un objetivo de utilización de memoria de GPU del 92% maximiza los recursos de GPU disponibles mientras mantiene una operación estable para la carga de trabajo probada.

Ajuste de rendimiento

Es posible que necesites ajustar los siguientes parámetros para cumplir tus requisitos de rendimiento y capacidad:

ParámetroDescripción
--tensor-parallel-sizeEscala la inferencia en múltiples GPUs.
--max-model-lenControla la longitud máxima de contexto admitida.
--max-num-seqsAumenta o reduce la capacidad de solicitudes concurrentes.
--max-num-batched-tokensControla el comportamiento del batching.
--gpu-memory-utilizationEquilibra el uso de memoria y la estabilidad.
--speculative-configOptimiza la latencia y el rendimiento.
--enable-prefix-cachingMejora el rendimiento para prompts repetidos.
--enable-chunked-prefillMejora el procesamiento de prompts grandes.

Después del despliegue, monitoriza la latencia, el rendimiento, la utilización de GPU y el consumo de memoria, y ajusta los valores de configuración según sea necesario para tu carga de trabajo.

¿Cómo es este tema?