권장 vLLM 런타임 구성
IBM Bob 자체 호스팅을 위해 지원되는 파운데이션 모델을 배포할 때 권장 vLLM 시작 파라미터를 사용합니다.
IBM Bob 자체 호스팅을 위해 지원되는 파운데이션 모델을 배포할 때 권장 vLLM 시작 파라미터를 사용합니다.
권장 구성의 주요 초점:
- 지연 시간을 줄이기 위한 추론적 디코딩(speculative decoding).
- 긴 컨텍스트 성능을 향상시키기 위한 prefix 캐싱 및 청크 단위 프리필(chunked prefill).
- 최적의 처리량을 위한 모델별 가속 백엔드.
- 큰 컨텍스트 창과 높은 동시성을 지원하기 위한 효율적인 메모리 활용.
이 섹션의 vLLM 시작 인수는 NVIDIA H200 GPU를 사용한 내부 검증 테스트를 기반으로 하며 권장 구성 값으로 제공됩니다. 이 설정은 하드코딩된 요구 사항이 아니며 모든 배포 시나리오에 적합하지 않을 수 있습니다. 프로덕션에 배포하기 전에 환경의 특정 하드웨어 플랫폼, 모델 변형, 성능 목표 및 워크로드 특성에 맞게 구성 값을 평가하고 조정하세요.
이 페이지에 나열된 모델은 텍스트 기반 입력만 지원하며 이미지 처리 또는 멀티모달 이미지 분석은 지원하지 않습니다. 스크린샷, 아키텍처 다이어그램, 애플리케이션 다이어그램, 스캔 문서 또는 기타 이미지 기반 콘텐츠를 모델 입력으로 업로드하지 마세요. 이미지에 정보가 포함되어 있는 경우 모델에 제출하기 전에 텍스트로 변환하세요.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B는 하이브리드 상태 공간 모델(SSM)과 어텐션 기반 모델입니다. FP8 및 NV-FP4 변형은 동일한 vLLM 구성을 사용합니다. 변형 간에는 모델 위치와 제공되는 모델 이름만 다릅니다.
최적의 성능을 위해 추론적 디코딩 및 Mamba 특화 최적화를 활성화하세요.
FP8 구성
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeNV-FP4 구성
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-code이 설정을 사용하는 이유
- 추론적 디코딩:
nemotron_h_mtp추론적 디코딩 방법은 드래프트 토큰을 생성하고 단일 패스로 검증합니다. 이 구성은 동시 워크로드에서 응답 지연 시간을 개선하고 첫 번째 토큰 생성 시간(TTFT)을 줄이는 데 도움이 됩니다. - Mamba 백엔드:
flashinfer백엔드는 Nemotron 하이브리드 SSM 레이어에 권장됩니다. 확률적 반올림과 결합하여 안정적인 처리량과 예측 가능한 메모리 소비를 제공하는 데 도움이 됩니다. - 청크 단위 프리필 및 prefix 캐싱: 청크 단위 프리필은 대규모 프롬프트를 더 작은 세그먼트로 처리하고, prefix 캐싱은 이전에 계산된 프롬프트 prefix를 재사용합니다. 이 옵션은 긴 컨텍스트 워크로드의 성능을 향상시키는 데 도움이 됩니다.
- 멀티스레드 모델 로딩: 64개의 로딩 스레드를 사용하면 모델 가중치가 영구 스토리지에 저장된 경우 모델 시작 시간을 줄일 수 있습니다. 이 설정은 모델이 로드된 후의 추론 성능에는 영향을 미치지 않습니다.
Laguna S 2.1 (FP8)
Laguna S 2.1은 dFlash 추론적 디코딩을 사용하는 혼합 전문가(MoE) 모델입니다. 다음 구성은 8개의 GPU에서 FP8 양자화 가중치로 검증되었습니다.
구성
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=triton이 설정을 사용하는 이유
- dFlash 추론적 디코딩: dFlash 드래프트 모델은 각 디코딩 단계마다 7개의 추론 토큰을 생성합니다. 기본 모델은 이 토큰을 단일 패스로 검증하여 지연 시간을 줄이고 처리량을 향상시킵니다.
- Triton MoE 백엔드:
triton백엔드는 혼합 전문가 워크로드에 최적화되어 있으며 동시 부하에서 더 안정적인 성능을 제공할 수 있습니다. - Prefix 캐싱: Prefix 캐싱은 여러 요청에 걸쳐 공통 프롬프트 prefix를 재사용하여 중복 계산을 줄입니다.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5는 Eagle 추론적 디코딩을 사용하는 밀집형(dense) 모델입니다.
구성
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'이 설정을 사용하는 이유
- FP8 KV-캐시 압축:
--kv-cache-dtype=fp8설정은 모델 가중치를 수정하지 않고도 큰 컨텍스트 창을 지원할 수 있도록 KV-캐시 메모리 요구 사항을 줄입니다. - Eagle 추론적 디코딩: Eagle 드래프트 모델은 기본 모델보다 3개의 토큰을 미리 예측합니다. 기본 모델은 생성된 토큰을 단일 패스로 검증하여 첫 번째 토큰 생성 시간과 응답 지연 시간을 줄이는 데 도움이 됩니다.
- GPU 메모리 활용: 92%의 GPU 메모리 활용 목표는 테스트된 워크로드에서 안정적인 운영을 유지하면서 사용 가능한 GPU 리소스를 최대화합니다.
성능 튜닝
성능 및 용량 요구 사항을 충족하기 위해 다음 파라미터를 조정해야 할 수 있습니다:
| 파라미터 | 설명 |
|---|---|
--tensor-parallel-size | 여러 GPU에 걸쳐 추론을 확장합니다. |
--max-model-len | 지원되는 최대 컨텍스트 길이를 제어합니다. |
--max-num-seqs | 동시 요청 처리 용량을 늘리거나 줄입니다. |
--max-num-batched-tokens | 배치 처리 동작을 제어합니다. |
--gpu-memory-utilization | 메모리 사용량과 안정성의 균형을 맞춥니다. |
--speculative-config | 지연 시간과 처리량을 최적화합니다. |
--enable-prefix-caching | 반복되는 프롬프트의 성능을 향상시킵니다. |
--enable-chunked-prefill | 대규모 프롬프트 처리를 향상시킵니다. |
배포 후 지연 시간, 처리량, GPU 활용률, 메모리 소비를 모니터링하고 워크로드에 맞게 구성 값을 조정하세요.