Önerilen vLLM çalışma zamanı yapılandırması
IBM Bob self-hosted için desteklenen temel modelleri dağıtırken önerilen vLLM başlangıç parametrelerini kullan.
IBM Bob self-hosted için desteklenen temel modelleri dağıtırken önerilen vLLM başlangıç parametrelerini kullan.
Önerilen yapılandırmalar şu konulara odaklanır:
- Gecikmeyi azaltmak için spekülatif kod çözme (speculative decoding).
- Uzun bağlam performansını iyileştirmek için prefix caching ve chunked prefill.
- Optimal throughput için modele özgü hızlandırma backend'leri.
- Büyük bağlam pencerelerini ve daha yüksek eşzamanlılığı desteklemek için verimli bellek kullanımı.
Bu bölümdeki vLLM başlangıç argümanları, NVIDIA H200 GPU'larla yürütülen dahili doğrulama testlerine dayanmaktadır ve önerilen yapılandırma değerleri olarak sunulmaktadır. Bu ayarlar sabit gereksinimler değildir ve tüm dağıtım senaryoları için uygun olmayabilir. Üretime geçmeden önce ortamının belirli donanım platformuna, model varyantına, performans hedeflerine ve iş yükü özelliklerine uyum sağlamak için yapılandırma değerlerini değerlendir ve ayarla.
Bu sayfada listelenen modeller yalnızca metin tabanlı girdileri destekler; görüntü işleme veya çok modlu görüntü analizini desteklemez. Model girdisi olarak ekran görüntüsü, mimari diyagram, uygulama diyagramı, taranmış belge veya diğer görüntü tabanlı içerikler yükleme. Bir görüntü içinde bilgi varsa, modele göndermeden önce metne dönüştür.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B, hibrit durum-uzay modeli (SSM) ve dikkat tabanlı bir modeldir. FP8 ve NV-FP4 varyantları aynı vLLM yapılandırmasını kullanır. Varyantlar arasında yalnızca model konumu ve sunulan model adı farklıdır.
Optimal performans için spekülatif kod çözmeyi ve Mamba'ya özgü optimizasyonları etkinleştir.
FP8 yapılandırması
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeNV-FP4 yapılandırması
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeBu ayarlar neden kullanılıyor
- Spekülatif kod çözme:
nemotron_h_mtpspekülatif kod çözme yöntemi taslak token'lar üretir ve bunları tek bir geçişte doğrular. Bu yapılandırma, eşzamanlı iş yüklerinde yanıt gecikmesini iyileştirebilir ve ilk token süresini (TTFT) azaltabilir. - Mamba backend:
flashinferbackend'i Nemotron hibrit SSM katmanları için önerilir. Stokastik yuvarlama ile birleştirildiğinde kararlı throughput ve öngörülebilir bellek tüketimi sağlamaya yardımcı olur. - Chunked prefill ve prefix caching: Chunked prefill büyük promptları daha küçük parçalarda işlerken, prefix caching daha önce hesaplanmış prompt öneklerini yeniden kullanır. Bu seçenekler uzun bağlam iş yükleri için performansın iyileştirilmesine yardımcı olur.
- Çok iş parçacıklı model yükleme: 64 yükleme iş parçacığı kullanmak, model ağırlıkları kalıcı depolama üzerinde tutulduğunda model başlangıç sürelerini azaltabilir. Bu ayar, model yüklendikten sonra çıkarım performansını etkilemez.
Laguna S 2.1 (FP8)
Laguna S 2.1, dFlash spekülatif kod çözme kullanan bir uzman karışımı (MoE) modelidir. Aşağıdaki yapılandırma, sekiz GPU üzerinde FP8 ile nicellendirilmiş ağırlıklarla doğrulanmıştır.
Yapılandırma
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=tritonBu ayarlar neden kullanılıyor
- dFlash spekülatif kod çözme: dFlash taslak modeli her kod çözme adımı için yedi spekülatif token üretir. Birincil model bu token'ları tek bir geçişte doğrular; gecikmeyi azaltır ve throughput'u artırır.
- Triton MoE backend:
tritonbackend'i uzman karışımı iş yükleri için optimize edilmiştir ve eşzamanlı yük altında daha kararlı performans sağlayabilir. - Prefix caching: Prefix caching, birden fazla istek genelinde ortak prompt öneklerini yeniden kullanarak gereksiz hesaplamayı azaltır.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5, Eagle spekülatif kod çözme kullanan yoğun (dense) bir modeldir.
Yapılandırma
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'Bu ayarlar neden kullanılıyor
- FP8 KV-cache sıkıştırması:
--kv-cache-dtype=fp8ayarı, KV-cache bellek gereksinimlerini azaltır; böylece model ağırlıklarını değiştirmeden büyük bağlam pencerelerinin desteklenmesi mümkün olur. - Eagle spekülatif kod çözme: Eagle taslak modeli birincil modelin üç token önesini tahmin eder. Birincil model üretilen token'ları tek bir geçişte doğrular; ilk token süresinin ve yanıt gecikmesinin azaltılmasına yardımcı olur.
- GPU bellek kullanımı: %92'lik bir GPU bellek kullanımı hedefi, test edilen iş yükü için kararlı çalışmayı sürdürürken mevcut GPU kaynaklarını en üst düzeye çıkarır.
Performans ayarlama
Performans ve kapasite gereksinimlerini karşılamak için aşağıdaki parametreleri ayarlaman gerekebilir:
| Parametre | Açıklama |
|---|---|
--tensor-parallel-size | Çıkarımı birden fazla GPU'ya ölçeklendirir. |
--max-model-len | Desteklenen maksimum bağlam uzunluğunu kontrol eder. |
--max-num-seqs | Eşzamanlı istek kapasitesini artırır veya azaltır. |
--max-num-batched-tokens | Toplu işleme davranışını kontrol eder. |
--gpu-memory-utilization | Bellek kullanımı ile kararlılığı dengeler. |
--speculative-config | Gecikmeyi ve throughput'u optimize eder. |
--enable-prefix-caching | Tekrarlanan promptlar için performansı artırır. |
--enable-chunked-prefill | Büyük promptların işlenmesini iyileştirir. |
Dağıtımdan sonra gecikmeyi, throughput'u, GPU kullanımını ve bellek tüketimini izle; iş yüküne göre gerektiğinde yapılandırma değerlerini ayarla.