Konfigurasi runtime vLLM yang direkomendasikan
Gunakan parameter startup vLLM yang direkomendasikan saat men-deploy model fondasi yang didukung untuk IBM Bob self-hosted.
Gunakan parameter startup vLLM yang direkomendasikan saat men-deploy model fondasi yang didukung untuk IBM Bob self-hosted.
Konfigurasi yang direkomendasikan berfokus pada:
- Speculative decoding untuk mengurangi latensi.
- Prefix caching dan chunked prefill untuk meningkatkan performa konteks panjang.
- Backend akselerasi spesifik model untuk throughput optimal.
- Utilisasi memori yang efisien untuk mendukung context window besar dan konkurensi lebih tinggi.
Argumen startup vLLM di bagian ini didasarkan pada pengujian validasi internal yang dilakukan dengan GPU NVIDIA H200 dan disediakan sebagai nilai konfigurasi yang direkomendasikan. Pengaturan ini bukan persyaratan yang dikodekan secara keras dan mungkin tidak cocok untuk semua skenario deployment. Evaluasi dan sesuaikan nilai konfigurasi untuk mengakomodasi platform hardware spesifik, varian model, tujuan performa, dan karakteristik workload lingkunganmu sebelum men-deploy ke produksi.
Model yang tercantum di halaman ini hanya mendukung input berbasis teks dan tidak mendukung pemrosesan gambar atau analisis gambar multimodal. Jangan unggah screenshot, diagram arsitektur, diagram aplikasi, dokumen yang dipindai, atau konten berbasis gambar lainnya sebagai input model. Jika informasi terdapat dalam gambar, konversikan ke teks sebelum mengirimkannya ke model.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B adalah model hybrid state-space model (SSM) berbasis attention. Varian FP8 dan NV-FP4 menggunakan konfigurasi vLLM yang sama. Hanya lokasi model dan nama model yang disajikan yang berbeda antar varian.
Untuk performa optimal, aktifkan speculative decoding dan optimisasi spesifik Mamba.
Konfigurasi FP8
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeKonfigurasi NV-FP4
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeMengapa pengaturan ini digunakan
- Speculative decoding: Metode speculative decoding
nemotron_h_mtpmenghasilkan draft token dan memverifikasinya dalam satu pass. Konfigurasi ini dapat meningkatkan latensi respons dan mengurangi time to first token (TTFT) pada workload bersamaan. - Backend Mamba: Backend
flashinferdirekomendasikan untuk layer Nemotron hybrid SSM. Dikombinasikan dengan stochastic rounding, backend ini membantu menyediakan throughput yang stabil dan konsumsi memori yang dapat diprediksi. - Chunked prefill dan prefix caching: Chunked prefill memproses prompt besar dalam segmen yang lebih kecil, sementara prefix caching menggunakan kembali prefix prompt yang telah dihitung sebelumnya. Opsi-opsi ini membantu meningkatkan performa untuk workload konteks panjang.
- Pemuatan model multi-thread: Menggunakan 64 thread pemuatan dapat mengurangi waktu startup model saat bobot model disimpan di persistent storage. Pengaturan ini tidak memengaruhi performa inferensi setelah model dimuat.
Laguna S 2.1 (FP8)
Laguna S 2.1 adalah model mixture-of-experts (MoE) yang menggunakan dFlash speculative decoding. Konfigurasi berikut divalidasi dengan bobot yang dikuantisasi FP8 pada delapan GPU.
Konfigurasi
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=tritonMengapa pengaturan ini digunakan
- dFlash speculative decoding: Model draft dFlash menghasilkan tujuh speculative token untuk setiap langkah decoding. Model utama memvalidasi token-token ini dalam satu pass, mengurangi latensi dan meningkatkan throughput.
- Backend Triton MoE: Backend
tritondioptimalkan untuk workload mixture-of-experts dan dapat memberikan performa yang lebih stabil di bawah beban bersamaan. - Prefix caching: Prefix caching mengurangi komputasi redundan dengan menggunakan kembali prefix prompt yang umum di beberapa permintaan.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5 adalah model dense yang menggunakan Eagle speculative decoding.
Konfigurasi
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'Mengapa pengaturan ini digunakan
- Kompresi KV-cache FP8: Pengaturan
--kv-cache-dtype=fp8mengurangi persyaratan memori KV-cache, memungkinkan dukungan untuk context window besar tanpa memodifikasi bobot model. - Eagle speculative decoding: Model draft Eagle memprediksi tiga token di depan model utama. Model utama memverifikasi token yang dihasilkan dalam satu pass, membantu mengurangi time to first token dan latensi respons.
- Utilisasi memori GPU: Target utilisasi memori GPU sebesar 92% memaksimalkan sumber daya GPU yang tersedia sambil mempertahankan operasi yang stabil untuk workload yang diuji.
Penyesuaian performa
Kamu mungkin perlu menyesuaikan parameter berikut untuk memenuhi persyaratan performa dan kapasitasmu:
| Parameter | Deskripsi |
|---|---|
--tensor-parallel-size | Menskalakan inferensi di beberapa GPU. |
--max-model-len | Mengontrol panjang konteks maksimum yang didukung. |
--max-num-seqs | Meningkatkan atau menurunkan kapasitas permintaan bersamaan. |
--max-num-batched-tokens | Mengontrol perilaku batching. |
--gpu-memory-utilization | Menyeimbangkan penggunaan memori dan stabilitas. |
--speculative-config | Mengoptimalkan latensi dan throughput. |
--enable-prefix-caching | Meningkatkan performa untuk prompt yang berulang. |
--enable-chunked-prefill | Meningkatkan pemrosesan prompt besar. |
Setelah deployment, pantau latensi, throughput, utilisasi GPU, dan konsumsi memori, serta sesuaikan nilai konfigurasi sesuai kebutuhan untuk workload-mu.