تكوين بيئة تشغيل vLLM الموصى بها
استخدم معاملات بدء تشغيل vLLM الموصى بها عند نشر نماذج الأساس المدعومة لـ IBM Bob ذاتي الاستضافة.
استخدم معاملات بدء تشغيل vLLM الموصى بها عند نشر نماذج الأساس المدعومة لـ IBM Bob ذاتي الاستضافة.
تركز التكوينات الموصى بها على:
- الترميز التخميني (Speculative decoding) لتقليل زمن الاستجابة.
- التخزين المؤقت للبادئات (Prefix caching) والتعبئة المجزأة (Chunked prefill) لتحسين أداء السياق الطويل.
- خلفيات التسريع الخاصة بكل نموذج للحصول على أفضل إنتاجية.
- الاستخدام الفعّال للذاكرة لدعم نوافذ السياق الكبيرة والتزامن الأعلى.
تستند وسيطات بدء تشغيل vLLM في هذا القسم إلى اختبارات التحقق الداخلية التي أُجريت باستخدام وحدات معالجة الرسومات NVIDIA H200 وهي مقدَّمة كقيم تكوين موصى بها. هذه الإعدادات ليست متطلبات مُضمَّنة في الكود وقد لا تكون مناسبة لجميع سيناريوهات النشر. قيّم قيم التكوين وعدّلها لتلائم منصة العتاد المحددة وتنوع النموذج وأهداف الأداء وخصائص أعباء العمل في بيئتك قبل النشر في الإنتاج.
النماذج المدرجة في هذه الصفحة تدعم المدخلات النصية فقط ولا تدعم معالجة الصور أو تحليل الصور متعدد الوسائط. لا تُحمّل لقطات الشاشة أو مخططات المعمارية أو مخططات التطبيقات أو المستندات الممسوحة ضوئيًا أو أي محتوى قائم على الصور كمدخل للنموذج. إذا كانت المعلومات موجودة في صورة، حوّلها إلى نص قبل إرسالها إلى النموذج.
Nvidia Nemotron 3 Ultra (FP8, NV-FP4)
Nemotron 3 Ultra 550B هو نموذج هجين يجمع بين نموذج حالة الفضاء (SSM) والنموذج القائم على الانتباه. يستخدم كل من متغيري FP8 وNV-FP4 نفس تكوين vLLM. يختلف الموقع المقدَّم للنموذج واسم النموذج المُقدَّم فقط بين المتغيرين.
للحصول على الأداء الأمثل، فعّل الترميز التخميني والتحسينات الخاصة بـ Mamba.
تكوين FP8
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeتكوين NV-FP4
args:
- --tensor-parallel-size=8
- --enable-expert-parallel
- --max-model-len=262144
- --max-num-seqs=32
- --max-num-batched-tokens=32768
- --gpu-memory-utilization=0.90
- --enable-chunked-prefill
- --enable-prefix-caching
- --mamba-cache-mode=align
- --mamba-ssm-cache-dtype=float16
- --mamba-backend=flashinfer
- --enable-mamba-cache-stochastic-rounding
- --mamba-cache-philox-rounds=5
- '--speculative-config={"method": "nemotron_h_mtp", "num_speculative_tokens": 5}'
- '--model-loader-extra-config={"enable_multithread_load": true, "num_threads": 64}'
- --reasoning-parser=nemotron_v3
- --tool-call-parser=qwen3_coder
- --enable-auto-tool-choice
- --enable-prompt-tokens-details
- --trust-remote-codeلماذا تُستخدم هذه الإعدادات
- الترميز التخميني: تُولّد طريقة الترميز التخميني
nemotron_h_mtpرموزًا مسودة وتتحقق منها في مرور واحد. يمكن أن يُحسّن هذا التكوين زمن استجابة الرد ويقلل الوقت حتى الرمز الأول (TTFT) في أحمال العمل المتزامنة. - خلفية Mamba: يُنصح بخلفية
flashinferلطبقات SSM الهجينة في Nemotron. بالاقتران مع التقريب العشوائي، تساعد على توفير إنتاجية ثابتة واستهلاك ذاكرة متوقع. - التعبئة المجزأة والتخزين المؤقت للبادئات: تعالج التعبئة المجزأة المطالبات الكبيرة في أجزاء أصغر، بينما يُعيد التخزين المؤقت للبادئات استخدام بادئات المطالبات المحسوبة مسبقًا. تساعد هذه الخيارات على تحسين الأداء لأحمال العمل ذات السياق الطويل.
- تحميل النموذج متعدد الخيوط: يمكن أن يُقلّل استخدام 64 خيطًا للتحميل من أوقات بدء تشغيل النموذج عندما تُخزَّن أوزانه على وحدة تخزين دائمة. لا يؤثر هذا الإعداد على أداء الاستدلال بعد تحميل النموذج.
Laguna S 2.1 (FP8)
Laguna S 2.1 هو نموذج خليط من الخبراء (MoE) يستخدم الترميز التخميني dFlash. تم التحقق من صحة التكوين التالي مع أوزان مُكمَّمة بـ FP8 على ثماني وحدات GPU.
التكوين
args:
- --trust-remote-code
- --tensor-parallel-size=8
- --tool-call-parser=poolside_v1
- --enable-auto-tool-choice
- --reasoning-parser=poolside_v1
- --enable-prompt-tokens-details
- --max-num-batched-tokens=16384
- --enable-prefix-caching
- '--default-chat-template-kwargs={"preserve_thinking": true, "enable_thinking": true}'
- '--speculative-config={"num_speculative_tokens": 7, "method": "dflash", "model": "/mnt/models/dflash-fp8"}'
- --moe-backend=tritonلماذا تُستخدم هذه الإعدادات
- الترميز التخميني dFlash: يُولّد نموذج المسودة dFlash سبعة رموز تخمينية لكل خطوة فك ترميز. يتحقق النموذج الأساسي من هذه الرموز في مرور واحد، مما يُقلّل زمن الاستجابة ويحسّن الإنتاجية.
- خلفية Triton لـ MoE: خُصِّصت خلفية
tritonلأحمال عمل خليط الخبراء ويمكنها توفير أداء أكثر استقرارًا تحت الحمل المتزامن. - التخزين المؤقت للبادئات: يُقلّل التخزين المؤقت للبادئات الحسابات المتكررة من خلال إعادة استخدام بادئات المطالبات المشتركة عبر طلبات متعددة.
Mistral Medium 3.5 (FP8)
Mistral Medium 3.5 هو نموذج كثيف يستخدم الترميز التخميني Eagle.
التكوين
args:
- --tensor-parallel-size=8
- --tool-call-parser=mistral
- --enable-auto-tool-choice
- --reasoning-parser=mistral
- --max-num-batched-tokens=32768
- --max-num-seqs=32
- --kv-cache-dtype=fp8
- --max-model-len=234800
- --gpu-memory-utilization=0.92
- '--speculative-config={"model": "/mnt/models/eagle", "num_speculative_tokens": 3, "method": "eagle"}'لماذا تُستخدم هذه الإعدادات
- ضغط ذاكرة التخزين المؤقت KV بـ FP8: يُقلّل إعداد
--kv-cache-dtype=fp8متطلبات ذاكرة التخزين المؤقت KV، مما يُتيح دعم نوافذ السياق الكبيرة دون تعديل أوزان النموذج. - الترميز التخميني Eagle: يتنبأ نموذج المسودة Eagle بثلاثة رموز قبل النموذج الأساسي. يتحقق النموذج الأساسي من الرموز المُولَّدة في مرور واحد، مما يساعد على تقليل الوقت حتى الرمز الأول وزمن استجابة الرد.
- استخدام ذاكرة GPU: يُعظّم هدف استخدام ذاكرة GPU بنسبة 92% الموارد المتاحة للـ GPU مع الحفاظ على تشغيل مستقر لحِمل العمل المُختبَر.
ضبط الأداء
قد تحتاج إلى ضبط المعاملات التالية لتلبية متطلبات الأداء والسعة لديك:
| المعامل | الوصف |
|---|---|
--tensor-parallel-size | يُوسّع الاستدلال عبر عدة وحدات GPU. |
--max-model-len | يتحكم في الحد الأقصى لطول السياق المدعوم. |
--max-num-seqs | يزيد أو يُقلّل سعة الطلبات المتزامنة. |
--max-num-batched-tokens | يتحكم في سلوك الدُّفعات. |
--gpu-memory-utilization | يوازن استخدام الذاكرة والاستقرار. |
--speculative-config | يُحسّن زمن الاستجابة والإنتاجية. |
--enable-prefix-caching | يحسّن الأداء للمطالبات المتكررة. |
--enable-chunked-prefill | يحسّن معالجة المطالبات الكبيرة. |
بعد النشر، راقب زمن الاستجابة والإنتاجية واستخدام GPU واستهلاك الذاكرة، وعدّل قيم التكوين حسب الحاجة لحِمل عملك.