Gerekli ve desteklenen modeller

Desteklenen temel çıkarım modelleri, koruluk modelleri ve yapay zeka destekli yetenekleri etkinleştirmek için kullanılan sağlayıcıya özgü güvenlik özellikleri dahil olmak üzere Bob on-premises için gereken modeller hakkında bilgi edinin.

Bob on-premises; kod oluşturma, açıklamalar, sohbet ve asistan yetenekleri sağlamak için desteklenen bir temel çıkarım (core inference) modeline erişim gerektirir. Dağıtım gereksinimlerinize bağlı olarak Bob'u ortamınızda barındırılan air-gapped modellere veya bulut sağlayıcıları aracılığıyla erişilen öncü (frontier) modellere bağlayabilirsiniz. Gelişmiş güvenlik ve politika uyumluluğu için IBM, bir koruluk (guardrail) modeli yapılandırmanızı veya sağlayıcıya özgü yerel koruluk yeteneklerini kullanmanızı önerir.

Gerekli modeller

Bob'u kurmadan önce aşağıdaki modellerin dağıtıldığından ve erişilebilir olduğundan emin olun.

Model rolüAmaç
Temel çıkarım modeliKod oluşturma, açıklamalar, sohbet istekleri ve asistan etkileşimlerini işler.
Koruluk (guardrail) modeliGüvenlik ve politika uyumluluğu için girdileri ve çıktıları denetler. Bir koruluk modeli kullanılması önemle tavsiye edilir.
Önemli:

Aynı anda tam olarak bir temel çıkarım modeli yapılandırın.

Not:

Tüm dağıtımlar için bir koruluk modeli şiddetle tavsiye edilir. Air-gapped dağıtımlar için openai/gpt-oss-20b kullanın. Yapılandırıldığında Bob, güvenlik ve politika değerlendirme isteklerini otomatik olarak koruluk servisi üzerinden yönlendirir.

Desteklenen modeller

Aşağıdaki temel çıkarım modelleri IBM Bob on-premises ile kullanılabilir. Model Gateway'de tek bir temel çıkarım modeli yapılandırın. Aynı anda birden fazla temel çıkarım modelinin çalıştırılması desteklenmez.

Air-gapped modeller

Kaynak gereksinimleri (CPU, RAM, GPU/VRAM ve eşzamanlılık boyutlandırması) model kuantizasyonuna, bağlam uzunluğuna (context length), sunum çalışma zamanına (vLLM veya TGI gibi) ve hedeflenen işleme kapasitesine (throughput) bağlıdır. Donanım özellikleri ve dağıtım kılavuzları için ürün belgelerine bakın.

ModelReferans
Mistral 3.5Mistral AI belgeleri
Nvidia Nemotron 3NVIDIA NeMo / Nemotron belgeleri
Poolside Laguna S2.1Poolside AI belgeleri

Öncü (frontier) modeller

Öncü bulut modellerine sağlayıcı tarafından yönetilen API'ler (AWS Bedrock, Google Cloud Vertex AI veya Azure OpenAI gibi) aracılığıyla erişilir. Hizmet kullanılabilirliği, kotalar, hız sınırları (rate limits) ve endpoint yapılandırması için ürün belgelerine bakın.

Sağlayıcı korulukları

Tüm girdi ve çıktılarda güvenlik, toksisite filtreleme ve politika denetimi için bir koruluk modeli kullanılması önemle tavsiye edilir. Dağıtım ayrıntıları ve donanım yönergeleri için model deposuna ve sunum çalışma zamanı belgelerine bakın.

ModelReferansAçıklama
openai/gpt-oss-20bHugging Face Model Hub / OpenAI belgeleriGüvenlik ve politika denetimi için gereklidir

Air-gapped modeller için korulukları uygulamak üzere openai/gpt-oss-20b kullanın. Bu koruluk modeli yapılandırıldıktan sonra, IDE ve Bob Shell istemcileri içerik filtreleme için bunu kullanacak şekilde otomatik olarak yapılandırılır.

Öncü model korulukları

Öncü modelleri kullanırken, openai/gpt-oss-20b koruluk modeli yerine sağlayıcının koruluk yeteneğini kullanabilirsiniz.

AWS Bedrock korulukları

Bir Bedrock koruluğu oluşturun ve guardrailId ile sürümünü alın. Rehberlik için Bedrock korulukları belgelerine ve CreateGuardrail API referansına bakın. Bedrock modeli için chat_inference_params altına koruluk yapılandırmasını ekleyin:

- model_name: bedrock-model
  bedrock:
    model: <bedrock-model-id>
    access_key_id: env.AWS_ACCESS_KEY
    region: us-east-1
    secret_access_key: env.AWS_SECRET_ACCESS_KEY
  model_info:
    exposed: true
    max_input_tokens: 270000
  chat_inference_params:
    guardrailConfig:
      guardrailIdentifier: <guardrail-id>
      guardrailVersion: <version-number-or-DRAFT>

Google Vertex AI

chat_inference_params içinde Vertex AI güvenlik filtrelerini yapılandırın. Bkz. Vertex AI güvenlik filtresi belgeleri.

Desteklenen kategorilerDesteklenen eşikler
HARM_CATEGORY_SEXUALLY_EXPLICIT, HARM_CATEGORY_HATE_SPEECH, HARM_CATEGORY_HARASSMENT, HARM_CATEGORY_DANGEROUS_CONTENTBLOCK_NONE, BLOCK_ONLY_HIGH, BLOCK_MEDIUM_AND_ABOVE (varsayılan), BLOCK_LOW_AND_ABOVE (en katı)
- model_name: gemini-model
  vertex:
    model: gemini-model
    project: <project-id>
    location: global
    credentials: env.BOB_GEMINI_CREDENTIALS
  model_info:
    max_tokens: 20000
    max_input_tokens: 270000
    exposed: false
  chat_inference_params:
    safetySettings:
      - category: HARM_CATEGORY_HATE_SPEECH
        threshold: BLOCK_MEDIUM_AND_ABOVE
      - category: HARM_CATEGORY_HARASSMENT
        threshold: BLOCK_ONLY_HIGH
      - category: HARM_CATEGORY_SEXUALLY_EXPLICIT
        threshold: BLOCK_LOW_AND_ABOVE
      - category: HARM_CATEGORY_DANGEROUS_CONTENT
        threshold: BLOCK_LOW_AND_ABOVE

Azure OpenAI

Azure'da bir içerik filtresi oluşturun ve bunu model dağıtımına atayın; model gateway yapılandırmasında herhangi bir değişiklik gerekmez. Bkz. Azure OpenAI içerik filtresi belgeleri. İlkeyi istek zamanında uygulamak için x-policy-id başlığını yapılandırın:

- model_name: gpt-model
  openai_compatible:
    model: openai/gpt-model
    base_url: https://<endpoint>.azure.com/openai
    api_key: env.AZURE_API_KEY
    extra_headers:
      x-policy-id: <custom-content-filter-name>
  model_info:
    max_tokens: 12000
    max_input_tokens: 200000
    exposed: true

Model sunum altyapısı

Bob, yapay zeka destekli görevleri gerçekleştirmek için bir veya daha fazla model çıkarım endpoint'ine erişim gerektirir. Bob, dağıtılan modellere Model Inference Gateway aracılığıyla bağlanır ancak model sunum altyapısını sağlamaz, barındırmaz veya yönetmez.

Çoğu on-premises ortamda; run.ai veya Red Hat OpenShift AI çalıştıran paylaşılan bir GPU kümesi, özel bir vLLM sunum çiftliği veya bir genel bulut sağlayıcısının model API'sine (AWS Bedrock, Azure OpenAI, Google Vertex AI) erişim gibi model sunum altyapısı zaten mevcuttur. Bob, OpenShift kümesinden ağ üzerinden erişilebilen ve OpenAI uyumlu bir API sunan bir endpoint gerektirir.

Desteklenen bir modelin dağıtılması hakkında daha fazla bilgi için bkz. Model sunum altyapısı.

Bu konu nasıl?