Model yang diperlukan dan didukung

Pelajari tentang model yang diperlukan oleh Bob on-premises, termasuk model inferensi inti yang didukung, model guardrail, dan fitur keamanan khusus penyedia yang digunakan untuk mengaktifkan kapabilitas bertenaga AI.

Bob on-premises memerlukan akses ke model inferensi inti yang didukung untuk menyediakan fungsionalitas pembuatan kode, penjelasan, obrolan (chat), dan interaksi asisten. Bergantung pada persyaratan deploymentmu, kamu dapat menghubungkan Bob ke model air-gapped yang di-host di lingkunganmu atau model frontier yang diakses melalui penyedia cloud. Untuk meningkatkan keamanan dan kepatuhan kebijakan, IBM merekomendasikan untuk mengonfigurasi model guardrail atau menggunakan kapabilitas guardrail bawaan penyedia.

Model yang diperlukan

Sebelum menginstal Bob, pastikan model berikut telah di-deploy dan dapat diakses.

Peran modelTujuan
Model inferensi intiMemproses pembuatan kode, penjelasan, permintaan chat, dan interaksi asisten.
Model guardrailMemeriksa input dan output untuk kepatuhan keamanan dan kebijakan. Menggunakan model guardrail sangat direkomendasikan.
Penting:

Konfigurasikan tepat satu model inferensi inti pada satu waktu.

Catatan:

Model guardrail sangat direkomendasikan untuk semua deployment. Untuk deployment air-gapped, gunakan openai/gpt-oss-20b. Saat dikonfigurasi, Bob secara otomatis merutekan permintaan evaluasi keamanan dan kebijakan melalui layanan guardrail.

Model yang didukung

Model inferensi inti berikut tersedia untuk digunakan dengan IBM Bob on-premises. Konfigurasikan satu model inferensi inti di Model Gateway. Menjalankan beberapa model inferensi inti secara bersamaan tidak didukung.

Model air-gapped

Persyaratan sumber daya (CPU, RAM, GPU/VRAM, dan penyesuaian konkurensi) bergantung pada kuantisasi model, panjang konteks, runtime serving (seperti vLLM atau TGI), dan throughput target. Lihat dokumentasi produk untuk spesifikasi perangkat keras dan panduan deployment.

ModelReferensi
Mistral 3.5Dokumentasi Mistral AI
Nvidia Nemotron 3Dokumentasi NVIDIA NeMo / Nemotron
Poolside Laguna S2.1Dokumentasi Poolside AI

Model frontier

Model cloud frontier diakses melalui API yang dikelola penyedia (seperti AWS Bedrock, Google Cloud Vertex AI, atau Azure OpenAI). Lihat dokumentasi produk untuk ketersediaan layanan, kuota, batas laju (rate limit), dan konfigurasi endpoint.

Guardrail penyedia

Menggunakan model guardrail sangat direkomendasikan untuk keamanan, pemfilteran toksisitas, dan penyaringan kebijakan di semua input dan output. Lihat repositori model dan dokumentasi runtime serving untuk detail deployment dan panduan perangkat keras.

ModelReferensiDeskripsi
openai/gpt-oss-20bHugging Face Model Hub / Dokumentasi OpenAIDiperlukan untuk penyaringan keamanan dan kebijakan

Untuk model air-gapped, gunakan openai/gpt-oss-20b untuk menerapkan guardrail. Setelah model guardrail ini dikonfigurasi, klien IDE dan Bob Shell secara otomatis dikonfigurasi untuk menggunakannya dalam pemfilteran konten.

Guardrail model frontier

Saat menggunakan model frontier, kamu dapat menggunakan kapabilitas guardrail penyedia alih-alih model guardrail openai/gpt-oss-20b.

Guardrail AWS Bedrock

Buat Bedrock guardrail dan dapatkan guardrailId beserta versinya. Untuk panduan, lihat dokumentasi Bedrock guardrails dan referensi API CreateGuardrail. Tambahkan konfigurasi guardrail di bawah chat_inference_params untuk model Bedrock:

- model_name: bedrock-model
  bedrock:
    model: <bedrock-model-id>
    access_key_id: env.AWS_ACCESS_KEY
    region: us-east-1
    secret_access_key: env.AWS_SECRET_ACCESS_KEY
  model_info:
    exposed: true
    max_input_tokens: 270000
  chat_inference_params:
    guardrailConfig:
      guardrailIdentifier: <guardrail-id>
      guardrailVersion: <version-number-or-DRAFT>

Google Vertex AI

Konfigurasikan filter keamanan Vertex AI di chat_inference_params. Lihat dokumentasi filter keamanan Vertex AI.

Kategori yang didukungAmbang batas (threshold) yang didukung
HARM_CATEGORY_SEXUALLY_EXPLICIT, HARM_CATEGORY_HATE_SPEECH, HARM_CATEGORY_HARASSMENT, HARM_CATEGORY_DANGEROUS_CONTENTBLOCK_NONE, BLOCK_ONLY_HIGH, BLOCK_MEDIUM_AND_ABOVE (default), BLOCK_LOW_AND_ABOVE (paling ketat)
- model_name: gemini-model
  vertex:
    model: gemini-model
    project: <project-id>
    location: global
    credentials: env.BOB_GEMINI_CREDENTIALS
  model_info:
    max_tokens: 20000
    max_input_tokens: 270000
    exposed: false
  chat_inference_params:
    safetySettings:
      - category: HARM_CATEGORY_HATE_SPEECH
        threshold: BLOCK_MEDIUM_AND_ABOVE
      - category: HARM_CATEGORY_HARASSMENT
        threshold: BLOCK_ONLY_HIGH
      - category: HARM_CATEGORY_SEXUALLY_EXPLICIT
        threshold: BLOCK_LOW_AND_ABOVE
      - category: HARM_CATEGORY_DANGEROUS_CONTENT
        threshold: BLOCK_LOW_AND_ABOVE

Azure OpenAI

Di Azure, buat content filter dan tetapkan ke deployment model; tidak ada perubahan konfigurasi model gateway yang diperlukan. Lihat dokumentasi content filter Azure OpenAI. Untuk menerapkan kebijakan pada saat permintaan (request time), konfigurasikan header x-policy-id:

- model_name: gpt-model
  openai_compatible:
    model: openai/gpt-model
    base_url: https://<endpoint>.azure.com/openai
    api_key: env.AZURE_API_KEY
    extra_headers:
      x-policy-id: <custom-content-filter-name>
  model_info:
    max_tokens: 12000
    max_input_tokens: 200000
    exposed: true

Infrastruktur model serving

Bob memerlukan akses ke satu atau lebih endpoint inferensi model untuk melakukan tugas-tugas bertenaga AI. Bob terhubung ke model yang di-deploy melalui Model Inference Gateway tetapi tidak menyediakan, meng-host, atau mengelola infrastruktur model serving.

Sebagian besar lingkungan on-premises telah memiliki infrastruktur model serving yang tersedia, baik itu cluster GPU bersama yang menjalankan run.ai, Red Hat OpenShift AI, farm serving vLLM khusus, atau akses ke API model penyedia cloud publik (AWS Bedrock, Azure OpenAI, Google Vertex AI). Bob memerlukan endpoint yang dapat dijangkau jaringan dari cluster OpenShift yang mengekspos API yang kompatibel dengan OpenAI.

Untuk informasi lebih lanjut tentang men-deploy model yang didukung, lihat Infrastruktur model serving.

Bagaimana topik ini?