必須およびサポートされているモデル

サポートされているコア推論モデル、ガードレールモデル、AI 機能を有効にするために使用されるプロバイダー固有の安全機能を含む、Bob オンプレミスが必要とするモデルについて説明します。

Bob オンプレミスは、コード生成、説明、チャット、アシスタント機能を提供するために、サポートされているコア推論モデルへのアクセスが必要です。デプロイメント要件に応じて、環境内でホストされているエアギャップモデルや、クラウドプロバイダーを通じてアクセスされるフロンティアモデルに Bob を接続できます。安全性とポリシーコンプライアンスを強化するために、IBM はガードレールモデルの設定またはプロバイダーネイティブのガードレール機能の使用を推奨しています。

必須モデル

Bob をインストールする前に、以下のモデルがデプロイされアクセス可能であることを確認してください。

モデルの役割目的
コア推論モデルコード生成、説明、チャットリクエスト、アシスタントインタラクションを処理します。
ガードレールモデル安全性とポリシーコンプライアンスのために入力と出力をスクリーニングします。ガードレールモデルの使用を強く推奨します。
重要:

コア推論モデルは一度に 1 つだけ設定してください。

注意:

ガードレールモデルはすべてのデプロイメントで強く推奨されます。エアギャップデプロイメントの場合は openai/gpt-oss-20b を使用してください。設定すると、Bob は安全性とポリシー評価リクエストをガードレールサービスを通じて自動的にルーティングします。

サポートされているモデル

以下のコア推論モデルは IBM Bob オンプレミスで使用できます。モデルゲートウェイで 1 つのコア推論モデルを設定してください。複数のコア推論モデルを同時に実行することはサポートされていません。

エアギャップモデル

リソース要件 (CPU、RAM、GPU/VRAM、同時実行サイジング) はモデルの量子化、コンテキスト長、サービングランタイム (vLLM や TGI など)、目標スループットによって異なります。ハードウェア仕様とデプロイメントガイドについては製品ドキュメントを参照してください。

モデルリファレンス
Mistral 3.5Mistral AI ドキュメント
Nvidia Nemotron 3NVIDIA NeMo / Nemotron ドキュメント
Poolside Laguna S2.1Poolside AI ドキュメント

フロンティアモデル

フロンティアクラウドモデルはプロバイダー管理 API (AWS Bedrock、Google Cloud Vertex AI、Azure OpenAI など) を通じてアクセスされます。サービスの可用性、クォータ、レート制限、エンドポイント設定については製品ドキュメントを参照してください。

プロバイダーガードレール

ガードレールモデルの使用は、すべての入力と出力にわたる安全性、毒性フィルタリング、ポリシースクリーニングに強く推奨されます。デプロイメントの詳細とハードウェアガイドラインについては、モデルリポジトリとサービングランタイムのドキュメントを参照してください。

モデルリファレンス説明
openai/gpt-oss-20bHugging Face Model Hub / OpenAI ドキュメント安全性とポリシースクリーニングに必要

エアギャップモデルの場合は、openai/gpt-oss-20b を使用してガードレールを実装します。このガードレールモデルが設定されると、IDE と Bob Shell クライアントはコンテンツフィルタリングに自動的に設定されます。

フロンティアモデルガードレール

フロンティアモデルを使用する場合は、openai/gpt-oss-20b ガードレールモデルの代わりにプロバイダーのガードレール機能を使用できます。

AWS Bedrock ガードレール

Bedrock ガードレールを作成して guardrailId とバージョンを取得します。ガイダンスについては Bedrock ガードレールドキュメントと CreateGuardrail API リファレンスを参照してください。Bedrock モデルの chat_inference_params 以下にガードレール設定を追加します。

- model_name: bedrock-model
  bedrock:
    model: <bedrock-model-id>
    access_key_id: env.AWS_ACCESS_KEY
    region: us-east-1
    secret_access_key: env.AWS_SECRET_ACCESS_KEY
  model_info:
    exposed: true
    max_input_tokens: 270000
  chat_inference_params:
    guardrailConfig:
      guardrailIdentifier: <guardrail-id>
      guardrailVersion: <version-number-or-DRAFT>

Google Vertex AI

chat_inference_params で Vertex AI 安全フィルターを設定します。Vertex AI 安全フィルタードキュメントを参照してください。

サポートされているカテゴリサポートされているしきい値
HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENTBLOCK_NONE、BLOCK_ONLY_HIGH、BLOCK_MEDIUM_AND_ABOVE (デフォルト)、BLOCK_LOW_AND_ABOVE (最も厳格)
- model_name: gemini-model
  vertex:
    model: gemini-model
    project: <project-id>
    location: global
    credentials: env.BOB_GEMINI_CREDENTIALS
  model_info:
    max_tokens: 20000
    max_input_tokens: 270000
    exposed: false
  chat_inference_params:
    safetySettings:
      - category: HARM_CATEGORY_HATE_SPEECH
        threshold: BLOCK_MEDIUM_AND_ABOVE
      - category: HARM_CATEGORY_HARASSMENT
        threshold: BLOCK_ONLY_HIGH
      - category: HARM_CATEGORY_SEXUALLY_EXPLICIT
        threshold: BLOCK_LOW_AND_ABOVE
      - category: HARM_CATEGORY_DANGEROUS_CONTENT
        threshold: BLOCK_LOW_AND_ABOVE

Azure OpenAI

Azure では、コンテンツフィルターを作成してモデルデプロイメントに割り当てます — モデルゲートウェイの設定変更は不要です。Azure OpenAI コンテンツフィルタードキュメントを参照してください。代わりにリクエスト時にポリシーを適用するには、x-policy-id ヘッダーを設定します。

- model_name: gpt-model
  openai_compatible:
    model: openai/gpt-model
    base_url: https://<endpoint>.azure.com/openai
    api_key: env.AZURE_API_KEY
    extra_headers:
      x-policy-id: <custom-content-filter-name>
  model_info:
    max_tokens: 12000
    max_input_tokens: 200000
    exposed: true

モデルサービングインフラ

Bob は AI 機能を実行するために 1 つ以上のモデル推論エンドポイントへのアクセスが必要です。Bob はモデル推論ゲートウェイを通じてデプロイされたモデルに接続しますが、モデルサービングインフラのプロビジョニング、ホスティング、管理は行いません。

ほとんどのオンプレミス環境には、run.ai や Red Hat OpenShift AI を実行する共有 GPU クラスター、専用の vLLM サービングファーム、またはパブリッククラウドプロバイダーのモデル API (AWS Bedrock、Azure OpenAI、Google Vertex AI) へのアクセスなど、すでにモデルサービングインフラが利用可能です。Bob は OpenShift クラスターから OpenAI 互換 API を公開するネットワーク到達可能なエンドポイントを必要とします。

サポートされているモデルのデプロイについては、モデルサービングインフラを参照してください。

このトピックはいかがですか?