必要和受支援的模型
了解 Bob 本地部署所需的模型,包括受支援的核心推論模型、防護欄模型,以及用於啟用 AI 功能的供應商特定安全功能。
Bob 本地部署需要存取受支援的核心推論模型,以提供程式碼生成、說明、聊天和助理功能。根據你的部署需求,你可以將 Bob 連線至環境內託管的氣隙模型,或透過雲端供應商存取的前沿模型。為了增強安全性和原則合規性,IBM 建議設定防護欄模型或使用供應商原生的防護欄功能。
必要模型
在安裝 Bob 之前,請確保以下模型已部署且可存取。
| 模型角色 | 用途 |
|---|---|
| 核心推論模型 | 處理程式碼生成、說明、聊天請求和助理互動。 |
| 防護欄模型 | 篩查輸入和輸出以確保安全性和原則合規性。強烈建議使用防護欄模型。 |
一次只能設定一個核心推論模型。
強烈建議所有部署都使用防護欄模型。對於氣隙部署,請使用 openai/gpt-oss-20b。設定後,Bob 會自動將安全性和原則評估請求路由到防護欄服務。
受支援的模型
以下核心推論模型可與 IBM Bob 本地部署搭配使用。在模型閘道中設定單一核心推論模型。不支援同時執行多個核心推論模型。
氣隙模型
資源需求(CPU、RAM、GPU/VRAM 和並行大小)取決於模型量化、上下文長度、服務執行時(例如 vLLM 或 TGI)和目標吞吐量。請參閱產品文件以了解硬體規格和部署指南。
| 模型 | 參考資料 |
|---|---|
| Mistral 3.5 | Mistral AI 文件 |
| Nvidia Nemotron 3 | NVIDIA NeMo / Nemotron 文件 |
| Poolside Laguna S2.1 | Poolside AI 文件 |
前沿模型
前沿雲端模型透過供應商管理的 API 存取(例如 AWS Bedrock、Google Cloud Vertex AI 或 Azure OpenAI)。請參閱產品文件以了解服務可用性、配額、速率限制和端點設定。
| 模型 | 參考資料 |
|---|---|
| Claude Sonnet 5 | Anthropic Claude 文件 / AWS Bedrock |
| Claude Opus 4.8 | Anthropic Claude 文件 / AWS Bedrock |
| Google Gemini 3.7 Flash | Google Cloud Vertex AI 文件 |
| OpenAI GPT5.6 Sol | Azure OpenAI Service 文件 |
供應商防護欄
強烈建議對所有輸入和輸出使用防護欄模型,以進行安全性、毒性過濾和原則篩查。請參閱模型儲存庫和服務執行時文件,以了解部署詳情和硬體指南。
| 模型 | 參考資料 | 描述 |
|---|---|---|
openai/gpt-oss-20b | Hugging Face Model Hub / OpenAI 文件 | 安全性和原則篩查所需 |
對於氣隙模型,請使用 openai/gpt-oss-20b 實作防護欄。設定此防護欄模型後,IDE 和 Bob Shell 用戶端會自動設定為使用它進行內容過濾。
前沿模型防護欄
使用前沿模型時,你可以使用供應商的防護欄功能,而不必使用 openai/gpt-oss-20b 防護欄模型。
AWS Bedrock 防護欄
建立 Bedrock 防護欄並取得其 guardrailId 和版本。如需指引,請參閱 Bedrock 防護欄文件和 CreateGuardrail API 參考。在 Bedrock 模型的 chat_inference_params 下新增防護欄設定:
- model_name: bedrock-model
bedrock:
model: <bedrock-model-id>
access_key_id: env.AWS_ACCESS_KEY
region: us-east-1
secret_access_key: env.AWS_SECRET_ACCESS_KEY
model_info:
exposed: true
max_input_tokens: 270000
chat_inference_params:
guardrailConfig:
guardrailIdentifier: <guardrail-id>
guardrailVersion: <version-number-or-DRAFT>Google Vertex AI
在 chat_inference_params 中設定 Vertex AI 安全性過濾器。請參閱 Vertex AI 安全性過濾器文件。
| 受支援的類別 | 受支援的閾值 |
|---|---|
HARM_CATEGORY_SEXUALLY_EXPLICIT、HARM_CATEGORY_HATE_SPEECH、HARM_CATEGORY_HARASSMENT、HARM_CATEGORY_DANGEROUS_CONTENT | BLOCK_NONE、BLOCK_ONLY_HIGH、BLOCK_MEDIUM_AND_ABOVE(預設)、BLOCK_LOW_AND_ABOVE(最嚴格) |
- model_name: gemini-model
vertex:
model: gemini-model
project: <project-id>
location: global
credentials: env.BOB_GEMINI_CREDENTIALS
model_info:
max_tokens: 20000
max_input_tokens: 270000
exposed: false
chat_inference_params:
safetySettings:
- category: HARM_CATEGORY_HATE_SPEECH
threshold: BLOCK_MEDIUM_AND_ABOVE
- category: HARM_CATEGORY_HARASSMENT
threshold: BLOCK_ONLY_HIGH
- category: HARM_CATEGORY_SEXUALLY_EXPLICIT
threshold: BLOCK_LOW_AND_ABOVE
- category: HARM_CATEGORY_DANGEROUS_CONTENT
threshold: BLOCK_LOW_AND_ABOVEAzure OpenAI
在 Azure 中,建立內容過濾器並將其指派給模型部署;不需要變更模型閘道設定。請參閱 Azure OpenAI 內容過濾器文件。若要在請求時套用原則,請設定 x-policy-id 標頭:
- model_name: gpt-model
openai_compatible:
model: openai/gpt-model
base_url: https://<endpoint>.azure.com/openai
api_key: env.AZURE_API_KEY
extra_headers:
x-policy-id: <custom-content-filter-name>
model_info:
max_tokens: 12000
max_input_tokens: 200000
exposed: true模型服務基礎架構
Bob 需要存取一個或多個模型推論端點才能執行 AI 功能。Bob 透過模型推論閘道連線至已部署的模型,但不負責佈建、託管或管理模型服務基礎架構。
大多數本地環境已有可用的模型服務基礎架構,無論是執行 run.ai、Red Hat OpenShift AI 的共享 GPU 叢集、專用的 vLLM 服務伺服器群,還是公用雲端供應商模型 API 的存取(AWS Bedrock、Azure OpenAI、Google Vertex AI)。Bob 需要 OpenShift 叢集中可透過網路存取的端點,該端點需公開 OpenAI 相容的 API。
如需部署受支援模型的詳細資訊,請參閱模型服務基礎架構。