필수 및 지원 모델
지원되는 핵심 추론 모델, 가드레일 모델 및 AI 기반 기능을 활성화하는 데 사용되는 제공자별 안전 기능을 포함하여 Bob 온프레미스에 필요한 모델에 대해 알아봅니다.
Bob 온프레미스는 코드 생성, 설명, 채팅 및 어시스턴트 기능을 제공하기 위해 지원되는 핵심 추론 모델에 대한 액세스가 필요합니다. 배포 요구 사항에 따라 환경 내에서 호스팅되는 에어갭 모델 또는 클라우드 제공자를 통해 액세스하는 프론티어 모델에 Bob을 연결할 수 있습니다. 강화된 안전 및 정책 준수를 위해 IBM은 가드레일 모델을 구성하거나 제공자 기본 가드레일 기능을 사용할 것을 권장합니다.
필수 모델
Bob을 설치하기 전에 다음 모델이 배포되어 있고 액세스 가능한지 확인하세요.
| 모델 역할 | 목적 |
|---|---|
| 핵심 추론 모델 | 코드 생성, 설명, 채팅 요청 및 어시스턴트 상호 작용을 처리합니다. |
| 가드레일 모델 | 안전 및 정책 준수를 위해 입력과 출력을 검사합니다. 가드레일 모델 사용을 적극 권장합니다. |
한 번에 정확히 하나의 핵심 추론 모델만 구성하세요.
모든 배포에 가드레일 모델을 적극 권장합니다. 에어갭 배포의 경우 openai/gpt-oss-20b를 사용하세요. 구성되면 Bob은 가드레일 서비스를 통해 안전 및 정책 평가 요청을 자동으로 라우팅합니다.
지원되는 모델
다음 핵심 추론 모델을 IBM Bob 온프레미스와 함께 사용할 수 있습니다. Model Gateway에서 단일 핵심 추론 모델을 구성하세요. 여러 핵심 추론 모델을 동시에 실행하는 것은 지원되지 않습니다.
에어갭 모델
리소스 요구 사항(CPU, RAM, GPU/VRAM 및 동시성 사이징)은 모델 양자화, 컨텍스트 길이, 서빙 런타임(예: vLLM 또는 TGI) 및 목표 처리량에 따라 달라집니다. 하드웨어 사양 및 배포 가이드는 제품 설명서를 참조하세요.
| 모델 | 참조 |
|---|---|
| Mistral 3.5 | Mistral AI 설명서 |
| Nvidia Nemotron 3 | NVIDIA NeMo / Nemotron 설명서 |
| Poolside Laguna S2.1 | Poolside AI 설명서 |
프론티어 모델
프론티어 클라우드 모델은 제공자 관리 API(예: AWS Bedrock, Google Cloud Vertex AI 또는 Azure OpenAI)를 통해 액세스합니다. 서비스 가용성, 할당량, 속도 제한 및 엔드포인트 구성은 제품 설명서를 참조하세요.
| 모델 | 참조 |
|---|---|
| Claude Sonnet 5 | Anthropic Claude 설명서 / AWS Bedrock |
| Claude Opus 4.8 | Anthropic Claude 설명서 / AWS Bedrock |
| Google Gemini 3.7 Flash | Google Cloud Vertex AI 설명서 |
| OpenAI GPT5.6 Sol | Azure OpenAI Service 설명서 |
제공자 가드레일
모든 입력 및 출력에 걸쳐 안전, 유해성 필터링 및 정책 검사를 위해 가드레일 모델을 사용하는 것을 적극 권장합니다. 배포 세부 정보 및 하드웨어 지침은 모델 저장소 및 서빙 런타임 설명서를 참조하세요.
| 모델 | 참조 | 설명 |
|---|---|---|
openai/gpt-oss-20b | Hugging Face Model Hub / OpenAI 설명서 | 안전 및 정책 검사에 필수 |
에어갭 모델의 경우 openai/gpt-oss-20b를 사용하여 가드레일을 구현합니다. 이 가드레일 모델이 구성되면 IDE 및 Bob Shell 클라이언트가 콘텐츠 필터링을 위해 이를 사용하도록 자동으로 구성됩니다.
프론티어 모델 가드레일
프론티어 모델을 사용할 때는 openai/gpt-oss-20b 가드레일 모델 대신 제공자의 가드레일 기능을 사용할 수 있습니다.
AWS Bedrock 가드레일
Bedrock 가드레일을 생성하고 해당 guardrailId 및 버전을 가져옵니다. 지침은 Bedrock 가드레일 설명서 및 CreateGuardrail API 참조를 확인하세요. Bedrock 모델의 chat_inference_params 아래에 가드레일 구성을 추가합니다:
- model_name: bedrock-model
bedrock:
model: <bedrock-model-id>
access_key_id: env.AWS_ACCESS_KEY
region: us-east-1
secret_access_key: env.AWS_SECRET_ACCESS_KEY
model_info:
exposed: true
max_input_tokens: 270000
chat_inference_params:
guardrailConfig:
guardrailIdentifier: <guardrail-id>
guardrailVersion: <version-number-or-DRAFT>Google Vertex AI
chat_inference_params에서 Vertex AI 안전 필터를 구성합니다. Vertex AI 안전 필터 설명서를 참조하세요.
| 지원되는 카테고리 | 지원되는 임계값 |
|---|---|
HARM_CATEGORY_SEXUALLY_EXPLICIT, HARM_CATEGORY_HATE_SPEECH, HARM_CATEGORY_HARASSMENT, HARM_CATEGORY_DANGEROUS_CONTENT | BLOCK_NONE, BLOCK_ONLY_HIGH, BLOCK_MEDIUM_AND_ABOVE (기본값), BLOCK_LOW_AND_ABOVE (가장 엄격) |
- model_name: gemini-model
vertex:
model: gemini-model
project: <project-id>
location: global
credentials: env.BOB_GEMINI_CREDENTIALS
model_info:
max_tokens: 20000
max_input_tokens: 270000
exposed: false
chat_inference_params:
safetySettings:
- category: HARM_CATEGORY_HATE_SPEECH
threshold: BLOCK_MEDIUM_AND_ABOVE
- category: HARM_CATEGORY_HARASSMENT
threshold: BLOCK_ONLY_HIGH
- category: HARM_CATEGORY_SEXUALLY_EXPLICIT
threshold: BLOCK_LOW_AND_ABOVE
- category: HARM_CATEGORY_DANGEROUS_CONTENT
threshold: BLOCK_LOW_AND_ABOVEAzure OpenAI
Azure에서 콘텐츠 필터를 생성하고 이를 모델 배포에 할당합니다. Model Gateway 구성 변경은 필요하지 않습니다. Azure OpenAI 콘텐츠 필터 설명서를 참조하세요. 요청 시 정책을 적용하려면 x-policy-id 헤더를 구성하세요:
- model_name: gpt-model
openai_compatible:
model: openai/gpt-model
base_url: https://<endpoint>.azure.com/openai
api_key: env.AZURE_API_KEY
extra_headers:
x-policy-id: <custom-content-filter-name>
model_info:
max_tokens: 12000
max_input_tokens: 200000
exposed: true모델 서빙 인프라
Bob은 AI 기반 작업을 수행하기 위해 하나 이상의 모델 추론 엔드포인트에 액세스해야 합니다. Bob은 Model Inference Gateway를 통해 배포된 모델에 연결하지만, 모델 서빙 인프라를 프로비저닝, 호스팅 또는 관리하지 않습니다.
대부분의 온프레미스 환경에는 이미 run.ai를 실행하는 공유 GPU 클러스터, Red Hat OpenShift AI, 전용 vLLM 서빙 팜 또는 퍼블릭 클라우드 제공자의 모델 API(AWS Bedrock, Azure OpenAI, Google Vertex AI)에 대한 액세스 등 사용 가능한 모델 서빙 인프라가 있습니다. Bob은 OpenAI 호환 API를 노출하는 OpenShift 클러스터에서 네트워크로 연결 가능한 엔드포인트를 필요로 합니다.
지원되는 모델 배포에 대한 자세한 내용은 모델 서빙 인프라를 참조하세요.