KapsuleHost GPU 서버는 AI 교육, 추론 및 기타 대규모 병렬 작업을 위해 구축된 NVIDIA 그래픽 프로세서와 이를 운영하는 데 필요한 CPU, 메모리 및 고속 스토리지가 장착된 단일 테넌트 물리 머신입니다.
전체 머신을 얻습니다. 다른 사람의 작업이 GPU, 메모리 대역폭 또는 디스크를 공유하지 않으므로, 이는 재현 가능한 벤치마크와 그렇지 않은 벤치마크의 차이입니다. 이 가이드는 네 가지 계층, 각 계층에 적합한 사용 사례, GPU 공급이 실제로 부족한 상황에서 주문이 어떻게 작동하는지, 그리고 설정 수수료가 무엇인지를 다룹니다.
네 가지 계층
| 계층 | GPU | GPU 메모리 | 시스템 메모리 | 월간 요금 | 일회 설정 |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | 빌드에 포함 | US$330.00 | 예 |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | 예 |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | 예 |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | 예 |
가격은 청구 통화로 GST를 제외한 금액입니다. 각 계층은 비관리형 또는 관리형으로 제공되며, 클라우드 서버와 동일한 선택입니다.
Spark에서 Forge로의 점프가 중요한 부분입니다. Spark는 개발, 더 작은 모델 및 추론 작업을 위한 진입점입니다. Forge, Foundry 및 Reactor는 동일한 96 GB의 GPU 메모리를 공유하고 시스템 메모리가 다르며, 이는 모델과 함께 호스트 RAM에 얼마나 많은 데이터를 보관할 수 있는지를 결정합니다. 데이터 세트 스테이징, 전처리 파이프라인 및 많은 수의 동시 요청 처리가 포함됩니다.
실행할 수 있는 것
머신에 대한 완전한 제어 권한을 얻으므로 자신의 스택을 실행합니다. 여기에는 PyTorch, TensorFlow, JAX, 원본 CUDA 워크로드 및 이들 위에 있는 일반적인 교육 및 제공 프레임워크가 포함됩니다.
일반적인 사용 사례:
- 머신러닝 및 딥러닝을 위한 모델 교육 및 미세 조정.
- 프로덕션에서 GPU가 허용 불가능한 응답 시간을 허용 가능한 응답 시간으로 바꾸는 추론 및 제공.
- 배치 AI 워크로드: 임베딩, 전사, 이미지 및 비디오 생성, 렌더링.
- GPU 가속의 이점을 얻는 과학 및 병렬 컴퓨팅.
GPU 메모리를 먼저 크기 조정합니다. 가장 흔한 실수는 가격으로 계층을 선택한 후 모델이 VRAM에 맞지 않는다는 것을 발견하는 것입니다. 의도한 정밀도 및 배치 크기에서 모델에 필요한 메모리를 계산하고, 여유를 추가하고, 이를 통과하는 계층을 선택합니다. 시스템 메모리와 CPU는 로드되지 않는 모델보다 훨씬 쉽게 해결할 수 있습니다.
가용성 및 주문 방식
GPU 하드웨어는 전체 산업에서 높은 수요가 있으며 공급이 제한되어 있습니다. 이는 KapsuleHost 정책이 아니라 시장에 대한 사실이며, 이는 이러한 것들이 어떻게 주문되는지를 형성합니다.
- 물리 머신이므로 몇 초 만에 프로비저닝되지 않고 주문에 맞게 프로비저닝됩니다.
- 가용성은 계층 및 위치에 따라 다르며, 계획 페이지를 볼 때 실시간으로 확인됩니다.
- Spark는 현재 공급이 제한되어 있습니다. 재고가 없을 때, 패널은 잘못된 주문 대신 예약 대기열을 제공합니다.
더 큰 또는 사용자 지정 구성의 경우, 프로비저닝하기 전에 정확한 빌드와 정확한 가격을 확인하므로 항상 무엇을 얻을지 알 수 있습니다. 우리는 제공할 수 없는 구성을 견적하지 않습니다.
예약 대기열
GPU 계층이 품절되면, 가는 대신 예약할 수 있습니다:
- 계획 페이지에서 계층을 예약합니다. 예약 참조 번호를 얻습니다.
- 아무것도 청구되지 않습니다. 예약은 무료이며 구독이 시작되지 않습니다.
- 용량이 나타나면, 우리는 자동으로 머신을 프로비저닝합니다.
- 첫 번째 결제는 서버가 실시간이 된 후에만 이루어지며, 청구 날짜는 그 날부터 시작됩니다.
- 대기하는 동안 언제든지 취소할 수 있으며, 비용이 없습니다.
지역, 가용성 및 예약 대기열은 모든 메커니즘을 완벽하게 설명합니다.
GPU 예약을 정해진 기한에 두지 마세요. 용량은 돌아올 때 돌아오며, 우리는 보유할 수 없는 날짜를 약속하기보다는 이를 명백히 알리고 싶습니다. 고정 배송 날짜가 있다면, 주문하기 전에 우리와 이야기하세요.
하나 주문하기
- KPanel에 로그인합니다.
- 왼쪽 사이드바에서 Store를 열고 GPU를 선택하거나,
/plans/compute?group=gpu으로 직접 이동합니다. - 비관리형 및 관리형 토글을 사용하여 원하는 양식을 선택합니다.
- 각 계층은 GPU, VRAM, 시스템 메모리, 월간 가격 및 일회 설정 수수료와 함께 실시간 재고 배지를 표시합니다.

설정 수수료
GPU 서버는 반복되는 월간 가격 외에도 체크아웃 시 일회 설정 수수료를 전달합니다. 물리 머신은 사용자를 위해 빌드되고 프로비저닝되어야 하기 때문입니다.
- 프로비저닝 시 한 번 청구됩니다. 갱신에는 나타나지 않습니다.
- 체크아웃 시 설정(일회)로 레이블이 지정된 자체 라인으로 표시되며, 자체 영수증이 있습니다.
- 계정 통화가 NZD일 때 GST의 대상입니다.
청구서에 일회 및 반복 청구가 어떻게 나타나는지에 대해서는 클라우드 서버 가격 책정 및 GST를 참조하세요.
GPU 서버가 클라우드 서버와 다른 점
| 클라우드 서버 | GPU 서버 | |
|---|---|---|
| 하드웨어 | 가상 머신 | NVIDIA GPU가 있는 단일 테넌트 물리 머신 |
| 프로비저닝 | 즉각적이며, 재고 대상 | 주문하기, 때때로 예약 대기열을 통해 |
| 설정 수수료 | 없음 | 일회 |
| KPanel에서 실시간 크기 조정 | 예 | 아니오 |
| 크기 조정 기준 | vCPU, 메모리, 디스크 | GPU 메모리 먼저, 그 다음 시스템 메모리 |
GPU 서버는 제자리에서 크기를 조정할 수 없습니다. 계층 간 이동은 새 머신을 주문하고 작업을 마이그레이션하는 것을 의미합니다. 이번 주에 실행 중인 모델만이 아니라 실행할 것으로 예상되는 모델에 맞는 계층을 선택합니다.
주문하기 전에
계층을 결정하므로 이 답변들을 준비하세요:
- 교육 또는 추론? 교육은 보통 메모리 집약적이고 오래 실행됩니다. 추론은 보통 지연 시간에 민감하고 동시입니다.
- 어떤 모델인가요, 어떤 정밀도에서? 이는 GPU 메모리 하한을 설정합니다.
- 얼마나 많은 데이터인가요, 어디에 존재하나요? 큰 데이터 세트를 스테이징하는 것이 시스템 메모리와 디스크의 목적입니다.
- 어떤 프레임워크? 드라이버 및 CUDA 기대 사항을 미리 확인할 수 있도록 합니다.
이 네 가지를 알려주면 올바른 계층을 가리키거나 표준 네 가지 중 어느 것도 맞지 않으면 구성을 함께 조립합니다. KPanel 내에서 Kora에 묻거나, support@kapsulehost.com로 이메일을 보내세요. 우리 뉴질랜드 팀이 도와드리겠습니다.
문제 해결
원하는 계층에 재고 없음이 표시됩니다. 예약하세요. 대기하는 동안 비용을 지불하지 않으며 용량이 반환되면 자동으로 프로비저닝합니다.
모델이 VRAM에 맞지 않습니다. 계층을 올리거나, 정밀도 또는 배치 크기를 줄입니다. Forge, Foundry 및 Reactor 모두 96 GB의 GPU 메모리를 전달합니다.
두 개 이상의 GPU가 필요하거나 나열되지 않은 구성이 필요합니다. 요구 사항을 알려주세요. 우리는 빌드할 수 있는 것과 비용을 확인하기 전에 무엇인지 확인합니다.
커밋하기 전에 시도할 수 있나요? Spark에서 개발 작업을 시작하고 파이프라인이 입증되면 올라가는 방법에 대해 우리와 이야기하세요.