# GPUサーバー概要

Source: https://support.kapsulehost.com/ja-jp/gpu-servers-overview

GPU サーバーはシングルテナントのベアメタルマシンで、NVIDIA アクセラレーターを搭載しており、AI トレーニング、推論、レンダリング用にサイジングされています。このガイドでは、4 つのティア、注文と配信の仕組み、セットアップ費がカバーする内容、およびライブになった GPU マシンを管理する方法について説明します。

## GPU サーバーとは

GPU サーバーは、1 つ以上の NVIDIA GPU を備えた専用物理マシンであり、それらをフィードするために必要な CPU、システムメモリ、高速ストレージを備えています。マシン全体がそのマシン専有です。他誰も、アクセラレーター、PCIe 帯域幅、またはディスクを共有していません。

独自スタックをインストールして、自分の好きなように実行できます。CUDA ワークロード、PyTorch、TensorFlow、JAX、および通常のサービングフレームワークはすべて、ベアメタル Linux ボックスで実行されるのと同じように動作します。なぜなら、それがまさにそれだからです。

シングルテナンシーを望む理由はパフォーマンスだけではありません。GPU ワークロードは数時間連続して実行される傾向があり、共有アクセラレーターはベンチマークの場合とは異なり、そのような持続的な負荷下では非常に異なった動作をします。

## 4 つのティア

| ティア | GPU | GPU メモリ | システム RAM |
|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | エントリ構成 |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB |

Spark はエントリーポイントであり、小さいモデル、ファインチューニング、推論、レンダリング作業に十分な GPU メモリを備えています。Forge、Foundry、および Reactor は同じアクセラレーターを共有し、その周辺のシステムメモリを増やします。これは大きなデータセットをステージングするか、複数のモデルをホストメモリに保持する場合に重要です。

すべてのティアはアンマネージドとマネージドの両方で販売されています。アンマネージドはルートを提供し、オペレーティングシステムはお客様の責任です。マネージドは同じハードウェアをそのままに、当社のエンジニアがソフトウェア層を担当します。[マネージドと アンマネージドクラウドサーバーの比較](https://support.kapsulehost.com/ja-jp/cloud-servers-managed-vs-unmanaged)を参照してください。

独自の通貨での最新の価格は、KPanel で **Store** を開き、**GPU Compute** カードを開いてください。

## ティアを選択する

価格ではなくモデルから始めてください。

- **モデルに必要な GPU メモリはどのくらいですか（実行する形式で）?** これはハードコンストレイントです。重みと活性化がフィットしないと、システム RAM がどれだけあっても役に立ちません。
- **トレーニングですか、それともサービングですか?** トレーニングはメモリが大量に必要で、長時間実行されます。推論は、GPU へのデータ供給速度に制限されることが多く、ここでシステム RAM とディスクがより重要になります。
- **ワーキングセットはどのくらいの大きさですか?** ホストメモリに収まらないデータセットをストリーミングしている場合、Foundry および Reactor 構成はまさにそのために存在しています。

確実でない場合は、実行中のもの、モデルサイズ、フレームワーク、およびどのくらいの GPU メモリが必要かを教えてください。買い過ぎさせるのではなく、適切なティアを指摘します。[GPU および AI コンピュートサーバー](https://support.kapsulehost.com/ja-jp/cloud-servers-gpu)には、ワークロード側についての詳細があります。

## 注文の仕組み

GPU ハードウェアは希少で高価であるため、このプロセスはワンクリックではありません。

1. [KPanel](https://kpanel.kapsulehost.com)にサインインしてください。
2. 左側のサイドバーで **Store** をクリックしてください。
3. **Servers** の下で、**GPU Compute** カードをクリックしてください。
4. **Unmanaged** と **Managed** を切り替えて、ティアを選択してください。
5. チェックアウトを完了してください。

![KPanel のコンピュートプラン ページ上の GPU ティア（アンマネージドとマネージド スイッチ付き）](https://support.kapsulehost.com/help/screenshots/gpu-servers-overview.65000b19.webp)

チェックアウト後、注文確認メールが送信され、当社のチームが現在の容量とビルドを確認してから、ハードウェアが割り当てられます。

> **Warning:** GPU サーバーは支払いの時点でプロビジョニングされません。容量は当社のチームによって最初に確認され、利用可能性は変動するため、固定的なリード時間は公開されていません。期限が重要な場合は、注文後ではなく注文前に必要なティアについて当社に確認してください。

いずれにせよ、当社からの連絡があります。支払い済みであり、期待していたフォローアップを受けていない場合は、確認メールに返信するか **Support** からチケットを開くと、注文がどこにあるかを正確に伝えます。

## セットアップ費と料金

GPU サーバーは専用サーバーとストレージサーバーと同様に、月額料金の上に一度限りのセットアップ費が発生します。これは物理マシンが構築され引き渡されるためです。クラウドサーバーはセットアップ費を請求しません。

セットアップ費は一度だけ請求され、繰り返されることはなく、チェックアウト時に月額料金とは別に表示されます。

> **Note:** 価格は GST を除いて表示されています。アカウント通貨が NZD の場合、15 パーセントの GST がチェックアウト時に追加され、支払いボタンの合計に表示されます。[クラウドサーバーの価格と GST](https://support.kapsulehost.com/ja-jp/cloud-servers-pricing-gst)を参照してください。

GPU ティアは時間単位のレンタルではなく高価なハードウェアに対する月額のコミットメントであるため、それに応じて決定を下してください。GPU が短いバーストでのみ必要な場合は、当社と話すときにそう言ってください。

## ティアの予約

ティアに容量がない場合、プランカードは構成アクションではなく予約を提供します。キューに参加すると、そのティアへのお客様の関心が記録されます。

> **Important:** 予約はスケジュール済みビルドではなくキュー内のプレイスであり、待機時間をコミットしていません。セルフサービスキャンセルボタンもありません。予約が不要になった場合は、サポートに連絡すると削除します。

## GPU サーバーの管理

GPU マシンがライブになると、KPanel サイドバーの **専用サーバー** からほかのベアメタルサーバーと同じように管理されます。サイドバーに GPU の個別アイテムはありません。

[専用サーバーの管理](https://support.kapsulehost.com/ja-jp/dedicated-servers-management)に完全に記載されているツールセットは、以下をカバーしています。

- **Power**: グレースフルリスタート、ハードウェアリセット、強制パワーサイクル、Wake-on-LAN。
- **レスキューシステム**: 一時的な Linux 環境、またはブラウザベースの仮想コンソール。
- **逆引き DNS**: ルーティングされた各 IP の PTR レコード。
- **IP とサブネット**: マシンにルーティングされるもの、および追加の IPv4。
- **Traffic**: 日、月、または年単位のインバウンドおよびアウトバウンド量。
- **Firewall**: マシンに到達する前に適用されるアップストリームフィルター。
- **Advanced**: 型付き確認の背後にある、完全なオペレーティングシステムの再インストール。

ブートしないマシンのコンソールアクセスは、[専用サーバーのコンソールアクセス](https://support.kapsulehost.com/ja-jp/dedicated-servers-console)にあります。

## 始める前の実用的な注意

**アンマネージドマシンのドライバーはお客様の責任です。** 実行するフレームワークバージョンに一致する NVIDIA ドライバーと CUDA スタックをインストールして固定してください。ドライバーとツールキットバージョンの不一致が、GPU が存在しているが使用できない最も一般的な原因です。

**ディスクに気をつけてください。** モデルチェックポイントとデータセットはサーバー上のその他すべてより速くディスクを満たします。容量が実際の問題であり、計算ではない場合、GPU マシンとともに[ストレージサーバー](https://support.kapsulehost.com/ja-jp/storage-servers-overview)を使用する方が、通常はより大きな GPU ティアより安価です。

**適切にファイアウォールを設定してください。** 推論エンドポイントを実行している GPU ボックスは魅力的なターゲットです。アップストリームファイアウォールを使用して、到達する必要のあるもののみを許可し、ロックアウトされないように **プラットフォームサービスを許可** をオンに保ってください。

**再インストールはすべてを消去します。** **Advanced** の下の再インストールアクションは、すべてのディスクを元に戻す手段なしで削除し、バックアップを取りません。チェックポイントを最初にコピーしてください。

## 助けを得る

GPU は、最初に当社と話すことで最もお金が節約できるプロダクトです。KPanel 内の Kora に聞くか、**Support** からチケットを開くか、実行中のものと必要な GPU メモリ の量を [support@kapsulehost.com](mailto:support@kapsulehost.com) にメールしてください。

コンピュート範囲の残りについては、[クラウドサーバーの概要](https://support.kapsulehost.com/ja-jp/cloud-servers-overview) と [専用サーバーの概要](https://support.kapsulehost.com/ja-jp/dedicated-servers-overview) を参照してください。
