# GPU 服务器概览

Source: https://support.kapsulehost.com/zh-cn/gpu-servers-overview

## GPU 服务器是什么

GPU 服务器是配备一个或多个 NVIDIA GPU 的独立物理机器，加上 CPU、系统内存和快速存储，以满足 GPU 的需求。整台机器属于您：没有其他人共享加速器、PCIe 带宽或磁盘。

您可以安装自己的软件栈并以任何方式运行它。CUDA 工作负载、PyTorch、TensorFlow、JAX 和常见的服务框架都能像在任何裸金属 Linux 机器上一样运行，因为这就是其本质。

选择单租户的原因不仅是性能。GPU 工作负载往往会持续数小时满负荷运行，而共享加速器在这种持续负载下的表现与基准测试中的表现大不相同。

## 四个服务层级

| 层级 | GPU | GPU 内存 | 系统内存 |
|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | 入门级配置 |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB |

Spark 是入门级选项：GPU 内存足以用于较小的模型、微调、推理和渲染工作。Forge、Foundry 和 Reactor 共享相同的加速器，并在系统内存上有所升级，这在您暂存大型数据集或在主机内存中保存多个模型时非常重要。

每个层级都以非托管和托管两种方式提供。非托管型为您提供 root 权限，操作系统由您负责。托管型保持相同的硬件，但由我们的工程师负责软件层。详见 [托管与非托管云服务器](https://support.kapsulehost.com/zh-cn/cloud-servers-managed-vs-unmanaged)。

如需查看以您自己货币计价的实时价格，请在 KPanel 中打开"商店"，然后打开 **GPU Compute** 卡片。

## 选择服务层级

从模型开始，而不是从价格开始。

- **您的模型在运行形式下需要多少 GPU 内存？** 这是硬性限制。如果权重加激活值无法装入，再多的系统 RAM 也帮不了。
- **您是在训练还是在推理？** 训练需要大量内存且运行时间长。推理通常受限于将数据传送到 GPU 的速度，这正是系统 RAM 和磁盘更加重要的地方。
- **您的工作集有多大？** 如果您正在流式传输无法放入主机内存的数据集，Foundry 和 Reactor 配置正是为此而生。

如果您不确定，请告诉我们您正在运行什么、模型大小、框架以及您认为需要多少 GPU 内存。我们会为您指出合适的层级，而不是让您过度购买。[GPU 和 AI 计算服务器](https://support.kapsulehost.com/zh-cn/cloud-servers-gpu)提供了更多有关工作负载方面的信息。

## 订购实际工作方式

GPU 硬件稀缺且昂贵，所以这个过程故意不是一键式的。

1. 登录 [KPanel](https://kpanel.kapsulehost.com)。
2. 点击左侧边栏中的"商店"。
3. 在"服务器"下，点击 **GPU Compute** 卡片。
4. 在"非托管"和"托管"之间切换，选择一个层级。
5. 完成结账。

![KPanel 中计算计划页面上的 GPU 层级，包含非托管和托管切换开关](https://support.kapsulehost.com/help/screenshots/gpu-servers-overview.65000b19.webp)

结账后，您会收到订单确认电子邮件，我们的团队会确认当前容量和构建情况，然后才会为您分配硬件。

> **Warning:** GPU 服务器不会在您支付的那一刻进行配置。容量需要由我们的团队首先确认，我们不会发布固定的交付时间，因为可用性在不断变化。如果截止日期很重要，请在订购之前而不是之后询问我们有关您所需层级的信息。

无论哪种情况，我们都会与您联系。如果您已支付但没有收到您期望的后续通知，请回复确认电子邮件或从"支持"打开工单，我们会告诉您订单的确切状态。

## 设置费和账单

GPU 服务器在月度价格之外还需支付一次性设置费，这与独立服务器和存储服务器相同，因为需要构建并交付物理机器。云服务器不收取设置费。

设置费只收取一次，永不重复收费，在结账时单独显示，与月度价格分开。

> **Note:** 价格以不含 GST 的形式显示。如果您的账户货币是新西兰元，结账时会添加 15% 的 GST，并在支付按钮的总价中显示。详见 [云服务器定价和 GST](https://support.kapsulehost.com/zh-cn/cloud-servers-pricing-gst)。

由于 GPU 层级是昂贵硬件的月度承诺，而不是按小时租赁，请相应地对待这个决定。如果您只需要 GPU 进行短期突发使用，请在与我们交流时告诉我们。

## 预留服务层级

当某个层级没有可用容量时，计划卡片会提供预留选项，而不是配置操作。加入队列会记录您对该层级的兴趣。

> **Important:** 预留是队列中的一个位置，而不是计划的构建，我们不承诺等待时间。也没有自助取消按钮：如果您不再想要预留，请联系支持，我们会将其删除。

## 管理 GPU 服务器

GPU 机器上线后，其管理方式与任何其他裸金属服务器完全相同，可从 KPanel 侧边栏的"独立服务器"中管理。侧边栏中没有单独的 GPU 项目。

工具集在 [管理独立服务器](https://support.kapsulehost.com/zh-cn/dedicated-servers-management) 中有完整记录，涵盖以下内容:

- **电源**: 优雅重启、硬件重置、强制断电和网络唤醒。
- **救援系统**: 临时 Linux 环境或基于浏览器的虚拟控制台。
- **反向 DNS**: 每个路由 IP 的 PTR 记录。
- **IP 和子网**: 路由到机器的内容，以及额外的 IPv4。
- **流量**: 按天、月或年的入站和出站流量。
- **防火墙**: 流量到达机器之前应用的上游过滤器。
- **高级**: 完整的操作系统重新安装，需要输入确认。

无法启动的机器的控制台访问见 [独立服务器控制台访问](https://support.kapsulehost.com/zh-cn/dedicated-servers-console)。

## 开始前的实用注意事项

**驱动程序在非托管机器上由您负责。** 安装与您打算运行的框架版本相匹配的 NVIDIA 驱动程序和 CUDA 栈，并锁定版本。驱动程序和工具包版本不匹配是 GPU 存在但无法使用的最常见原因。

**注意磁盘容量。** 模型检查点和数据集填满磁盘的速度比服务器上任何其他东西都快。如果您真正的问题是容量而不是计算能力，与 GPU 机器一起使用 [存储服务器](https://support.kapsulehost.com/zh-cn/storage-servers-overview) 通常比使用更大的 GPU 层级更便宜。

**正确配置防火墙。** 运行推理端点的 GPU 机器是一个诱人的目标。使用上游防火墙仅允许需要到达它的内容，并保持"允许平台服务"处于启用状态，以防止您将自己锁定在外。

**重新安装会清除所有内容。** "高级"下的重新安装操作会擦除每个磁盘，无法撤销，也不会为您备份。请先复制您的检查点。

## 获取帮助

GPU 是与我们先交流可以节省最多资金的产品。在 KPanel 中询问 Kora，从"支持"打开工单，或发送电子邮件至 [support@kapsulehost.com](mailto:support@kapsulehost.com)，告诉我们您正在运行什么以及需要多少 GPU 内存。

有关其余计算范围的信息，请参见 [云服务器概览](https://support.kapsulehost.com/zh-cn/cloud-servers-overview) 和 [独立服务器概览](https://support.kapsulehost.com/zh-cn/dedicated-servers-overview)。
