Un serveur GPU KapsuleHost est une machine physique à locataire unique équipée de processeurs graphiques NVIDIA et du processeur, de la mémoire et du stockage rapide nécessaires pour les alimenter, conçue pour l'entraînement en IA, l'inférence et autres travaux massivement parallèles.
Vous obtenez la machine entière. Aucun autre travail ne partage votre GPU, votre bande passante mémoire ou votre disque, ce qui est la différence entre un benchmark que vous pouvez reproduire et un que vous ne pouvez pas. Ce guide couvre les quatre niveaux, ce qui leur convient, comment fonctionne la commande étant donné que l'approvisionnement en GPU est véritablement serré, et à quoi sert le frais d'installation.
Les Quatre Niveaux
| Niveau | GPU | Mémoire GPU | Mémoire système | Mensuel | Configuration unique |
|---|---|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | Inclus dans la configuration | US$330.00 | Oui |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB | US$1,680.00 | Oui |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB | US$2,520.00 | Oui |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB | US$3,240.00 | Oui |
Les prix sont affichés hors TVA dans votre devise de facturation. Chaque niveau est proposé non géré ou géré, le même choix que nos serveurs cloud.
Le saut de Spark à Forge est le plus important. Spark est un point d'entrée pour le développement, les petits modèles et le travail d'inférence. Forge, Foundry et Reactor partagent les mêmes 96 GB de mémoire GPU et diffèrent par la mémoire système, qui détermine la quantité que vous pouvez conserver dans la RAM hôte aux côtés du modèle : préparation des ensembles de données, pipelines de prétraitement et traitement de nombreuses demandes simultanées.
Ce Que Vous Pouvez Exécuter
Vous avez le contrôle total de la machine, vous exécutez donc votre propre stack. Cela comprend PyTorch, TensorFlow, JAX, les charges de travail CUDA brutes et les frameworks d'entraînement et de service habituels au-dessus.
Cas d'usage typiques :
- Entraînement et ajustement de modèles pour l'apprentissage automatique et l'apprentissage profond.
- Inférence et service en production, où un GPU transforme un temps de réponse inacceptable en un temps acceptable.
- Charges de travail IA par lot : embeddings, transcription, génération d'images et vidéos, rendu.
- Calcul scientifique et parallèle qui bénéficie de l'accélération GPU.
Dimensionnez d'abord sur la mémoire GPU. L'erreur la plus courante est de choisir un niveau en fonction du prix, puis de découvrir que le modèle ne tient pas en VRAM. Déterminez la mémoire dont votre modèle a besoin à votre précision et taille de lot prévues, ajoutez une marge de sécurité et choisissez le niveau qui la dépasse. La mémoire système et le CPU sont beaucoup plus faciles à contourner qu'un modèle qui ne se chargera pas.
Disponibilité et Comment Fonctionne la Commande
Le matériel GPU est très demandé dans toute l'industrie et l'approvisionnement est limité. C'est un fait du marché, pas une politique de KapsuleHost, et cela façonne la façon dont ces éléments sont commandés.
- Ce sont des machines physiques, elles sont donc provisionnées sur commande plutôt qu'en quelques secondes.
- La disponibilité varie selon le niveau et l'emplacement, et elle est vérifiée en direct lorsque vous consultez la page des plans.
- Spark est actuellement limité en approvisionnement. Quand il n'a pas de stock, le panneau vous propose la file d'attente de réserve plutôt qu'une commande défectueuse.
Pour les configurations plus grandes ou personnalisées, nous confirmons avec vous la configuration exacte et le prix exact avant le provisionnement, vous savez donc toujours ce que vous obtenez. Nous ne proposons pas une configuration que nous ne pouvons pas livrer.
La File d'Attente de Réserve
Quand un niveau GPU est en rupture de stock, vous pouvez le réserver au lieu de partir :
- Réservez le niveau depuis la page des plans. Vous obtenez une référence de réservation.
- Rien n'est débité. Une réservation est gratuite et aucun abonnement ne commence.
- Quand la capacité devient disponible, nous provisionons la machine pour vous automatiquement.
- Votre premier paiement est prélevé uniquement une fois que le serveur est en direct, et votre date de facturation commence à partir de ce jour.
- Annulez à tout moment pendant que vous attendez, sans frais.
Régions, Disponibilité et File d'Attente de Réserve explique les mécanismes en détail.
Ne mettez pas une réservation GPU sur une date limite fixe. La capacité revient quand elle revient, et nous préférerions vous le dire franchement plutôt que de promettre une date que nous ne pouvons pas tenir. Si vous avez une date de livraison fixe, contactez-nous avant de commander.
Commander Un Serveur
- Connectez-vous à KPanel.
- Ouvrez Store dans la barre latérale gauche et choisissez GPU, ou allez directement à
/plans/compute?group=gpu. - Utilisez le curseur Unmanaged et Managed pour choisir le formulaire que vous souhaitez.
- Chaque niveau affiche son GPU, sa VRAM, sa mémoire système, son prix mensuel et son frais d'installation unique, plus un badge de stock en direct.

Les Frais d'Installation
Un serveur GPU entraîne des frais d'installation uniques à la facturation en plus du prix mensuel récurrent, car une machine physique doit être construite et provisionée pour vous.
- Débité une fois, au provisionnement. Il n'apparaît jamais sur un renouvellement.
- Affiché comme sa propre ligne à la facturation, étiqueté Setup (one-time), avec son propre reçu.
- Soumis à la TVA quand la devise de votre compte est NZD.
Voir Tarification des Serveurs Cloud et TVA pour voir comment les frais uniques et récurrents apparaissent sur vos factures.
Comment les Serveurs GPU Diffèrent des Serveurs Cloud
| Serveurs Cloud | Serveurs GPU | |
|---|---|---|
| Matériel | Machines virtuelles | Machines physiques à locataire unique avec GPU NVIDIA |
| Provisionnement | Immédiat, selon la disponibilité | Sur commande, parfois via la file d'attente de réserve |
| Frais d'installation | Aucun | Unique |
| Redimensionnement en direct dans KPanel | Oui | Non |
| Dimensionné sur | vCPU, mémoire, disque | Mémoire GPU d'abord, puis mémoire système |
Les serveurs GPU ne peuvent pas être redimensionnés en place. Passer d'un niveau à l'autre signifie commander la nouvelle machine et migrer votre travail vers elle. Choisissez le niveau qui correspond aux modèles que vous vous attendez à exécuter, pas seulement celui que vous exécutez cette semaine.
Avant de Commander
Ayez ces réponses prêtes, car elles déterminent le niveau :
- Entraînement ou inférence ? L'entraînement est généralement gourmand en mémoire et de longue durée. L'inférence est généralement sensible à la latence et simultanée.
- Quel modèle, à quelle précision ? Cela fixe le plancher de mémoire GPU.
- Combien de données, et où vivent-elles ? La préparation d'un grand ensemble de données c'est pour la mémoire système et le disque.
- Quel framework ? Pour que nous puissions confirmer les attentes de pilote et CUDA dès le départ.
Dites-nous ces quatre choses et nous vous orienterons vers le bon niveau, ou assemblerons une configuration si aucun des quatre standard n'est adapté. Posez la question à Kora dans KPanel, ou envoyez un e-mail à support@kapsulehost.com, et notre équipe de Nouvelle-Zélande vous aidera.
Dépannage
Le niveau que je veux affiche Rupture de stock. Réservez-le. Vous ne payez rien pendant que vous attendez et nous provisionons automatiquement quand la capacité revient.
Mon modèle ne tient pas en VRAM. Montez d'un niveau, ou réduisez la précision ou la taille de lot. Forge, Foundry et Reactor portent tous 96 GB de mémoire GPU.
J'ai besoin de plus d'un GPU, ou d'une configuration que vous n'avez pas listée. Contactez-nous avec vos besoins et nous confirmerons ce que nous pouvons construire et ce que cela coûte avant que quoi que ce soit soit débité.
Puis-je essayer avant de m'engager ? Parlez-nous de commencer sur Spark pour le travail de développement et de monter une fois que votre pipeline est éprouvé.