Vai al contenuto
Indice
Server

Server di Calcolo GPU e AI

Traduzione automatica. L'originale in inglese è disponibile.

Un server GPU KapsuleHost è una macchina fisica single-tenant dotata di processori grafici NVIDIA e della CPU, della memoria e dello storage veloce necessari per alimentarli, costruita per l'addestramento di IA, l'inferenza e altri lavori massicciamente paralleli.

Ottieni l'intera macchina. Il lavoro di nessun altro sta condividendo la tua GPU, la tua larghezza di banda della memoria o il tuo disco, che è la differenza tra un benchmark che puoi riprodurre e uno che non puoi. Questa guida copre i quattro livelli, a cosa servono, come funziona l'ordinazione dato che l'offerta di GPU è effettivamente limitata, e a cosa serve la commissione di configurazione.

I Quattro Livelli

LivelloGPUMemoria GPUMemoria di SistemaMensileConfigurazione Una tantum
SparkNVIDIA RTX 400020 GBInclusa nella buildUS$330.00Sì
ForgeNVIDIA RTX PRO 600096 GB256 GBUS$1,680.00Sì
FoundryNVIDIA RTX PRO 600096 GB512 GBUS$2,520.00Sì
ReactorNVIDIA RTX PRO 600096 GB768 GBUS$3,240.00Sì

I prezzi sono mostrati escludendo l'IVA nella tua valuta di fatturazione. Ogni livello viene fornito non gestito o gestito, la stessa scelta dei nostri server cloud.

Il salto da Spark a Forge è quello significativo. Spark è un punto di partenza per lo sviluppo, modelli più piccoli e lavori di inferenza. Forge, Foundry e Reactor condividono gli stessi 96 GB di memoria GPU e differiscono nella memoria di sistema, che è quello che governa quanto puoi tenere nella RAM dell'host insieme al modello: staging dei dataset, pipeline di preprocessing e servizio di molte richieste simultanee.

Cosa Puoi Eseguire

Ottieni il controllo completo della macchina, quindi esegui il tuo stack. Questo include PyTorch, TensorFlow, JAX, carichi di lavoro CUDA grezzi e i soliti framework di addestramento e servizio su di essi.

Usi tipici:

  • Addestramento e fine-tuning del modello per machine learning e deep learning.
  • Inferenza e servizio in produzione, dove una GPU trasforma un tempo di risposta inaccettabile in uno accettabile.
  • Carichi di lavoro IA batch: embeddings, trascrizione, generazione di immagini e video, rendering.
  • Calcolo scientifico e parallelo che beneficia dall'accelerazione GPU.

Dimensiona prima sulla memoria GPU. L'errore più comune è scegliere un livello in base al prezzo e poi scoprire che il modello non si adatta alla VRAM. Calcola la memoria di cui il tuo modello ha bisogno alla tua precisione prevista e dimensione batch, aggiungi margine, e scegli il livello che la supera. La memoria di sistema e la CPU sono molto più facili da aggirare rispetto a un modello che non si caricherà.

Disponibilità e Come Funziona l'Ordinazione

L'hardware GPU è molto richiesto in tutta l'industria e l'offerta è limitata. È un fatto del mercato, non una politica di KapsuleHost, e modella come questi vengono ordinati.

  • Queste sono macchine fisiche, quindi vengono provisionate su ordinazione piuttosto che in secondi.
  • La disponibilità varia in base al livello e alla posizione, ed è controllata in tempo reale quando guardi la pagina dei piani.
  • Spark è attualmente limitato dall'offerta. Quando non ha stock, il pannello ti offre la coda di prenotazione piuttosto che un ordine interrotto.

Per configurazioni più grandi o personalizzate confermiamo con te la build esatta e il prezzo esatto prima del provisioning, quindi sai sempre cosa stai ottenendo. Non quotizziamo una configurazione che non possiamo fornire.

La Coda di Prenotazione

Quando un livello GPU è esaurito, puoi invece prenotarlo:

  1. Prenota il livello dalla pagina dei piani. Ricevi un riferimento di prenotazione.
  2. Non viene addebitato nulla. Una prenotazione è gratuita e nessun abbonamento inizia.
  3. Quando la capacità si libera, provisioning della macchina automaticamente.
  4. Il tuo primo pagamento viene riscosso solo quando il server è attivo e la tua data di fatturazione inizia da quel giorno.
  5. Annulla in qualsiasi momento mentre aspetti, senza costi.

Regioni, Disponibilità e la Coda di Prenotazione spiega la meccanica completa.

Non mettere una prenotazione GPU su una scadenza fissa. La capacità ritorna quando ritorna, e preferiremmo dirti questo chiaramente piuttosto che prometterti una data che non possiamo mantenere. Se hai una data di consegna fissa, parla con noi prima di ordinare.

Ordinarne Uno

  1. Accedi a KPanel.
  2. Apri Store nella barra laterale sinistra e scegli GPU, oppure vai direttamente a /plans/compute?group=gpu.
  3. Usa l'interruttore Unmanaged e Managed per scegliere il modulo che desideri.
  4. Ogni livello mostra la sua GPU, la sua VRAM, la sua memoria di sistema, il suo prezzo mensile e la sua commissione di configurazione una tantum, più un badge di stock live.

Il gruppo GPU sulla scala dei piani di calcolo in KPanel

La Commissione di Configurazione

Un server GPU ha una commissione di configurazione una tantum al checkout oltre al prezzo ricorrente mensile, perché una macchina fisica deve essere costruita e sottoposta a provisioning per te.

  • Addebitata una volta, al provisioning. Non appare mai su un rinnovo.
  • Mostrata come sua propria riga al checkout, etichettata Setup (one-time), con sua propria ricevuta.
  • Soggetta a IVA quando la valuta del tuo account è NZD.

Vedi Prezzi e IVA dei Server Cloud per come gli addebiti una tantum e ricorrenti appaiono sulle tue fatture.

Come i Server GPU Differiscono dai Server Cloud

Server CloudServer GPU
HardwareMacchine virtualiMacchine fisiche single-tenant con GPU NVIDIA
ProvisioningImmediato, soggetto a stockSu ordinazione, a volte tramite la coda di prenotazione
Commissione di configurazioneNessunaUna tantum
Ridimensionamento live in KPanelSìNo
Dimensionato suvCPU, memoria, discoMemoria GPU prima, poi memoria di sistema

I server GPU non possono essere ridimensionati sul posto. Passare da un livello all'altro significa ordinare la nuova macchina e migrare il tuo lavoro su di essa. Scegli il livello che si adatta ai modelli che prevedi di eseguire, non solo a quello che stai eseguendo questa settimana.

Prima di Ordinare

Avere queste risposte pronte, perché determinano il livello:

  • Addestramento o inferenza? L'addestramento di solito richiede molta memoria e è un processo lungo. L'inferenza di solito è sensibile alla latenza e concorrente.
  • Quale modello, a quale precisione? Questo imposta il floor della memoria GPU.
  • Quanti dati e dove vivono? Lo staging di un grande dataset è quello per cui sono destinati la memoria di sistema e il disco.
  • Quale framework? In modo da poter confermare le aspettative di driver e CUDA in anticipo.

Dicci questi quattro aspetti e ti indicheremo il livello giusto, o metteremo insieme una configurazione se nessuno dei quattro standard si adatta. Chiedi a Kora dentro KPanel, o invia un'email a support@kapsulehost.com, e il nostro team della Nuova Zelanda ti aiuterà.

Risoluzione dei Problemi

Il livello che voglio mostra Esaurito. Prenotalo. Non paghi nulla mentre aspetti e forniamo automaticamente quando la capacità ritorna.

Il mio modello non si adatta alla VRAM. Passa a un livello superiore, o riduci la precisione o la dimensione batch. Forge, Foundry e Reactor portano tutti 96 GB di memoria GPU.

Ho bisogno di più di una GPU, o di una configurazione che non elenchi. Contattaci con i tuoi requisiti e confermeremo cosa possiamo costruire e cosa costa prima che venga addebitato qualsiasi cosa.

Posso provare prima di impegnarmi? Parla con noi di iniziare su Spark per lavori di sviluppo e passare a un livello superiore una volta che la tua pipeline è provata.

Ti è stato utile?

È un'IA? Legga questa pagina in Markdown

Articoli correlati

Panoramica dei server CloudI server cloud sono macchine virtuali che provvedi in pochi minuti, ridimensioni quando il tuo carico di lavoro cambia, e gestisci da KPanel con accesso root…Panoramica dei server dedicatiUn server dedicato ti dà un'intera macchina fisica tutta per te, senza altri clienti che condividono la sua CPU, memoria o dischi.…Panoramica dei server di archiviazioneChe Cosa È un Server di Storage Un server di storage è una macchina fisica dedicata la cui configurazione è deliberatamente squilibrata: una CPU modesta, molta…Panoramica dei server GPUI server GPU sono macchine bare-metal single-tenant dotate di acceleratori NVIDIA, dimensionate per l'addestramento di IA, l'inferenza e il rendering.…

Hai ancora bisogno di aiuto?

Chiedi a Kora, che conosce il tuo account, o contatta il nostro team.

ContattaciContatta il supporto