GPU सर्वर क्या है
एक GPU सर्वर एक समर्पित भौतिक मशीन है जिसमें एक या अधिक NVIDIA GPU हैं, साथ ही CPU, सिस्टम मेमोरी और तेज़ स्टोरेज भी हैं जो उन्हें चलाते रहने के लिए आवश्यक हैं। पूरी मशीन आपकी है: कोई और एक्सेलेरेटर, PCIe बैंडविड्थ या डिस्क साझा नहीं कर रहा है।
आप अपना स्वयं का स्टैक इंस्टॉल करते हैं और इसे जैसे चाहें चलाते हैं। CUDA वर्कलोड, PyTorch, TensorFlow, JAX और सामान्य सर्विंग फ्रेमवर्क सभी वैसे ही चलते हैं जैसे किसी भी bare-metal Linux बॉक्स पर चलते, क्योंकि यह वही है।
यहाँ single tenancy चाहने का कारण केवल प्रदर्शन नहीं है। GPU वर्कलोड घंटों तक पूरी शक्ति से चलते हैं, और साझा एक्सेलेरेटर उस तरह के sustained load के तहत बेंचमार्क की तुलना में बहुत अलग तरीके से काम करते हैं।
चार स्तर
| स्तर | GPU | GPU मेमोरी | सिस्टम RAM |
|---|---|---|---|
| Spark | NVIDIA RTX 4000 | 20 GB | प्रवेश स्तर कॉन्फ़िगरेशन |
| Forge | NVIDIA RTX PRO 6000 | 96 GB | 256 GB |
| Foundry | NVIDIA RTX PRO 6000 | 96 GB | 512 GB |
| Reactor | NVIDIA RTX PRO 6000 | 96 GB | 768 GB |
Spark प्रवेश बिंदु है: छोटे मॉडल, fine-tuning, inference और रेंडरिंग कार्य के लिए पर्याप्त GPU मेमोरी। Forge, Foundry और Reactor एक ही एक्सेलेरेटर साझा करते हैं और इसके चारों ओर सिस्टम मेमोरी में वृद्धि करते हैं, जो महत्वपूर्ण है जब आप बड़े डेटा सेट स्टेज कर रहे हों या होस्ट मेमोरी में कई मॉडल रख रहे हों।
हर स्तर unmanaged और managed दोनों के रूप में बेचा जाता है। Unmanaged आपको root देता है और ऑपरेटिंग सिस्टम आप पर छोड़ देता है। Managed एक ही हार्डवेयर रखता है जहाँ हमारे इंजीनियर सॉफ़्टवेयर परत पर होते हैं। Managed vs Unmanaged Cloud Servers देखें।
अपनी मुद्रा में लाइव मूल्य निर्धारण के लिए, KPanel में Store खोलें, फिर GPU Compute कार्ड खोलें।
एक स्तर चुनना
कीमत से नहीं, मॉडल से शुरू करें।
- आपके मॉडल को उस आकार में कितनी GPU मेमोरी की आवश्यकता है जिसमें आप इसे चला रहे हैं? यह कठोर constraint है। यदि weights plus activations fit नहीं होते, तो कोई भी सिस्टम RAM मदद नहीं करेगा।
- क्या आप training कर रहे हैं या serving कर रहे हैं? Training मेमोरी की भूखी होती है और long-running होती है। Inference अक्सर इससे bounded होता है कि आप GPU तक डेटा कितनी तेजी से पहुंचा सकते हैं, यहीं पर सिस्टम RAM और डिस्क अधिक महत्वपूर्ण होते हैं।
- आपका working set कितना बड़ा है? यदि आप एक डेटा सेट स्ट्रीम कर रहे हैं जो होस्ट मेमोरी में fit नहीं होता, तो Foundry और Reactor कॉन्फ़िगरेशन बिल्कुल इसी कारण से मौजूद हैं।
यदि आप अनिश्चित हैं, तो हमें बताएँ कि आप क्या चला रहे हैं, मॉडल का आकार, फ्रेमवर्क और आपको कितनी GPU मेमोरी की आवश्यकता है। हम आपको सही स्तर की ओर इशारा करेंगे बजाय आपको overbuy करने देने के। GPU and AI Compute Servers में workload side पर अधिक जानकारी है।
कैसे ऑर्डर करना वास्तव में काम करता है
GPU हार्डवेयर दुर्लभ और महंगा है, इसलिए प्रक्रिया जानबूझकर one-click नहीं है।
- KPanel में साइन इन करें।
- बाईं ओर की साइडबार में Store पर क्लिक करें।
- Servers के तहत, GPU Compute कार्ड पर क्लिक करें।
- Unmanaged और Managed के बीच स्विच करें, और एक स्तर चुनें।
- चेकआउट पूरा करें।

चेकआउट के बाद आप एक ऑर्डर acknowledgement ईमेल प्राप्त करते हैं, और हमारी टीम मौजूदा capacity और build को confirm करती है इससे पहले कि हार्डवेयर आपको आवंटित किया जाए।
एक GPU सर्वर उस क्षण provisioned नहीं होता जब आप भुगतान करते हैं। Capacity को पहले हमारी टीम द्वारा confirm किया जाता है, और हम एक fixed lead time प्रकाशित नहीं करते क्योंकि availability बदलती है। यदि कोई deadline मायने रखता है, तो ऑर्डर करने से पहले हमसे उस स्तर के बारे में पूछें।
आप किसी भी तरीके से हमसे सुनेंगे। यदि आपने भुगतान कर दिया है और आपको कोई follow-up नहीं मिला है जिसकी आप उम्मीद कर रहे थे, तो acknowledgement ईमेल का जवाब दें या Support से एक ticket खोलें और हम आपको बताएँगे कि ऑर्डर कहाँ है।
सेटअप फी और बिलिंग
GPU सर्वर मासिक कीमत के शीर्ष पर एक बार की setup fee लेते हैं, जो dedicated और storage सर्वर के समान है, क्योंकि एक भौतिक मशीन बनाई जाती है और सौंपी जाती है। Cloud सर्वर कोई setup fee नहीं लेते।
Setup fee एक बार charge होती है, कभी दोहराई नहीं जाती, और चेकआउट पर मासिक कीमत से अलग दिखाई जाती है।
कीमतें GST को छोड़कर दिखाई जाती हैं। यदि आपकी account currency NZD है, तो 15 प्रतिशत GST चेकआउट पर जोड़ा जाता है और pay-button total में दिखाई देता है। Cloud Server Pricing and GST देखें।
क्योंकि एक GPU स्तर महंगे हार्डवेयर पर एक मासिक commitment है न कि hourly rental, इसके अनुसार निर्णय लें। यदि आपको GPU की केवल एक छोटी अवधि के लिए आवश्यकता है, तो ऐसा कहें जब आप हमसे बात करें।
एक स्तर को आरक्षित करना
जब एक स्तर की कोई capacity नहीं होती, तो plan card एक configure action के बजाय एक reservation प्रदान करता है। Queue में शामिल होना उस स्तर में आपकी रुचि record करता है।
एक reservation एक queue में एक स्थान है, एक scheduled build नहीं, और हम किसी wait time के लिए प्रतिबद्ध नहीं हैं। कोई self-service cancel button भी नहीं है: यदि आप अब reservation नहीं चाहते हैं, तो support से संपर्क करें और हम इसे remove कर देंगे।
GPU सर्वर का प्रबंधन
एक बार GPU मशीन live हो जाने के बाद इसे बिल्कुल किसी अन्य bare-metal सर्वर की तरह प्रबंधित किया जाता है, KPanel साइडबार में डेडिकेटेड सर्वर से। साइडबार में कोई अलग GPU item नहीं है।
Managing a Dedicated Server में पूरी तरह से documented toolset में शामिल हैं:
- Power: graceful restart, hardware reset, forced power cycle और Wake-on-LAN।
- Rescue सिस्टम: एक अस्थायी Linux environment या browser-based virtual console।
- रिवर्स DNS: प्रत्येक routed IP के लिए PTR records।
- IP और सबनेट: मशीन के लिए routed है, साथ ही अतिरिक्त IPv4।
- Traffic: दिन, महीने या साल के आधार पर inbound और outbound volume।
- Firewall: upstream filter जो मशीन तक traffic पहुंचने से पहले लागू होता है।
- Advanced: एक पूर्ण ऑपरेटिंग सिस्टम reinstall, typed confirmation के पीछे।
एक मशीन के लिए console access जो boot नहीं होगी Dedicated Server Console Access में है।
शुरू करने से पहले व्यावहारिक नोट्स
Drivers unmanaged मशीन पर आपके हैं। NVIDIA driver और CUDA stack install करें जो उन framework versions से match करता है जिन्हें आप चलाने का इरादा रखते हैं, और उन्हें pin करें। Mismatched driver और toolkit versions एक GPU के present होने के बावजूद unusable होने का सबसे आम कारण हैं।
अपनी डिस्क पर ध्यान रखें। Model checkpoints और data sets एक डिस्क को सर्वर पर किसी भी अन्य चीज़ से तेजी से भर देते हैं। यदि capacity आपकी असली समस्या है न कि compute, तो GPU मशीन के साथ storage server आमतौर पर एक बड़े GPU स्तर की तुलना में सस्ता होता है।
इसे ठीक से Firewall करें। एक GPU box जो एक inference endpoint चला रहा है एक आकर्षक target है। upstream firewall का उपयोग केवल उसे allow करने के लिए करें जो इसतक पहुंचने की आवश्यकता है, और प्रदाता सेवाएँ अनुमति दें को on रखें ताकि आप अपने आप को lock out न करें।
Reinstalling सब कुछ erase करता है। Advanced के तहत reinstall action हर डिस्क को undo के बिना wipe करता है और आपके लिए कोई backup नहीं लेता। पहले अपने checkpoints को copy करें।
सहायता प्राप्त करना
GPU वह product है जहाँ पहले हमसे बात करना सबसे अधिक पैसा बचाता है। KPanel के अंदर Kora से पूछें, Support से एक ticket खोलें, या support@kapsulehost.com को ईमेल करें कि आप क्या चला रहे हैं और आपको कितनी GPU मेमोरी की आवश्यकता है।
compute range के बाकी हिस्से के लिए, Cloud Servers Overview और Dedicated Servers Overview देखें।