Sunucu Yönetimi & Linux

    GPU Sunucu Kiralama: Yapay Zeka İçin Doğru Seçim

    Model boyutuna ve iş yüküne göre gereken GPU ve VRAM miktarını belirleyip kiralama maliyetini kart satın almayla karşılaştırır.

    13 dk okuma Güncellendi: 11 Ağustos 2026

    GPU sunucu kiralama sayfalarına baktığınızda karşınıza kart modellerinden oluşan bir liste çıkar: şu kart, bu kart, şu kadar çekirdek. Ama sizin sorunuz o değildir. Sizin sorunuz şudur: "Elimdeki modeli çalıştırmak için kaç GB VRAM gerekiyor?", "16 GB'lık kart yeterli mi yoksa 48 GB'a mı çıkmalıyım?", "aylık kiralamak mı, kartı alıp kendi sunucuma takmak mı daha mantıklı?" Türkçe kaynaklarda bu üç sorunun cevabı neredeyse hiç yok; ekran kartlı sunucu arayan herkes ürün listelerinin arasında kaybolup deneme yanılmayla ilerliyor.

    Bu rehber tam olarak o boşluğu doldurmak için yazıldı. Önce VRAM ihtiyacını hesaplamayı öğreneceksiniz — tahminle değil, model parametre sayısından yola çıkan bir formülle. Sonra farklı kart sınıflarının hangi iş yükünde ne fark yarattığını, kiralama ile satın almanın başabaş noktasını nasıl hesaplayacağınızı ve sunucuyu teslim aldıktan sonraki ilk saatte ne yapmanız gerektiğini adım adım göreceksiniz. Fiyat rakamı vermeyeceğiz; onun yerine kendi rakamlarınızı yerine koyabileceğiniz hesap yöntemini vereceğiz.

    GPU Sunucu Ne Zaman Gerekir, Ne Zaman Gerekmez#

    GPU sunucu, işin doğası "aynı işlemi çok sayıda veri üzerinde paralel yapmak" olduğunda gerekir; bunun dışındaki her yükte pahalı bir CPU sunucusudur. Pratikte gerçekten GPU isteyen iş yükleri şunlardır:

    • Büyük dil modeli çalıştırma (inference). Kendi sunucunuzda bir sohbet modeli ya da gömme (embedding) modeli servis etmek.
    • Model eğitimi ve ince ayar (fine-tuning / LoRA). Inference'tan kat kat fazla bellek ister.
    • Görüntü üretimi. Difüzyon modelleriyle görsel üretimi, upscaling, arka plan kaldırma.
    • 3B render. Blender Cycles, OctaneRender gibi GPU render motorları.
    • Video kodlama. NVENC ile çok sayıda eşzamanlı transkodlama.
    • Bilimsel hesaplama. CUDA ile yazılmış simülasyonlar.

    Buna karşılık şu işler GPU sunucuda hızlanmaz: klasik web uygulaması, veritabanı, e-posta sunucusu, dosya sunucusu, WordPress. Bir e-ticaret sitesini GPU sunucuya taşımak hiçbir şey kazandırmaz — orada doğru adres standart bir sanal sunucudur.

    Karar cümlesi şudur: kodunuzda CUDA, ROCm, TensorRT, cuDNN ya da bir GPU render motoru yoksa, GPU sunucu size hız kazandırmaz.

    VRAM Hesabı: Modelinizin Kaç GB İstediğini Nasıl Bulursunuz#

    VRAM ihtiyacı tahminle değil, model parametre sayısı ile veri tipinin çarpımıyla bulunur. Temel formül şudur:

    Ağırlık belleği (GB) ≈ Parametre sayısı (milyar) × Parametre başına bayt
    

    Parametre başına bayt, modeli hangi hassasiyette yüklediğinize bağlıdır:

    Veri tipiParametre başına7B model13B model70B model
    FP32 (tam hassasiyet)4 bayt~28 GB~52 GB~280 GB
    FP16 / BF16 (yaygın)2 bayt~14 GB~26 GB~140 GB
    INT8 (8-bit nicemleme)1 bayt~7 GB~13 GB~70 GB
    4-bit (Q4 nicemleme)~0,5 bayt~4 GB~7 GB~38 GB

    Ama bu yalnızca ağırlıklar. Gerçek ihtiyaç için üstüne iki kalem daha eklenir:

    1. KV önbelleği (bağlam belleği). Uzun bağlamda hızla büyür. Kaba bir kural: her 1000 token bağlam için 7B sınıfı bir modelde birkaç yüz MB. 32.000 token bağlamla çalışacaksanız bu kalem birkaç GB'a çıkar.
    2. Çalışma alanı ve parçalanma payı. CUDA bağlamı, ara aktivasyonlar ve bellek parçalanması için ağırlık boyutunun yaklaşık %15-20'si kadar pay bırakın.

    Pratik formül:

    Gereken VRAM ≈ (Ağırlık belleği + KV önbelleği) × 1,2
    

    Örnek: 13B parametreli bir modeli 4-bit nicemlemeyle, 8.000 token bağlamla çalıştıracaksınız. Ağırlık ~7 GB, KV önbelleği ~1,5 GB, toplam 8,5 GB, güvenlik payıyla ~10 GB. 16 GB VRAM'li bir kart bu işi rahat yapar; 24 GB'a çıkmanıza gerek yoktur.

    Karşı örnek: aynı modeli FP16 çalıştırmak isterseniz ağırlık 26 GB'a fırlar ve 24 GB'lık tek kart yetmez. Nicemleme kararı, kart kararından önce gelir.

    Eğitim ve ince ayar için kural farklıdır. Tam ince ayarda optimizer durumları ve gradyanlar yüzünden ihtiyaç ağırlığın 3-4 katına çıkar; 7B bir modelin tam ince ayarı FP16'da 60 GB'ı aşar. Bu yüzden pratikte LoRA/QLoRA kullanılır: taban model 4-bit yüklenir, yalnızca küçük adaptör katmanları eğitilir ve 7B ince ayar 16-24 GB'lık bir kartta yapılabilir hâle gelir.

    Kartın boş belleğini her zaman ölçerek doğrulayın:

    nvidia-smi --query-gpu=name,memory.total,memory.used,memory.free --format=csv
    

    Kart Sınıfları Arasındaki Fark İşinize Nasıl Yansır#

    Kartlar arasındaki farkı yalnızca VRAM miktarına indirgemek en yaygın hatadır. İş yükünüze göre belirleyici olan özellik değişir:

    ÖzellikNe işe yararKim için kritik
    VRAM miktarıModelin sığıp sığmadığını belirlerLLM ve büyük sahne render
    Bellek bant genişliğiToken üretim hızını belirlerLLM inference (asıl darboğaz budur)
    Tensor çekirdek nesliFP16/INT8/FP8 hızlanmasıEğitim ve yoğun inference
    ECC bellekBellek hatasını düzeltirUzun süren eğitim işleri
    NVENC/NVDECVideo kodlama-çözme birimiTranskodlama iş yükleri
    Çoklu kart bağlantısıKartlar arası hızlı aktarımTek karta sığmayan modeller
    Sürücü modeliUzun destek, sanallaştırma uyumuÜretim ortamı

    Buradaki en önemli ve en az bilinen gerçek şu: LLM inference'ta hızınızı belirleyen şey çekirdek sayısı değil, bellek bant genişliğidir. Model her token üretiminde tüm ağırlıkları bellekten okur; dolayısıyla saniyedeki token sayısı kabaca "bant genişliği ÷ model boyutu" ile orantılıdır. İki kart aynı VRAM'e sahip olsa bile bant genişliği yüksek olan belirgin biçimde daha hızlı cevap üretir.

    İkinci önemli fark: profesyonel seri kartlar (A-serisi, L-serisi) ECC belleğe ve daha uzun sürücü desteğine sahiptir, tüketici kartları ise aynı fiyata daha yüksek ham hız verir. Günlerce süren eğitim işi çalıştıracaksanız ECC'nin değeri vardır; gece render alıp sabah teslim edecekseniz yoktur.

    Üçüncü fark fiziksel: profesyonel kartlar tek slot ve blower tipi soğutmayla, sunucu kasasına takılmak üzere tasarlanır. Tüketici kartları üç slot kaplar ve masaüstü hava akışına göre soğutulur; yoğun bir sunucu kasasında sıcaklık yüzünden hız düşürür. Kartı kendi kasanıza takmayı düşünüyorsanız bu detayı atlamayın.

    İş Yüküne Göre Hedef VRAM Tablosu#

    Aşağıdaki tablo, tipik senaryolarda başlanacak minimum ve rahat çalışılacak hedef değerleri verir:

    İş yüküMinimum VRAMRahat çalışmaNotlar
    7B LLM inference (4-bit)8 GB16 GBBağlam uzarsa 16 GB şart
    7B LLM inference (FP16)16 GB24 GBBant genişliği belirleyici
    13B LLM inference (4-bit)12 GB16 GBÇok kullanıcılıysa 24 GB
    13B LLM inference (FP16)32 GB48 GBTek kartta zorlanır
    70B LLM inference (4-bit)48 GB80 GB veya çift kartBant genişliği kritik
    LoRA ince ayar (7B)16 GB24 GBQLoRA ile 16 GB mümkün
    LoRA ince ayar (13B)24 GB48 GBBatch boyutu belirler
    Görüntü üretimi (SD sınıfı)8 GB12-16 GBYüksek çözünürlükte artar
    Blender GPU render12 GB24 GBSahne tüm belleğe sığmalı
    Video transkodlama8 GB16 GBNVENC akış limiti önemli
    Gömme/embedding servisi8 GB16 GBToplu işlemede artar

    Tabloyu okurken şunu unutmayın: sahne veya model belleğe sığmazsa iş yavaşlamaz, çalışmaz. Blender'da "CUDA out of memory" alırsanız render CPU'ya düşer ve saatler sürer; LLM'de aynı hata süreci doğrudan sonlandırır. Bu yüzden VRAM'de cimrilik, diğer bileşenlerdeki cimrilikten daha maliyetlidir.

    Kiralamak mı, Kart Satın Almak mı: Başabaş Hesabı#

    Bu kararı duygusal değil, hesapla verin. Kullanacağınız formül:

    Başabaş süresi (ay) = Sahiplenme maliyeti / (Aylık kiralama − Aylık işletme gideri)
    
    Sahiplenme maliyeti = Kart bedeli + Uyumlu sunucu/kasa + Güçlü güç kaynağı + Kurulum emeği
    Aylık işletme gideri = Elektrik + Barındırma/kolokasyon + Soğutma + Bakım payı + Arıza riski karşılığı
    

    Elektrik kalemini kendi tarifenizle şöyle hesaplayın:

    Aylık kWh = (Kart TDP watt + Sunucu tüketimi watt) × Günlük çalışma saati × 30 / 1000
    

    300 W çeken bir kart, üstüne 200 W çeken bir sunucu, günde 24 saat çalışırsa: (300+200) × 24 × 30 / 1000 = 360 kWh/ay. Bu rakamı kendi kWh birim fiyatınızla çarpın; ayrıca veri merkezinde barındırıyorsanız soğutma çarpanı olarak üstüne bir pay eklemeniz gerekir.

    Kararı yönlendiren üç kritik soru:

    1. Kullanım oranınız kaç? Kart günde 2 saat çalışacaksa satın almak neredeyse her zaman kaybettirir; boşta duran donanım da amortisman yer. Günde 20+ saat sürekli yükte çalışacaksa satın alma tarafı güçlenir.
    2. Ne kadar süre aynı karta ihtiyacınız var? GPU nesilleri hızlı değişir. Bugünkü karta bağlanmak, iki nesil sonra aynı işi yarı sürede yapan bir karta geçişi zorlaştırır. Kiralama bu riski taşımaz.
    3. Yük dalgalı mı sabit mi? Ayda bir hafta yoğun render, üç hafta boş bir stüdyo için kiralama açık ara mantıklıdır. Kesintisiz inference servisi veren bir SaaS için sabit yük, satın almayı savunulabilir kılar.

    Pratik özet: deneme, prototip, dönemsel render ve model kıyaslama işleri için kiralama; 7/24 sabit yükte çalışan, donanımı en az üç yıl aynı kalacak üretim servisleri için satın alma. Satın alma yolunu seçerseniz kartın nerede duracağı ayrı bir karardır; kendi donanımını veri merkezine koymak isteyenler için colocation ve dedicated sunucu kararını ayrıca ele aldık.

    GPU Sunucu Kiralarken Sorulacak Teknik Sorular#

    Ürün sayfasında yazan "GPU sunucu" ifadesi tek başına hiçbir şey söylemez. Sipariş öncesi netleştirilmesi gereken maddeler:

    • Kart passthrough mu, paylaşımlı mı? Kart doğrudan sanal makineye atanmışsa (PCI passthrough) tüm belleği ve hesaplama gücü sizindir. Paylaşımlı vGPU modelinde bellek bölünür ve komşu yükten etkilenirsiniz.
    • VRAM tam mı yoksa dilim mi? "24 GB kart" ile "24 GB kartın 8 GB dilimi" çok farklı şeylerdir.
    • Sürücü kurulumu kimde? İşletim sistemi kurulu geliyorsa NVIDIA sürücüsü ve CUDA araç takımı önceden yüklü mü, yoksa sizin mi kuracağınız net olsun.
    • Disk tipi ve boyutu. Model dosyaları büyüktür; 70B sınıfı bir modelin nicemlenmiş hâli bile onlarca GB tutar. NVMe disk, model yükleme süresini dakikalardan saniyelere indirir.
    • Sistem RAM'i. Kaba kural: sistem RAM'i toplam VRAM'in en az 1,5 katı olsun. Model diskten belleğe, oradan VRAM'e taşınır; RAM darsa yükleme takılır.
    • Bant genişliği ve trafik limiti. Model indirmeleri ve veri seti aktarımları yüz GB'lara ulaşır.
    • Yeniden kurulum ve anlık görüntü. Deneysel çalışmada sık sık temiz kuruluma dönmek gerekir.

    Sunucuyu Teslim Aldıktan Sonraki İlk Saat#

    Yeni GPU sunucuda ilk yapılacak iş, kartın gerçekten göründüğünü ve beklenen kapasitede olduğunu doğrulamaktır. Sırayla:

    # 1. Kart PCI üzerinde görünüyor mu
    lspci | grep -i nvidia
    
    # 2. Sürücü yüklü mü, kart hangi güç modunda
    nvidia-smi
    
    # 3. CUDA araç takımı sürümü
    nvcc --version
    
    # 4. Uygulama katmanı kartı görüyor mu (PyTorch örneği)
    python3 -c "import torch; print(torch.cuda.is_available(), torch.cuda.get_device_name(0), round(torch.cuda.get_device_properties(0).total_memory/1024**3,1))"
    

    Beklenen çıktı, kart adını ve VRAM miktarını içermelidir. torch.cuda.is_available() False dönüyorsa sırasıyla şunlara bakın: sürücü sürümü ile CUDA sürümü uyumu, nvidia-smi çıktısının hata verip vermediği, konteyner kullanıyorsanız NVIDIA konteyner araç takımının kurulu olup olmadığı.

    Ardından temel sertleştirme ve izleme adımlarını atlamayın: SSH anahtar tabanlı girişe geçin, güvenlik duvarını yalnızca gerekli portlara açın ve kartın sıcaklık/kullanım grafiğini izlemeye alın. Kaynak izlemeyi Netdata ile sunucu izleme yazısındaki kurulumla dakikalar içinde ayağa kaldırabilir, birden fazla GPU sunucusu yönetiyorsanız kurulum adımlarını Ansible ile sunucu otomasyonu yaklaşımıyla tekrarlanabilir hâle getirebilirsiniz. Model servislerini konteyner içinde çalıştırmak, sürücü-kütüphane çakışmalarını büyük ölçüde ortadan kaldırır; başlangıç için Docker temelleri yeterlidir.

    Son olarak sıcaklık ve güç limitini gözleyin. Uzun eğitim işlerinde kart ısı yüzünden hız düşürüyorsa (thermal throttling) beklediğiniz sürenin iki katını harcarsınız:

    watch -n 2 nvidia-smi --query-gpu=utilization.gpu,temperature.gpu,power.draw,clocks.sm --format=csv
    

    Sıkça Sorulan Sorular#

    Yapay zeka modeli için kaç GB VRAM gerekir#

    Gereken VRAM, model parametre sayısı ile parametre başına baytın çarpımına yaklaşık %20 pay eklenerek bulunur. 4-bit nicemlenmiş 7 milyar parametreli bir model yaklaşık 4 GB ağırlık belleği ister, bağlam ve çalışma payıyla birlikte 8 GB'lık bir kartta çalışır. Aynı model FP16 yüklenirse ihtiyaç 14 GB'a çıkar ve rahat çalışması için 24 GB'lık kart gerekir. Bu yüzden kart seçmeden önce modeli hangi hassasiyette çalıştıracağınıza karar vermelisiniz; nicemleme kararı VRAM ihtiyacını üçte bire kadar düşürür.

    GPU sunucu kiralamak mı kart satın almak mı daha ucuz#

    Cevap kullanım oranınıza bağlıdır ve başabaş hesabıyla bulunur: sahiplenme maliyetini, aylık kiralama ile aylık işletme gideri arasındaki farka bölün. Günde birkaç saat çalışacak, dönemsel ve dalgalı iş yüklerinde kiralama neredeyse her zaman öndedir çünkü boşta duran donanımın maliyeti durmaz. Kesintisiz çalışan, en az iki-üç yıl aynı donanımla devam edecek üretim servislerinde satın alma tarafı güçlenir. Hesaba elektrik, soğutma, barındırma ve arıza riskini eklemeyi unutmayın; bunlar çıkarıldığında satın almanın görünen avantajı çoğu senaryoda küçülür.

    Oyun ekran kartıyla profesyonel kart arasındaki fark nedir#

    Temel farklar ECC bellek desteği, sürücü destek süresi, fiziksel tasarım ve sanallaştırma uyumudur. Profesyonel kartlar bellek hatalarını düzelten ECC belleğe sahiptir ve günlerce süren eğitim işlerinde bu, sessiz veri bozulmasını önler. Fiziksel olarak tek slot ve sunucu hava akışına uygun soğutmayla üretilirler; tüketici kartları yoğun kasalarda ısınıp hız düşürür. Buna karşılık tüketici kartları benzer bütçede daha yüksek ham hız sunar, dolayısıyla kısa süreli render ve deneme işleri için mantıklıdır.

    Tek kart yetmezse ne yapmalıyım#

    Model tek kartın belleğine sığmıyorsa iki yol vardır: nicemleme seviyesini düşürmek veya modeli birden fazla karta bölmek. İlk yol daha basittir ve çoğu inference senaryosunda kabul edilebilir bir kalite kaybıyla belleği yarıya, hatta dörtte bire indirir. İkinci yolda model katmanları kartlar arasında paylaştırılır, ancak kartlar arası veri aktarımı yeni bir darboğaz yaratır ve hız beklediğiniz kadar artmaz. Üretim ortamında genelde önce nicemleme denenir, yetmezse tek büyük VRAM'li karta geçilir.

    GPU sunucuda hangi işletim sistemi kullanılmalı#

    Ubuntu LTS sürümleri, CUDA ve derin öğrenme kütüphaneleriyle uyumun en iyi test edildiği ortamdır ve pratikte yaygın tercih budur. Sürücü paketleri, konteyner araç takımı ve çoğu proje dokümantasyonu bu dağıtımı varsayar, dolayısıyla sorun yaşadığınızda çözüm bulmanız kolaylaşır. Windows tarafı yalnızca kullanacağınız yazılım Windows'a bağlıysa (bazı render ve video paketleri) anlamlıdır ve genelde biraz daha fazla bellek tüketir. Hangi dağıtımı seçerseniz seçin, sürücü ile CUDA sürümlerinin birbirini desteklediğini kurulum öncesi doğrulayın.

    Render işleri için VRAM mi çekirdek sayısı mı önemli#

    Render işlerinde önce VRAM, sonra çekirdek sayısı önemlidir çünkü sahne belleğe sığmazsa çekirdek sayısının hiçbir anlamı kalmaz. GPU render motorları sahneyi, dokuları ve geometriyi tümüyle kart belleğine yükler; sığmadığında ya işlem iptal olur ya da CPU'ya düşerek defalarca yavaşlar. Sahne belleğe rahatça sığdıktan sonra render süresini belirleyen asıl unsur çekirdek sayısı ve saat hızıdır. Bu yüzden yüksek çözünürlüklü, çok dokulu sahnelerle çalışıyorsanız bütçeyi önce belleğe ayırın.

    Kiraladığım GPU sunucuda kartın tamamı bana mı ait#

    Bu tamamen sağlayıcının sanallaştırma modeline bağlıdır ve sipariş öncesi netleştirilmesi gereken en kritik maddedir. Kart PCI passthrough ile doğrudan sanal makinenize atanmışsa belleğin ve hesaplama gücünün tamamı sizindir, komşu yükten etkilenmezsiniz. Paylaşımlı vGPU modelinde ise kart dilimlenir; ilan edilen bellek, kartın toplam belleği değil size ayrılan dilimdir. Teslim sonrası nvidia-smi çıktısındaki toplam bellek değerini kontrol ederek hangi modelde olduğunuzu kolayca doğrulayabilirsiniz.

    Kapanış#

    GPU sunucu seçimi, kart modeli listesinden birini işaretlemek değil, üç sayıyı sırayla belirlemektir: modelinizin hangi hassasiyette çalışacağı, bunun ne kadar VRAM istediği ve iş yükünüzün ne kadar süre kartı meşgul edeceği. İlk ikisi kart sınıfını, üçüncüsü kiralama ile satın alma arasındaki kararı belirler. Bellek bant genişliğinin LLM hızındaki belirleyici rolünü ve sahne/model belleğe sığmadığında işin yavaşlamayıp tamamen durduğunu akılda tutarsanız, hem gereğinden büyük hem de gereğinden küçük kart alma hatasından kaçınırsınız. Teslim sonrası ilk saatte nvidia-smi ve torch.cuda doğrulamasını yapmak da sonradan çıkacak sürücü sürprizlerinin çoğunu baştan eler.

    Hesabınız yapay zeka, render ya da video işleme için ekran kartlı bir makineyi işaret ediyorsa, kartın doğrudan makinenize atandığı GPU VDS tarafına bakabilirsiniz; iş yükünüz GPU gerektirmiyor ama daha fazla CPU ve RAM istiyorsa doğru adres sanal sunucu paketleridir. Donanımın tamamının size ayrılmasını, kendi kart ve disk yapılandırmanızı kurmayı istiyorsanız dedicated sunucu tarafı bu esnekliği verir. Sürücü kurulumu, izleme, yedekleme ve güvenlik sertleştirmesiyle uğraşmak istemiyorsanız sunucu yönetimi hizmeti bu yükü devralır ve siz yalnızca modelinizle ilgilenirsiniz.

    gpuyapay zekakiralama

    Uygulamaya geçmeye hazır mısınız?

    NVMe SSD, ücretsiz SSL ve %99.9 uptime garantisiyle Clou.TR hosting ve sunucu çözümleriyle projenizi hayata geçirin.