LLM Eğitimi için GPU Küme Tasarımı: Kaç GPU, Hangi Mimaride?

LLM eğitimi için kaç GPU gerekli? Model boyutuna göre GPU sayısı hesaplama, H100 vs A100 karşılaştırması ve 8×H100 örnek yapılandırma.

· 6 dk okuma
LLM Eğitimi için GPU Küme Tasarımı: Kaç GPU, Hangi Mimaride?

Llama-3 70B modelini tek bir NVIDIA A100 GPU’da eğitmeye kalksanız, iyimser bir hesapla yaklaşık 300 yıl sürer. Doğru tasarlanmış bir LLM eğitimi GPU cluster‘ı ile ise aynı model birkaç haftada eğitilebilir. Aradaki fark, paralelleştirme stratejisinde ve onu mümkün kılan donanım altyapısında yatıyor.

Türkiye’de yapay zeka araştırmaları hızla büyüyor. TÜBİTAK BİLGEM, üniversite AI laboratuvarları ve özel sektör girişimleri, kendi büyük dil modeli eğitim altyapısını kurma arayışında. Bu rehberde, LLM eğitimi için gereken GPU kümesinin nasıl boyutlandırılacağını, hangi donanım kararlarının kritik olduğunu ve somut bir maliyet-performans çerçevesi sunuyoruz.

LLM Eğitimi İçin GPU Gereksinimleri Nasıl Hesaplanır?

Bir modeli eğitmek için gereken minimum GPU belleği, şu formülle kabaca hesaplanır:

GPU Bellek İhtiyacı = (Model Parametresi × Hassasiyet Baytı) + Optimizer Durumu + Aktivasyon Belleği

Hassasiyet senaryolarına göre bellek ihtiyacı:

HassasiyetParametre Başına BaytOptimizer Çarpanı7B Model13B Model70B Model
FP32 (tam)4 bayt112 GB208 GB1.120 GB
FP16 / BF162 bayt56 GB104 GB560 GB
INT8 (kuvantize)1 bayt1,5×38,5 GB71,5 GB385 GB
INT4 (kuvantize)0,5 bayt1,5×28 GB52 GB280 GB

Pratikte FP16/BF16 karma hassasiyet (mixed precision) eğitimi en yaygın kullanılan yöntemdir. Bu durumda bir 70B model, en az 560 GB toplam GPU belleği gerektirir — ki bu da en az 7 adet 80 GB H100 veya A100 demektir.

GPU bellek yönetimi hakkında daha fazla teknik detay için GPU Bellek Mimarisi yazımıza göz atabilirsiniz.

Model Boyutuna Göre GPU Sayısı ve Tipi

Her model boyutu için önerilen GPU konfigürasyonu, eğitim süresi ve maliyet dengesi gözetilerek belirlenir:

Model BoyutuMinimum GPUÖnerilen GPUGPU SayısıTahmini Eğitim Süresi*Tahmini Maliyet (Kiralama/Aylık)
1-3B (Mistral, Phi)1× A100 40GB4× A100 40GB41-3 gün~8.000 $
7-8B (Llama-3 8B)2× A100 80GB4× A100 80GB43-7 gün~12.000 $
13B (Llama-2 13B)4× A100 80GB8× A100 80GB87-14 gün~22.000 $
70B (Llama-3 70B)8× H100 80GB16× H100 80GB1614-30 gün~45.000 $
405B (Llama-3 405B)64× H100 80GB128× H100 80GB12830-60 gün~350.000 $

* 1 trilyon token üzerinde, FP16/BF16 karma hassasiyet ile. Süreler optimizasyon seviyesine göre değişir.

H100 vs A100 vs B200 — LLM eğitimi için hangisi?

A100 80GBH100 80GBB200 (2026)
Bellek Bant Genişliği2,0 TB/s3,35 TB/s8,0 TB/s
FP8 DesteğiYokVar (Transformer Engine)Var (gelişmiş)
NVLink Bant Genişliği600 GB/s900 GB/s1.800 GB/s
LLM Eğitim Hızı (göreceli)2-3×4-6×
Göreceli Maliyet~1,5×~2,5-3×

LLM eğitimi için H100, FP8 Transformer Engine sayesinde A100’e göre 2-3 kat hız avantajı sağlar. B200 ise henüz yaygınlaşmamış olsa da 2026 sonu itibarıyla büyük projelerde tercih edilmeye başlanacaktır. GPU karşılaştırmaları hakkında kapsamlı rehberimiz için GPU Seçim Rehberi yazımızı inceleyebilirsiniz.

LLM eğitiminde GPU’lar sürekli olarak gradyanları senkronize eder (all-reduce operasyonu). Bu iletişim yavaşsa, 16 GPU’lu bir sistem bile 4 GPU’lu bir sistemden daha yavaş eğitim yapabilir.

İki seviyeli iletişim mimarisi:

SeviyeTeknolojiBant Genişliği (GPU başına)Kullanım
Node İçi (GPU-GPU)NVLink 4.0 + NVSwitch900 GB/s çift yönlü8 GPU’ya kadar tek node içi iletişim
Node’lar ArasıInfiniBand NDR 400400 Gb/sÇok node’lu eğitimde node’lar arası gradyan senkronizasyonu

Kritik eşik: 8 GPU ve altı eğitimlerde tek bir DGX veya HGX sunucu yeterlidir; tüm GPU’lar NVSwitch üzerinden konuşur, InfiniBand gerekmez. 8 GPU’yu aştığınızda node’lar arası iletişim başlar ve InfiniBand zorunlu hale gelir.

Örnek: 16×H100 ile 70B model eğitimi yapıyorsanız, iki adet 8 GPU’lu node’u InfiniBand NDR ile bağlamanız gerekir. Bu bağlantının bant genişliği, eğitim verimliliğini doğrudan etkiler. InfiniBand altyapısı hakkında detaylı bilgi için InfiniBand Çözümlerimiz sayfasına göz atabilirsiniz.

Depolama Altyapısı: Veri Seti ve Checkpoint Yönetimi

LLM eğitiminde depolama genellikle ihmal edilen ama kritik bir bileşendir. Eğer HPC Cluster Bileşenleri yazımızı okuduysanız, depolama katmanının cluster performansındaki rolünü biliyorsunuzdur. LLM özelinde durum daha da hassastır:

Veri seti boyutları: 1 trilyon token’lık bir eğitim veri seti, ham metin olarak yaklaşık 3-5 TB, tokenize edilmiş halde 1-2 TB yer kaplar. Bu verinin eğitim sırasında GPU’lara sürekli ve hızlı biçimde beslenmesi gerekir.

Checkpoint yönetimi: Bir 70B modelin tek bir checkpoint’i FP16 formatında yaklaşık 140 GB’tır. Optimizer durumuyla birlikte bu rakam 280 GB’a çıkar. Eğitim sırasında her 1.000-5.000 adımda bir checkpoint alınması önerilir — bu da günde 1-5 TB depolama yazımı demektir.

Depolama GereksinimiMinimumÖnerilen
Veri Seti DepolamaNVMe (yerel) — 5-10 TBPaylaşımlı NVMe — 20-50 TB
Checkpoint DepolamaNVMe (yerel) — 10-20 TBBeeGFS paylaşımlı — 50-100 TB
Arşiv / Model DeposuHDD — 50-100 TBTier’li depolama (NVMe + HDD)

Yüksek performanslı paylaşımlı depolama için HPC Depolama Çözümlerimiz sayfasını inceleyebilirsiniz.

Örnek Yapılandırma: 8×H100 Küme ile Llama-3 Tarzı Model Eğitimi

70B parametre seviyesinde bir modeli (Llama-3 70B benzeri) eğitmek için referans yapılandırma:

BileşenÖzellikAdetAmaç
GPU SunucuNVIDIA DGX H100 veya 8×H100 SXM (80 GB)1Ana eğitim donanımı
NVSwitchDGX içinde entegre18 GPU arası 900 GB/s iletişim
Head/Login NodeÇift soket Xeon, 256 GB RAM1İş yönetimi, kullanıcı girişi
Yönetim Ağı25 GbE1 anahtarMonitoring, dış erişim
Eğitim DepolamaNVMe RAID — 30 TB kullanılabilir1 sistemVeri seti ve checkpoint
İş ZamanlayıcıSLURM1GPU kaynak yönetimi, iş kuyruğu

Yazılım Yığını:

  • PyTorch 2.x + Fully Sharded Data Parallel (FSDP) veya DeepSpeed ZeRO-3
  • CUDA 12.x + cuDNN
  • NVIDIA NeMo veya Hugging Face Transformers (framework seviyesi)

Tahmini eğitim süresi: 1 trilyon token üzerinde, FP16/BF16 karma hassasiyet ile yaklaşık 14-21 gün.

Tahmini maliyet:

  • Satın alma: 350.000 – 450.000 USD (DGX H100 + depolama + ağ)
  • Kiralama: Aylık 18.000 – 25.000 USD (kullanım süresine bağlı)

Bu konfigürasyon, Üniversiteler için HPC yazımızda ele aldığımız akademik araştırma altyapısının GPU bileşeni olarak da değerlendirilebilir.

Mevasis ile Sonraki Adım

Mevasis olarak, ister konsept kanıtlama (PoC) aşamasında olun ister üretim ölçeğinde bir eğitim kümesi kurmayı planlayın — GPU küme tasarımı sürecinin her aşamasında teknik ortak olarak yanınızdayız:

  • GPU cluster kurulum: NVIDIA DGX, HGX veya özel yapılandırma — ihtiyacınıza uygun çözüm. Detaylar için GPU Cluster Çözümleri sayfamızı inceleyin.
  • GPU kiralama: Büyük sermaye yatırımı yapmadan H100 ve A100 GPU’lara erişim. HPC Kiralama sayfamızda esnek kiralama modellerimizi bulabilirsiniz.
  • Danışmanlık ve mimari tasarım: Model boyutunuza ve bütçenize uygun, ölçeklenebilir altyapı planlaması.

LLM eğitim altyapınız için bizimle iletişime geçin — birlikte en verimli çözümü tasarlayalım.


Sıkça Sorulan Sorular

8×H100’lük bir sistem ne kadara mal olur?

DGX H100 (8×H100 SXM, 80 GB) donanım maliyeti yaklaşık 300.000-350.000 USD’dir. Depolama, ağ ve kurulum ile birlikte toplam yatırım 400.000-500.000 USD aralığında olur. Kiralama modelinde aylık 18.000-25.000 USD seviyesinde erişim mümkündür.

Kiralama ile başlayıp sonra satın alabilir miyiz?

Evet. Birçok kurum, PoC aşamasında kiralama ile başlayıp iş yükü doğrulandıktan sonra satın almaya geçmektedir. Hatta kiralama süresince ödenen bedelin bir kısmı satın alma fiyatından düşülebilir. Detaylar için HPC Kiralama sayfamıza bakabilirsiniz.

Fine-tuning için de aynı altyapı gerekir mi?

Hayır. Fine-tuning (ince ayar), tam eğitime (pre-training) kıyasla çok daha az kaynak gerektirir. Örneğin bir 70B modelin LoRA/QLoRA ile fine-tuning’i, 1-2 adet A100 80GB GPU ile yapılabilir. Tam eğitim altyapısı yalnızca sıfırdan model eğitimi (pre-training) veya büyük ölçekli continual pre-training için gereklidir.

AMD GPU’lar (MI300X) LLM eğitimi için uygun mu?

AMD MI300X, 192 GB HBM3 bellek ile teorik olarak LLM eğitimi için güçlü bir alternatiftir. Ancak yazılım ekosistemi (ROCm, PyTorch desteği) NVIDIA CUDA kadar olgun değildir. 2026 itibarıyla AMD, Llama ve benzeri modellerde giderek daha rekabetçi hale gelmektedir. Kurumsal projelerde NVIDIA, kanıtlanmış ekosistemi nedeniyle hâlâ ilk tercihtir.