LLM Eğitimi için GPU Küme Tasarımı: Kaç GPU, Hangi Mimaride?
LLM eğitimi için kaç GPU gerekli? Model boyutuna göre GPU sayısı hesaplama, H100 vs A100 karşılaştırması ve 8×H100 örnek yapılandırma.
Llama-3 70B modelini tek bir NVIDIA A100 GPU’da eğitmeye kalksanız, iyimser bir hesapla yaklaşık 300 yıl sürer. Doğru tasarlanmış bir LLM eğitimi GPU cluster‘ı ile ise aynı model birkaç haftada eğitilebilir. Aradaki fark, paralelleştirme stratejisinde ve onu mümkün kılan donanım altyapısında yatıyor.
Türkiye’de yapay zeka araştırmaları hızla büyüyor. TÜBİTAK BİLGEM, üniversite AI laboratuvarları ve özel sektör girişimleri, kendi büyük dil modeli eğitim altyapısını kurma arayışında. Bu rehberde, LLM eğitimi için gereken GPU kümesinin nasıl boyutlandırılacağını, hangi donanım kararlarının kritik olduğunu ve somut bir maliyet-performans çerçevesi sunuyoruz.
LLM Eğitimi İçin GPU Gereksinimleri Nasıl Hesaplanır?
Bir modeli eğitmek için gereken minimum GPU belleği, şu formülle kabaca hesaplanır:
GPU Bellek İhtiyacı = (Model Parametresi × Hassasiyet Baytı) + Optimizer Durumu + Aktivasyon Belleği
Hassasiyet senaryolarına göre bellek ihtiyacı:
| Hassasiyet | Parametre Başına Bayt | Optimizer Çarpanı | 7B Model | 13B Model | 70B Model |
|---|---|---|---|---|---|
| FP32 (tam) | 4 bayt | 3× | 112 GB | 208 GB | 1.120 GB |
| FP16 / BF16 | 2 bayt | 2× | 56 GB | 104 GB | 560 GB |
| INT8 (kuvantize) | 1 bayt | 1,5× | 38,5 GB | 71,5 GB | 385 GB |
| INT4 (kuvantize) | 0,5 bayt | 1,5× | 28 GB | 52 GB | 280 GB |
Pratikte FP16/BF16 karma hassasiyet (mixed precision) eğitimi en yaygın kullanılan yöntemdir. Bu durumda bir 70B model, en az 560 GB toplam GPU belleği gerektirir — ki bu da en az 7 adet 80 GB H100 veya A100 demektir.
GPU bellek yönetimi hakkında daha fazla teknik detay için GPU Bellek Mimarisi yazımıza göz atabilirsiniz.
Model Boyutuna Göre GPU Sayısı ve Tipi
Her model boyutu için önerilen GPU konfigürasyonu, eğitim süresi ve maliyet dengesi gözetilerek belirlenir:
| Model Boyutu | Minimum GPU | Önerilen GPU | GPU Sayısı | Tahmini Eğitim Süresi* | Tahmini Maliyet (Kiralama/Aylık) |
|---|---|---|---|---|---|
| 1-3B (Mistral, Phi) | 1× A100 40GB | 4× A100 40GB | 4 | 1-3 gün | ~8.000 $ |
| 7-8B (Llama-3 8B) | 2× A100 80GB | 4× A100 80GB | 4 | 3-7 gün | ~12.000 $ |
| 13B (Llama-2 13B) | 4× A100 80GB | 8× A100 80GB | 8 | 7-14 gün | ~22.000 $ |
| 70B (Llama-3 70B) | 8× H100 80GB | 16× H100 80GB | 16 | 14-30 gün | ~45.000 $ |
| 405B (Llama-3 405B) | 64× H100 80GB | 128× H100 80GB | 128 | 30-60 gün | ~350.000 $ |
* 1 trilyon token üzerinde, FP16/BF16 karma hassasiyet ile. Süreler optimizasyon seviyesine göre değişir.
H100 vs A100 vs B200 — LLM eğitimi için hangisi?
| A100 80GB | H100 80GB | B200 (2026) | |
|---|---|---|---|
| Bellek Bant Genişliği | 2,0 TB/s | 3,35 TB/s | 8,0 TB/s |
| FP8 Desteği | Yok | Var (Transformer Engine) | Var (gelişmiş) |
| NVLink Bant Genişliği | 600 GB/s | 900 GB/s | 1.800 GB/s |
| LLM Eğitim Hızı (göreceli) | 1× | 2-3× | 4-6× |
| Göreceli Maliyet | 1× | ~1,5× | ~2,5-3× |
LLM eğitimi için H100, FP8 Transformer Engine sayesinde A100’e göre 2-3 kat hız avantajı sağlar. B200 ise henüz yaygınlaşmamış olsa da 2026 sonu itibarıyla büyük projelerde tercih edilmeye başlanacaktır. GPU karşılaştırmaları hakkında kapsamlı rehberimiz için GPU Seçim Rehberi yazımızı inceleyebilirsiniz.
NVLink ve InfiniBand: GPU’lar Arası İletişim
LLM eğitiminde GPU’lar sürekli olarak gradyanları senkronize eder (all-reduce operasyonu). Bu iletişim yavaşsa, 16 GPU’lu bir sistem bile 4 GPU’lu bir sistemden daha yavaş eğitim yapabilir.
İki seviyeli iletişim mimarisi:
| Seviye | Teknoloji | Bant Genişliği (GPU başına) | Kullanım |
|---|---|---|---|
| Node İçi (GPU-GPU) | NVLink 4.0 + NVSwitch | 900 GB/s çift yönlü | 8 GPU’ya kadar tek node içi iletişim |
| Node’lar Arası | InfiniBand NDR 400 | 400 Gb/s | Çok node’lu eğitimde node’lar arası gradyan senkronizasyonu |
Kritik eşik: 8 GPU ve altı eğitimlerde tek bir DGX veya HGX sunucu yeterlidir; tüm GPU’lar NVSwitch üzerinden konuşur, InfiniBand gerekmez. 8 GPU’yu aştığınızda node’lar arası iletişim başlar ve InfiniBand zorunlu hale gelir.
Örnek: 16×H100 ile 70B model eğitimi yapıyorsanız, iki adet 8 GPU’lu node’u InfiniBand NDR ile bağlamanız gerekir. Bu bağlantının bant genişliği, eğitim verimliliğini doğrudan etkiler. InfiniBand altyapısı hakkında detaylı bilgi için InfiniBand Çözümlerimiz sayfasına göz atabilirsiniz.
Depolama Altyapısı: Veri Seti ve Checkpoint Yönetimi
LLM eğitiminde depolama genellikle ihmal edilen ama kritik bir bileşendir. Eğer HPC Cluster Bileşenleri yazımızı okuduysanız, depolama katmanının cluster performansındaki rolünü biliyorsunuzdur. LLM özelinde durum daha da hassastır:
Veri seti boyutları: 1 trilyon token’lık bir eğitim veri seti, ham metin olarak yaklaşık 3-5 TB, tokenize edilmiş halde 1-2 TB yer kaplar. Bu verinin eğitim sırasında GPU’lara sürekli ve hızlı biçimde beslenmesi gerekir.
Checkpoint yönetimi: Bir 70B modelin tek bir checkpoint’i FP16 formatında yaklaşık 140 GB’tır. Optimizer durumuyla birlikte bu rakam 280 GB’a çıkar. Eğitim sırasında her 1.000-5.000 adımda bir checkpoint alınması önerilir — bu da günde 1-5 TB depolama yazımı demektir.
| Depolama Gereksinimi | Minimum | Önerilen |
|---|---|---|
| Veri Seti Depolama | NVMe (yerel) — 5-10 TB | Paylaşımlı NVMe — 20-50 TB |
| Checkpoint Depolama | NVMe (yerel) — 10-20 TB | BeeGFS paylaşımlı — 50-100 TB |
| Arşiv / Model Deposu | HDD — 50-100 TB | Tier’li depolama (NVMe + HDD) |
Yüksek performanslı paylaşımlı depolama için HPC Depolama Çözümlerimiz sayfasını inceleyebilirsiniz.
Örnek Yapılandırma: 8×H100 Küme ile Llama-3 Tarzı Model Eğitimi
70B parametre seviyesinde bir modeli (Llama-3 70B benzeri) eğitmek için referans yapılandırma:
| Bileşen | Özellik | Adet | Amaç |
|---|---|---|---|
| GPU Sunucu | NVIDIA DGX H100 veya 8×H100 SXM (80 GB) | 1 | Ana eğitim donanımı |
| NVSwitch | DGX içinde entegre | 1 | 8 GPU arası 900 GB/s iletişim |
| Head/Login Node | Çift soket Xeon, 256 GB RAM | 1 | İş yönetimi, kullanıcı girişi |
| Yönetim Ağı | 25 GbE | 1 anahtar | Monitoring, dış erişim |
| Eğitim Depolama | NVMe RAID — 30 TB kullanılabilir | 1 sistem | Veri seti ve checkpoint |
| İş Zamanlayıcı | SLURM | 1 | GPU kaynak yönetimi, iş kuyruğu |
Yazılım Yığını:
- PyTorch 2.x + Fully Sharded Data Parallel (FSDP) veya DeepSpeed ZeRO-3
- CUDA 12.x + cuDNN
- NVIDIA NeMo veya Hugging Face Transformers (framework seviyesi)
Tahmini eğitim süresi: 1 trilyon token üzerinde, FP16/BF16 karma hassasiyet ile yaklaşık 14-21 gün.
Tahmini maliyet:
- Satın alma: 350.000 – 450.000 USD (DGX H100 + depolama + ağ)
- Kiralama: Aylık 18.000 – 25.000 USD (kullanım süresine bağlı)
Bu konfigürasyon, Üniversiteler için HPC yazımızda ele aldığımız akademik araştırma altyapısının GPU bileşeni olarak da değerlendirilebilir.
Mevasis ile Sonraki Adım
Mevasis olarak, ister konsept kanıtlama (PoC) aşamasında olun ister üretim ölçeğinde bir eğitim kümesi kurmayı planlayın — GPU küme tasarımı sürecinin her aşamasında teknik ortak olarak yanınızdayız:
- GPU cluster kurulum: NVIDIA DGX, HGX veya özel yapılandırma — ihtiyacınıza uygun çözüm. Detaylar için GPU Cluster Çözümleri sayfamızı inceleyin.
- GPU kiralama: Büyük sermaye yatırımı yapmadan H100 ve A100 GPU’lara erişim. HPC Kiralama sayfamızda esnek kiralama modellerimizi bulabilirsiniz.
- Danışmanlık ve mimari tasarım: Model boyutunuza ve bütçenize uygun, ölçeklenebilir altyapı planlaması.
LLM eğitim altyapınız için bizimle iletişime geçin — birlikte en verimli çözümü tasarlayalım.
Sıkça Sorulan Sorular
8×H100’lük bir sistem ne kadara mal olur?
DGX H100 (8×H100 SXM, 80 GB) donanım maliyeti yaklaşık 300.000-350.000 USD’dir. Depolama, ağ ve kurulum ile birlikte toplam yatırım 400.000-500.000 USD aralığında olur. Kiralama modelinde aylık 18.000-25.000 USD seviyesinde erişim mümkündür.
Kiralama ile başlayıp sonra satın alabilir miyiz?
Evet. Birçok kurum, PoC aşamasında kiralama ile başlayıp iş yükü doğrulandıktan sonra satın almaya geçmektedir. Hatta kiralama süresince ödenen bedelin bir kısmı satın alma fiyatından düşülebilir. Detaylar için HPC Kiralama sayfamıza bakabilirsiniz.
Fine-tuning için de aynı altyapı gerekir mi?
Hayır. Fine-tuning (ince ayar), tam eğitime (pre-training) kıyasla çok daha az kaynak gerektirir. Örneğin bir 70B modelin LoRA/QLoRA ile fine-tuning’i, 1-2 adet A100 80GB GPU ile yapılabilir. Tam eğitim altyapısı yalnızca sıfırdan model eğitimi (pre-training) veya büyük ölçekli continual pre-training için gereklidir.
AMD GPU’lar (MI300X) LLM eğitimi için uygun mu?
AMD MI300X, 192 GB HBM3 bellek ile teorik olarak LLM eğitimi için güçlü bir alternatiftir. Ancak yazılım ekosistemi (ROCm, PyTorch desteği) NVIDIA CUDA kadar olgun değildir. 2026 itibarıyla AMD, Llama ve benzeri modellerde giderek daha rekabetçi hale gelmektedir. Kurumsal projelerde NVIDIA, kanıtlanmış ekosistemi nedeniyle hâlâ ilk tercihtir.