HPC Cluster Bileşenleri: Node, Ağ ve Depolama Mimarisi

HPC cluster bileşenleri rehberi: Head node, compute node, InfiniBand ağ ve paralel depolamanın görevleri. Her bileşenin rolünü örneklerle öğrenin.

· 6 dk okuma
HPC Cluster Bileşenleri: Node, Ağ ve Depolama Mimarisi

Bir HPC cluster‘ına dışarıdan bakınca “bir sürü sunucunun bir araya getirildiği büyük bir bilgisayar” gibi görünür. Bu kısmen doğru, ama işin özü çok daha hassas. Her bileşenin özel bir görevi vardır ve bu bileşenlerin birbirleriyle nasıl konuştuğu, cluster’ın performansını doğrudan belirler.

İster 8 node’luk bir laboratuvar sistemi, ister 1000+ node’luk bir ulusal süperbilgisayar olsun — tüm yüksek başarımlı hesaplama sistemi’ler aynı temel yapı taşlarından oluşur. Bu yazıda, bir HPC cluster’ını oluşturan her bileşeni tek tek inceleyecek, ne iş yaptığını ve neden gerekli olduğunu somut örneklerle açıklayacağız.

Daha önce HPC Nedir? yazımızda temel kavramları ve HPC Cluster Mimarisi yazımızda tasarım prensiplerini ele almıştık. Bu yazı ise tamamen bileşen odaklı: her donanım parçasının fiziksel olarak ne olduğu ve cluster içindeki rolü.

Head Node (Yönetim Düğümü): Cluster’ın Beyni

Head node, cluster’ın komuta merkezidir. Kullanıcılar doğrudan bu node’a bağlanmaz; bu node, sistemi yöneten servisleri çalıştırır.

Head node’un başlıca görevleri:

GörevAçıklama
İş Zamanlama (SLURM slurmctld)Tüm işleri kuyruğa alır, kaynakları tahsis eder, öncelikleri yönetir
Kullanıcı Yönetimi (LDAP/NIS)Kullanıcı hesaplarını, grupları ve erişim yetkilerini yönetir
Monitoring (Prometheus/Grafana)Tüm node’ların CPU, bellek, sıcaklık ve ağ kullanımını izler
Yapılandırma Yönetimi (Ansible/xCAT)Tüm compute node’lara işletim sistemi imajı ve yazılım dağıtımı yapar
Muhasebe (SLURM slurmdbd)İş geçmişini, kaynak kullanım istatistiklerini ve faturalandırma verisini saklar

Head node donanımı, compute node’lar kadar güçlü olmak zorunda değildir; ancak yüksek erişilebilirlik kritiktir. Çoğu orta ve büyük ölçekli cluster’da iki head node (aktif-yedek) kullanılır. İş zamanlayıcılar hakkında daha fazla bilgi için İş Zamanlayıcı Nedir? yazımıza göz atabilirsiniz.

Login Node (Giriş Düğümü): Kullanıcıların Kapısı

Login node, kullanıcıların cluster’a bağlandığı noktadır. SSH ile bağlandığınız, kodlarınızı derlediğiniz, iş script’lerinizi hazırladığınız ve sbatch ile iş gönderdiğiniz yer burasıdır.

Login node ile head node neden ayrıdır?

Head node’da çalışan kritik servislerin (slurmctld, veritabanı) kullanıcı hatalarından etkilenmemesi için login node’lar ayrı tutulur. Bir kullanıcı yanlışlıkla login node’da belleği şişiren bir derleme yaparsa, bu sadece o login node’u etkiler — cluster’ın yönetim servisleri etkilenmez.

Büyük cluster’larda birden fazla login node bulunur ve kullanıcılar round-robin DNS veya load balancer üzerinden yönlendirilir. Bu sayede 50 kullanıcı aynı anda sisteme bağlıyken bile giriş deneyimi hızlı kalır.

Compute Node (Hesaplama Düğümü): İşin Yapıldığı Yer

Compute node’lar, cluster’ın asıl iş gücüdür. Simülasyonların çalıştığı, modellerin eğitildiği, verilerin işlendiği yer burasıdır. Compute node’lar iki ana kategoriye ayrılır:

CPU Compute Node

  • Çift soket işlemci (AMD EPYC veya Intel Xeon), 64-192 çekirdek
  • Çekirdek başına 2-4 GB RAM (toplam 256-768 GB)
  • Tipik kullanım: CFD, FEA, kuantum kimyası, hava durumu modelleme
  • Detaylı bilgi: CPU Cluster Çözümleri

GPU Compute Node

  • 4-8 adet NVIDIA H100/A100 GPU
  • GPU başına 80 GB HBM2e/HBM3 bellek
  • NVLink ile GPU’lar arası doğrudan iletişim
  • Tipik kullanım: Derin öğrenme, moleküler dinamik, elektromanyetik simülasyon
  • Detaylı bilgi: GPU Cluster Çözümleri
ÖzellikCPU Compute NodeGPU Compute Node
Paralel İş Birimi64-192 CPU çekirdeği4-8 GPU (her biri binlerce CUDA çekirdeği)
Bellek256-768 GB sistem RAM320-640 GB GPU belleği (HBM)
Bellek Bant Genişliği200-400 GB/s2-3,35 TB/s (GPU başına)
İdeal İş YüküÇok çekirdekli simülasyonlarYüksek paralellik gerektiren işlemler

Interconnect (Ağ Altyapısı): Node’ları Birbirine Bağlayan Otoyol

HPC cluster mimarisi içinde en kritik ama en az görünen bileşen ağ altyapısıdır. Compute node’lar bir problemi birlikte çözerken sürekli haberleşir. Bu haberleşme yavaşsa, 1000 node’luk bir cluster bile tek bir iş istasyonundan daha yavaş çalışabilir.

İki temel ağ teknolojisi:

InfiniBandEthernet
Gecikme (Latency)< 1 µs5-50 µs
Bant Genişliği200-400 Gb/s (HDR/NDR)100-400 Gb/s
MaliyetYüksekDüşük-Orta
Kullanım AlanıHesaplama trafiği (MPI)Yönetim, depolama, dış erişim

Neden iki ağ?

HPC cluster’larında genellikle iki ayrı ağ bulunur:

  • Hesaplama ağı (InfiniBand): Node’lar arası MPI trafiği, düşük gecikme kritik
  • Yönetim ağı (Ethernet): IPMI uzaktan yönetim, monitoring, kullanıcı girişi

InfiniBand teknolojisi hakkında derinlemesine bilgi için InfiniBand ve HPC Ağ yazımıza ve InfiniBand Çözümlerimiz sayfasına göz atabilirsiniz.

Depolama Katmanı: Veri Nerede Durur?

Bir HPC cluster’ında depolama, “büyük bir NAS alalım, yeterli” yaklaşımıyla çözülemez. Farklı türdeki veriler, farklı performans profillerine ihtiyaç duyar.

Tier’li depolama mimarisi:

TierTeknolojiKapasite (Örnek)HızKullanım
Tier 0 — ScratchNVMe (yerel veya paylaşımlı)50-200 TB10-50 GB/sAktif simülasyon geçici dosyaları
Tier 1 — Paralel FSBeeGFS / Lustre200 TB - 2 PB5-20 GB/sProje verileri, sık erişilen sonuçlar
Tier 2 — HomeNFS50-200 TB500 MB - 2 GB/sKullanıcı home dizinleri, kod, script
Tier 3 — ArşivHDD + Tape1-10 PB100-500 MB/sTamamlanmış proje arşivi, yedek

Paralel dosya sistemleri (BeeGFS, Lustre), veriyi birden fazla depolama sunucusuna dağıtarak aynı anda yüzlerce node’un yüksek hızda okuma/yazma yapmasını sağlar. Normal bir NFS sunucusu, 100 node aynı anda okuma yaptığında darboğaz olurken, paralel dosya sistemleri bu senaryo için tasarlanmıştır. Paralel Dosya Sistemleri yazımızda bu konuyu detaylıca ele aldık. Ayrıca HPC Depolama Çözümlerimiz sayfasını da inceleyebilirsiniz. LLM eğitimi gibi yoğun I/O gerektiren iş yüklerinde depolama katmanının nasıl yapılandırılacağını LLM Eğitimi için GPU Küme Tasarımı yazımızda ele alıyoruz.

Üç Ölçekte Cluster: Küçük, Orta ve Büyük

Tüm bu bileşenlerin bir araya gelişi, cluster’ın ölçeğine göre değişir. İşte üç tipik ölçek:

Küçük (Laboratuvar)Orta (Bölümsel)Büyük (Kurumsal/Ulusal)
Compute Node4-816-64128-1000+
GPU Node0-12-816-128+
Head Node12 (aktif-yedek)2+ (aktif-yedek)
Login NodeHead node ile birleşik1-24-8 (load balanced)
Interconnect25-100 GbEInfiniBand HDRInfiniBand NDR / 400 GbE
DepolamaNFS (20-50 TB)BeeGFS/Lustre (200 TB+)BeeGFS/Lustre (2 PB+)
Tahmini Bütçe50-150 bin $400-900 bin $2-15 milyon $+
Tipik Kullanıcı5-15 araştırmacı50-200 araştırmacı500-5000+ araştırmacı

Orta ve büyük ölçekli cluster’ların üniversitelerde nasıl yapılandırıldığını Üniversiteler için HPC Altyapı Rehberi yazımızda gerçek bir senaryo üzerinden inceledik.

Mevasis ile Sonraki Adım

İster küçük bir laboratuvar cluster’ı, ister büyük ölçekli bir kurumsal sistem kurmayı planlıyor olun — doğru bileşen seçimi, cluster’ınızın yıllarca verimli çalışmasını sağlar. Mevasis olarak HPC Danışmanlık hizmetimizle ihtiyaç analizinden bileşen seçimine, anahtar teslim kurulumdan operasyon desteğine kadar tüm süreçte yanınızdayız.

İlk adım olarak iş yüklerinizi birlikte analiz edelim, size özel bir mimari önerisi hazırlayalım. Bizimle iletişime geçin. Tüm HPC çözümlerimizi Çözümler sayfamızdan inceleyebilirsiniz.


Sıkça Sorulan Sorular

Küçük bir cluster için minimum bileşenler nelerdir?

Minimum yapılandırma: 1 head/login node (birleşik), 4-8 compute node, 1 yönetim anahtarı (25 GbE) ve paylaşımlı NFS depolama. Bu yapılandırma küçük araştırma grupları için yeterlidir. InfiniBand, bu ölçekte genellikle gerekli değildir; hesaplama trafiği için de Ethernet kullanılabilir.

Mevcut sunucularımızı cluster’a çevirebilir miyiz?

Evet, homojen donanım kullanılması koşuluyla mümkündür. Farklı işlemci nesilleri veya farklı RAM miktarları olan node’lar, iş zamanlayıcının kaynak tahsisini zorlaştırır. Mevcut sunucular değerlendirilirken bu homojenlik kontrol edilmelidir. Ayrıca tüm node’larda aynı işletim sistemi ve yazılım yığını bulunmalıdır.

InfiniBand her cluster için şart mı?

Hayır. 16 node ve altındaki cluster’larda, iş yükleri yoğun MPI haberleşmesi gerektirmiyorsa (örneğin bağımsız parametre taramaları), 25-100 GbE yeterli olabilir. Ancak 32+ node’lu cluster’larda ve CFD, FEA gibi node’lar arası sürekli haberleşen iş yüklerinde InfiniBand kritik öneme sahiptir.

Depolama için normal bir NAS yeterli mi?

Küçük cluster’larda (8 node ve altı) başlangıç için yeterli olabilir. Ancak 16+ node’un aynı anda okuma/yazma yaptığı senaryolarda NFS/NAS darboğaz haline gelir. Bu ölçekte BeeGFS veya Lustre gibi paralel dosya sistemleri, performansı 10-50 kat artırabilir.