NVIDIA veri merkezi ürün ailesini üç ana mimari (Ampere, Hopper, Blackwell) ve bunlara ek olarak iş istasyonu/giriş seviyesi sunucular için tasarlanan Ada Lovelace serisi üzerinden yürütmektedir.

Hopper mimarisinin zirve noktası H200’dür. Hopper sonrasında doğrudan Blackwell mimarisine (B100, B200, GB200 ve en yeni Rubin ailesi) geçiş yapılmıştır.

Hopper Mimarisi (AI & HPC Standartı)

  • NVIDIA H100: Sektörün en yaygın kullanılan yapay zeka ve LLM (Büyük Dil Modelleri) eğitim kartıdır. 80GB HBM3 bellek kapasitesine ve 3.35 TB/s bellek bant genişliğine sahiptir. PCIe (çift slot, 350W-400W) ve SXM5 (700W, özel entegre kart kartuşu) form faktörlerinde bulunur.

  • NVIDIA H200: H100 mimarisinin bellek darboğazını çözmek için üretilen geliştirilmiş versiyondur. 141GB ultra hızlı HBM3e bellek barındırır ve bant genişliğini 4.8 TB/s seviyesine çıkarır. Güç tüketimi H100 ile aynı (700W) kalmasına rağmen, özellikle büyük LLM çıkarım (inference) süreçlerinde 2 kata yakın performans artışı sunar.

  • NVIDIA H100 NVL: İki adet PCIe H100 kartının özel bir NVLink köprüsüyle birbirine bağlanarak tek bir 188GB (94GB + 94GB) NVL havuzu oluşturduğu, LLM çıkarımları için optimize edilmiş özel bir paket modeldir.

Blackwell Mimarisi (Yeni Nesil AI Devrimi)

  • NVIDIA B100 / B200: Çift çipli (dual-chip monolitik olmayan) tasarıma sahip yeni nesil amiral gemileridir. B200, 192GB HBM3e bellek ve 8 TB/s bant genişliği ile çalışır. Tek bir kartın TDP değeri 1000W seviyelerine çıkabilmektedir.

  • NVIDIA GB200 (Grace Blackwell): Bir adet Grace CPU ve iki adet Blackwell GPU’nun tek bir anakart üzerinde (Superchip) birleştirildiği, doğrudan sıvı soğutma (Liquid Cooling) gerektiren üst seviye altyapı modelidir.

Ada Lovelace & Ampere Serisi (Enterprise & Esnek İş Yükleri)

  • NVIDIA L40S / L4: Ada Lovelace tabanlı bu kartlar, GDDR6 belleğe sahiptir ve maliyet/performans odaklıdır. L40S (48GB) özellikle küçük ölçekli LLM ince ayarları (Fine-Tuning) ve Omniverse iş yükleri için idealdir. L4 ise sadece 72W güç tüketen, tek slot düşük profilli (Low-Profile) evrensel bir çıkarım ve video işleme kartıdır.

  • NVIDIA A100 / A30 / A2: Ampere mimarisinin olgunlaşmış altyapısıdır. Üretim ortamlarında hala yaygın olarak vGPU cluster’larında görev yapmaktadır.

Resim-1

VMware ortamında fiziksel bir GPU’yu sanal makinelere (VM) atamak için iki temel operasyonel yöntem mevcuttur:

A. DirectPath I/O (Passthrough)

GPU, ESXi hypervisor katmanı tarafından hiç dokunulmadan, doğrudan tek bir VM’e adanır.

  • Kullanım Senaryosu: H100 veya H200 donanımının tam performansına ihtiyaç duyan, tek bir büyük yapay zeka eğitim (Training) makinesi oluşturulurken tercih edilir.

  • Dezavantajı: VM çalışırken vMotion (canlı göç) yapılamaz, snapshot alınamaz ve donanım paylaşımı imkansızdır.

B. NVIDIA vGPU (Virtual GPU Software)

Fiziksel GPU, donanımsal düzeyde bölümlere ayrılarak birden fazla sanal makineye paylaştırılır. Bu süreç NVIDIA AI Enterprise (NVAIE) lisanslamasına tabidir.

  • MIG (Multi-Instance GPU): H100 ve H200 modellerinde bulunan donanımsal bölümlendirme teknolojisidir. Bir H100, silikon düzeyinde izole edilmiş 7 adede kadar bağımsız fiziksel GPU parçasına (Instance) bölünebilir. Her parçanın kendi bellek kontrolcüsü ve cache yapısı olur. Bir VM’deki hata diğer VM’i asla etkilemez.

  • vGPU Profilleri: Örneğin, 80GB belleğe sahip bir H100 üzerinde, H100-20C profili kullanılarak her biri 20GB vRAM’e sahip 4 adet VM veya H100-10C profiliyle 8 adet VM oluşturulabilir (MIG ile birleştirilerek).

Kubernetes tabanlı OpenShift cluster’larında NVIDIA GPU’ların orchestrate edilmesi, altyapı ekiplerinin işini büyük ölçüde otomatize eden NVIDIA GPU Operator sayesinde gerçekleştirilir.

OpenShift Entegrasyon Adımları

  1. NVIDIA GPU Operator Kurulumu: OpenShift OperatorHub üzerinden tek tıkla yüklenir. Bu operator; ESXi katmanından veya doğrudan bare-metal sunucudan gelen GPU’yu algılar; gerekli NVIDIA sürücülerini (Driver), container runtime eklentilerini (NVIDIA Container Toolkit) ve izleme araçlarını (DCGM Exporter) otomatik olarak kurar.

  2. MIG Konfigürasyonu: Eğer altyapıda H100/H200 varsa, GPU Operator’a bir ClusterPolicy gönderilerek kartların otomatik olarak MIG moduna alınması sağlanır (Örn: all-1g.10gb profili ile her karta 7 adet pod atanabilir hale getirilir).

  3. Pod Seviyesinde Tüketim: Uygulama geliştiriciler (Data Scientist), hazırladıkları YAML dosyalarında (Deployment) veya Jupyter Notebook arayüzlerinde standart Kubernetes kaynak talebi gibi GPU isterler:

  4. OpenShift AI Entegrasyonu: OpenShift AI (RHOAI) platformu, bu GPU havuzunu arkada otomatik olarak algılayarak modellerin dağıtımını (Inference) ve eğitilmesini web arayüzü üzerinden yönetmenizi sağlar.