AMD'den Blackwell'e Meydan Okuyan 'Helios' Raf Mimarisi: ROCm 7.0 ve Instinct MI350X Altyapısı

AMD, Nvidia GB200 NVL72'ye doğrudan rakip olan sıvı soğutmalı Helios rack-scale mimarisini, 288GB HBM3e bellekli Instinct MI350X yongalarını ve ROCm 7.0 platformunu tanıttı.

AMD Helios sıvı soğutmalı yapay zekâ sunucu kabini ve Instinct MI350X bilgi işlem blokları

Yapay zekâ süper bilgisayar pazarında Nvidia’nın ezici üstünlüğüne karşı en iddialı meydan okuma AMD’den geldi: Şirket CEO’su Dr. Lisa Su, Nvidia GB200 NVL72 kümesine doğrudan rakip olarak tasarlanan sıvı soğutmalı “AMD Helios” rack-scale (raf ölçekli) yapay zekâ süper bilgisayar mimarisini, yeni nesil 3nm “Instinct MI350X” hızlandırıcılarını ve baştan yazılan “ROCm 7.0” açık yazılım platformunu duyurdu.

Tek bir sunucu rafında 72 adet MI350X hızlandırıcısını ve EPYC Turin işlemcilerini sıvı soğutmalı doğrudan çip bloklarıyla (Direct-to-Chip Liquid Cooling) birbirine bağlayan Helios sistemi; trilyon parametreli yapay zekâ modellerinin çıkarım ve eğitiminde Nvidia sistemlerine kıyasla %30 daha düşük toplam sahip olma maliyeti (TCO) sunuyor.


Instinct MI350X: Bellek Canavarı 288 GB HBM3e

Büyük dil modellerinin eğitiminde ve çıkarımında en büyük darboğaz bellek kapasitesidir. Birçok model GPU belleğine sığmadığı için birden fazla karta bölünmek zorunda kalıyor.

AMD’nin MI350X yongasıyla getirdiği 3 kritik üstünlük:

  1. 288 GB HBM3e Bellek Kapasitesi: Nvidia Blackwell B200’ün (192 GB) çok ötesine geçen bellek hacmi sayesinde, 70 milyar parametreli modeller tek bir GPU üzerinde bölünmeden çalışabiliyor.
  2. 8 TB/sn Bellek Bant Genişliği: SK Hynix ortaklığıyla üretilen 12 katmanlı HBM3e bellek yığınları, veri aktarım hızlarını zirveye taşıyor.
  3. CDNA 4 Mimarisi ve FP4 Desteği: Yeni 4-bit kayan nokta (FP4) tensör çekirdekleri, çıkarım hızını önceki nesle göre 4 katına çıkarırken enerji tüketimini yarıya indiriyor.
AMD Instinct MI350X hızlandırıcı çip paketi ve 288GB HBM3e yığın bellek silikon mimarisi
Helios kabinleri, 100 kW'ı aşan güç yoğunluğunu sıfır su tüketimli kapalı devre dielektrik sıvı soğutmayla kontrol altında tutuyor.

ROCm 7.0: CUDA Bağımlılığı Kırılıyor mu?

Yıllardır geliştiricilerin Nvidia’yı tercih etmesinin en büyük sebebi CUDA yazılım kütüphanesiydi. AMD, ROCm 7.0 güncellemesiyle PyTorch, JAX, vLLM ve Triton kütüphanelerini tek tıkla yerel olarak çalıştırabilen “sıfır kod değişikliği” uyumluluğuna ulaştı.

Microsoft, Meta ve Oracle Cloud’un yeni nesil yapay zekâ kümelerinde Helios sistemlerini kurmaya başladığını duyurması, Nvidia’nın fiyatlandırma gücü üzerindeki baskıyı artırdı.

KriterNvidia GB200 NVL72 RafıAMD Helios MI350X Rafı
Toplam HBM Bellek13.8 TB HBM3e20.7 TB HBM3e (%50 Daha Fazla)
Yazılım EkosistemiKapalı Tescilli CUDAAçık Kaynaklı ROCm 7.0 / Triton
Soğutma AltyapısıÖzel Sıvı Soğutma AltyapısıStandart Açık Hesaplama (OCP) Uyumlu Sıvı Döngü
Maliyet AvantajıYüksek Fiyat Primi%30 Daha Uygun TCO (Toplam Maliyet)

Kısa Özet

  • AMD Helios Tanıtıldı: Nvidia Blackwell’e rakip sıvı soğutmalı raf ölçekli süper bilgisayar duyuruldu.
  • 288 GB Bellek: Instinct MI350X çipleri rekor HBM3e kapasitesiyle modelleri bölmeden çalıştırıyor.
  • ROCm 7.0 Açık Yazılım: PyTorch ve vLLM entegrasyonuyla CUDA bağımlılığı kırıldı.
  • Bulut Devleri Seçti: Microsoft, Meta ve Oracle veri merkezlerine Helios altyapısını ekledi.

Sonuç

AMD’nin Helios ve MI350X atılımı, küresel yapay zekâ çip pazarında tekelleşmenin kırıldığını ve rekabetin veri merkezi maliyetlerini hızla aşağı çekeceğini kanıtlıyor. Açık standartlar ve devasa bellek kapasitesi, yeni nesil yapay zekâ veri merkezlerinin omurgasını güçlendiriyor.

Sık sorulan sorular

AMD Helios sisteminin temel özellikleri nelerdir?

Tek bir kabinde 72 adet MI350X hızlandırıcısını sıvı soğutmayla bağlayan ve 20.7 TB toplam HBM3e bellek sunan raf ölçekli yapay zekâ mimarisidir.

Instinct MI350X çipinin bellek kapasitesi ne kadardır?

288 GB HBM3e bellek ve 8 TB/sn bellek bant genişliği ile 70B modelleri tek bir GPU'da bölmeden çalıştırmaktadır.

ROCm 7.0 açık yazılımı ne sunuyor?

PyTorch, JAX ve vLLM kütüphanelerini kod değişikliği gerektirmeden çalıştırarak Nvidia CUDA kilitlenmesini kırmaktadır.

Maliyet avantajı nedir?

Nvidia GB200 NVL72 sistemlerine kıyasla toplam sahip olma maliyetinde (TCO) %30'a varan tasarruf sağlamaktadır.

Altyapı & Veri Merkezleri kategorisinden