Supermicro’dan NVIDIA Vera Rubin NVL4 Tabanlı Sıvı Soğutmalı HPC Altyapısı

4
0

Supermicro’nun Yeni HPC Altyapı Planının Tanıtımı ve Temel Hedefleri

Supermicro, NVIDIA Vera Rubin NVL4 platformuna dayalı yeni yüksek performanslı hesaplama (HPC) altyapı planını tanıttı. Bu plan, Supermicro’nun Data Center Building Block Solutions (DCBBS) yaklaşımının bir uzantısı olarak, doğrulanmış bileşenlerden oluşan modüler ve ölçeklenebilir altyapılar sunmayı hedefliyor. DCBBS, bireysel sunuculardan rack ölçeğine ve tüm veri merkezi kurulumlarına kadar geniş bir yelpazede uygulanabilen, esnek ve sürdürülebilir çözümler geliştirmeye odaklanıyor.

NVIDIA Vera Rubin NVL4 platformu, bilimsel araştırma ve yapay zeka uygulamalarında karmaşık ve yoğun hesaplama gereksinimlerini karşılamak üzere tasarlanmıştır. Özellikle FP64 çift hassasiyetli simülasyonları hızlandırma ve yapay zeka yöntemleriyle birleştirme yeteneğiyle, iklim araştırmaları, ilaç keşfi, malzeme bilimi ve enerji gibi kritik alanlarda kullanılmak üzere öne çıkıyor. Supermicro’nun yeni HPC altyapı planı, bu platformun sunduğu performans avantajlarını, modüler ve ölçeklenebilir bir mimariyle birleştirerek, araştırma kurumları ve süper bilgisayar merkezleri gibi kullanıcı profillerinin ihtiyaçlarına yanıt vermeyi amaçlıyor.

Planın temel vizyonu, yüksek performanslı hesaplama kaynaklarını esnek ve sürdürülebilir bir şekilde sunmak; farklı ölçeklerdeki HPC projelerinin gereksinimlerini karşılamak ve bilimsel ilerlemeyi desteklemektir. Modüler yapı sayesinde, kullanıcılar kapasiteyi gereksinimlerine göre artırıp azaltabilirken, operasyonel verimlilik ve bakım kolaylığı da ön planda tutuluyor.

Altyapının teknik bileşenlerine ve mimarisine geçiş yapılacak.

NVIDIA Vera Rubin NVL4 Tabanlı HPC Altyapısının Teknik Bileşenleri

Supermicro’nun yeni HPC altyapısının temelini, sekiz adet sıvı soğutmalı compute rack oluşturuyor. Her biri 52U yüksekliğinde ve 750 mm genişliğinde olan bu rack’lerde, 36 NVIDIA Vera Rubin NVL4 node bulunuyor ve toplamda 288 node’a ulaşılıyor. Bu yapı, 1.152 NVIDIA Rubin GPU ve 576 Vera CPU kapasitesine sahip. Her rack, 362 kW güç zarfında çalışıyor ve sekiz rack’lik birim, büyük ölçekli bilimsel ve yapay zeka iş yükleri için optimize edilmiş durumda.

Soğutma tarafında, doğrudan sıvı soğutma teknolojisi kullanılıyor. Bu sistemde, bakır cold plate’ler ve dikey manifoldlar ile Supermicro SMC PG25-A soğutucu akışkanı entegre edilmiş. Her bir ölçeklenebilir birim için üç adet in-row cooling dağıtım ünitesi bulunuyor; bunlar 1.8 MW’a kadar kapasiteye sahip ve 2+1 yedekli konfigürasyonla çalışıyor. Bu sayede, yüksek yoğunluklu bileşenlerin termal yönetimi güvenli ve verimli şekilde sağlanıyor.

Ağ altyapısı ise NVIDIA Quantum-X800 InfiniBand compute fabric ile destekleniyor. Bu yapı, özel anahtar rack’leri üzerinden yüksek bant genişliği ve düşük gecikme sunarak, dağıtık bilimsel ve yapay zeka iş yüklerinde veri iletimini optimize ediyor. Her compute rack’te sekiz adet 72 kW güç rafı bulunuyor ve busbar üzerinden güç dağıtımı sağlanıyor. Ayrıca, her rack’in üst kısmında iki yönetim anahtarı yer alıyor ve bu sayede sistemlerin uzaktan ve güvenli yönetimi mümkün oluyor.

Kurulum, entegrasyon ve devreye alma süreçlerine geçiş yapılacak.

Kurulum, Entegrasyon ve Dağıtım Süreçlerinde İzlenen Adımlar

Supermicro’nun NVIDIA Vera Rubin NVL4 tabanlı HPC altyapısının kurulumu, titiz bir yerinde tesis incelemesiyle başlıyor. Bu aşamada, yükleme alanının erişilebilirliği, veri salonunun boyutları, zemin yük kapasitesi ve mevcut güç ile soğutma altyapısının uygunluğu detaylı şekilde değerlendiriliyor. Bu ön değerlendirmeler, sistemin sorunsuz entegrasyonu için kritik öneme sahip.

Teslimat öncesi entegrasyon sürecinde, rack montajı, kablolama işlemleri ve sistem ile küme testleri Supermicro’nun üretim tesislerinde gerçekleştiriliyor. Bu adım, bileşenlerin doğru şekilde bir araya getirilmesini ve performansın önceden doğrulanmasını sağlıyor. Böylece, sahada karşılaşılabilecek olası sorunlar minimize ediliyor.

Sahada ise rack yerleşimi, güç ve soğutma bağlantılarının kurulumu, ağ kablolaması ve sistemin devreye alınması adımları takip ediliyor. Devreye alma süreci, sistemin işlevselliğinin ve performansının doğrulanması için kapsamlı testlerle destekleniyor. Ayrıca, kritik sistemler için yerinde destek seçenekleri sunularak, operasyonel süreklilik ve hızlı müdahale imkanı sağlanıyor.

Altyapının bilimsel ve yapay zeka uygulamalarındaki mühendislik etkilerine geçiş yapılacak.

Bilimsel Araştırma ve Yapay Zeka Uygulamaları İçin Mühendislik Etkileri

Yeni altyapı, FP64 çift hassasiyetli simülasyon ile hızlandırılmış hesaplama ve yapay zekanın birleşimini destekliyor. Bu sayede, iklim araştırmaları, ilaç keşfi, malzeme bilimi ve enerji gibi alanlarda karmaşık modelleme ve veri analizi süreçleri önemli ölçüde hızlandırılabiliyor. Özellikle bilimsel araştırmalarda, yüksek doğruluk gerektiren hesaplamalar ile makine öğrenimi ve yapay zeka yöntemlerinin aynı platformda bir araya gelmesi, çok disiplinli projeler için önemli avantajlar sunuyor.

Sıvı soğutma teknolojisi, enerji verimliliği ve yüksek yoğunluk avantajlarıyla öne çıkıyor. Doğrudan sıvı soğutma, bileşenlerin daha düşük sıcaklıklarda çalışmasını sağlayarak, sistemin genel enerji tüketimini azaltıyor ve daha kompakt veri merkezi tasarımlarına olanak tanıyor. InfiniBand ağ altyapısı ise yüksek bant genişliği ve düşük gecikme ile büyük veri setlerinin hızlı işlenmesini mümkün kılıyor. Bu, özellikle dağıtık yapay zeka eğitimlerinde ve bilimsel simülasyonlarda performansın sürdürülebilirliğini artırıyor.

Modüler mimari, altyapının ölçeklenebilirliğini ve esnekliğini artırıyor. Kullanıcılar, ihtiyaç duydukça kapasite ekleyebiliyor veya mevcut kaynakları yeniden yapılandırabiliyor. Bu yaklaşım, hem yatırım maliyetlerinin optimize edilmesini hem de uzun vadede teknolojik gelişmelere hızlı uyum sağlanmasını mümkün kılıyor.

Altyapının genel mühendislik değerlendirmesi, potansiyel riskler ve değerlendirme ölçütleriyle sonuçlandırılacak.

Genel Mühendislik Değerlendirmesi, Riskler ve Değerlendirme Ölçütleri

Sıvı soğutmalı HPC altyapılarında karşılaşılan başlıca mühendislik zorlukları arasında, sistemlerin karmaşıklığı, bakım gereksinimleri ve operasyonel sürdürülebilirlik yer alıyor. Doğrudan sıvı soğutma teknolojisi, yüksek yoğunluklu bileşenlerin etkin termal yönetimini sağlarken, sızıntı riski ve soğutma devrelerinin güvenilirliği gibi kritik faktörlerin dikkatle yönetilmesini gerektiriyor. Tasarım aşamasında malzeme seçimi, soğutucu akışkanın özellikleri ve sistem yedekliliği gibi unsurlar öncelikli olarak ele alınmalı.

Enerji tüketimi açısından, sıvı soğutma sistemleri hava soğutmaya kıyasla daha yüksek verimlilik sunar; ancak, soğutma altyapısının işletme maliyetleri ve bakım gereksinimleri uzun vadede sürdürülebilirlik açısından değerlendirilmelidir. Modüler mimari, bakım ve yükseltme süreçlerinde esneklik sağlarken, bileşenlerin uyumluluğu ve sistem entegrasyonunun karmaşıklığı potansiyel sınırlamalar arasında yer alır. Bu mimari, ölçeklenebilirlik ve esneklik avantajlarıyla birlikte, uzun vadeli operasyonel maliyetlerin optimize edilmesine olanak tanır.

Başarı ölçütleri arasında performans, enerji verimliliği, ölçeklenebilirlik ve bakım kolaylığı ön plandadır. Performans, NVIDIA Vera Rubin NVL4 platformunun yüksek hesaplama kapasitesiyle desteklenirken, enerji verimliliği sıvı soğutma ve optimize edilmiş güç dağıtım sistemleriyle artırılır. Ölçeklenebilirlik, modüler yapı sayesinde farklı büyüklükteki HPC projelerine uyum sağlarken, bakım kolaylığı ise sistem sürekliliği ve operasyonel verimlilik için kritik öneme sahiptir. Bu değerlendirmeler, altyapının mühendislik perspektifinden sürdürülebilir ve yüksek performanslı bir çözüm olarak konumlandırılmasını sağlar.

Kaynaklar: engineering.com

0 0 votes
Article Rating
Subscribe
Bildir
guest

Bu site istenmeyenleri azaltmak için Akismet kullanır. Yorum verilerinizin nasıl işlendiğini öğrenin.

0 Yorum
Eskiler
En Yeniler Beğenilenler