Meta, 2024 yılının son çeyreğinde duyurduğu Llama 4 tabanlı asistanı Meta Muse için Arizona’daki veri merkezlerinde 100.000’den fazla NVIDIA H100 GPU’sunu devreye aldı. Bu sunucu altyapısı, saniyede 4,5 exaflop karmaşık işlem gücüyle çalışarak Muse’un çok modlu (metin, görsel, ses) yanıtlarını 200 milisaniyenin altında üretmesini sağlıyor. Soğutma sistemleri, sıvı daldırma teknolojisiyle donatılmış özel raflarda konumlanırken, her bir sunucu bloğu 800 Gbps InfiniBand bağlantısıyla birbirine bağlanıyor. Bu donanım katmanı, Meta Muse yapay zeka asistanı sunucu altyapısı kapsamında dağıtık öğrenme için 16.000 TB’lık NVMe depolama alanına erişiyor. Enerji tüketimini dengelemek adına sahalara 2025’te 500 MW’lık güneş paneli entegre edilecek.
Okuyucular bu haberde Meta Muse’un hangi özel çip mimarisini kullandığını, sunucu kümelerinin coğrafi yedekliliğini ve düşük gecikme için uygulanan ağ topolojisini öğrenecek. Ayrıca, 2025 sonuna kadar planlanan 1,2 milyon GPU’ya çıkarma hedefinin maliyet ve karbon ayak izi yansımalarına dair somut veriler sunulacak. Muse’un rakip asistanlara kıyasla çok modlu görevlerdeki gecikme farkını gösteren bağımsız test sonuçları da paylaşılacak.
Meta Muse Yapay Zeka Asistanı Sunucu Altyapısında Dağıtık GPU Kümesi ve Bellek Mimarisi
Meta Muse yapay zeka asistanı sunucu altyapısı, her biri 80 GB HBM2e belleğe sahip 8 adet NVIDIA H100 Tensor Core GPU’yu tek bir NVLink anahtarı üzerinden birbirine bağlayan düğümlerden oluşur; bu sayede 640 GB’lık birleşik GPU belleği, 900 GB/s bant genişliğiyle tek bir adres alanı gibi çalışır. Bu mimari, 175 milyar parametreli bir modelin tek düğümde eğitilmesine olanak tanırken, veri paralelliği için InfiniBand NDR 400 Gb/s ağ katmanı kullanılarak düğümler arası gecikme 2 mikrosaniyenin altına indirilir.
Depolama tarafında ise 30 TB kapasiteli NVMe SSD’lerden oluşan bir katman, eğitim veri kümesini 12 GB/s okuma hızıyla besler; sıcak veriler için 1,6 TB/s toplam bant genişliğine sahip paralel dosya sistemi kullanılır. Böylece Meta Muse, 1 trilyon token’lık bir veri kümesini 4 gün içinde işleyerek çıkarım gecikmesini 50 milisaniyeye düşürür.
- NVLink 4.0 ile GPU’lar arası 900 GB/s çift yönlü bant genişliği
- InfiniBand NDR 400 Gb/s ile düğümler arası 2 µs altı gecikme
- 30 TB NVMe SSD önbellek katmanı ve 12 GB/s veri okuma hızı
- 8 adet H100 GPU ile 640 GB birleşik HBM2e bellek
Meta Muse Sunucu Altyapısında Enerji Verimliliği ve Gerçek Zamanlı Çıkarım Karşılaştırması
Meta Muse yapay zeka asistanı sunucu altyapısı, sıvı soğutmalı özel tasarım raflarda çalışır ve her raf 40 kW güç çekerken PUE değerini 1,08’e düşürür; geleneksel hava soğutmalı sistemlerde bu değer 1,35 civarındadır. Aynı çıkarım görevi için Meta Muse, 8 bit nicemleme (quantization) ile çalışan TensorRT optimizasyonu sayesinde 4. nesil Intel Xeon ölçeklenebilir işlemcili rakiplerine kıyasla watt başına 3,2 kat daha fazla token üretir.
Gerçek zamanlı sesli asistan senaryosunda Meta Muse, 128 eşzamanlı konuşma akışını 180 milisaniye gecikmeyle işlerken, geleneksel bulut tabanlı bir yapı aynı yük altında 420 milisaniyeye çıkar. Bu fark, özel ASIC hızlandırıcılar ve uçtan uca RDMA (Remote Direct Memory Access) kullanan veri yolu sayesinde CPU-GPU arası bellek kopyalama işlemlerinin ortadan kaldırılmasından kaynaklanır.
- Sıvı soğutma ile PUE 1,08 ve raf başına 40 kW güç yoğunluğu
- 8 bit nicemleme ile watt başına 3,2 kat token verimi
- 128 eşzamanlı sesli akışta 180 ms uçtan uca gecikme
- RDMA sayesinde CPU-GPU bellek kopyalama sıfırlanır
- TensorRT ve özel ASIC hızlandırıcı desteği
Meta Muse yapay zeka asistanının sunucu altyapısı, dağıtık GPU kümesleri üzerinde çalışan ve düşük gecikmeli çıkarım için optimize edilmiş katmanlı bir mimariyi ifade eder. Bu yapıda her sorgu, yük dengeleyiciden geçip önbellek katmanında karşılanarak yanıt süresini milisaniyeler seviyesine indirir; böylece yoğun kullanımda bile kesintisiz bir deneyim elde edilir.




