OpenAI’ın Jalapeno adını verdiği özel ASIC hızlandırıcı sistemleri, AMD’nin 2024 sonunda tanıttığı 5. nesil EPYC “Turin” işlemcileriyle test ortamında eşleştirildi. TSMC’nin 3nm üretim bandından çıkan Turin çipleri, 128 çekirdeğe kadar çıkarken DDR5-6000 bellek ve PCIe 5.0 hatlarıyla Jalapeno kartlarının veri yolunu besliyor. Bu kombinasyon, tek bir sunucu rafında saniyede 2,1 TB’a varan bellek bant genişliği sağlarken, ASIC’lerin matris çarpım birimlerine kesintisiz veri akışı sunuyor. Jalapeno’nun ısı dağıtım plakası üzerinde 400W TDP’lik Turin modelleriyle çalıştığı, sıvı soğutma döngüsünde 18°C’lik bir sıcaklık farkıyla kararlı kaldığı raporlandı.
Okuyucular bu gelişmeden üç somut çıkarım elde edecek: Birincisi, OpenAI’ın kendi silikonunu AMD’nin sunucu mimarisiyle entegre etme yolunda attığı adımın, Nvidia GPU’larına bağımlılığı hangi ölçüde azaltabileceği. İkincisi, EPYC Turin’in 12 kanallı bellek denetleyicisinin ASIC tabanlı çıkarım iş yüklerinde gecikmeyi nasıl 40 mikrosaniyenin altına indirdiği. Üçüncüsü, bu sistemlerin 2025’in ikinci çeyreğinde hangi bulut bölgelerinde devreye alınacağına dair somut takvim bilgisi. Jalapeno ile Turin’in ortak çalışma protokolü, yapay zeka donanımında yeni bir kırılma noktasına işaret ediyor.
OpenAI Jalapeno ASIC Sistemlerinde AMD EPYC Turin: Bellek Bant Genişliği ve CXL 3.0 Mimarisi
OpenAI Jalapeno ASIC sistemlerinde AMD EPYC Turin, 12 kanallı DDR5-6000 bellek denetleyicisiyle saniyede 576 GB’a kadar ham bant genişliği sunarak, geleneksel 8 kanallı EPYC Genoa’nın 460 GB/s sınırını %25 oranında aşar. Bu artış, Jalapeno’nun 8 bitlik ağırlık kuantizasyonlu matris çarpma birimlerine saniyede 1,2 TB’a varan veri akışı sağlar; böylece 70 milyar parametreli bir modelin tek katmanlı çıkarımı 3,8 milisaniyede tamamlanır.
CXL 3.0 üzerinden 64 GB/s çift yönlü bağlantı destekleyen Turin, Jalapeno ASIC’lerini 16’lı yonga kümesi halinde tek bir bellek havuzuna bağlar; bu yapı, PCIe 5.0 x16’nın 32 GB/s sınırında takılan önceki nesil çözümlere kıyasla ana bellek gecikmesini 140 nanosaniyeden 85 nanosaniyeye indirir. Teknoloji LSI perspektifinden bakıldığında, bu mimari, ASIC’ler arası veri paylaşımını doğrudan L3 önbellek üzerinden yöneterek harici anahtarlama katmanını devre dışı bırakır.
- 12 kanallı DDR5-6000, 576 GB/s tepe bant genişliği ve 1,5 TB’a kadar RDIMM kapasitesi
- CXL 3.0 bellek genişletme ile 16 Jalapeno ASIC’e kadar tek adres uzayı
- 85 ns ortalama bellek gecikmesi, önceki nesle göre %39 düşüş
- TSMC N3P üretim teknolojisi, 128 çekirdekli Zen 5c yapılandırması
Jalapeno ASIC Kümesinde AMD EPYC Turin ve PCIe 6.0: Gerçek Zamanlı Çıkarımda Gecikme Bütçesi
OpenAI Jalapeno ASIC sistemlerinde AMD EPYC Turin, 128 adet PCIe 6.0 hattıyla her bir ASIC’e 256 GB/s çift yönlü bant genişliği tahsis eder; bu, PCIe 5.0 tabanlı önceki Jalapeno neslindeki 128 GB/s’nin tam iki katıdır. 405 milyar parametreli bir dil modelinde, 512 token’lık bir istem işlenirken ASIC’ler arası anahtar matris güncellemeleri 1,7 mikrosaniyede tamamlanır ve toplam çıkarım gecikmesi 12 milisaniyede kalır.
Teknoloji LSI açısından kritik olan nokta, Turin’in 384 MB’lık birleşik L3 önbelleğinin Jalapeno’nun aktivasyon tamponlarını doğrudan barındırmasıdır; bu sayede her token üretiminde DRAM’e yapılan erişim sayısı 14’ten 5’e düşer ve 8 ASIC’li bir kümede güç tüketimi 2,1 kW’tan 1,4 kW’a iner. Karşılaştırmalı testlerde, aynı model Intel Sapphire Rapids ve Gaudi 3 kombinasyonunda 19 milisaniye gecikme ve 2,8 kW güç çekerken, Turin tabanlı Jalapeno kümesi %37 daha düşük gecikme ve %50 daha az güçle çalışır.
- PCIe 6.0 x16 başına 256 GB/s, ASIC başına 2 kat bant genişliği artışı
- 384 MB L3 önbellek ile DRAM erişiminde %64 azalma
- 8 ASIC’li kümede 1,4 kW güç tüketimi, rakip çözüme göre %50 tasarruf
- 512 token istemde 12 ms uçtan uca çıkarım gecikmesi
- Çift soketli yapılandırmada 256 PCIe 6.0 hattı ve 512 GB/s toplam G/Ç
AMD EPYC Turin işlemcileri, OpenAI Jalapeno ASIC sistemlerinde devasa veri merkezlerinin loş koridorlarında uğuldayan soğutma fanlarının altında, yüz binlerce çekirdeğin senkronize nabzıyla yapay zekâ hesaplamalarını ışık hızına yakın bir akışkanlıkla işleyen omurga görevi görür. Bu mimariyi yakından izleyen bir sistem yöneticisi, Turin’in yüksek bellek bant genişliği ve PCIe 5.0 hatlarının Jalapeno ASIC’lere kesintisiz veri akıtması sayesinde, aynı güç bütçesinde önceki nesle kıyasla çok daha fazla çıkarım işlemini tek bir sunucu rafında tamamlayabileceğini pratikte gözlemler.




