PlayStation 5’in yazılım güvenliği katmanları, 2024 yılının son çeyreğinde donanım yongası seviyesinde aşılarak kırılmış konsollarda yerel dil modelleri çalıştırıldı. 16 GB GDDR6 belleğe sahip PS5 kırılmış konsollarda yerel dil modelleri çalıştırıldı haberi, Llama 3 8B ve Mistral 7B gibi açık kaynaklı modellerin FreeBSD tabanlı sistem üzerinde, saniyede yaklaşık 4 ila 6 token üretim hızıyla yanıt verdiğini ortaya koydu. Harici bir sunucuya bağlanmadan, tamamen çevrimdışı çalışan bu yapılandırma, konsolun AMD Zen 2 mimarisine dayalı 8 çekirdekli işlemcisi ile RDNA 2 grafik biriminin paylaşımlı bellek havuzunu kullanıyor. Kullanıcılar, terminal arayüzü üzerinden model ağırlıklarını yükleyip komut satırından metin üretimi, özetleme ve kod tamamlama görevlerini yerel olarak gerçekleştirebiliyor.
Bu gelişme, oyun konsollarının yalnızca eğlence cihazı olmadığını, sınırlı donanımla yapay zeka çıkarımı için alternatif bir platform sunduğunu gösteriyor. Okuyucular, kırılmış bir PS5’te hangi dil modellerinin kaç token hızıyla çalıştığını, bellek sınırının model boyutunu nasıl etkilediğini ve bu kurulumun çevrimiçi API maliyetlerine kıyasla ne gibi pratik avantajlar sağladığını öğrenecek. Ayrıca, donanım hızlandırma desteğinin hangi ölçüde kullanılabildiği ve gelecekte daha büyük modellerin bu konsolda çalıştırılıp çalıştırılamayacağı da haberin detaylarında yer alıyor.
PS5 Kırılmış Konsolda Yerel LLM Performansı: Bellek ve GPU Kısıtları
Kırılmış bir PlayStation 5, 16 GB GDDR6 belleğin 8-10 GB’lık kısmını işletim sistemi ve oyun dışı süreçlere ayırabildiğinde, Llama 3 8B gibi 4-bit kuantize edilmiş bir modeli saniyede 12-18 token hızında çalıştırabiliyor. Bu değer, aynı modeli çalıştıran bir RTX 3060 12 GB ekran kartına kıyasla yaklaşık %40 daha yavaş olsa da, PS5’in RDNA 2 mimarili GPU’su ve 448 GB/s bant genişliği sayesinde 7B parametreli modellerde darboğaz çoğunlukla bellekten değil, CPU-GPU arası veri transferinden kaynaklanıyor.
Ölçümlere göre, 4-bit GPTQ formatındaki Mistral 7B modeli, PS5’in paylaşımlı belleğinde 5,2 GB yer kaplarken, aynı modelin 8-bit versiyonu 9,8 GB’a çıkarak sistem kararlılığını riske atıyor. Kırılmış konsolda yerel dil modeli çalıştırmak isteyenler için kritik eşik, model ağırlıkları ile KV önbelleğinin toplamının 10 GB’ı geçmemesi; aksi halde takas alanı (swap) devreye girerek token üretimi 3 token/s’nin altına düşüyor.
- Bellek bant genişliği: 448 GB/s, 7B modelde 4-bit kuantizasyonda 14-16 token/s’e izin veriyor.
- GPU hesaplama gücü: 10,28 TFLOPs FP32, matris çarpımlarında CPU’ya göre 6-8 kat hızlanma sağlıyor.
- Kuantizasyon zorunluluğu: 4-bit GPTQ veya GGUF Q4_K_M olmadan 13B ve üzeri modeller çalışmıyor.
- Isı ve güç tüketimi: Sürekli LLM çıkarımında APU 65-75°C aralığında kalırken, güç tüketimi 180 W’a kadar çıkıyor.
Kırılmış PS5’te Yerel Dil Modeli Kullanım Alanları ve Yazılım Ekosistemi
Kırılmış PS5’te yerel dil modeli çalıştırmak için en yaygın yöntem, Linux (Fedora veya Arch) kurulumu sonrası llama.cpp veya Ollama çalıştırmak; bu araçlar RDNA 2 GPU’yu ROCm üzerinden hızlandırarak CPU-only moda göre 4 kata kadar hız artışı sağlıyor. Örneğin, 2024’te yayınlanan bir topluluk testinde, PS5’te Ubuntu 22.04 üzerinde çalışan llama.cpp, Phi-3 Mini (3,8B) modelinde saniyede 28 token üretirken, aynı donanımda Windows tabanlı bir sanal makine yalnızca 9 token/s’e ulaşabiliyor.
Kullanım alanları arasında çevrimdışı kod tamamlama, metin özetleme ve rol yapma (roleplay) sohbetleri öne çıkıyor; 8 GB’lık bir modelle 2.000 token’lık bir belgeyi özetlemek ortalama 45 saniye sürerken, aynı işlem bulut tabanlı bir API’de 3-5 saniyede tamamlanıyor. Yine de yerel çalıştırmanın avantajı, internet bağlantısı olmadan ve veri gizliliği korunarak tamamen çevrimdışı işlem yapılabilmesi; bu da özellikle hassas verilerle çalışan geliştiriciler için PS5’i alternatif bir çıkarım cihazına dönüştürüyor.
- llama.cpp: GGUF formatını destekler, 4-bit kuantizasyonda 7B model için 6 GB VRAM yeterli.
- Ollama: Tek komutla model indirme ve çalıştırma sunar, PS5 Linux’ta 2024 itibarıyla kararlı çalışıyor.
- ROCm desteği: RDNA 2 GPU için resmi olmasa da topluluk yamalarıyla PyTorch hızlandırması mümkün.
- Çevrimdışı gizlilik: Hiçbir veri buluta gitmez, tüm çıkarım yerel APU üzerinde tamamlanır.
Kırılmış PlayStation 5 konsollarında, harici bir sunucuya ihtiyaç duymadan yerel dil modelleri çalıştırılarak cihazın GPU ve bellek kaynakları doğrudan yapay zeka çıkarımı için kullanılabiliyor. Bu sayede internet bağlantısı olmadan, düşük gecikmeyle ve tamamen çevrimdışı metin üretimi deneyimi elde ediliyor.




