Kurumsal AI
128 GB’lık ASUS ProArt PX13: Evde neyi gerçekten yerel çalıştırabiliyorum?
Bu makineyi “ince bir kasada her AI işini çözen mucize” diye anlatmak kolay olurdu. Benim deneyimim daha net: 128 GB unified bellek, büyük yerel dil modelleri ve ajan işlerinde gerçekten fark yaratıyor. Görsel üretimi yapılabiliyor ama süreler beklediğim kadar iyi değil; video tarafıysa bugün benim için yeterli değil.

Benim PX13’ümde ne var?
Cihaz ASUS ProArt PX13 HN7306. İçinde 16 çekirdek, 32 thread’li AMD Ryzen AI Max+ 395; 40 compute unit’li Radeon 8060S; 50 TOPS’a kadar XDNA 2 NPU ve 128 GB LPDDR5X unified bellek var. ASUS bu işlemciyi PX13 kasasında 85 W’a kadar çalıştırıyor.
13,3 inç 2880×1800 OLED dokunmatik ekran, 360 derece dönebilen gövde, 1,39 kg ağırlık ve iki adet 40 Gbps USB4 port bu gücü taşınabilir kılıyor. Bu benim için masaüstünün küçültülmüş hali değil; evde model denediğim, gerektiğinde yanıma alabildiğim ayrı bir çalışma biçimi.
Asıl fark 128 GB’ın unified olması
Buradaki 128 GB yalnızca klasik sistem RAM’i gibi davranmıyor. CPU ile entegre GPU aynı bellek havuzunu kullanıyor. ASUS’un ayarında grafik tarafına 96 GB’a kadar değişken ayrılmış bellek verilebiliyor; toplam grafik adreslenebilir alan 112 GB’a çıkabiliyor. Bu yüzden normal bir dizüstünde bellekten taşacak büyük quantized modeller bu cihazda yüklenebiliyor.
Fakat bu, elimde 96 GB’lık bağımsız bir ekran kartı olduğu anlamına gelmiyor. Bellek kapasitesi modeli sığdırıyor; hız ise Radeon 8060S’in hesap gücü, bellek bant genişliği, kullandığım runtime ve modelin optimizasyonuyla belirleniyor. “Sığıyor” ile “hızlı çalışıyor” aynı cümle değil.
Dil modellerinde neden çok iyi?
Ben cihazda Qwen3.8-27B ve Qwen3.8-Flash-Next kullanıyorum. 27B dense model genel kullanım, Türkçe, reasoning ve kod tarafında sağlam bir temel. Flash-Next ise toplam ağırlığı çok büyük olmasına rağmen token başına daha az parametre etkinleştiren yapısıyla farklı bir hız-kapasite dengesi sunuyor. 128 GB bellek sayesinde tek sorum “model sığacak mı?” olmaktan çıkıyor; quantization, context, KV cache ve çıktı kalitesini gerçekten karşılaştırabiliyorum.
Bu sınıfta asıl değer yalnız sohbet değil. Belgelerimi dışarı göndermeden özetleme, yerel RAG denemeleri, uzun teknik metinlerle çalışma, kod inceleme ve OpenAI uyumlu bir endpoint üzerinden farklı istemcileri aynı modele bağlama imkanı doğuyor. Ölçmediğim tokens/s rakamını yazmıyorum; benim için daha önemli gerçek şu: büyük bir yerel modeli günlük işte beklemeden kullanabildiğim bir düzen kurabiliyorum.
Hermes bu işin ajan katmanı
Hermes’i başka bir model gibi düşünmüyorum. Altta Qwen gibi bir model çalışıyor; Hermes onun çevresine araç kullanımı, skills, hafıza, terminal ve çok adımlı görev akışı koyuyor. Yani model yalnız cevap yazmıyor; doğru kurulduğunda dosya okuyabiliyor, komut çalıştırabiliyor, sonucu kontrol edip bir sonraki adıma geçebiliyor.
Hermes yerel modeller için llama.cpp runtime’ını kurup yönetebiliyor; AMD GPU’lar için Vulkan seçeneği var. İstersem kendi llama-server’ımı da OpenAI uyumlu endpoint olarak verebiliyorum. 128 GB burada yalnız modeli sığdırmıyor; uzun context, KV cache ve araç döngülerinin payını da genişletiyor. Yine de iyi ajan davranışı RAM’den gelmiyor: modelin tool calling disiplini, sistem talimatı ve gerçek görev testleri ayrı ayrı ölçülmeli.
OpenCode ile neden mantıklı?
OpenCode herhangi bir OpenAI uyumlu yerel sağlayıcıyı özel provider olarak tanımlayabiliyor. PX13’te llama.cpp, Ollama ya da başka bir runtime ile `/v1` endpoint açtığımda modelimi OpenCode’un model seçicisinde kullanabiliyorum. Böylece kaynak kod ve prompt her çağrıda dış servise gitmeden, aynı makinede kod ajanı çalıştırmak mümkün oluyor.
Benim için doğru kullanım, bulut modelini tamamen silmek değil. Yerel Qwen ile repo okuma, küçük düzenlemeler, test çalıştırma, dokümantasyon ve tekrar eden işleri yaparım; zor karar veya son kontrol gerektiğinde daha güçlü bir bulut modeliyle karşılaştırırım. OpenCode’a bağlanabilmesi tek başına “iyi coding agent” olduğu anlamına gelmiyor. Uzun context, doğru dosya seçimi, tool call başarısı ve işi gerçekten bitirme oranı birlikte önemli.
Görsel oluyor, ama hızlı değil; video bana yetmedi
ComfyUI ile görsel modelleri çalıştırabiliyorum. 128 GB bellek büyük checkpoint ve quantized modelleri yükleme konusunda rahatlık sağlıyor. Fakat pratikte görsel üretim süreleri, güçlü bir NVIDIA masaüstü GPU’sunda alıştığım akış kadar kısa değil. Birkaç görsel denemek mümkün; çok varyasyon üretip hızlı eleme yapmak istediğimde bekleme süresi iş akışını yavaşlatıyor.
Video tarafında fark daha sert. Modelin belleğe sığması güzel, fakat kareler boyunca tekrar eden hesap ve AMD tarafındaki runtime uyumluluğu toplam süreyi büyütüyor. Bugün PX13’ü Wan, LTX veya benzeri video işlerinde ana üretim makinem saymıyorum. Deneme ve öğrenme için kullanırım; düzenli video üretimi için yüksek hızlı ayrık GPU ya da bulut kapasitesi daha doğru.
AMD tarafının dürüst sınırı
Radeon 8060S artık ROCm belgelerinde desteklenen bir gfx1151 hedefi olarak yer alıyor ve unified memory için dynamic/carveout yapısı tanımlı. Bu önemli bir ilerleme. Yine de AI ekosisteminin büyük kısmı önce CUDA için optimize ediliyor. Bir modelin veya custom node’un NVIDIA’da çalışması, aynı gün Windows ya da WSL üzerindeki AMD kurulumunda sorunsuz çalışacağı anlamına gelmiyor.
Bu yüzden ben kapasite ile uyumluluğu ayrı değerlendiriyorum. 128 GB bana çok geniş bir laboratuvar veriyor; fakat doğru Vulkan, ROCm, DirectML veya llama.cpp build’ini seçmek hala işin parçası. Bu cihaz “kur ve unut” değil; denemeyi seven biri için güçlü bir ev laboratuvarı.
Küçük kasanın depolama hesabı
PX13’te tek M.2 2230 PCIe 4.0 x4 yuvası var. Fabrika çıkışı 1 TB, birkaç büyük GGUF, image checkpoint, Docker ve WSL kurulumuyla hızlı dolar. Elimdeki 2 TB WD SN740’ı iç diskte kullanmak ve büyük model arşivini USB4 üzerinden harici NVMe’ye taşımak bu nedenle daha mantıklı.
Sonuçta bu makinenin güçlü olduğu yer belli: taşınabilir gövdede büyük yerel dil modelleri, Hermes ile ajan denemeleri, OpenCode ile özel kod işleri ve veriyi evde tutabilmek. Görselde kullanılabilir ama sabır istiyor; videoda şimdilik yeterli değil. Benim için değeri, masaüstü GPU’yu taklit etmesinde değil, normal bir dizüstünün açmadığı yerel AI alanını açmasında.