+− THE DAILY DIFFdev & AI news
SHIP IT

Yerel Yapay Zeka Donanım Rehberi (2026)

Yerel yapay zeka ajanları ve açık ağırlıklı LLM'ler için bir makine kurarken, geliştiriciler oyun bilgisayarı özelliklerini satın alma hatasına düşerler: 5.8 GHz CPU'lar, özel sıvı soğutma döngüleri ve sadece 8 GB VRAM'e sahip hızlı oyun GPU'ları.

Yerel yapay zeka ajanları ve açık ağırlıklı LLM'ler için bir makine kurarken, geliştiriciler oyun bilgisayarı özelliklerini satın alma hatasına düşerler: 5.8 GHz CPU'lar, özel sıvı soğutma döngüleri ve sadece 8 GB VRAM'e sahip hızlı oyun GPU'ları. Ancak otoprogresif belirteç üretimi hesaplama sınırlı değil, bellek bant genişliği sınırlıdır: tek bir belirteç çıkarmak için, modeldeki her ağırlığın bellek veriyolu üzerinden akması gerekir. Ağırlıklarınız veya KV önbellek bağlamınız fiziksel VRAM'i aştığında, çalışma zamanı katmanları PCIe üzerinden sistem DDR5'e boşaltır ve 20 kat bellek bant genişliği uçurumuna çarparsınız: hız saniyede 40 belirteçten 1.5'e düşer. Bu saha testinde, Niko donanım mekaniğini, 4 bit niceleme model boyutlandırma kurallarını, 1.200 ila 5.000 dolar arasındaki üç gerçek bütçe seviyesini, neden kullanılmış bir RTX 3090 24GB'ın bilişimde dolar başına en iyi VRAM anlaşması olduğunu, Raspberry Pi uç tuzağını ve yerel ile bulut çıkarımı için ev spor salonu stratejisini açıklıyor. Karar: SHIP IT.

Yazılı sürümü oku (İngilizce) ↗

Bu video neleri kapsar

  • 20 kat bellek bant genişliği uçurumu: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Model boyutlandırma @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Kademe 1 (1.200–1.500 $): RTX 4060 Ti 16GB (asla 8GB) veya Mac Mini 16GB
  • Kademe 2 (1.500–2.000 $): Kullanılmış RTX 3090 24GB ideal nokta veya Mac Mini M4 Pro 64GB
  • Kademe 3 (3.500 $+): RTX 4090 24GB / çift 3090 veya Mac Studio Ultra

Çevrilmiş deşifre

Orijinal İngilizce anlatımdan çevrilmiştir. Mevcut ses ve altyazılar YouTube tarafından kontrol edilir.

0:00 Yerel yapay zeka ajanlarını çalıştırmak için bir bilgisayar kurmayı planlıyorsanız, bir oyun sistemi kurmayı bırakın. Beş nokta sekiz gigahertz Core i9'a, bir sıvı soğutma döngüsüne, veya RGB kaplı sekiz gigabaytlık bir ekran kartına ihtiyacınız yok. Yerel yapay zeka çıkarımında, oyun özellikleri neredeyse işe yaramaz. Ajanınızın çalışıp çalışmayacağını belirleyen tek ölçüt VRAM kapasitesi ve bellek veriyolu bant genişliğidir. Donanım testinin kuralları: CPU saatlerini ve rasterleştirme kıyaslamalarını unutun.

0:24 Üç sayıya önem veriyoruz: bellek veriyolu genişliği, saniyede gigabayt cinsinden bant genişliği ve KV önbellek şişkinliği için ham VRAM boşluğu. Bu saha testinde, yirmi kat bellek bant genişliği uçurumunu açıklayacak, model boyutlandırma kurallarını haritalandıracak, bin iki yüz dolardan beş bine kadar üç gerçek kademeyi kıyaslayacak ve kullanılmış bir 3090'ın neden hala bilişimin en büyük hile kodu olduğunu açıklayacağım. Bu The Daily Diff, saha testi. Oyun sistemlerinin neden başarısız olduğunu anlamak için, belirteç üretiminin aslında nasıl gerçekleştiğine bakın. Oyunlarda, CPU'nuz çizim çağrılarını besler ve GPU'nuz kareleri işler.

0:54 Ancak otoprogresif LLM kod çözme neredeyse tamamen bellek bant genişliği sınırlıdır. Tek bir belirteç üretmek için, GPU'nun modelin her ağırlık parametresini bellekten hesaplama çekirdekleri aracılığıyla akıtması gerekir. Modeliniz on gigabayt ise, bir belirteç üretmek on gigabayt veri okumak anlamına gelir. 384 bit bellek veriyoluna sahip bir Nvidia RTX 3090'da, saniyede 936 gigabayt GDDR6X bant genişliği elde edersiniz, saniyede seksen belirteç üretirsiniz. Ancak modeliniz fiziksel VRAM'i aştığı an ne olduğuna bakın.

1:22 VRAM dolduğunda, çalışma zamanları kalan katmanları PCIe veriyolu üzerinden sistem DDR5 belleğine boşaltır. GPU çekirdekleriniz saniyede bin gigabayt bekler. Bunun yerine, çift kanallı DDR5 onlara elli verir ve PCIe 4 otuz birde tıkanır. Bu yirmi kat bant genişliği çöküşüdür. Belirteç üretim hattı veriyolu beklerken anında durur, ve hız saniyede kırk belirteçten bir buçuğa düşer. İki bin dolarlık bir sistemi bir uzay ısıtıcısına dönüştürdünüz.

1:47 Ve çoklu dönüşlü ajan çalıştırmaları sırasında daha da kötüleşir, çünkü ağırlıklar savaşın sadece yarısıdır. Her istem, araç çağrısı ve dosya parçası Anahtar-Değer önbelleğinde saklanır. Otuz iki k bağlam penceresi, ağırlıklara ek olarak dört ila sekiz gigabayt VRAM'i tüketebilir. Kartınızda yalnızca on altı gigabayt varsa, ajanınız iki kez döner, bağlam duvarına çarpar ve ya bellek yetersizliği hatasıyla çöker ya da DDR5'e taşar. İşte dört bitlik boyutlandırma kopya kağıdı. Llama 3.1 veya DeepSeek Distill gibi yedi veya sekiz milyar parametreli bir model yaklaşık beş gigabayt yer kaplar.

2:16 yaklaşık beş gigabayt yer kaplar. On dört milyar parametreli bir model on gigabayt yer kaplar. Otuz iki milyar parametreli bir model, kodlama ajanları için zeka açısından ideal nokta, yirmi gigabayt gerektirir. Ve yetmiş milyar parametreli bir öncü model, bağlam ayırmadan önce bile kırk gigabayt talep eder. Bu da bizi gerçek donanım kurulumlarına getiriyor. Kademe 1, başlangıç sistemi olup, bin iki yüz ila bin beş yüz dolar arasındadır. PC'de, anahtarınız bir RTX 4060 Ti 16 gigabayttır.

2:39 Kritik uyarı: yetmiş dolar tasarruf etmek için asla sekiz gigabaytlık sürümü almayın. 2026'da sekiz gigabayt VRAM, herhangi bir gerçek ajan iş akışında anında bellek yetersizliği ölüm cezasıdır. herhangi bir gerçek ajan iş akışında anında bellek yetersizliği ölüm cezasıdır. Bunu altı çekirdekli bir Ryzen 5, altmış dört gigabayt DDR5 ve iki terabayt NVMe sürücüsü ile eşleştirin. Apple tarafında ise, eşdeğeri on altı gigabayt birleşik belleğe sahip bir Mac Mini veya MacBook Pro'dur. gigabayt birleşik belleğe sahip bir Mac Mini veya MacBook Pro'dur.

3:02 Sekiz milyar parametreli modellerde saniyede kırk ila elli belirteç göreceksiniz. Kademe 2, güç kullanıcısı için ideal noktadır: özellikle Qwen 2.5 32B gibi otuz iki milyar parametreli modelleri çalıştırmak için oluşturulmuştur. A Yolu, sekiz yüz dolara on altı gigabaytlı yeni bir RTX 4070 Ti Super'dır. Ancak B Yolu, güçlü tavsiyemdir: kullanılmış bir Nvidia RTX 3090 yirmi dört gigabayt satın alın. eBay'de altı yüz elli ila yedi yüz elli dolara temiz 3090'lar bulabilirsiniz. ila yedi yüz elli dolara temiz 3090'lar bulabilirsiniz. Bu size 384 bitlik devasa bir veri yolu üzerinde saniyede 936 gigabayt

3:33 iterek yirmi dört gigabayt VRAM sağlar. Dolar bazında, bilişimdeki en iyi VRAM anlaşmasıdır. macOS'ta, Kademe 2 karşılığı altmış dört gigabayt birleşik belleğe sahip bir Mac Mini M4 Pro'dur. Otuz iki milyar parametreli bir modelde saniyede on bir ila on iki belirteç üretir: Nvidia'dan daha yavaş, ancak otuz watt'ta tamamen sessiz ve devasa bir bağlam penceresi için yer var. Kademe 3, çoklu ajan sürüleri için meraklıların grubudur. PC'de bu, yirmi dört gigabaytlı bir RTX 4090,

3:57 bir Ryzen 9 ve yüz yirmi sekiz gigabayt RAM veya kırk sekiz gigabayt toplam VRAM sağlayan çift RTX 3090 anlamına gelir. Apple ürün yelpazesinde bu, doksan altı ila yüz yirmi sekiz gigabayt birleşik belleğe sahip bir Mac Studio Ultra'dır. Süper gücü bellek kalıcılığıdır: bir gömme modelini, hızlı bir yönlendiriciyi ve 32 milyar parametreli bir kodlama modelini sıfır takas gecikmesiyle aynı anda yükleyebilirsiniz. sıfır takas gecikmesiyle aynı anda yükleyebilirsiniz. Şimdi saha testimizin dürüst başarısızlığına geçelim: uç bilgi işlem tuzağı.

4:24 Her hafta sosyal medyada seksen dolarlık bir Raspberry Pi 5 üzerinde otonom kodlama ajanları çalıştırılabileceği iddia ediliyor. Test ettim. Küçücük bir buçuk milyar parametreli bir model çalıştırmak, kart seksen beş derece Santigrat'ta kısıtlarken saniyede zar zor üç belirteç verir. Neşeli bir hafta sonu oyuncağı, ancak günlük bir geliştirme sürücüsü olarak, tamamen bir eziyet. Yazılım için, doğrudan Cursor, Cline veya VS Code'a bağlanan temiz bir komut satırı

4:47 arka plan programı istiyorsanız Ollama'yı kullanın. Model indirmeleri ve GPU katmanı kaydırıcıları ile grafiksel bir oyun alanı istiyorsanız, LM Studio'yu kullanın. Ve formatınızı silikonunuza uygun hale getirin. Apple Silicon'da, her zaman Metal için optimize edilmiş GGUF modellerini indirin. Nvidia'lı Windows veya Linux'ta, Nvidia Tensor Çekirdeklerini yüzde yirmi ila otuz daha hızlı çıkarım için kullanan AWQ veya EXL2 modellerini indirin. Peki bunu batmadan nasıl dağıtırsınız?

5:11 Yerel donanımı bir ev spor salonu ile ticari bir spor salonu gibi düşünün. Evde bir squat rack olması, her gün sıfır işe gidip gelme, sıfır abonelik ücreti ve tam mahremiyetle antrenman yapmanız demektir. Yerel makineniz günlük kodlamanızın yüzde seksenini, birim testlerinizi ve özel belge işlemlerinizi belirteç başına sıfır dolara halleder. Ve beş yüz pound ağırlık kaldırmanız gerektiğinde — elli dosyada büyük bir depo çapında mimari yeniden düzenleme gibi — ticari spor salonuna gidersiniz: Claude 3.5 Sonnet veya OpenAI o3 için bulut API'sine on beş dakika boyunca ödeme yapın

5:38 ve devam edin. İşte fatura: kullanılmış bir 3090 içeren Kademe 2 kurulumu her şey dahil bin altı yüz dolara mal olur. Ayda elli ila yüz dolar API belirteçlerine harcarsanız, özel kod tabanınızı üçüncü taraf sunuculardan uzak tutarken on sekiz ayda kendini amorti eder. üçüncü taraf sunuculardan uzak tutarken on sekiz ayda kendini amorti eder. Bugünkü saha testi kararı: SHIP IT. VRAM ve bellek bant genişliği her seferinde saat hızlarını yener. Yapay zeka için beş gigahertz CPU satın almayı bırakın ve kullanılmış bir 3090 bulun.

6:04 Yerel modeller için hangi donanım kurulumunu kullandığınızı yorumlarda bana söyleyin. Ve eğer bu analizi okumayı tercih ediyorsanız, the daily diff dot dev adresindeki haber bültenine abone olun, link aşağıda. Ve bugünkü fark bu kadar. Ben Axrisi'den Niko. Sorumlulukla birleştirin.

Kaynaklar

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

İlgili videolar