+− THE DAILY DIFFdev & AI news
SHIP IT

Panduan Perangkat Keras AI Lokal (2026)

Ketika membangun mesin untuk agen AI lokal dan LLM bobot terbuka, pengembang membuat kesalahan dengan membeli spesifikasi PC gaming: CPU 5.8 GHz, pendingin cairan kustom, dan GPU gaming cepat dengan VRAM hanya 8GB.

Ketika membangun mesin untuk agen AI lokal dan LLM bobot terbuka, pengembang membuat kesalahan dengan membeli spesifikasi PC gaming: CPU 5.8 GHz, pendingin cairan kustom, dan GPU gaming cepat dengan VRAM hanya 8GB. Namun, pembuatan token autoregresif terikat pada bandwidth memori, bukan terikat pada komputasi: untuk memancarkan satu token, setiap bobot dalam model harus mengalir melalui bus memori. Ketika bobot atau konteks cache KV Anda melebihi VRAM fisik, runtime mengalihkan lapisan ke sistem DDR5 melalui PCIe, dan Anda mengalami penurunan bandwidth memori 20x: kecepatan anjlok dari 40 token per detik menjadi 1.5. Dalam uji lapangan ini, Niko membedah mekanisme perangkat keras, aturan ukuran model kuantisasi 4-bit, tiga tingkat anggaran riil dari $1.200 hingga $5.000, mengapa RTX 3090 24GB bekas adalah penawaran VRAM-per-dolar terbaik dalam komputasi, jebakan edge Raspberry Pi, dan strategi home gym untuk inferensi lokal versus cloud. Putusan: SHIP IT.

Baca edisi tertulis (Inggris) ↗

Isi video ini

  • Penurunan bandwidth memori 20x: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Ukuran model @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Tingkat 1 ($1.200–$1.500): RTX 4060 Ti 16GB (jangan pernah 8GB) atau Mac Mini 16GB
  • Tingkat 2 ($1.500–$2.000): RTX 3090 24GB bekas adalah titik manis atau Mac Mini M4 Pro 64GB
  • Tingkat 3 ($3.500+): RTX 4090 24GB / dual 3090s atau Mac Studio Ultra

Transkrip terjemahan

Diterjemahkan dari narasi asli bahasa Inggris. Audio dan teks tersedia yang dikontrol oleh YouTube.

0:00 Jika Anda berencana untuk membangun PC untuk menjalankan agen AI lokal, berhentilah membangun rig gaming. Anda tidak membutuhkan Core i9 lima koma delapan gigahertz, pendingin cairan, atau kartu grafis delapan gigabyte yang dilapisi RGB. Dalam inferensi AI lokal, spesifikasi gaming hampir tidak berguna. Satu-satunya metrik yang menentukan apakah agen Anda berjalan atau merangkak adalah kapasitas VRAM dan bandwidth bus memori. Aturan uji perangkat keras: lupakan kecepatan clock CPU dan benchmark rasterisasi.

0:24 Kita peduli dengan tiga angka: lebar bus memori, bandwidth dalam gigabyte per detik, dan ruang kepala VRAM mentah untuk pembengkakan cache KV. Dalam uji lapangan ini, saya akan menguraikan penurunan bandwidth memori dua puluh kali lipat, memetakan aturan ukuran model, mengukur tiga tingkatan nyata dari seribu dua ratus dolar hingga lima ribu, dan menjelaskan mengapa 3090 bekas masih merupakan kode curang terbesar dalam komputasi. Ini adalah The Daily Diff, uji lapangan. Untuk memahami mengapa rig gaming gagal, lihat bagaimana pembuatan token sebenarnya berjalan. Dalam game, CPU Anda memberi makan panggilan gambar dan GPU Anda merender bingkai.

0:54 Namun decoding LLM autoregresif hampir murni terikat pada bandwidth memori. Untuk menghasilkan satu token, GPU harus mengalirkan setiap parameter bobot dari model dari memori melalui inti komputasinya. Jika model Anda berukuran sepuluh gigabyte, menghasilkan satu token berarti membaca sepuluh gigabyte data. Pada Nvidia RTX 3090 dengan bus memori 384-bit, Anda mendapatkan 936 gigabyte per detik bandwidth GDDR6X, menghasilkan delapan puluh token per detik. Tapi perhatikan apa yang terjadi saat model Anda melebihi VRAM fisik.

1:22 Ketika VRAM terisi, runtime memindahkan lapisan yang tersisa melalui bus PCIe ke memori sistem DDR5. Inti GPU Anda mengharapkan seribu gigabyte per detik. Sebaliknya, DDR5 dual-channel memberi mereka lima puluh, dan PCIe 4 tercekik pada tiga puluh satu. Itu adalah kolaps bandwidth dua puluh kali lipat. Pipa pembuatan token langsung terhenti menunggu bus, dan kecepatan anjlok dari empat puluh token per detik menjadi satu koma lima. Anda telah mengubah rig dua ribu dolar menjadi pemanas ruangan.

1:47 Dan itu menjadi lebih buruk selama menjalankan agen multi-putaran, karena bobot hanyalah setengah pertempuran. Setiap prompt, panggilan alat, dan potongan file disimpan dalam cache Key-Value. Jendela konteks tiga puluh dua ribu dapat menghabiskan empat hingga delapan gigabyte VRAM di atas bobot. Jika kartu Anda hanya memiliki enam belas gigabyte, agen Anda berputar dua kali, menabrak dinding konteks, dan kemudian crash dengan kesalahan kehabisan memori atau tumpah ke DDR5. Berikut adalah lembar contekan ukuran 4-bit. Model parameter tujuh atau delapan miliar seperti Llama 3.1 atau DeepSeek Distill

2:16 membutuhkan sekitar lima gigabyte. Model empat belas miliar membutuhkan sepuluh gigabyte. Model tiga puluh dua miliar, titik manis kecerdasan untuk agen pengkodean, membutuhkan dua puluh gigabyte. Dan model frontier tujuh puluh miliar membutuhkan empat puluh gigabyte sebelum Anda bahkan mengalokasikan konteks. Yang membawa kita pada build perangkat keras sebenarnya. Tingkat 1 adalah rig pemula, seribu dua ratus hingga seribu lima ratus dolar. Pada PC, jangkar Anda adalah RTX 4060 Ti 16-gigabyte.

2:39 Peringatan kritis: jangan pernah membeli versi delapan gigabyte untuk menghemat tujuh puluh dolar. Delapan gigabyte VRAM pada tahun 2026 adalah hukuman mati kehabisan memori langsung pada alur kerja agen nyata mana pun. Pasangkan dengan Ryzen 5 enam inti, enam puluh empat gigabyte DDR5, dan drive NVMe dua terabyte. Di dunia Apple, yang setara adalah Mac Mini atau MacBook Pro dengan enam belas gigabyte memori terpadu.

3:02 Anda akan melihat empat puluh hingga lima puluh token per detik pada model delapan miliar. Tingkat 2 adalah titik manis pengguna daya: membangun secara khusus untuk menjalankan model parameter tiga puluh dua miliar seperti Qwen 2.5 32B. Jalur A adalah RTX 4070 Ti Super baru dengan enam belas gigabyte seharga delapan ratus dolar. Tapi Jalur B adalah rekomendasi kuat saya: beli Nvidia RTX 3090 bekas dua puluh empat gigabyte. Anda dapat menemukan 3090 bersih di eBay seharga enam ratus lima puluh hingga tujuh ratus lima puluh dolar. Itu memberi Anda dua puluh empat gigabyte VRAM pada bus 384-bit besar yang mendorong

3:33 936 gigabyte per detik. Dolar per dolar, itu adalah penawaran VRAM terbaik dalam komputasi. Di macOS, rekan Tingkat 2 adalah Mac Mini M4 Pro dengan enam puluh empat gigabyte memori terpadu. Ini menghasilkan sebelas hingga dua belas token per detik pada model tiga puluh dua miliar: lebih lambat dari Nvidia, tetapi hening pada tiga puluh watt dengan ruang untuk jendela konteks raksasa. Tingkat 3 adalah kategori penggemar untuk kawanan multi-agen. Pada PC, itu berarti RTX 4090 dengan dua puluh empat gigabyte,

3:57 Ryzen 9, dan seratus dua puluh delapan gigabyte RAM, atau dual RTX 3090 yang menyediakan empat puluh delapan gigabyte total VRAM. Dalam jajaran Apple, ini adalah Mac Studio Ultra dengan sembilan puluh enam hingga seratus dua puluh delapan gigabyte memori terpadu. Kekuatan supernya adalah residensi memori: Anda dapat menyimpan model penyematan, router cepat, dan model pengkodean 32 miliar dimuat secara bersamaan tanpa penundaan swap nol. Sekarang untuk kegagalan jujur dari uji lapangan kami: jebakan komputasi edge.

4:24 Setiap minggu sebuah postingan sosial mengklaim Anda dapat menjalankan agen pengkodean otonom pada Raspberry Pi 5 seharga delapan puluh dolar. Saya mengujinya. Menjalankan model parameter satu koma lima miliar yang kecil memberi Anda hampir tiga token per detik sementara papan tersebut membatasi pada delapan puluh lima derajat Celcius. Ini mainan akhir pekan yang bagus, tapi sebagai driver pengembangan harian, itu murni hukuman. Untuk perangkat lunak, gunakan Ollama jika Anda menginginkan daemon baris perintah bersih yang terhubung

4:47 langsung ke Cursor, Cline, atau VS Code. Jika Anda menginginkan lingkungan bermain grafis dengan unduhan model dan penggeser lapisan GPU, gunakan LM Studio. Dan sesuaikan format Anda dengan silikon Anda. Di Apple Silicon, selalu unduh model GGUF yang dioptimalkan untuk Metal. Di Windows atau Linux dengan Nvidia, unduh model AWQ atau EXL2, yang memanfaatkan Nvidia Tensor Cores untuk inferensi dua puluh hingga tiga puluh persen lebih cepat. Jadi bagaimana Anda menyebarkan ini tanpa bangkrut?

5:11 Anggap perangkat keras lokal seperti gym rumahan versus gym komersial. Memiliki rak squat di rumah berarti Anda berlatih setiap hari tanpa perjalanan, tanpa biaya langganan, dan privasi lengkap. Mesin lokal Anda menangani delapan puluh persen pengkodean harian Anda, pengujian unit, dan pemrosesan dokumen pribadi tanpa biaya per token. Dan ketika Anda perlu mengangkat beban lima ratus pon — seperti refactor arsitektur besar di seluruh repositori pada lima puluh file — Anda mengunjungi gym komersial: bayar API cloud untuk Claude 3.5 Sonnet atau OpenAI o3 selama lima belas menit

5:38 dan lanjutkan. Berikut tagihannya: build Tingkat 2 dengan 3090 bekas berharga seribu enam ratus dolar secara keseluruhan. Jika Anda menghabiskan lima puluh hingga seratus dolar sebulan untuk token API, itu akan menguntungkan dirinya sendiri dalam delapan belas bulan sambil menjaga basis kode milik Anda dari server pihak ketiga. Putusan uji lapangan hari ini: SHIP IT. VRAM dan bandwidth memori mengalahkan kecepatan clock setiap saat. Berhentilah membeli CPU lima gigahertz untuk AI, dan cari 3090 bekas.

6:04 Beri tahu saya build perangkat keras apa yang Anda gunakan untuk model lokal di kolom komentar. Dan jika Anda lebih suka membaca rincian ini, dapatkan buletin di the daily diff dot dev, tautan di bawah. Dan itulah perbedaannya untuk hari ini. Saya Niko dari Axrisi. Gabungkan secara bertanggung jawab.

Sumber

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Video terkait