+− THE DAILY DIFFdev & AI news
SHIP IT

Ang Gabay sa Lokal na AI Hardware (2026)

Kapag nagtatayo ng makina para sa mga lokal na AI agent at open-weight LLM, nagkakamali ang mga developer sa pagbili ng gaming PC specs: 5.8 GHz CPU, custom liquid cooling loop, at mabilis na gaming GPU na may 8GB lang ng VRAM.

Kapag nagtatayo ng makina para sa mga lokal na AI agent at open-weight LLM, nagkakamali ang mga developer sa pagbili ng gaming PC specs: 5.8 GHz CPU, custom liquid cooling loop, at mabilis na gaming GPU na may 8GB lang ng VRAM. Ngunit ang autoregressive token generation ay memory-bandwidth bound, hindi compute bound: upang makagawa ng isang token, bawat weight sa modelo ay dapat dumaloy sa memory bus. Kapag ang iyong weights o KV cache context ay lumampas sa pisikal na VRAM, inililipat ng runtime ang mga layer sa system DDR5 sa ibabaw ng PCIe, at makakaranas ka ng 20x memory bandwidth cliff: ang bilis ay bumababa mula 40 tokens bawat segundo sa 1.5. Sa field test na ito, sinira ni Niko ang mekanika ng hardware, ang 4-bit quantization model sizing rules, tatlong tunay na budget tier mula $1,200 hanggang $5,000, kung bakit ang isang ginamit na RTX 3090 24GB ang pinakamahusay na VRAM-per-dollar deal sa computing, ang Raspberry Pi edge trap, at ang home gym strategy para sa lokal laban sa cloud inference. Hatol: SHIP IT.

Basahin ang nakasulat na edisyon (English) ↗

Ang sakop ng video na ito

  • Ang 20x memory bandwidth cliff: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
  • Pag-size ng modelo @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Tier 1 ($1,200–$1,500): RTX 4060 Ti 16GB (hindi 8GB) o Mac Mini 16GB
  • Tier 2 ($1,500–$2,000): Ginamit na RTX 3090 24GB sweet spot o Mac Mini M4 Pro 64GB
  • Tier 3 ($3,500+): RTX 4090 24GB / dalawang 3090 o Mac Studio Ultra

Isinaling transcript

Isinalin mula sa orihinal na salaysay sa English. Ang available na audio at mga caption ay kinokontrol ng YouTube.

0:00 Kung plano mong bumuo ng isang PC para magpatakbo ng mga lokal na AI agent, tigilan na ang paggawa ng gaming rig. Hindi mo kailangan ang limang-punto-walong gigahertz na Core i9, isang liquid cooling loop, o isang walong-gigabyte na graphics card na may RGB. Sa lokal na AI inference, halos walang silbi ang gaming specs. Ang tanging sukatan na nagdidikta kung tatakbo o maglalakad ang iyong agent ay ang VRAM capacity at memory bus bandwidth. Mga Panuntunan ng hardware test: kalimutan ang CPU clocks at rasterization benchmarks.

0:24 Tatlong numero ang mahalaga sa atin: memory bus width, bandwidth sa gigabytes bawat segundo, at raw VRAM headroom para sa KV cache bloat. Sa field test na ito, sisirain ko ang twenty-x memory bandwidth cliff, imapa ang mga panuntunan sa pag-size ng modelo, i-benchmark ang tatlong tunay na tier mula twelve hundred dollars hanggang five grand, at ipaliwanag kung bakit ang isang ginamit na 3090 ay nananatiling pinakamalaking cheat code ng computing. Ito ang The Daily Diff, field test. Upang maunawaan kung bakit nabibigo ang mga gaming rig, tingnan kung paano talaga gumagana ang pagbuo ng token. Sa mga laro, ang iyong CPU ang nagpapakain ng mga draw call at ang iyong GPU ang nagre-render ng mga frame.

0:54 Ngunit ang autoregressive LLM decoding ay halos puro memory bandwidth bound. Upang makabuo ng isang token, dapat i-stream ng GPU ang bawat parameter ng weight ng modelo mula sa memory sa pamamagitan ng mga compute core nito. Kung ang iyong modelo ay sampung gigabytes, ang paggawa ng isang token ay nangangahulugang pagbabasa ng sampung gigabytes ng data. Sa isang Nvidia RTX 3090 na may 384-bit memory bus, makakakuha ka ng 936 gigabytes bawat segundo ng GDDR6X bandwidth, na nagbubunga ng walumpung tokens bawat segundo. Ngunit tingnan kung ano ang mangyayari sa sandaling lumampas ang iyong modelo sa pisikal na VRAM.

1:22 Kapag napuno ang VRAM, inililipat ng mga runtime ang natitirang mga layer sa buong PCIe bus sa system DDR5 memory. Inaasahan ng iyong mga GPU core ang isang libong gigabytes bawat segundo. Sa halip, ang dual-channel DDR5 ay nagpapakain sa kanila ng limampu, at ang PCIe 4 ay nagsasara sa tatlumpu't isa. Iyon ay isang twenty-x bandwidth collapse. Agad na humihinto ang pipeline ng pagbuo ng token habang naghihintay sa bus, at ang bilis ay bumababa mula sa apatnapung tokens bawat segundo hanggang sa isang punto lima. Ginawa mong pampainit ang isang two-thousand-dollar rig.

1:47 At lumala pa ito sa multi-turn agent runs, dahil ang mga weights ay kalahati lamang ng laban. Bawat prompt, tool call, at file chunk ay nakaimbak sa Key-Value cache. Ang isang thirty-two-k context window ay maaaring gumamit ng apat hanggang walong gigabytes ng VRAM bukod pa sa mga weights. Kung ang iyong card ay may labing-anim na gigabytes lamang, ang iyong agent ay umuulit ng dalawang beses, tinatamaan ang context wall, at alinman ay nag-crash na may out-of-memory error o nag-spill sa DDR5. Narito ang four-bit sizing cheat sheet. Ang isang pito o walong-bilyong parameter na modelo tulad ng Llama 3.1 o DeepSeek Distill

2:16 ay tumatagal ng mga limang gigabytes. Ang isang fourteen-billion na modelo ay tumatagal ng sampung gigabytes. Ang isang thirty-two-billion na modelo, ang intelligence sweet spot para sa mga coding agent, ay nangangailangan ng dalawampung gigabytes. At ang isang seventy-billion frontier na modelo ay nangangailangan ng apatnapung gigabytes bago mo pa man ialok ang context. Na nagdadala sa atin sa aktwal na paggawa ng hardware. Ang Tier 1 ay ang starter rig, twelve hundred hanggang fifteen hundred dollars. Sa PC, ang iyong anchor ay isang RTX 4060 Ti 16-gigabyte.

2:39 Kritikal na babala: huwag kailanman bilhin ang eight-gigabyte na bersyon para makatipid ng seventy dollars. Ang walong gigabytes ng VRAM sa 2026 ay isang agarang out-of-memory death sentence sa anumang tunay na agent workflow. Ipares ito sa isang six-core Ryzen 5, sixty-four gigabytes ng DDR5, at isang two-terabyte NVMe drive. Sa Apple land, ang katumbas ay isang Mac Mini o MacBook Pro na may labing-anim na gigabytes ng unified memory.

3:02 Makikita mo ang apatnapu hanggang limampung tokens bawat segundo sa eight-billion na modelo. Ang Tier 2 ay ang power user sweet spot: partikular na binuo upang magpatakbo ng thirty-two-billion parameter na modelo tulad ng Qwen 2.5 32B. Ang Path A ay isang bagong RTX 4070 Ti Super na may labing-anim na gigabytes para sa walong daan dolyar. Ngunit ang Path B ay ang aking matinding rekomendasyon: bumili ng ginamit na Nvidia RTX 3090 twenty-four gigabytes. Makakahanap ka ng malinis na 3090s sa eBay sa anim na raan at limampu hanggang pitong daan at limampung dolyar. Nagbibigay iyon sa iyo ng twenty-four gigabytes ng VRAM sa isang napakalaking 384-bit bus na nagtutulak ng

3:33 936 gigabytes bawat segundo. Dolyar para sa dolyar, ito ang pinakamahusay na VRAM deal sa computing. Sa macOS, ang Tier 2 counterpart ay isang Mac Mini M4 Pro na may sixty-four gigabytes ng unified memory. Nagbubunga ito ng labing-isa hanggang labindalawang tokens bawat segundo sa isang thirty-two-billion na modelo: mas mabagal kaysa sa Nvidia, ngunit tahimik sa tatlumpung watts na may espasyo para sa isang higanteng context window. Ang Tier 3 ay ang enthusiast bracket para sa multi-agent swarms. Sa PC, nangangahulugan iyon ng isang RTX 4090 na may twenty-four gigabytes,

3:57 isang Ryzen 9, at isang hundred and twenty-eight gigabytes ng RAM, o dalawang RTX 3090 na nagbibigay ng apatnapu't walong gigabytes ng kabuuang VRAM. Sa lineup ng Apple, ito ay isang Mac Studio Ultra na may ninety-six hanggang isang daan at dalawampu't walong gigabytes ng unified memory. Ang superpower ay memory residency: maaari kang magtago ng isang embedding model, isang mabilis na router, at isang 32-billion coding model na sabay-sabay na naka-load nang may zero swap delay. Ngayon para sa matapat na kabiguan ng aming field test: ang edge computing trap.

4:24 Bawat linggo, sinasabi ng isang social post na maaari kang magpatakbo ng autonomous coding agents sa isang eighty-dollar Raspberry Pi 5. Sinubukan ko. Ang pagpapatakbo ng isang maliit na one-point-five billion parameter na modelo ay nagbibigay sa iyo ng halos tatlong tokens bawat segundo habang ang board ay nag-throttle sa eighty-five degrees Celsius. Ito ay isang magandang laruan sa weekend, ngunit bilang isang pang-araw-araw na development driver, ito ay purong kaparusahan. Para sa software, gamitin ang Ollama kung gusto mo ng malinis na command-line daemon na kumokonekta

4:47 diretso sa Cursor, Cline, o VS Code. Kung gusto mo ng graphical playground na may mga model download at GPU layer slider, gamitin ang LM Studio. At itugma ang iyong format sa iyong silicon. Sa Apple Silicon, palaging i-download ang mga GGUF model na na-optimize para sa Metal. Sa Windows o Linux na may Nvidia, i-download ang AWQ o EXL2 model, na gumagamit ng Nvidia Tensor Cores para sa twenty hanggang thirty percent na mas mabilis na inference. Kaya paano mo ito i-deploy nang hindi nababali?

5:11 Isipin ang lokal na hardware tulad ng isang home gym kumpara sa isang komersyal na gym. Ang pagkakaroon ng squat rack sa bahay ay nangangahulugang nagte-training ka araw-araw nang walang commute, walang subscription fees, at kumpletong privacy. Hinihawakan ng iyong lokal na makina ang walumpung porsyento ng iyong pang-araw-araw na coding, unit testing, at pribadong pagpoproseso ng dokumento nang walang bayad bawat token. At kapag kailangan mong mag-deadlift ng limang daang pounds — tulad ng isang napakalaking repo-wide architectural refactor sa limampung file — binibisita mo ang komersyal na gym: bayaran ang cloud API para sa Claude 3.5 Sonnet o OpenAI o3 sa loob ng labing-limang minuto

5:38 at magpatuloy. Narito ang bill: ang isang Tier 2 build na may ginamit na 3090 ay nagkakahalaga ng sixteen hundred dollars lahat-lahat. Kung gagastos ka ng fifty hanggang isang daang dolyar bawat buwan sa mga API token, babayaran nito ang sarili sa loob ng labing-walong buwan habang pinapanatili ang iyong proprietary codebase na malayo sa mga third-party server. Ang hatol ng field test ngayon: SHIP IT. Ang VRAM at memory bandwidth ay mas mahusay kaysa sa clock speeds sa bawat pagkakataon. Tigilan ang pagbili ng five-gigahertz CPU para sa AI, at maghanap ng ginamit na 3090.

6:04 Sabihin mo sa akin kung anong hardware build ang ginagamit mo para sa mga lokal na modelo sa comments. At kung mas gusto mong basahin ang breakdown na ito, kunin ang newsletter sa the daily diff dot dev, link sa ibaba. At iyan ang diff para sa ngayon. Ako si Niko mula sa Axrisi. Magsama nang responsable.

Mga Pinagmulan

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Mga kaugnay na video