+− THE DAILY DIFFdev & AI news
SHIP IT

Ghidul local de hardware AI (2026)

Atunci când construiesc o mașină pentru agenți AI locali și LLM-uri cu greutate deschisă, dezvoltatorii fac greșeala de a cumpăra specificații de PC pentru jocuri: procesoare de 5,8 GHz, sisteme personalizate de răcire lichidă și GPU-uri rapide de jocuri cu doar 8GB de VRAM.

Atunci când construiesc o mașină pentru agenți AI locali și LLM-uri cu greutate deschisă, dezvoltatorii fac greșeala de a cumpăra specificații de PC pentru jocuri: procesoare de 5,8 GHz, sisteme personalizate de răcire lichidă și GPU-uri rapide de jocuri cu doar 8GB de VRAM. Dar generarea autoregresivă de token-uri este limitată de lățimea de bandă a memoriei, nu de puterea de calcul: pentru a emite un singur token, fiecare greutate din model trebuie să "curgă" prin magistrala de memorie. Când greutățile sau contextul cache-ului KV depășesc VRAM-ul fizic, runtime-ul descarcă straturile în DDR5-ul sistemului prin PCIe și te lovești de o "prăpastie" de lățime de bandă a memoriei de 20 de ori: viteza scade de la 40 de token-uri pe secundă la 1,5. În acest test de teren, Niko analizează mecanica hardware, regulile de dimensionare a modelului de cuantificare pe 4 biți, trei niveluri reale de buget de la 1.200 USD la 5.000 USD, de ce un RTX 3090 24GB folosit este cea mai bună afacere VRAM-per-dolar în calcul, capcana edge computing-ului cu Raspberry Pi și strategia "sălii de sport acasă" pentru inferența locală versus cea din cloud. Verdict: SHIP IT.

Citiți ediția scrisă (engleză) ↗

Ce acoperă acest videoclip

  • Prăpastia de 20x lățime de bandă a memoriei: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31,5 GB/s PCIe
  • Dimensionarea modelului @ 4 biți: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Nivelul 1 (1.200–1.500 USD): RTX 4060 Ti 16GB (niciodată 8GB) sau Mac Mini 16GB
  • Nivelul 2 (1.500–2.000 USD): Punctul optim RTX 3090 24GB folosit sau Mac Mini M4 Pro 64GB
  • Nivelul 3 (3.500 USD+): RTX 4090 24GB / dual 3090 sau Mac Studio Ultra

Transcrierea tradusă

Tradus din narațiunea originală în engleză. Audio-ul și subtitrările disponibile sunt controlate de YouTube.

0:00 Dacă intenționați să construiți un PC pentru a rula agenți AI locali, încetați să construiți un rig de gaming. Nu aveți nevoie de un Core i9 de cinci virgule opt gigahertzi, un sistem de răcire cu lichid, sau o placă grafică de opt gigabytes acoperită cu RGB. În inferența AI locală, specificațiile de gaming sunt practic inutile. Singura metrică care dictează dacă agentul dvs. rulează sau se târăște este capacitatea VRAM și lățimea de bandă a magistralei de memorie. Regulile testului hardware: uitați de frecvențele CPU și de benchmark-urile de rasterizare.

0:24 Ne interesează trei numere: lățimea magistralei de memorie, lățimea de bandă în gigabytes pe secundă și spațiul liber VRAM brut pentru umflarea cache-ului KV. În acest test de teren, voi analiza "prăpastia" de lățime de bandă a memoriei de douăzeci de ori, voi cartografia regulile de dimensionare a modelului, voi compara trei niveluri reale de la o mie două sute de dolari la cinci mii și voi explica de ce un 3090 folosit este încă cel mai mare cod de înșelăciune al calculatoarelor. Acesta este The Daily Diff, test de teren. Pentru a înțelege de ce rig-urile de gaming eșuează, uitați-vă la modul în care se execută efectiv generarea de token-uri. În jocuri, CPU-ul dvs. alimentează apelurile de desenare și GPU-ul dvs. randează cadrele.

0:54 Dar decodarea LLM autoregresivă este aproape pur limitată de lățimea de bandă a memoriei. Pentru a genera un singur token, GPU-ul trebuie să transmită în flux fiecare parametru de greutate al modelului din memorie prin nucleele sale de calcul. Dacă modelul dvs. este de zece gigabytes, producerea unui token înseamnă citirea a zece gigabytes de date. Pe un Nvidia RTX 3090 cu o magistrală de memorie de 384 de biți, obțineți 936 gigabytes pe secundă de lățime de bandă GDDR6X, producând optzeci de token-uri pe secundă. Dar uitați-vă ce se întâmplă în clipa în care modelul dvs. depășește VRAM-ul fizic.

1:22 Când VRAM-ul se umple, runtime-urile descarcă straturile rămase prin magistrala PCIe către memoria sistemului DDR5. Nucleele GPU-ului dvs. se așteaptă la o mie de gigabytes pe secundă. În schimb, DDR5-ul dual-channel le alimentează cu cincizeci, iar PCIe 4 se "înfundă" la treizeci și unu. Aceasta este o prăbușire a lățimii de bandă de douăzeci de ori. Pipelina de generare a token-urilor se blochează instantaneu, așteptând pe magistrală, și viteza scade de la patruzeci de token-uri pe secundă la unu virgule cinci. Ați transformat un rig de două mii de dolari într-un încălzitor de spațiu.

1:47 Și se înrăutățește în timpul rulărilor de agenți multi-turn, deoarece greutățile sunt doar jumătate din bătălie. Fiecare prompt, apel de instrument și bucată de fișier este stocat în cache-ul Key-Value. O fereastră de context de treizeci și doi de mii poate consuma patru până la opt gigabytes de VRAM pe lângă greutăți. Dacă placa dvs. are doar șaisprezece gigabytes, agentul dvs. rulează în buclă de două ori, atinge peretele de context și fie se blochează cu o eroare de memorie insuficientă, fie se revarsă în DDR5. Iată fișa de cheat-uri pentru dimensionarea pe patru biți. Un model de șapte sau opt miliarde de parametri, cum ar fi Llama 3.1 sau DeepSeek Distill,

2:16 necesită aproximativ cinci gigabytes. Un model de paisprezece miliarde necesită zece gigabytes. Un model de treizeci și două de miliarde, punctul optim de inteligență pentru agenții de codare, necesită douăzeci de gigabytes. Și un model de frontieră de șaptezeci de miliarde cere patruzeci de gigabytes înainte de a aloca context. Ceea ce ne aduce la construcțiile hardware reale. Nivelul 1 este rig-ul de pornire, o mie două sute până la o mie cinci sute de dolari. Pe PC, ancora dvs. este un RTX 4060 Ti de 16 gigabytes.

2:39 Avertisment critic: nu cumpărați niciodată versiunea de opt gigabytes pentru a economisi șaptezeci de dolari. Opt gigabytes de VRAM în 2026 este o condamnare imediată la "out-of-memory" (memorie insuficientă) pentru orice flux de lucru real cu agenți. Asociați-l cu un Ryzen 5 cu șase nuclee, șaizeci și patru de gigabytes de DDR5, și o unitate NVMe de doi terabytes. În lumea Apple, echivalentul este un Mac Mini sau MacBook Pro cu șaisprezece gigabytes de memorie unificată.

3:02 Veți vedea patruzeci până la cincizeci de token-uri pe secundă pe modele de opt miliarde. Nivelul 2 este punctul optim pentru utilizatorii avansați: construit specific pentru a rula modele cu treizeci și două de miliarde de parametri, cum ar fi Qwen 2.5 32B. Calea A este un nou RTX 4070 Ti Super cu șaisprezece gigabytes pentru opt sute de dolari. Dar Calea B este recomandarea mea puternică: cumpărați un Nvidia RTX 3090 de douăzeci și patru de gigabytes folosit. Puteți găsi 3090-uri curate pe eBay pentru șase sute cincizeci până la șapte sute cincizeci de dolari. Aceasta vă oferă douăzeci și patru de gigabytes de VRAM pe o magistrală masivă de 384 de biți, împingând

3:33 936 gigabytes pe secundă. Dolar pentru dolar, este cea mai bună afacere VRAM din calcul. Pe macOS, echivalentul Nivelului 2 este un Mac Mini M4 Pro cu șaizeci și patru de gigabytes de memorie unificată. Produce unsprezece până la doisprezece token-uri pe secundă pe un model de treizeci și două de miliarde: mai lent decât Nvidia, dar absolut silențios la treizeci de wați, cu spațiu pentru o fereastră de context uriașă. Nivelul 3 este categoria entuziaștilor pentru roiuri de agenți multipli. Pe PC, asta înseamnă un RTX 4090 cu douăzeci și patru de gigabytes,

3:57 un Ryzen 9 și o sută douăzeci și opt de gigabytes de RAM, sau dual RTX 3090 oferind patruzeci și opt de gigabytes de VRAM total. În gama Apple, acesta este un Mac Studio Ultra cu nouăzeci și șase până la o sută douăzeci și opt de gigabytes de memorie unificată. Superputerea este rezidența memoriei: puteți păstra un model de încorporare, un router rapid și un model de codare de 32 de miliarde încărcat simultan, fără întârziere de swap. Acum, despre eșecul sincer al testului nostru de teren: capcana edge computing.

4:24 În fiecare săptămână, o postare socială susține că puteți rula agenți de codare autonomi pe un Raspberry Pi 5 de optzeci de dolari. L-am testat. Rularea unui model mic de un virgule cinci miliarde de parametri vă oferă abia trei token-uri pe secundă, în timp ce placa se sufocă la optzeci și cinci de grade Celsius. Este o jucărie interesantă de weekend, dar ca driver de dezvoltare zilnic, este pură pedeapsă. Pentru software, folosiți Ollama dacă doriți un daemon curat de linie de comandă care se conectează

4:47 direct la Cursor, Cline sau VS Code. Dacă doriți un "playground" grafic cu descărcări de modele și slidere pentru straturi GPU, folosiți LM Studio. Și potriviți formatul cu siliciul dvs. Pe Apple Silicon, descărcați întotdeauna modele GGUF optimizate pentru Metal. Pe Windows sau Linux cu Nvidia, descărcați modele AWQ sau EXL2, care utilizează Nvidia Tensor Cores pentru o inferență cu douăzeci până la treizeci la sută mai rapidă. Deci, cum implementați asta fără să dați faliment?

5:11 Gândiți-vă la hardware-ul local ca la o sală de sport acasă versus o sală de sport comercială. A avea un rack de genuflexiuni acasă înseamnă că vă antrenați în fiecare zi fără navetă, fără taxe de abonament și cu intimitate completă. Mașina dvs. locală gestionează optzeci la sută din codificarea dvs. zilnică, testarea unitară și procesarea documentelor private pentru zero dolari per token. Și când trebuie să ridicați o mie de livre – ca o refactorizare arhitecturală masivă la nivel de repo pe cincizeci de fișiere – vizitați sala de sport comercială: plătiți API-ul cloud pentru Claude 3.5 Sonnet sau OpenAI o3 timp de cincisprezece minute

5:38 și mergeți mai departe. Iată factura: o construcție de Nivel 2 cu un 3090 folosit costă o mie șase sute de dolari cu totul. Dacă cheltuiți cincizeci până la o sută de dolari pe lună pe token-uri API, se amortizează în optsprezece luni, păstrând în același timp baza de cod proprietară în afara serverelor terților. Verdictul testului de teren de astăzi: SHIP IT. VRAM și lățimea de bandă a memoriei bat frecvențele de ceas de fiecare dată. Nu mai cumpărați procesoare de cinci gigahertzi pentru AI și găsiți un 3090 folosit.

6:04 Spuneți-mi ce construcție hardware rulați pentru modelele locale în comentarii. Și dacă preferați să citiți această analiză, abonați-vă la newsletter la the daily diff punct dev, link mai jos. Și aceasta este diferența pentru astăzi. Sunt Niko de la Axrisi. Îmbină responsabil.

Surse

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Videoclipuri similare