Den lokale maskinvareguiden for AI (2026)
Når utviklere bygger en maskin for lokale AI-agenter og åpen kildekode LLM-er, gjør de feilen med å kjøpe gaming-PC-spesifikasjoner: 5,8 GHz CPU-er, tilpassede væskekjølingssystemer og raske gaming-GPU-er med bare 8 GB VRAM.
Når utviklere bygger en maskin for lokale AI-agenter og åpen kildekode LLM-er, gjør de feilen med å kjøpe gaming-PC-spesifikasjoner: 5,8 GHz CPU-er, tilpassede væskekjølingssystemer og raske gaming-GPU-er med bare 8 GB VRAM. Men autoregressiv token-generering er begrenset av minnebåndbredde, ikke beregningskraft: for å sende ut et enkelt token, må hver vekt i modellen strømme over minnebussen. Når vektene eller KV-cache-konteksten overskrider fysisk VRAM, laster kjøretiden av lag til system-DDR5 over PCIe, og du treffer en 20x minnebåndbreddekollaps: hastigheten stuper fra 40 tokens per sekund til 1,5. I denne felttesten bryter Niko ned maskinvaremekanikken, 4-bits kvantiseringsmodellstørrelsesreglene, tre reelle budsjettnivåer fra $1200 til $5000, hvorfor et brukt RTX 3090 24GB er den beste VRAM-per-dollar-avtalen innen databehandling, Raspberry Pi-kantfellen og hjemmegymstrategien for lokal versus skyinferens. Dom: SHIP IT.
Les den skriftlige utgaven (engelsk) ↗
Hva denne videoen dekker
- Den 20x minnebåndbreddekollapsen: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31,5 GB/s PCIe
- Modellstørrelse @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nivå 1 ($1200–$1500): RTX 4060 Ti 16GB (aldri 8GB) eller Mac Mini 16GB
- Nivå 2 ($1500–$2000): Brukt RTX 3090 24GB "sweet spot" eller Mac Mini M4 Pro 64GB
- Nivå 3 ($3500+): RTX 4090 24GB / doble 3090-er eller Mac Studio Ultra
Oversatt transkripsjon
Oversatt fra den originale engelske fortellingen. Tilgjengelig lyd og undertekster kontrolleres av YouTube.
0:00 Hvis du planlegger å bygge en PC for å kjøre lokale AI-agenter, slutt å bygge en gaming-rigg. Du trenger ikke en 5,8 gigahertz Core i9, et væskekjølesystem, eller et åtte gigabyte grafikkort dekket i RGB. I lokal AI-inferens er gaming-spesifikasjoner praktisk talt ubrukelige. Den eneste metrikken som avgjør om agenten din kjører eller snegler seg fremover, er VRAM-kapasitet og minnebussbåndbredde. Regler for maskinvaretesten: glem CPU-klokker og rasteriseringsytelse.
0:24 Vi bryr oss om tre tall: minnebussbredde, båndbredde i gigabyte per sekund, og rå VRAM-tak for KV-cache-oppsvulming. I denne felttesten skal jeg bryte ned den tjue-gangeres minnebåndbreddekollapsen, kartlegge modellstørrelsesreglene, sammenligne tre reelle nivåer fra tolv hundre dollar til fem tusen, og forklare hvorfor en brukt 3090 fortsatt er datamaskinens største juks. Dette er The Daily Diff, felttest. For å forstå hvorfor gaming-rigger feiler, se på hvordan tokengenerering faktisk utføres. I spill mater CPU-en dine tegnekommandoer, og GPU-en render bilder.
0:54 Men autoregressiv LLM-dekoding er nesten utelukkende begrenset av minnebåndbredden. For å generere et enkelt token må GPU-en strømme hver vektparameter i modellen fra minnet gjennom sine beregningskjerner. Hvis modellen din er ti gigabyte, betyr produksjon av ett token å lese ti gigabyte med data. På en Nvidia RTX 3090 med en 384-bits minnebuss, får du 936 gigabyte per sekund med GDDR6X-båndbredde, som produserer åtti tokens per sekund. Men se hva som skjer det millisekundet modellen din overskrider fysisk VRAM.
1:22 Når VRAM fylles opp, laster kjøretidene av gjenværende lag over PCIe-bussen til systemets DDR5-minne. GPU-kjernene dine forventer tusen gigabyte per sekund. I stedet mater dobbelkanals DDR5 dem femti, og PCIe 4 kveles ved trettien. Det er en tjue-gangers båndbreddekollaps. Tokengenereringspipelinen stopper umiddelbart og venter på bussen, og hastigheten stuper fra førti tokens per sekund ned til ett og et halvt. Du har gjort en to tusen dollar rigg til en romvarmer.
1:47 Og det blir verre under fler-svingers agentkjøringer, fordi vekter er bare halve kampen. Hver prompt, verktøyanrop og filbit lagres i "Key-Value"-cachen. Et trettito-k kontekstvindu kan tygge gjennom fire til åtte gigabyte VRAM på toppen av vektene. Hvis kortet ditt bare har seksten gigabyte, går agenten din i løkke to ganger, treffer kontekstveggen, og krasjer enten med en "out-of-memory"-feil eller søler inn i DDR5. Her er fire-bits størrelsesoversikten. En syv eller åtte milliarder parameter modell som Llama 3.1 eller DeepSeek Distill
2:16 tar omtrent fem gigabyte. En fjorten milliarder modell tar ti gigabyte. En trettito milliarder modell, intelligensens "sweet spot" for kodeagenter, krever tjue gigabyte. Og en sytti milliarder grensemodell krever førti gigabyte før du i det hele tatt allokerer kontekst. Noe som bringer oss til de faktiske maskinvarebyggene. Nivå 1 er startriggen, tolv hundre til femten hundre dollar. På PC er ankeret ditt en RTX 4060 Ti 16-gigabyte.
2:39 Kritisk advarsel: kjøp aldri åtte-gigabyte-versjonen for å spare sytti dollar. Åtte gigabyte VRAM i 2026 er en umiddelbar "out-of-memory" dødsdom på enhver reell agentarbeidsflyt. Kombiner den med en seks-kjerners Ryzen 5, sekstifire gigabyte DDR5, og en to-terabyte NVMe-stasjon. I Apple-land er tilsvarende en Mac Mini eller MacBook Pro med seksten gigabyte enhetlig minne.
3:02 Du vil se førti til femti tokens per sekund på åtte milliarder modeller. Nivå 2 er "power user sweet spot": bygget spesifikt for å kjøre trettito milliarder parameter modeller som Qwen 2.5 32B. Vei A er en ny RTX 4070 Ti Super med seksten gigabyte for åtte hundre dollar. Men Vei B er min sterke anbefaling: kjøp en brukt Nvidia RTX 3090 tjuefire gigabyte. Du kan finne rene 3090-er på eBay for seks hundre og femti til syv hundre og femti dollar. Det gir deg tjuefire gigabyte VRAM på en massiv 384-bit buss som presser
3:33 936 gigabyte per sekund. Dollar for dollar er det den beste VRAM-avtalen innen databehandling. På macOS er Nivå 2-motstykket en Mac Mini M4 Pro med sekstifire gigabyte enhetlig minne. Den produserer elleve til tolv tokens per sekund på en trettito milliarder modell: saktere enn Nvidia, men helt stille ved tretti watt med rom for et gigantisk kontekstvindu. Nivå 3 er entusiastkategorien for multi-agent svermer. På PC betyr det en RTX 4090 med tjuefire gigabyte,
3:57 en Ryzen 9, og hundre og tjueåtte gigabyte RAM, eller doble RTX 3090-er som gir førtiåtte gigabyte total VRAM. I Apples sortiment er dette en Mac Studio Ultra med nittiseks til hundre og tjueåtte gigabyte enhetlig minne. Superkraften er minneresidens: du kan beholde en innebygd modell, en rask ruter, og en 32-milliarder kodemodell lastet samtidig med null bytteforsinkelse. Nå til den ærlige feilen i felttesten vår: "edge computing"-fellen.
4:24 Hver uke hevder et sosialt innlegg at du kan kjøre autonome kodeagenter på en åtti-dollars Raspberry Pi 5. Jeg testet det. Å kjøre en liten 1,5 milliarder parameter modell gir deg knapt tre tokens per sekund mens kortet struper ved åttifem grader Celsius. Det er en fin helgeleke, men som en daglig utviklingsdriver, er det ren straff. For programvare, bruk Ollama hvis du vil ha en ren kommandolinje-demon som kobler
4:47 direkte til Cursor, Cline eller VS Code. Hvis du vil ha en grafisk lekeplass med modellnedlastinger og GPU-lag-glidere, bruk LM Studio. Og match formatet ditt med silisiumet ditt. På Apple Silicon, last alltid ned GGUF-modeller optimalisert for Metal. På Windows eller Linux med Nvidia, last ned AWQ- eller EXL2-modeller, som bruker Nvidia Tensor Cores for tjue til tretti prosent raskere inferens. Så hvordan implementerer du dette uten å bli blakk?
5:11 Tenk på lokal maskinvare som et hjemmegym kontra et kommersielt treningsstudio. Å ha et knebøystativ hjemme betyr at du trener hver dag uten reisevei, null abonnementsavgifter, og fullstendig personvern. Din lokale maskin håndterer åtti prosent av din daglige koding, enhetstesting og privat dokumentbehandling for null dollar per token. Og når du trenger å "deadlifte" fem hundre pund – som en massiv repo-bred arkitektonisk refaktor på tvers av femti filer – besøker du det kommersielle treningsstudioet: betal sky-API-en for Claude 3.5 Sonnet eller OpenAI o3 i femten minutter
5:38 og gå videre. Her er regningen: et Nivå 2-bygg med en brukt 3090 koster seksten hundre dollar totalt. Hvis du bruker femti til hundre dollar i måneden på API-tokens, betaler det seg selv på atten måneder samtidig som din proprietære kodebase holdes borte fra tredjepartsservere. Dagens felttestdom: SHIP IT. VRAM og minnebåndbredde slår klokkehastigheter hver eneste gang. Slutt å kjøpe fem-gigahertz CPU-er for AI, og finn en brukt 3090.
6:04 Fortell meg hvilken maskinvare du kjører for lokale modeller i kommentarene. Og hvis du heller vil lese denne oversikten, hent nyhetsbrevet på the daily diff dot dev, lenke nedenfor. Og det er forskjellen for i dag. Jeg er Niko fra Axrisi. Flett ansvarlig.
Kilder
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



