Den Lokale AI Hardware Guide (2026)
Når udviklere bygger en maskine til lokale AI-agenter og open-weight LLM'er, begår de den fejl at købe gaming-PC-specifikationer: 5,8 GHz CPU'er, specialtilpassede væskekølingssystemer og hurtige gaming-GPU'er med kun 8 GB VRAM.
Når udviklere bygger en maskine til lokale AI-agenter og open-weight LLM'er, begår de den fejl at købe gaming-PC-specifikationer: 5,8 GHz CPU'er, specialtilpassede væskekølingssystemer og hurtige gaming-GPU'er med kun 8 GB VRAM. Men autoregressiv token-generering er begrænset af hukommelsesbåndbredden, ikke regnekraften: for at udsende et enkelt token skal hver vægt i modellen streames over hukommelsesbussen. Når dine vægte eller KV-cache-kontekst overstiger fysisk VRAM, aflæsser runtime-miljøet lag til system-DDR5 via PCIe, og du rammer en 20x hukommelsesbåndbreddekløft: hastigheden falder fra 40 tokens i sekundet til 1,5. I denne felttest gennemgår Niko hardwaremekanikken, reglerne for 4-bit kvantiseringsmodelstørrelse, tre reelle budgetniveauer fra 1.200 til 5.000 dollars, hvorfor et brugt RTX 3090 24GB er den bedste VRAM-per-dollar-aftale inden for computing, Raspberry Pi-edge-fælden og hjemmegym-strategien for lokal versus cloud-inferens. Dom: SHIP IT.
Læs den skriftlige udgave (engelsk) ↗
Hvad denne video dækker
- 20x hukommelsesbåndbreddekløften: 936 GB/s GDDR6X vs. 50 GB/s DDR5 & 31,5 GB/s PCIe
- Modelstørrelse @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Niveau 1 (1.200–1.500 dollars): RTX 4060 Ti 16GB (aldrig 8GB) eller Mac Mini 16GB
- Niveau 2 (1.500–2.000 dollars): Brugt RTX 3090 24GB "sweet spot" eller Mac Mini M4 Pro 64GB
- Niveau 3 (3.500+ dollars): RTX 4090 24GB / dobbelt 3090'ere eller Mac Studio Ultra
Oversat udskrift
Oversat fra den originale engelske fortælling. Tilgængelig lyd og undertekster styres af YouTube.
0:00 Hvis du planlægger at bygge en PC til at køre lokale AI-agenter, lad være med at bygge en gaming-rig. Du behøver ikke en 5,8 gigahertz Core i9, et væskekølingssystem, eller et otte-gigabyte grafikkort dækket af RGB. I lokal AI-inferens er gaming-specifikationer stort set ubrugelige. Den eneste metrik, der afgør, om din agent kører eller kravler, er VRAM-kapacitet og hukommelsesbussens båndbredde. Regler for hardwaretesten: glem CPU-frekvenser og rasteriseringsbenchmarks.
0:24 Vi bekymrer os om tre tal: hukommelsesbusbredde, båndbredde i gigabyte per sekund, og rå VRAM-hovedrum til KV-cache-oppustethed. I denne felttest vil jeg gennemgå 20x hukommelsesbåndbreddekløften, kortlægge reglerne for modelstørrelse, benchmarke tre reelle niveauer fra tolv hundrede dollars til fem tusind, og forklare, hvorfor en brugt 3090 stadig er computerens største snydekode. Dette er The Daily Diff, felttest. For at forstå hvorfor gaming-rigger fejler, se på hvordan token-generering faktisk udføres. I spil forsyner din CPU tegningskald, og din GPU gengiver frames.
0:54 Men autoregressiv LLM-dekodning er næsten udelukkende begrænset af hukommelsesbåndbredden. For at generere et enkelt token skal GPU'en streame hver vægtparameter i modellen fra hukommelsen gennem dens regnekerner. Hvis din model er ti gigabyte, betyder produktion af et token at læse ti gigabyte data. På et Nvidia RTX 3090 med en 384-bit hukommelsesbus, får du 936 gigabyte per sekund GDDR6X-båndbredde, hvilket producerer firs tokens i sekundet. Men se, hvad der sker i det øjeblik, din model overstiger den fysiske VRAM.
1:22 Når VRAM fyldes op, aflæsser runtimes resterende lag over PCIe-bussen til system-DDR5-hukommelse. Dine GPU-kerner forventer tusind gigabyte i sekundet. I stedet forsyner dual-channel DDR5 dem med halvtreds, og PCIe 4 kvæles ved enogtredive. Det er et tyve-x båndbreddekollaps. Token-genereringspipelinen går øjeblikkeligt i stå i ventetid på bussen, og hastigheden falder fra fyrre tokens i sekundet til halvanden. Du har forvandlet en to-tusind-dollars rig til en rumvarmer.
1:47 Og det bliver værre under multi-turn agent-kørsler, fordi vægte kun er halvdelen af kampen. Hver prompt, værktøjskald og filchunk gemmes i Key-Value cachen. Et toogtredive-k kontekstvindue kan tygge sig igennem fire til otte gigabyte VRAM ud over vægtene. Hvis dit kort kun har seksten gigabyte, gentager din agent to gange, rammer kontekstvæggen og enten går ned med en out-of-memory-fejl eller spilder ind i DDR5. Her er 4-bit størrelses-snydearket. En syv eller otte milliarder parameter model som Llama 3.1 eller DeepSeek Distill
2:16 tager cirka fem gigabyte. En fjorten milliarder model tager ti gigabyte. En toogtredive milliarder model, det intelligente "sweet spot" for kodningsagenter, kræver tyve gigabyte. Og en halvfjerds milliarder "frontier" model kræver fyrre gigabyte, før du overhovedet allokerer kontekst. Hvilket bringer os til de faktiske hardware-bygninger. Niveau 1 er startriggen, tolv hundrede til femten hundrede dollars. På PC er dit anker et RTX 4060 Ti 16-gigabyte.
2:39 Kritisk advarsel: køb aldrig otte-gigabyte versionen for at spare halvfjerds dollars. Otte gigabyte VRAM i 2026 er en øjeblikkelig out-of-memory dødsdom på enhver reel agent-workflow. Par den med en seks-kernet Ryzen 5, fireogtres gigabyte DDR5, og et to-terabyte NVMe-drev. I Apple-land er ækvivalenten en Mac Mini eller MacBook Pro med seksten gigabyte samlet hukommelse.
3:02 Du vil se fyrre til halvtreds tokens i sekundet på otte-milliarder modeller. Niveau 2 er powerbrugerens "sweet spot": bygget specifikt til at køre toogtredive milliarder parameter modeller som Qwen 2.5 32B. Vej A er et nyt RTX 4070 Ti Super med seksten gigabyte til otte hundrede dollars. Men Vej B er min stærke anbefaling: køb et brugt Nvidia RTX 3090 fireogtyve gigabyte. Du kan finde pæne 3090'ere på eBay for seks hundrede og halvtreds til syv hundrede og halvfems dollars. Det giver dig fireogtyve gigabyte VRAM på en massiv 384-bit bus, der skubber
3:33 936 gigabyte i sekundet. Dollar for dollar er det den bedste VRAM-aftale inden for computing. På macOS er Niveau 2-modstykket en Mac Mini M4 Pro med fireogtres gigabyte samlet hukommelse. Den producerer elleve til tolv tokens i sekundet på en toogtredive milliarder model: langsommere end Nvidia, men helt lydløs ved tredive watt med plads til et kæmpe kontekstvindue. Niveau 3 er entusiastbeslaget til multi-agent sværme. På PC betyder det et RTX 4090 med fireogtyve gigabyte,
3:57 en Ryzen 9 og et hundrede og otteogtyve gigabyte RAM, eller dobbelte RTX 3090'ere, der giver otteogfyrre gigabyte total VRAM. I Apples sortiment er dette en Mac Studio Ultra med seksoghalvfems til et hundrede og otteogtyve gigabyte samlet hukommelse. Superkraften er hukommelsesresidens: du kan beholde en indlejringsmodel, en hurtig router og en 32-milliarder kodningsmodel indlæst samtidigt med nul swap-forsinkelse. Nu til den ærlige fiasko i vores felttest: edge computing-fælden.
4:24 Hver uge hævder et socialt opslag, at du kan køre autonome kodningsagenter på en firs-dollars Raspberry Pi 5. Jeg testede det. At køre en lille 1,5 milliarder parameter model giver dig knap tre tokens i sekundet, mens kortet begrænser sig ved femogfirs grader Celsius. Det er et pænt weekendlegetøj, men som daglig udviklingsdriver, er det ren straf. Til software, brug Ollama, hvis du vil have en ren kommandolinje-dæmon, der forbinder
4:47 direkte til Cursor, Cline eller VS Code. Hvis du vil have en grafisk legeplads med modeldownloads og GPU-lag-skydere, brug LM Studio. Og match dit format med din silicium. På Apple Silicon skal du altid downloade GGUF-modeller optimeret til Metal. På Windows eller Linux med Nvidia, download AWQ eller EXL2 modeller, som udnytter Nvidia Tensor Cores til tyve til tredive procent hurtigere inferens. Så hvordan implementerer du dette uden at gå fallit?
5:11 Tænk på lokal hardware som et hjemmegym over for et kommercielt fitnesscenter. At have et squat rack derhjemme betyder, at du træner hver dag uden pendling, ingen abonnementsafgifter og fuldstændig privatliv. Din lokale maskine håndterer firs procent af din daglige kodning, enhedstest og privat dokumentbehandling for nul dollars per token. Og når du skal dødløfte fem hundrede pund — som en massiv repo-dækkende arkitektonisk refaktor over halvtreds filer — besøger du det kommercielle fitnesscenter: betal cloud API'et for Claude 3.5 Sonnet eller OpenAI o3 i femten minutter
5:38 og kom videre. Her er regningen: et Niveau 2-byggeri med en brugt 3090 koster seksten hundrede dollars alt inklusive. Hvis du bruger halvtreds til hundrede dollars om måneden på API-tokens, betaler det sig selv på atten måneder, samtidig med at din proprietære kodebase holdes væk fra tredjeparts servere. Dagens felttestdom: SHIP IT. VRAM og hukommelsesbåndbredde slår altid clock-hastigheder. Stop med at købe fem-gigahertz CPU'er til AI, og find en brugt 3090.
6:04 Fortæl mig, hvilken hardware-build du kører til lokale modeller i kommentarerne. Og hvis du hellere vil læse denne gennemgang, så få nyhedsbrevet på the daily diff dot dev, link nedenfor. Og det var forskellen for i dag. Jeg er Niko fra Axrisi. Flet ansvarligt.
Kilder
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



