Udhëzuesi i Harduerit Lokal të Inteligjencës Artificiale (2026)
Kur ndërtojnë një makinë për agjentët lokalë të AI-së dhe LLM-të me peshë të hapur, zhvilluesit bëjnë gabimin e blerjes së specifikimeve të PC-ve të lojërave: CPU 5.8 GHz, sisteme personalizuar ftohjeje me lëng, dhe GPU të shpejta lojërash me vetëm 8 GB VRAM.
Kur ndërtojnë një makinë për agjentët lokalë të AI-së dhe LLM-të me peshë të hapur, zhvilluesit bëjnë gabimin e blerjes së specifikimeve të PC-ve të lojërave: CPU 5.8 GHz, sisteme personalizuar ftohjeje me lëng, dhe GPU të shpejta lojërash me vetëm 8 GB VRAM. Por gjenerimi autoregresiv i shenjave është i kufizuar nga gjerësia e brezit të kujtesës, jo nga llogaritja: për të nxjerrë një shenjë të vetme, çdo peshë në model duhet të kalojë nëpër autobusin e kujtesës. Kur peshat ose konteksti i cache-it KV kalojnë VRAM-in fizik, ambienti i ekzekutimit zhvendos shtresat në sistemin DDR5 mbi PCIe, dhe arrini në një rënie 20-fish të gjerësisë së brezit të kujtesës: shpejtësia bie nga 40 shenja në sekondë në 1.5. Në këtë test në terren, Niko shpjegon mekanikën e harduerit, rregullat e madhësisë së modelit me kuantizim 4-bit, tre nivele reale buxhetore nga 1,200 dollarë në 5,000 dollarë, pse një RTX 3090 24GB i përdorur është oferta më e mirë e VRAM-it për dollar në llogaritje, kurthin e Raspberry Pi edge, dhe strategjinë e palestrës shtëpiake për inferencën lokale kundrejt asaj në renë kompjuterike. Vendimi: SHIP IT.
Lexoni edicionin e shkruar (anglisht) ↗
Çfarë mbulon kjo video
- Rënia 20-fish e gjerësisë së brezit të kujtesës: 936 GB/s GDDR6X kundrejt 50 GB/s DDR5 & 31.5 GB/s PCIe
- Madhësia e modelit @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Niveli 1 (1,200–1,500 dollarë): RTX 4060 Ti 16GB (asnjëherë 8GB) ose Mac Mini 16GB
- Niveli 2 (1,500–2,000 dollarë): Pika optimale e RTX 3090 24GB e përdorur ose Mac Mini M4 Pro 64GB
- Niveli 3 (3,500$+): RTX 4090 24GB / dy 3090 ose Mac Studio Ultra
Transkript i përkthyer
Përkthyer nga tregimi origjinal në anglisht. Audio dhe titrat e disponueshme kontrollohen nga YouTube.
0:00 Nëse po planifikoni të ndërtoni një PC për të ekzekutuar agjentë lokalë të AI-së, ndaloni së ndërtuari një pajisje lojërash. Nuk keni nevojë për një Core i9 pesë pikë tetë gigahertz, një sistem ftohjeje me lëng, ose një kartë grafike tetë gigabyte e mbuluar me RGB. Në inferencën lokale të AI-së, specifikimet e lojërave janë praktikisht të padobishme. E vetmja metrikë që dikton nëse agjenti juaj funksionon apo zvarritet është kapaciteti i VRAM-it dhe gjerësia e brezit të autobusit të kujtesës. Rregullat e testit të harduerit: harroni shpejtësitë e CPU-së dhe matjet e rasterizimit.
0:24 Na interesojnë tre numra: gjerësia e autobusit të kujtesës, gjerësia e brezit në gigabyte për sekondë, dhe hapësira e papërpunuar e VRAM-it për fryrjen e cache-it KV. Në këtë test në terren, unë do të shpjegoj rënien njëzet herë të gjerësisë së brezit të kujtesës, do të hartoj rregullat e madhësisë së modelit, do të bëj krahasime për tre nivele reale nga dymbëdhjetë qind dollarë deri në pesë mijë, dhe do të shpjegoj pse një 3090 i përdorur është ende kodi më i madh i mashtrimit në llogaritje. Ky është The Daily Diff, test në terren. Për të kuptuar pse pajisjet e lojërave dështojnë, shikoni se si ekzekutohet në të vërtetë gjenerimi i shenjave. Në lojëra, CPU juaj ushqen thirrjet e vizatimit dhe GPU juaj renderon kornizat.
0:54 Por dekodimi autoregresiv i LLM-së është pothuajse thjesht i kufizuar nga gjerësia e brezit të kujtesës. Për të gjeneruar një shenjë të vetme, GPU duhet të transmetojë çdo parametër peshe të modelit nga kujtesa nëpërmjet bërthamave të saj llogaritëse. Nëse modeli juaj është dhjetë gigabyte, prodhimi i një shenje do të thotë leximi i dhjetë gigabyte të të dhënave. Në një Nvidia RTX 3090 me një autobus kujtese 384-bit, ju merrni 936 gigabyte në sekondë gjerësi brezi GDDR6X, duke prodhuar tetëdhjetë shenja në sekondë. Por shikoni çfarë ndodh në milisekondën që modeli juaj kalon VRAM-in fizik.
1:22 Kur VRAM mbushet, ambientet e ekzekutimit zhvendosin shtresat e mbetura nëpërmjet autobusit PCIe në kujtesën e sistemit DDR5. Bërthamat e GPU-së tuaj presin një mijë gigabyte në sekondë. Në vend të kësaj, DDR5 me dy kanale i ushqen me pesëdhjetë, dhe PCIe 4 bllokohet në tridhjetë e një. Kjo është një kolaps i gjerësisë së brezit njëzet herë. Linja e gjenerimit të shenjave bllokohet menjëherë duke pritur në autobus, dhe shpejtësia bie nga dyzet shenja në sekondë në një pikë pesë. Keni kthyer një pajisje dymijë dollarëshe në një ngrohës hapësire.
1:47 Dhe bëhet më keq gjatë ekzekutimeve të agjentëve me shumë kthime, sepse peshat janë vetëm gjysma e betejës. Çdo kërkesë, thirrje mjeti dhe bllok skedari ruhet në cache-in Key-Value. Një dritare konteksti tridhjetë e dy-k mund të konsumojë katër deri në tetë gigabyte VRAM-i mbi peshat. Nëse karta juaj ka vetëm gjashtëmbëdhjetë gigabyte, agjenti juaj bën cikël dy herë, godet murin e kontekstit, dhe ose dështon me një gabim mungese kujtese ose derdhet në DDR5. Këtu është fleta e shpejtë e madhësive 4-bit. Një model me shtatë ose tetë miliardë parametra si Llama 3.1 ose DeepSeek Distill
2:16 merr rreth pesë gigabyte. Një model me katërmbëdhjetë miliardë merr dhjetë gigabyte. Një model me tridhjetë e dy miliardë, pika optimale e inteligjencës për agjentët e kodimit, kërkon njëzet gigabyte. Dhe një model kufitar me shtatëdhjetë miliardë kërkon dyzet gigabyte para se të ndani kontekstin. Kjo na sjell te ndërtimet aktuale të harduerit. Niveli 1 është pajisja fillestare, dymbëdhjetë qind deri në pesëmbëdhjetë qind dollarë. Në PC, ankori juaj është një RTX 4060 Ti 16-gigabyte.
2:39 Paralajmërim kritik: mos blini asnjëherë versionin tetë-gigabyte për të kursyer shtatëdhjetë dollarë. Tetë gigabyte VRAM në vitin 2026 është një dënim i menjëhershëm me vdekje për mungesë kujtese në çdo rrjedhë pune të vërtetë agjenti. Çiftojeni me një Ryzen 5 me gjashtë bërthama, gjashtëdhjetë e katër gigabyte DDR5, dhe një disk NVMe dy terabyte. Në botën e Apple, ekuivalenti është një Mac Mini ose MacBook Pro me gjashtëmbëdhjetë gigabyte kujtesë të unifikuar.
3:02 Do të shihni dyzet deri në pesëdhjetë shenja në sekondë në modele tetë-miliardëshe. Niveli 2 është pika optimale e përdoruesit të fuqishëm: ndërtimi specifikisht për të ekzekutuar modele me tridhjetë e dy miliardë parametra si Qwen 2.5 32B. Rruga A është një RTX 4070 Ti Super i ri me gjashtëmbëdhjetë gigabyte për tetë qind dollarë. Por Rruga B është rekomandimi im i fortë: blini një Nvidia RTX 3090 të përdorur njëzet e katër gigabyte. Mund të gjeni 3090-a të pastër në eBay për gjashtë qind e pesëdhjetë deri në shtatë qind e pesëdhjetë dollarë. Kjo ju jep njëzet e katër gigabyte VRAM në një autobus masiv 384-bit duke shtyrë
3:33 936 gigabyte në sekondë. Dollar për dollar, është oferta më e mirë e VRAM-it në llogaritje. Në macOS, homologu i Nivelit 2 është një Mac Mini M4 Pro me gjashtëdhjetë e katër gigabyte kujtesë të unifikuar. Prodhon njëmbëdhjetë deri në dymbëdhjetë shenja në sekondë në një model tridhjetë e dy miliardësh: më ngadalë se Nvidia, por pa zhurmë në tridhjetë vat me hapësirë për një dritare gjigante konteksti. Niveli 3 është kategoria entuziastësh për grupe me shumë agjentë. Në PC, kjo do të thotë një RTX 4090 me njëzet e katër gigabyte,
3:57 një Ryzen 9, dhe një qind e njëzet e tetë gigabyte RAM, ose dy RTX 3090 që ofrojnë dyzet e tetë gigabyte VRAM totale. Në linjën e Apple, kjo është një Mac Studio Ultra me nëntëdhjetë e gjashtë deri në një qind e njëzet e tetë gigabyte kujtesë të unifikuar. Superfuqia është qëndrimi në kujtesë: mund të mbani një model embedding, një router të shpejtë, dhe një model kodimi 32-miliardësh të ngarkuar njëkohësisht me zero vonesë shkëmbimi. Tani për dështimin e sinqertë të testit tonë në terren: kurthi i llogaritjes në skaj.
4:24 Çdo javë një postim social pretendon se mund të ekzekutoni agjentë kodimi autonomë në një Raspberry Pi 5 me tetëdhjetë dollarë. E testova. Ekzekutimi i një modeli të vogël me një pikë pesë miliardë parametra ju jep mezi tre shenja në sekondë ndërsa bordi ngadalësohet në tetëdhjetë e pesë gradë Celsius. Është një lodër e këndshme fundjave, por si një drejtues zhvillimi i përditshëm, është torturë e pastër. Për softuer, përdorni Ollama nëse dëshironi një demon të pastër të linjës komanduese që lidhet
4:47 drejtpërdrejt me Cursor, Cline, ose VS Code. Nëse dëshironi një mjedis grafik me shkarkime modelesh dhe rrëshqitës shtresash GPU, përdorni LM Studio. Dhe përshtatni formatin tuaj me silikonin tuaj. Në Apple Silicon, gjithmonë shkarkoni modele GGUF të optimizuara për Metal. Në Windows ose Linux me Nvidia, shkarkoni modele AWQ ose EXL2, të cilat përdorin bërthamat Nvidia Tensor për inferencë njëzet deri në tridhjetë për qind më të shpejtë. Pra, si e vendosni këtë pa u falimentuar?
5:11 Mendoni për harduerin lokal si një palestër shtëpie kundrejt një palestre komerciale. Të kesh një raft për squat në shtëpi do të thotë të stërvitesh çdo ditë me zero udhëtim, zero tarifa abonimi, dhe privatësi të plotë. Makina juaj lokale trajton tetëdhjetë për qind të kodimit tuaj të përditshëm, testimin e njësisë, dhe përpunimin e dokumenteve private për zero dollarë për shenjë. Dhe kur duhet të bëni deadlift pesëqind paund – si një riorganizim arkitekturor masiv në të gjithë depozitën në pesëdhjetë skedarë – vizitoni palestrën komerciale: paguani API-në e resë kompjuterike për Claude 3.5 Sonnet ose OpenAI o3 për pesëmbëdhjetë minuta
5:38 dhe vazhdoni. Këtu është fatura: një ndërtim i Nivelit 2 me një 3090 të përdorur kushton një mijë e gjashtëqind dollarë gjithsej. Nëse shpenzoni pesëdhjetë deri në njëqind dollarë në muaj për shenja API, ai shlyen veten në tetëmbëdhjetë muaj duke mbajtur kodin tuaj pronësor jashtë serverave të palëve të treta. Vendimi i testit në terren të sotëm: SHIP IT. VRAM dhe gjerësia e brezit të kujtesës mundin shpejtësitë e orës çdo herë. Ndaloni së blerjes së CPU-ve pesë-gigahertz për AI, dhe shkoni të gjeni një 3090 të përdorur.
6:04 Më tregoni se çfarë ndërtimi hardueri po përdorni për modele lokale në komente. Dhe nëse preferoni të lexoni këtë shpjegim, merrni buletinin te the daily diff pikë dev, linku më poshtë. Dhe kjo është diferenca për sot. Unë jam Niko nga Axrisi. Bashkohuni me përgjegjësi.
Burimet
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



