+− THE DAILY DIFFdev & AI news
SHIP IT

Vietinis AI aparatinės įrangos gidas (2026)

Kurpdami mašiną vietiniams AI agentams ir atviro svorio LLM, kūrėjai daro klaidą pirkdami žaidimų kompiuterių specifikacijas: 5,8 GHz procesorius, nestandartines skysto aušinimo sistemas ir greitus žaidimų GPU tik su 8 GB VRAM.

Kurpdami mašiną vietiniams AI agentams ir atviro svorio LLM, kūrėjai daro klaidą pirkdami žaidimų kompiuterių specifikacijas: 5,8 GHz procesorius, nestandartines skysto aušinimo sistemas ir greitus žaidimų GPU tik su 8 GB VRAM. Tačiau autoregresinis žetonų generavimas yra ribojamas atminties pralaidumo, o ne skaičiavimo galios: norint išleisti vieną žetoną, kiekvienas modelio svoris turi persikelti per atminties magistralę. Kai jūsų svoriai arba KV talpyklos kontekstas viršija fizinį VRAM, vykdymo aplinka perkrauna sluoksnius į sistemos DDR5 per PCIe, ir jūs atsitrenkiate į 20 kartų atminties pralaidumo prarają: greitis nukrinta nuo 40 žetonų per sekundę iki 1,5. Šiame lauko bandyme Niko išsamiai nagrinėja aparatinės įrangos mechaniką, 4 bitų kvantavimo modelių dydžio nustatymo taisykles, tris realias biudžeto kategorijas nuo 1 200 iki 5 000 JAV dolerių, kodėl naudota RTX 3090 24 GB yra geriausias VRAM už dolerį pasiūlymas skaičiavimo srityje, Raspberry Pi krašto spąstus ir namų sporto salės strategiją vietiniam, palyginti su debesų inferencija. Verdiktas: SHIP IT.

Skaityti rašytinę versiją (anglų k.) ↗

Kas aptariama šiame vaizdo įraše

  • 20 kartų atminties pralaidumo praraja: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31,5 GB/s PCIe
  • Modelio dydis @ 4 bitų: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • 1 lygis (1 200–1 500 JAV dol.): RTX 4060 Ti 16GB (niekada 8GB) arba Mac Mini 16GB
  • 2 lygis (1 500–2 000 JAV dol.): Naudota RTX 3090 24GB geriausias pasirinkimas arba Mac Mini M4 Pro 64GB
  • 3 lygis (3 500 JAV dol.+): RTX 4090 24GB / dvi 3090 arba Mac Studio Ultra

Išverstas transkriptas

Išversta iš originalo anglų kalbos. Galimas garso ir subtitrų valdymas per YouTube.

0:00 Jei planuojate statyti kompiuterį, skirtą vietiniams AI agentams paleisti, nustokite statyti žaidimų įrenginį. Jums nereikia 5,8 gigahercų Core i9, skysto aušinimo sistemos, arba aštuonių gigabaitų vaizdo plokštės, apšviestos RGB. Vietinėje AI inferencijoje žaidimų specifikacijos yra praktiškai bevertės. Vienintelis rodiklis, lemiantis, ar jūsų agentas veiks, ar šliaužios, yra VRAM talpa ir atminties magistralės pralaidumas. Aparatinės įrangos testo taisyklės: pamirškite CPU laikrodžius ir rastrizavimo etalonus.

0:24 Mums rūpi trys skaičiai: atminties magistralės plotis, pralaidumas gigabaitais per sekundę ir neapdorotas VRAM rezervas KV talpyklos išsipūtimui. Šiame lauko bandyme išnagrinėsiu 20 kartų atminties pralaidumo prarają, pateiksiu modelio dydžio nustatymo taisykles, įvertinsiu tris realias kategorijas nuo tūkstančio dviejų šimtų dolerių iki penkių tūkstančių ir paaiškinsiu, kodėl naudota 3090 vis dar yra geriausias kompiuterių „cheat code“. Tai „The Daily Diff“ lauko bandymas. Norėdami suprasti, kodėl žaidimų įrenginiai nepavyksta, pažiūrėkite, kaip iš tikrųjų vyksta žetonų generavimas. Žaidimuose jūsų CPU tiekia piešimo iškvietimus, o GPU atvaizduoja kadrus.

0:54 Tačiau autoregresinis LLM dekodavimas yra beveik grynai atminties pralaidumo ribojamas. Norėdami sugeneruoti vieną žetoną, GPU turi srautiniu būdu perduoti kiekvieną modelio svorio parametrą iš atminties per savo skaičiavimo branduolius. Jei jūsų modelis yra dešimt gigabaitų, vieno žetono sukūrimas reiškia dešimties gigabaitų duomenų skaitymą. „Nvidia RTX 3090“ su 384 bitų atminties magistrale, gausite 936 gigabaitus per sekundę GDDR6X pralaidumo, sukuriančio aštuoniasdešimt žetonų per sekundę. Bet pažiūrėkite, kas atsitinka tą milisekundę, kai jūsų modelis viršija fizinį VRAM.

1:22 Kai VRAM užpildoma, vykdymo aplinka perkrauna likusius sluoksnius per PCIe magistralę į sistemos DDR5 atmintį. Jūsų GPU branduoliai tikisi tūkstančio gigabaitų per sekundę. Vietoj to, dviejų kanalų DDR5 jiems suteikia penkiasdešimt, o PCIe 4 užstringa ties trisdešimt vienu. Tai yra 20 kartų pralaidumo sumažėjimas. Žetonų generavimo srautas akimirksniu sustoja laukdamas magistralės, o greitis nukrenta nuo keturiasdešimt žetonų per sekundę iki vieno su puse. Jūs pavertėte dviejų tūkstančių dolerių įrenginį erdvės šildytuvu.

1:47 Ir viskas pablogėja vykdant kelių posūkių agentus, nes svoriai yra tik pusė mūšio. Kiekvienas raginimas, įrankio iškvietimas ir failo dalis saugoma rakto ir reikšmės talpykloje. Trisdešimt dviejų tūkstančių konteksto langas gali sunaudoti nuo keturių iki aštuonių gigabaitų VRAM, be svorių. Jei jūsų kortelė turi tik šešiolika gigabaitų, jūsų agentas persijungia du kartus, atsitrenkia į konteksto sieną ir arba sugenda dėl atminties trūkumo klaidos, arba išsilieja į DDR5. Štai keturių bitų dydžio nustatymo atmintinė. Septynių ar aštuonių milijardų parametrų modelis, toks kaip Llama 3.1 arba DeepSeek Distill,

2:16 užima apie penkis gigabaitus. Keturiolikos milijardų modelis užima dešimt gigabaitų. Trisdešimt dviejų milijardų modelis, intelektualinis aukso viduriukas kodavimo agentams, reikalauja dvidešimt gigabaitų. Ir septyniasdešimties milijardų pažangiausias modelis reikalauja keturiasdešimt gigabaitų, kol jūs netgi paskirsite kontekstą. Kas mus priveda prie tikrosios aparatinės įrangos. 1 lygis yra pradinė įranga, nuo tūkstančio dviejų šimtų iki tūkstančio penkių šimtų dolerių. PC atveju jūsų pagrindas yra RTX 4060 Ti 16 gigabaitų.

2:39 Kritinis įspėjimas: niekada nepirkite aštuonių gigabaitų versijos, kad sutaupytumėte septyniasdešimt dolerių. Aštuoni gigabaitai VRAM 2026 metais yra tiesioginis mirties nuosprendis dėl atminties trūkumo bet kokiam realiam agento darbui. Suporuokite jį su šešių branduolių Ryzen 5, šešiasdešimt keturiais gigabaitais DDR5, ir dviejų terabaitų NVMe disku. „Apple“ pasaulyje atitikmuo yra „Mac Mini“ arba „MacBook Pro“ su šešiolika gigabaitų vieningos atminties.

3:02 Matysite nuo keturiasdešimt iki penkiasdešimt žetonų per sekundę su aštuonių milijardų modeliais. 2 lygis yra galingo vartotojo aukso viduriukas: sukurtas specialiai paleisti trisdešimt dviejų milijardų parametrų modelius, tokius kaip Qwen 2.5 32B. A variantas yra naujas RTX 4070 Ti Super su šešiolika gigabaitų už aštuonis šimtus dolerių. Tačiau B variantas yra mano tvirtas rekomendacija: pirkite naudotą Nvidia RTX 3090 dvidešimt keturių gigabaitų. Švarių 3090 galite rasti „eBay“ už šešis šimtus penkiasdešimt iki septynių šimtų penkiasdešimt dolerių. Tai suteikia jums dvidešimt keturis gigabaitus VRAM ant masyvios 384 bitų magistralės, perduodančios

3:33 936 gigabaitus per sekundę. Dolerių už dolerį, tai geriausias VRAM pasiūlymas kompiuterijoje. „macOS“ atveju 2 lygio atitikmuo yra „Mac Mini M4 Pro“ su šešiasdešimt keturiais gigabaitais vieningos atminties. Jis generuoja vienuolika iki dvylikos žetonų per sekundę su trisdešimt dviejų milijardų modeliu: lėčiau nei „Nvidia“, bet visiškai tylus, sunaudodamas trisdešimt vatų ir turėdamas vietos didžiuliam konteksto langui. 3 lygis yra entuziastų kategorija, skirta daugelio agentų spiečiams. PC atveju tai reiškia RTX 4090 su dvidešimt keturiais gigabaitais,

3:57 Ryzen 9 ir šimtas dvidešimt aštuoniais gigabaitais RAM, arba dvi RTX 3090, suteikiančios keturiasdešimt aštuonis gigabaitus bendro VRAM. „Apple“ asortimente tai yra „Mac Studio Ultra“ su devyniasdešimt šešiais iki šimto dvidešimt aštuoniais gigabaitais vieningos atminties. Supergalia yra atminties nuolatinė vieta: galite laikyti įterpimo modelį, greitą maršrutizatorių ir 32 milijardų kodavimo modelį vienu metu, be jokio keitimo vėlavimo. Dabar apie sąžiningą mūsų lauko bandymo nesėkmę: krašto skaičiavimo spąstus.

4:24 Kiekvieną savaitę socialiniuose tinkluose teigiama, kad galite paleisti autonominius kodavimo agentus ant aštuoniasdešimties dolerių „Raspberry Pi 5“. Aš išbandžiau. Paleidus mažą, pusantro milijardo parametrų modelį, gaunate vos tris žetonus per sekundę, o plokštė droseliuojasi esant aštuoniasdešimt penkiems laipsniams Celsijaus. Tai puikus savaitgalio žaislas, bet kaip kasdienis kūrimo įrankis, tai yra gryna kančia. Programinei įrangai naudokite „Ollama“, jei norite švaraus komandinės eilutės demono, kuris jungiasi

4:47 tiesiai prie „Cursor“, „Cline“ ar „VS Code“. Jei norite grafinės žaidimų aikštelės su modelių atsisiuntimais ir GPU sluoksnių slankikliais, naudokite „LM Studio“. Ir pritaikykite savo formatą prie silicio. „Apple Silicon“ atveju visada atsisiųskite „Metal“ optimizuotus GGUF modelius. „Windows“ ar „Linux“ su „Nvidia“ atsisiųskite AWQ arba EXL2 modelius, kurie naudoja „Nvidia Tensor Cores“ 20–30 procentų greitesnei inferencijai. Taigi, kaip tai įdiegti nesužlugus?

5:11 Galvokite apie vietinę aparatinę įrangą kaip apie namų sporto salę, palyginti su komercine sporto sale. Turėdami štangos stovą namuose, treniruojatės kiekvieną dieną be kelionės, be prenumeratos mokesčių ir visiškai privačiai. Jūsų vietinis kompiuteris apdoroja aštuoniasdešimt procentų jūsų kasdienio kodavimo, vieneto testavimo ir privačių dokumentų apdorojimo už nulį dolerių už žetoną. O kai jums reikia pakelti penkis šimtus svarų – kaip masyvų visos saugyklos architektūrinį pertvarkymą per penkiasdešimt failų – aplankote komercinę sporto salę: sumokate debesų API už „Claude 3.5 Sonnet“ arba „OpenAI o3“ penkiolika minučių

5:38 ir tęskite. Štai sąskaita: 2 lygio konstrukcija su naudotu 3090 kainuoja šešiolika šimtų dolerių iš viso. Jei per mėnesį išleidžiate nuo penkiasdešimt iki šimto dolerių API žetonams, ji atsipirks per aštuoniolika mėnesių, išlaikant jūsų nuosavybės teise priklausantį kodą nuo trečiųjų šalių serverių. Šiandienos lauko bandymo verdiktas: SHIP IT. VRAM ir atminties pralaidumas visada įveikia laikrodžio greitį. Nustokite pirkti penkių gigahercų procesorius AI ir ieškokite naudoto 3090.

6:04 Komentaruose papasakokite, kokią aparatinę įrangą naudojate vietiniams modeliams. Ir jei norėtumėte perskaityti šį paaiškinimą, užsiprenumeruokite naujienlaiškį daily diff dot dev, nuoroda žemiau. Ir tai yra šiandienos skirtumas. Aš esu Niko iš Axrisi. Sujungti atsakingai.

Šaltiniai

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Susiję vaizdo įrašai