+− THE DAILY DIFFdev & AI news
SHIP IT

Vietējā AI aparatūras rokasgrāmata (2026)

Veidojot mašīnu vietējiem AI aģentiem un atvērtā svara LLM, izstrādātāji pieļauj kļūdu, iegādājoties spēļu datoru specifikācijas: 5,8 GHz centrālos procesorus, pielāgotas šķidruma dzesēšanas sistēmas un ātras spēļu grafiskās kartes ar tikai 8 GB VRAM.

Veidojot mašīnu vietējiem AI aģentiem un atvērtā svara LLM, izstrādātāji pieļauj kļūdu, iegādājoties spēļu datoru specifikācijas: 5,8 GHz centrālos procesorus, pielāgotas šķidruma dzesēšanas sistēmas un ātras spēļu grafiskās kartes ar tikai 8 GB VRAM. Bet autoregresīvā marķieru ģenerēšana ir ierobežota ar atmiņas joslas platumu, nevis ar aprēķinu jaudu: lai izdotu vienu marķieri, katram modeļa svaram jāpārraida pa atmiņas kopni. Ja jūsu svari vai KV kešatmiņas konteksts pārsniedz fizisko VRAM, izpildlaiks izlādē slāņus uz sistēmas DDR5 caur PCIe, un jūs sasniedzat 20 reižu lielāku atmiņas joslas platuma kritumu: ātrums nokrītas no 40 marķieriem sekundē līdz 1,5. Šajā lauka testā Niko izskaidro aparatūras mehāniku, 4 bitu kvantizācijas modeļu izmēru noteikšanas noteikumus, trīs reālus budžeta līmeņus no 1200 līdz 5000 ASV dolāriem, kāpēc lietota RTX 3090 24GB ir labākais VRAM-uz-dolāru piedāvājums skaitļošanā, Raspberry Pi malas slazdu un mājas sporta zāles stratēģiju vietējai pret mākoņdatošanas secināšanai. Spriedums: SHIP IT.

Lasiet rakstisko izdevumu (angļu valodā) ↗

Ko aptver šis video

  • 20 reižu atmiņas joslas platuma kritums: 936 GB/s GDDR6X pret 50 GB/s DDR5 un 31,5 GB/s PCIe
  • Modeļa izmēri @ 4 bitiem: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • 1. līmenis (1200–1500 ASV dolāri): RTX 4060 Ti 16GB (nekad 8GB) vai Mac Mini 16GB
  • 2. līmenis (1500–2000 ASV dolāri): Lietots RTX 3090 24GB optimālais variants vai Mac Mini M4 Pro 64GB
  • 3. līmenis (3500+ ASV dolāri): RTX 4090 24GB / divas 3090 vai Mac Studio Ultra

Tulkotais transkripts

Tulkojums no oriģinālā angļu stāstījuma. Pieejamais audio un subtitri tiek kontrolēti no YouTube.

0:00 Ja plānojat būvēt datoru, lai palaistu vietējos AI aģentus, pārtrauciet būvēt spēļu iekārtu. Jums nav nepieciešams pieci komats astoņi gigahercu Core i9, šķidruma dzesēšanas sistēma, vai astoņu gigabaitu grafiskā karte, kas pārklāta ar RGB. Vietējā AI inferencē spēļu specifikācijas ir praktiski bezjēdzīgas. Vienīgais rādītājs, kas nosaka, vai jūsu aģents darbosies vai rāpos, ir VRAM jauda un atmiņas kopnes joslas platums. Aparatūras testa noteikumi: aizmirstiet par CPU takts frekvencēm un rastrizācijas etaloniem.

0:24 Mums rūp trīs skaitļi: atmiņas kopnes platums, joslas platums gigabaitos sekundē un neapstrādāta VRAM rezerve KV kešatmiņas palielināšanai. Šajā lauka testā es izskaidrošu divdesmit reižu atmiņas joslas platuma kritumu, uzskaitīšu modeļu izmēru noteikšanas noteikumus, noteikšu trīs reālus līmeņus no divpadsmit simtiem dolāru līdz pieciem tūkstošiem, un izskaidrošu, kāpēc lietota 3090 joprojām ir labākais skaitļošanas krāpšanās kods. Tas ir The Daily Diff, lauka tests. Lai saprastu, kāpēc spēļu iekārtas neizdodas, aplūkojiet, kā faktiski tiek veikta marķieru ģenerēšana. Spēlēs jūsu CPU nodrošina zīmēšanas pieprasījumus, un jūsu GPU renderē kadrus.

0:54 Bet autoregresīvā LLM dekodēšana ir gandrīz tīri atkarīga no atmiņas joslas platuma. Lai ģenerētu vienu marķieri, GPU jāpārraida katrs modeļa svara parametrs no atmiņas caur saviem aprēķinu kodoliem. Ja jūsu modelis ir desmit gigabaiti, viena marķiera izveide nozīmē desmit gigabaitu datu lasīšanu. Nvidia RTX 3090 ar 384 bitu atmiņas kopni, jūs iegūstat 936 gigabaitus sekundē GDDR6X joslas platuma, ģenerējot astoņdesmit marķierus sekundē. Bet vērojiet, kas notiek brīdī, kad jūsu modelis pārsniedz fizisko VRAM.

1:22 Kad VRAM piepildās, izpildlaiki pārceļ atlikušos slāņus caur PCIe kopni uz sistēmas DDR5 atmiņu. Jūsu GPU kodoli sagaida tūkstoš gigabaitu sekundē. Tā vietā divkanālu DDR5 tiem piegādā piecdesmit, un PCIe 4 noslāpējas pie trīsdesmit viena. Tas ir divdesmit reižu joslas platuma sabrukums. Marķieru ģenerēšanas cauruļvads nekavējoties apstājas, gaidot kopnes, un ātrums nokrītas no četrdesmit marķieriem sekundē līdz vienam komatam pieci. Jūs esat pārvērtis divu tūkstošu dolāru iekārtu par telpas sildītāju.

1:47 Un tas kļūst vēl sliktāk vairāku pagriezienu aģentu darbības laikā, jo svari ir tikai puse cīņas. Katrs uzvedne, rīka izsaukums un faila daļa tiek saglabāta Key-Value kešatmiņā. Trīsdesmit divu k konteksta logs var izmantot četrus līdz astoņus gigabaitus VRAM papildus svariem. Ja jūsu kartei ir tikai sešpadsmit gigabaiti, jūsu aģents atkārtojas divreiz, sasniegs konteksta sienu un vai nu avarēs ar atmiņas trūkuma kļūdu, vai arī izlīdīs DDR5. Šeit ir četru bitu izmēru noteikšanas instrukcija. Septiņu vai astoņu miljardu parametru modelis, piemēram, Llama 3.1 vai DeepSeek Distill,

2:16 aizņem apmēram piecus gigabaitus. Četrpadsmit miljardu modelis aizņem desmit gigabaitus. Trīsdesmit divu miljardu modelis, inteliģences "sweet spot" kodēšanas aģentiem, prasa divdesmit gigabaitus. Un septiņdesmit miljardu robežas modelis prasa četrdesmit gigabaitus, pirms jūs pat piešķirat kontekstu. Kas mūs noved pie faktiskajām aparatūras konstrukcijām. 1. līmenis ir sākuma iekārta, no divpadsmit simtiem līdz piecpadsmit simtiem dolāru. Datoram jūsu enkurs ir RTX 4060 Ti 16 gigabaitu.

2:39 Kritisks brīdinājums: nekad nepērciet astoņu gigabaitu versiju, lai ietaupītu septiņdesmit dolārus. Astoņi gigabaiti VRAM 2026. gadā ir tūlītējs nāves spriedums bez atmiņas jebkurā reālā aģentu darbplūsmā. Apvienojiet to ar seškodolu Ryzen 5, sešdesmit četriem gigabaitiem DDR5, un divu terabaitu NVMe disku. Apple pasaulē, ekvivalents ir Mac Mini vai MacBook Pro ar sešpadsmit gigabaitiem vienotās atmiņas.

3:02 Jūs redzēsiet četrdesmit līdz piecdesmit marķierus sekundē astoņu miljardu modeļiem. 2. līmenis ir jaudīga lietotāja optimālais punkts: būvēts īpaši, lai palaistu trīsdesmit divu miljardu parametru modeļus, piemēram, Qwen 2.5 32B. A ceļš ir jauns RTX 4070 Ti Super ar sešpadsmit gigabaitiem par astoņiem simtiem dolāru. Bet B ceļš ir mans stingrais ieteikums: iegādājieties lietotu Nvidia RTX 3090 divdesmit četrus gigabaitus. Tīras 3090 var atrast eBay par sešiem simtiem piecdesmit līdz septiņiem simtiem piecdesmit dolāriem. Tas dod jums divdesmit četrus gigabaitus VRAM uz masīvas 384 bitu kopnes, kas spiež

3:33 936 gigabaitus sekundē. Dolārs par dolāru, tas ir labākais VRAM darījums skaitļošanā. MacOS, 2. līmeņa analogs ir Mac Mini M4 Pro ar sešdesmit četriem gigabaitiem vienotās atmiņas. Tas ģenerē vienpadsmit līdz divpadsmit marķierus sekundē ar trīsdesmit divu miljardu modeli: lēnāk nekā Nvidia, bet pilnīgi kluss pie trīsdesmit vatu ar vietu milzīgam konteksta logā. 3. līmenis ir entuziastu kategorija daudzaģentu spieķiem. Datorā tas nozīmē RTX 4090 ar divdesmit četriem gigabaitiem,

3:57 Ryzen 9 un simts divdesmit astoņus gigabaitus RAM, vai divas RTX 3090, kas nodrošina četrdesmit astoņus gigabaitus kopējās VRAM. Apple klāstā tas ir Mac Studio Ultra ar deviņdesmit sešiem līdz simts divdesmit astoņiem gigabaitiem vienotās atmiņas. Spējas ir atmiņas rezidence: jūs varat saglabāt iestrādāšanas modeli, ātrs maršrutētājs un 32 miljardu kodēšanas modelis vienlaicīgi ielādēti ar nulles maiņas aizkavi. Tagad par godīgu mūsu lauka testa neveiksmi: malu skaitļošanas slazdu.

4:24 Katru nedēļu sociālajā tīklā tiek apgalvots, ka jūs varat palaist autonomus kodēšanas aģentus ar astoņdesmit dolāru Raspberry Pi 5. Es to pārbaudīju. Palaižot mazu viena komata piecu miljardu parametru modeli, jūs knapi iegūstat trīs marķierus sekundē, kamēr plate droseles pie astoņdesmit pieciem grādiem pēc Celsija. Tā ir jauka nedēļas nogales rotaļlieta, bet kā ikdienas attīstības dzinējs, tas ir tīrs sods. Programmatūrai izmantojiet Ollama, ja vēlaties tīru komandrindas dēmonu, kas savieno

4:47 tieši ar Cursor, Cline vai VS Code. Ja vēlaties grafisku rotaļu laukumu ar modeļu lejupielādēm un GPU slāņu slīdņiem, izmantojiet LM Studio. Un pielāgojiet savu formātu savam silīcijam. Apple Silicon, vienmēr lejupielādējiet GGUF modeļus, kas optimizēti Metal. Operētājsistēmā Windows vai Linux ar Nvidia lejupielādējiet AWQ vai EXL2 modeļus, kas izmanto Nvidia Tensor Cores divdesmit līdz trīsdesmit procentiem ātrākai inferencēšanai. Tātad, kā to izvietot, nebankrotējot?

5:11 Iedomājieties vietējo aparatūru kā mājas sporta zāli pret komerciālu sporta zāli. Squat rack mājās nozīmē, ka jūs trenējaties katru dienu bez braukšanas, bez abonēšanas maksām un ar pilnīgu privātumu. Jūsu vietējā mašīna apstrādā astoņdesmit procentus jūsu ikdienas kodēšanas, vienības testēšana un privāta dokumentu apstrāde par nulli dolāru par marķieri. Un, kad jums jāpaceļ pieci simti mārciņu — piemēram, masīvs repo-platuma arhitektūras refaktorings piecdesmit failos — jūs apmeklējat komerciālo sporta zāli: maksājiet mākoņa API par Claude 3.5 Sonnet vai OpenAI o3 uz piecpadsmit minūtēm

5:38 un ejiet tālāk. Šeit ir rēķins: 2. līmeņa konstrukcija ar lietotu 3090 maksā sešpadsmit simtus dolāru visā. Ja jūs tērējat piecdesmit līdz simts dolārus mēnesī API marķieriem, tā atmaksājas astoņpadsmit mēnešos, vienlaikus saglabājot jūsu patentēto kodu bāzi ārpus trešo pušu serveriem. Šodienas lauka testa spriedums: SHIP IT. VRAM un atmiņas joslas platums katru reizi pārspēj takts frekvences. Pārtrauciet pirkt piecu gigahercu CPU AI, un atrodiet lietotu 3090.

6:04 Pasakiet man, kādu aparatūras konstrukciju jūs izmantojat vietējiem modeļiem komentāros. Un, ja vēlaties izlasīt šo sadalījumu, saņemiet biļetenu the daily diff dot dev, saite zemāk. Un tas ir šodienas diff. Esmu Niko no Axrisi. Apvienojiet atbildīgi.

Avoti

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Saistītie video