+− THE DAILY DIFFdev & AI news
SHIP IT

Местното ръководство за AI хардуер (2026)

При изграждането на машина за локални AI агенти и LLM с отворени тегла, разработчиците правят грешката да купуват спецификации за гейминг компютри: 5.8 GHz процесори, персонализирани системи за течно охлаждане и бързи гейминг графични процесори само с 8GB VRAM.

При изграждането на машина за локални AI агенти и LLM с отворени тегла, разработчиците правят грешката да купуват спецификации за гейминг компютри: 5.8 GHz процесори, персонализирани системи за течно охлаждане и бързи гейминг графични процесори само с 8GB VRAM. Но авторегресивното генериране на токени е ограничено от пропускателната способност на паметта, а не от изчислителната мощност: за да се излъчи един токен, всяко тегло в модела трябва да премине през шината на паметта. Когато вашите тегла или контекстът на KV кеша надхвърлят физическата VRAM, изпълнителната среда разтоварва слоеве към системната DDR5 през PCIe и вие удряте 20-кратен спад в пропускателната способност на паметта: скоростта спада от 40 токена в секунда до 1.5. В този полеви тест Нико разглежда хардуерната механика, правилата за оразмеряване на 4-битов квантов модел, три реални бюджетни нива от $1,200 до $5,000, защо употребявана RTX 3090 24GB е най-добрата сделка за VRAM на долар в компютрите, капана на Raspberry Pi edge и стратегията за домашен фитнес за локално срещу облачно извеждане. Присъда: SHIP IT.

Прочетете писменото издание (английски) ↗

Какво обхваща този видеоклип

  • 20-кратен спад в пропускателната способност на паметта: 936 GB/s GDDR6X срещу 50 GB/s DDR5 и 31.5 GB/s PCIe
  • Оразмеряване на модел @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Ниво 1 ($1,200–$1,500): RTX 4060 Ti 16GB (никога 8GB) или Mac Mini 16GB
  • Ниво 2 ($1,500–$2,000): Употребявана RTX 3090 24GB е оптимална или Mac Mini M4 Pro 64GB
  • Ниво 3 ($3,500+): RTX 4090 24GB / две 3090s или Mac Studio Ultra

Преведен препис

Преведено от оригиналния английски разказ. Наличните аудио и субтитри се контролират от YouTube.

0:00 Ако планирате да си изградите компютър за стартиране на локални AI агенти, спрете да изграждате гейминг машина. Не ви е нужен 5.8 гигахерцов Core i9, система за течно охлаждане, или осемгигабайтова видеокарта, покрита с RGB. При локално AI извеждане, гейминг спецификациите са почти безполезни. Единственият показател, който определя дали вашият агент работи или пълзи, е капацитетът на VRAM и пропускателната способност на шината на паметта. Правила на хардуерния тест: забравете тактовите честоти на процесора и бенчмарковете за растеризация.

0:24 Ние се интересуваме от три числа: ширина на шината на паметта, пропускателна способност в гигабайта за секунда и суров VRAM запас за набъбване на KV кеша. В този полеви тест ще разгледам 20-кратния спад в пропускателната способност на паметта, ще начертая правилата за оразмеряване на моделите, ще тествам три реални нива от хиляда и двеста долара до пет хиляди и ще обясня защо употребявана 3090 все още е най-големият чийт код в компютърните технологии. Това е The Daily Diff, полеви тест. За да разберете защо гейминг машините се провалят, погледнете как всъщност се изпълнява генерирането на токени. В игрите, вашият процесор подава команди за рисуване, а вашият графичен процесор рендира кадри.

0:54 Но авторегресивното LLM декодиране е почти изцяло ограничено от пропускателната способност на паметта. За да генерира един токен, графичният процесор трябва да предава всеки параметър на теглото на модела от паметта през своите изчислителни ядра. Ако вашият модел е десет гигабайта, произвеждането на един токен означава четене на десет гигабайта данни. На Nvidia RTX 3090 с 384-битова шина на паметта, получавате 936 гигабайта в секунда пропускателна способност на GDDR6X, произвеждайки осемдесет токена в секунда. Но вижте какво се случва в момента, в който вашият модел надхвърли физическата VRAM.

1:22 Когато VRAM се запълни, времената за изпълнение прехвърлят останалите слоеве през PCIe шината към системна DDR5 памет. Вашите графични ядра очакват хиляда гигабайта в секунда. Вместо това, двуканална DDR5 им подава петдесет, а PCIe 4 се задъхва на тридесет и един. Това е двадесеткратно срив на пропускателната способност. Конвейерът за генериране на токени незабавно спира, чакайки на шината, и скоростта спада от четиридесет токена в секунда до един и половина. Превърнали сте машина за две хиляди долара в нагревател.

1:47 И става по-зле по време на многократни изпълнения на агенти, защото теглата са само половината битка. Всяка подкана, извикване на инструмент и файлов фрагмент се съхраняват в кеша Key-Value. Контекстен прозорец от тридесет и два хиляди може да изяде от четири до осем гигабайта от VRAM в допълнение към теглата. Ако вашата карта има само шестнадесет гигабайта, вашият агент се повтаря два пъти, удря стената на контекста и или се срива с грешка за изчерпана памет, или се прелива в DDR5. Ето таблицата за оразмеряване на четири бита. Модел с осем милиарда параметри като Llama 3.1 или DeepSeek Distill

2:16 заема около пет гигабайта. Модел с четиринадесет милиарда заема десет гигабайта. Модел с тридесет и два милиарда, оптималната точка за интелигентност за кодиращи агенти, изисква двадесет гигабайта. А авангарден модел със седемдесет милиарда изисква четиридесет гигабайта, преди дори да разпределите контекст. Което ни води до действителните хардуерни конфигурации. Ниво 1 е стартовата конфигурация, от хиляда и двеста до хиляда и петстотин долара. На компютър, вашият котва е RTX 4060 Ti 16-гигабайта.

2:39 Критично предупреждение: никога не купувайте осемгигабайтовата версия, за да спестите седемдесет долара. Осем гигабайта VRAM през 2026 г. е незабавна смъртна присъда от изчерпана памет при всеки реален работен процес на агент. Сдвоете го с шест-ядрен Ryzen 5, шестдесет и четири гигабайта DDR5, и двутерабайтов NVMe диск. В света на Apple еквивалентът е Mac Mini или MacBook Pro със шестнадесет гигабайта обединена памет.

3:02 Ще видите от четиридесет до петдесет токена в секунда на осем-милиардни модели. Ниво 2 е оптималната точка за напреднали потребители: изграждане специално за стартиране на модели с тридесет и два милиарда параметри като Qwen 2.5 32B. Път А е нова RTX 4070 Ti Super с шестнадесет гигабайта за осемстотин долара. Но Път Б е моята силна препоръка: купете употребявана Nvidia RTX 3090 двадесет и четири гигабайта. Можете да намерите чисти 3090 на eBay за шестстотин и петдесет до седемстотин и петдесет долара. Това ви дава двадесет и четири гигабайта VRAM на масивна 384-битова шина, изтласкваща

3:33 936 гигабайта в секунда. Долар за долар, това е най-добрата сделка за VRAM в компютрите. На macOS, еквивалентът на Ниво 2 е Mac Mini M4 Pro с шестдесет и четири гигабайта обединена памет. Той произвежда единадесет до дванадесет токена в секунда на тридесет и два милиарден модел: по-бавно от Nvidia, но абсолютно безшумно при тридесет вата с място за огромен контекстен прозорец. Ниво 3 е категорията за ентусиасти за рояци от множество агенти. На компютър, това означава RTX 4090 с двадесет и четири гигабайта,

3:57 Ryzen 9 и сто двадесет и осем гигабайта RAM, или две RTX 3090, осигуряващи общо четиридесет и осем гигабайта VRAM. В продуктовата линия на Apple, това е Mac Studio Ultra с деветдесет и шест до сто и двадесет и осем гигабайта унифицирана памет. Суперсилата е резидентността на паметта: можете да поддържате модел за вграждане, бърз рутер и 32-милиарден модел за кодиране, заредени едновременно с нулево забавяне при смяна. Сега за честния провал на нашия полеви тест: капанът на периферните изчисления.

4:24 Всяка седмица социална публикация твърди, че можете да стартирате автономни кодиращи агенти на осемдесет доларов Raspberry Pi 5. Тествах го. Стартирането на миниатюрен модел с 1.5 милиарда параметъра ви дава едва три токена в секунда, докато платката се задушава при осемдесет и пет градуса по Целзий. Това е приятна играчка за уикенда, но като ежедневен инструмент за разработка, е чисто наказание. За софтуер използвайте Ollama, ако искате чист демон на командния ред, който се свързва

4:47 директно с Cursor, Cline или VS Code. Ако искате графична среда за игра с изтегляне на модели и плъзгачи за GPU слоеве, използвайте LM Studio. И съчетайте формата си със силиция си. На Apple Silicon винаги изтегляйте GGUF модели, оптимизирани за Metal. На Windows или Linux с Nvidia, изтегляйте AWQ или EXL2 модели, които използват Nvidia Tensor Cores за двадесет до тридесет процента по-бързо извеждане. И така, как да разгърнете това, без да фалирате?

5:11 Мислете за локалния хардуер като за домашен фитнес срещу търговски фитнес. Наличието на стойка за клякане у дома означава, че тренирате всеки ден без пътуване, без абонаментни такси и пълна поверителност. Вашата локална машина обработва осемдесет процента от ежедневното ви кодиране, тестване на единици и обработка на частни документи за нула долара на токен. И когато трябва да вдигнете двеста килограма – като мащабен архитектурен рефакторинг в целия репо през петдесет файла – посещавате търговския фитнес: плащате на API на облака за Claude 3.5 Sonnet или OpenAI o3 за петнадесет минути и продължавате напред.

5:38 И продължавате напред. Ето сметката: конфигурация от Ниво 2 с употребявана 3090 струва хиляда и шестстотин долара общо. Ако харчите от петдесет до сто долара на месец за API токени, тя се изплаща за осемнадесет месеца, като същевременно запазва вашата собствена кодова база извън сървъри на трети страни. Присъдата от днешния полеви тест: SHIP IT. VRAM и пропускателната способност на паметта превъзхождат тактовите честоти всеки път. Спрете да купувате петгигахерцови процесори за AI и намерете употребявана 3090.

6:04 Кажете ми каква хардуерна конфигурация използвате за локални модели в коментарите. И ако предпочитате да прочетете този анализ, вземете бюлетина на the daily diff dot dev, линк по-долу. И това е разликата за днес. Аз съм Нико от Axrisi. Сливайте отговорно.

Източници

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Свързани видеоклипове