Жергілікті AI аппараттық құралдары бойынша нұсқаулық (2026)
Жергілікті AI агенттері мен ашық салмақты LLM-дер үшін машина құрастырғанда, әзірлеушілер ойын компьютерлерінің сипаттамаларын сатып алу қателігін жібереді: 5.8 ГГц процессорлар, арнайы сұйық салқындату жүйелері және тек 8 ГБ VRAM бар жылдам ойын графикалық процессорлары.
Жергілікті AI агенттері мен ашық салмақты LLM-дер үшін машина құрастырғанда, әзірлеушілер ойын компьютерлерінің сипаттамаларын сатып алу қателігін жібереді: 5.8 ГГц процессорлар, арнайы сұйық салқындату жүйелері және тек 8 ГБ VRAM бар жылдам ойын графикалық процессорлары. Бірақ авторегрессивті токен генерациясы есептеуге емес, жад өткізу қабілетіне байланысты: бір токенді шығару үшін модельдегі әрбір салмақ жад шинасы арқылы өтуі керек. Егер сіздің салмақтарыңыз немесе KV кэш контексті физикалық VRAM-нан асып кетсе, жұмыс уақыты қабаттарды PCIe арқылы жүйелік DDR5-ке жібереді, сонда сіз жад өткізу қабілетінің 20 есе төмендеуіне тап боласыз: жылдамдық секундына 40 токеннен 1.5-ке дейін төмендейді. Осы далалық сынақта Нико аппараттық механиканы, 4 биттік кванттау моделін өлшемдеу ережелерін, $1,200-ден $5,000-ға дейінгі үш нақты бюджеттік деңгейді, пайдаланылған RTX 3090 24 ГБ неліктен есептеудегі ең жақсы VRAM-ды долларға қатынасы бойынша ең жақсы ұсыныс екенін, Raspberry Pi шеткі тұзағын және жергілікті және бұлттық инференцияға арналған үй спортзалы стратегиясын талдайды. Үкім: SHIP IT.
Жазбаша басылымды оқыңыз (ағылшынша) ↗
Бұл бейне не туралы
- Жад өткізу қабілетінің 20 есе төмендеуі: 936 ГБ/с GDDR6X vs 50 ГБ/с DDR5 & 31.5 ГБ/с PCIe
- Модельді өлшемдеу @ 4-бит: 8B (5ГБ), 14B (10ГБ), 32B (20ГБ), 70B (40ГБ)
- 1-деңгей ($1,200–$1,500): RTX 4060 Ti 16ГБ (ешқашан 8ГБ емес) немесе Mac Mini 16ГБ
- 2-деңгей ($1,500–$2,000): Пайдаланылған RTX 3090 24ГБ оңтайлы немесе Mac Mini M4 Pro 64ГБ
- 3-деңгей ($3,500+): RTX 4090 24ГБ / екі 3090 немесе Mac Studio Ultra
Аударылған транскрипция
Бастапқы ағылшын тіліндегі баяндамадан аударылған. Қолжетімді аудио және субтитрлерді YouTube басқарады.
0:00 Егер сіз жергілікті AI агенттерін іске қосу үшін компьютер құрастыруды жоспарлап отырсаңыз, ойын құрылғысын құрастыруды тоқтатыңыз. Сізге бес-сегіз гигагерцтік Core i9, сұйық салқындату жүйесі қажет емес, немесе RGB жарығымен қапталған сегіз гигабайттық графикалық карта да қажет емес. Жергілікті AI инференциясында ойын сипаттамалары іс жүзінде пайдасыз. Агентіңіздің жұмыс істеуін немесе баяу жұмыс істеуін анықтайтын жалғыз көрсеткіш - VRAM сыйымдылығы және жад шинасының өткізу қабілеті. Аппараттық сынақ ережелері: процессор сағаттары мен растерлеу бенчмарктерін ұмытыңыз.
0:24 Бізді үш сан қызықтырады: жад шинасының ені, өткізу қабілеті секундына гигабайтпен және KV кэш ісінуі үшін VRAM-ның шикі қоры. Осы далалық сынақта мен жиырма еселік жад өткізу қабілетінің төмендеуін талдаймын, модельді өлшемдеу ережелерін көрсетемін, мың екі жүзден бес мың долларға дейінгі үш нақты деңгейді сынақтан өткіземін және пайдаланылған 3090 неліктен әлі күнге дейін есептеудің ең үлкен алдау коды екенін түсіндіремін. Бұл The Daily Diff, далалық сынақ. Ойын құрылғылары неліктен істен шығатынын түсіну үшін, токен генерациясының іс жүзінде қалай орындалатынына қараңыз. Ойындарда процессор сурет шақыруларын береді, ал графикалық процессор кадрларды көрсетеді.
0:54 Бірақ авторегрессивті LLM декодтау дерлік толығымен жад өткізу қабілетіне байланысты. Бір токенді генерациялау үшін графикалық процессор модельдің әрбір салмақ параметрін жадтан өзінің есептеу ядролары арқылы ағынмен жіберуі керек. Егер сіздің моделіңіз он гигабайт болса, бір токенді шығару он гигабайт деректерді оқуды білдіреді. 384 биттік жад шинасы бар Nvidia RTX 3090-да, сіз секундына 936 гигабайт GDDR6X өткізу қабілетін аласыз, секундына сексен токен шығарады. Бірақ моделіңіз физикалық VRAM-нан асқан сәтте не болатынын қараңыз.
1:22 VRAM толған кезде, жұмыс уақыты қалған қабаттарды PCIe шинасы арқылы жүйелік DDR5 жадына жібереді. Сіздің графикалық процессор ядролары секундына мың гигабайт күтеді. Оның орнына, қос арналы DDR5 оларға елуін береді, ал PCIe 4 отыз бірде тұншығады. Бұл жиырма еселік өткізу қабілетінің құлдырауы. Токен генерациясы құбыры дереу шинаны күтіп тұрып қалады, жылдамдық секундына қырық токеннен бір жарымға дейін төмендейді. Сіз екі мың долларлық құрылғыны жылытқышқа айналдырдыңыз.
1:47 Ал көп сатылы агенттік жұмыстар кезінде жағдай нашарлайды, себебі салмақтар тек жартысы ғана. Әрбір сұраныс, құрал шақыруы және файл бөлігі Key-Value кэшіне сақталады. Отыз екі мыңдық контекст терезесі салмақтардан бөлек төрттен сегіз гигабайт VRAM-ды жеп жіберуі мүмкін. Егер сіздің картаңызда тек он алты гигабайт болса, агентіңіз екі рет айналады, контекст қабырғасына соғылады және жад жетіспеушілігі қатесімен құлап қалады немесе DDR5-ке төгіледі. Міне, төрт биттік өлшемдеу парағы. Llama 3.1 немесе DeepSeek Distill сияқты жеті немесе сегіз миллиард параметрлі модель
2:16 шамамен бес гигабайт алады. Он төрт миллиардтық модель он гигабайт алады. Отыз екі миллиардтық модель, кодтау агенттері үшін интеллекттің оңтайлы нүктесі, жиырма гигабайтты қажет етеді. Ал жетпіс миллиардтық шекаралық модель сіз контекстті бөлмес бұрын қырық гигабайтты талап етеді. Бұл бізді нақты аппараттық құрастыруларға әкеледі. 1-деңгей – бастапқы құрылғы, он екі жүзден он бес жүз долларға дейін. Дербес компьютерде сіздің негізгі құрылғыңыз – RTX 4060 Ti 16 гигабайттық.
2:39 Маңызды ескерту: ешқашан жетпіс доллар үнемдеу үшін сегіз гигабайттық нұсқасын сатып алмаңыз. 2026 жылы сегіз гигабайт VRAM кез келген нақты агенттік жұмыс процесінде бірден жадтың таусылуына әкелетін өлім үкімі. Оны алты ядролы Ryzen 5, алпыс төрт гигабайт DDR5 және екі терабайт NVMe дискісімен жұптаңыз. Apple әлемінде оған балама Mac Mini немесе он алты гигабайт біріктірілген жады бар MacBook Pro.
3:02 Сегіз миллиардтық модельдерде секундына қырықтан елуге дейін токен көресіз. 2-деңгей – қуатты пайдаланушы үшін ең қолайлы нүкте: Qwen 2.5 32B сияқты отыз екі миллиард параметрлік модельдерді іске қосуға арналған құрастыру. А жолы – жаңа RTX 4070 Ti Super он алты гигабайтпен сегіз жүз долларға. Бірақ В жолы – менің қатаң ұсынысым: пайдаланылған Nvidia RTX 3090 жиырма төрт гигабайтты сатып алыңыз. Таза 3090-дарды eBay-ден алты жүз елуден жеті жүз елу долларға таба аласыз. Бұл сізге үлкен 384 биттік шинада 936 гигабайтты секундына
3:33 жіберетін жиырма төрт гигабайт VRAM береді. Долларға қатынасы бойынша, бұл есептеудегі ең жақсы VRAM келісімі. macOS жүйесінде 2-деңгейге сәйкес келетіні – алпыс төрт гигабайт біріктірілген жады бар Mac Mini M4 Pro. Ол отыз екі миллиардтық модельде секундына он бірден он екіге дейін токен шығарады: Nvidia-дан баяуырақ, бірақ отыз ватт қуатта дыбыссыз және үлкен контекст терезесіне арналған орын бар. 3-деңгей – көп агентті ройларға арналған энтузиастар санаты. Дербес компьютерде бұл жиырма төрт гигабайттық RTX 4090,
3:57 Ryzen 9 және жүз жиырма сегіз гигабайт ЖЖҚ, немесе жалпы қырық сегіз гигабайт VRAM беретін екі RTX 3090. Apple желісінде бұл тоқсан алтыдан жүз жиырма сегіз гигабайт біріктірілген жады бар Mac Studio Ultra. Суперқабілет – жадта тұрақтылық: сіз бір мезгілде кірістіру моделін, жылдам маршрутизаторды және 32 миллиардтық кодтау моделін нөлдік айырбастау кідірісімен жүктей аласыз. Енді біздің далалық сынақтың шынайы сәтсіздігі туралы: шеткі есептеу тұзағы.
4:24 Әр апта сайын әлеуметтік желілерде сексен долларлық Raspberry Pi 5-те автономды кодтау агенттерін іске қосуға болады деген жазбалар пайда болады. Мен оны сынақтан өткіздім. Кішкентай бір жарым миллиард параметрлі модельді іске қосу секундына әрең үш токен береді, ал плата сексен бес градус Цельсий температурасында дроссельдейді. Бұл керемет демалыс ойыншығы, бірақ күнделікті әзірлеу құралы ретінде, бұл таза азап. Бағдарламалық қамтамасыз ету үшін, егер сіз Cursor, Cline немесе VS Code-қа тікелей
4:47 қосылатын таза командалық жол демонын қаласаңыз, Ollama қолданыңыз. Егер сіз модельдерді жүктеп алуға және GPU қабаттарының жылжытқыштарына арналған графикалық алаңды қаласаңыз, LM Studio қолданыңыз. Және пішіміңізді кремнийге сәйкестендіріңіз. Apple Silicon-да әрқашан Metal үшін оңтайландырылған GGUF модельдерін жүктеп алыңыз. Windows немесе Linux-та Nvidia-мен бірге AWQ немесе EXL2 модельдерін жүктеп алыңыз, олар Nvidia Tensor Cores-ті жиырмадан отыз пайызға дейін жылдамырақ инференция үшін пайдаланады. Ендеше, бұны қалай жұмсақ шығындамай қолдануға болады?
5:11 Жергілікті жабдықты үй спортзалы мен коммерциялық спортзал сияқты елестетіңіз. Үйде скват ракінің болуы сіздің күн сайын жол жүрусіз, нөлдік жазылым төлемдерімен және толық құпиялылықпен жаттығуға мүмкіндік береді. Сіздің жергілікті машинаңыз күнделікті кодтаудың сексен пайызын, бірлік тестілеуін және жеке құжаттарды өңдеуді токен үшін нөл долларға орындайды. Ал сізге бес жүз фунтты жерден көтеру қажет болғанда — мысалы, елу файлды қамтитын массивті репо-кең сәулеттік рефакторинг — сіз коммерциялық спортзалға барасыз: Claude 3.5 Sonnet немесе OpenAI o3 үшін бұлттық API-ге он бес минутқа төлеп
5:38 ары қарай жылжисыз. Міне, есеп: пайдаланылған 3090 бар 2-деңгейлі құрастыру барлығы он алты жүз доллар тұрады. Егер сіз айына елуден жүз долларға дейін API токендеріне жұмсасаңыз, ол он сегіз айда өзін ақтайды, әрі меншікті код базаңызды үшінші тарап серверлерінен тыс сақтайды. Бүгінгі далалық сынақтың қорытындысы: SHIP IT. VRAM және жад өткізу қабілеті әрқашан тактілік жиіліктерді жеңеді. AI үшін бес гигагерцтік процессорларды сатып алуды тоқтатыңыз және пайдаланылған 3090 табыңыз.
6:04 Түсініктемелерде жергілікті модельдер үшін қандай аппараттық құрастыруды қолданып жатқаныңызды айтыңыз. Ал егер сіз осы талдауды оқығыңыз келсе, daily diff dot dev сайтынан ақпараттық бюллетеньді алыңыз, сілтеме төменде. Бүгінгі айырмашылық осы. Мен Niko, Axrisi-ден. Жауапкершілікпен біріктіріңіз.
Дереккөздер
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



