+− THE DAILY DIFFdev & AI news
SHIP IT

Lokalny Przewodnik po Sprzęcie AI (2026)

Przy budowaniu maszyny dla lokalnych agentów AI i modeli LLM o otwartej wadze, deweloperzy popełniają błąd, kupując specyfikacje komputera do gier: procesory 5,8 GHz, niestandardowe systemy chłodzenia cieczą i szybkie karty graficzne do gier z zaledwie 8 GB pamięci VRAM.

Przy budowaniu maszyny dla lokalnych agentów AI i modeli LLM o otwartej wadze, deweloperzy popełniają błąd, kupując specyfikacje komputera do gier: procesory 5,8 GHz, niestandardowe systemy chłodzenia cieczą i szybkie karty graficzne do gier z zaledwie 8 GB pamięci VRAM. Jednak autoregresywna generacja tokenów jest ograniczona przepustowością pamięci, a nie mocą obliczeniową: aby wyemitować pojedynczy token, każda waga w modelu musi przepłynąć przez magistralę pamięci. Gdy Twoje wagi lub kontekst pamięci podręcznej KV przekroczą fizyczną pamięć VRAM, środowisko wykonawcze odciąża warstwy do pamięci systemowej DDR5 przez PCIe, a Ty napotykasz 20-krotny spadek przepustowości pamięci: prędkość spada z 40 tokenów na sekundę do 1,5. W tym teście terenowym Niko rozkłada mechanikę sprzętu, zasady doboru rozmiaru modelu dla 4-bitowej kwantyzacji, trzy rzeczywiste poziomy budżetowe od 1200 do 5000 USD, dlaczego używany RTX 3090 24GB jest najlepszym stosunkiem VRAM do dolara w informatyce, pułapkę krawędzi Raspberry Pi oraz strategię "domowej siłowni" dla wnioskowania lokalnego versus chmurowego. Werdykt: SHIP IT.

Przeczytaj wydanie pisemne (angielski) ↗

Co obejmuje ten film

  • 20-krotny spadek przepustowości pamięci: 936 GB/s GDDR6X vs 50 GB/s DDR5 i 31,5 GB/s PCIe
  • Rozmiar modelu @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
  • Poziom 1 (1200–1500 USD): RTX 4060 Ti 16GB (nigdy 8GB) lub Mac Mini 16GB
  • Poziom 2 (1500–2000 USD): Używany RTX 3090 24GB to najlepszy wybór lub Mac Mini M4 Pro 64GB
  • Poziom 3 (3500 USD+): RTX 4090 24GB / dwa 3090 lub Mac Studio Ultra

Przetłumaczona transkrypcja

Przetłumaczono z oryginalnej narracji angielskiej. Dostępne audio i napisy są kontrolowane przez YouTube.

0:00 Jeśli planujesz zbudować komputer do uruchamiania lokalnych agentów AI, przestań budować maszynę do gier. Nie potrzebujesz procesora Core i9 5,8 GHz, chłodzenia cieczą, ani karty graficznej 8 GB pokrytej RGB. W lokalnym wnioskowaniu AI, specyfikacje gamingowe są praktycznie bezużyteczne. Jedyną metryką, która decyduje o tym, czy Twój agent działa, czy się wlecze, jest pojemność VRAM i przepustowość magistrali pamięci. Zasady testu sprzętu: zapomnij o taktowaniach procesora i benchmarkach rasteryzacji.

0:24 Zależy nam na trzech liczbach: szerokości magistrali pamięci, przepustowości w gigabajtach na sekundę i surowym zapasie VRAM na rozszerzenie pamięci podręcznej KV. W tym teście terenowym omówię 20-krotny spadek przepustowości pamięci, wyjaśnię zasady doboru rozmiaru modelu, przetestuję trzy rzeczywiste poziomy budżetowe od dwunastu stu dolarów do pięciu tysięcy i wyjaśnię, dlaczego używany 3090 nadal jest największym oszustwem w informatyce. To jest The Daily Diff, test terenowy. Aby zrozumieć, dlaczego komputery do gier zawodzą, spójrz na to, jak faktycznie odbywa się generowanie tokenów. W grach Twój procesor dostarcza wywołania rysowania, a Twoja karta graficzna renderuje klatki.

0:54 Ale autoregresywne dekodowanie LLM jest niemal wyłącznie ograniczone przepustowością pamięci. Aby wygenerować pojedynczy token, karta graficzna musi przesyłać każdy parametr wagowy modelu z pamięci przez swoje rdzenie obliczeniowe. modelu z pamięci przez swoje rdzenie obliczeniowe. Jeśli Twój model ma dziesięć gigabajtów, wyprodukowanie jednego tokena oznacza odczytanie dziesięciu gigabajtów danych. Na karcie Nvidia RTX 3090 z 384-bitową magistralą pamięci, otrzymujesz 936 gigabajtów na sekundę przepustowości GDDR6X, produkując osiemdziesiąt tokenów na sekundę. Ale zobacz, co się dzieje w milisekundzie, gdy Twój model przekroczy fizyczną pamięć VRAM.

1:22 Gdy VRAM się zapełni, środowiska wykonawcze odciążają pozostałe warstwy przez magistralę PCIe do pamięci systemowej DDR5. Rdzenie Twojej karty graficznej oczekują tysiąca gigabajtów na sekundę. Zamiast tego, dwukanałowy DDR5 dostarcza im pięćdziesiąt, a PCIe 4 dławi się na trzydziestu jeden. To jest 20-krotny spadek przepustowości. Potok generacji tokenów natychmiast się zatrzymuje, czekając na magistralę, a prędkość spada z czterdziestu tokenów na sekundę do jednego i pół. Zamieniłeś dwutysięczną maszynę w grzejnik.

1:47 A jest gorzej podczas wieloetapowych uruchomień agentów, ponieważ wagi to tylko połowa bitwy. Każda podpowiedź, wywołanie narzędzia i fragment pliku są przechowywane w pamięci podręcznej Key-Value. Okno kontekstu 32K może zużyć od czterech do ośmiu gigabajtów pamięci VRAM, oprócz wag. VRAM oprócz wag. Jeśli Twoja karta ma tylko szesnaście gigabajtów, Twój agent zapętla się dwukrotnie, uderza w ścianę kontekstu i albo zawiesza się z powodu błędu braku pamięci, albo przelewa się do DDR5. Oto ściąga z rozmiarów dla 4-bitowej kwantyzacji. Model z siedmioma lub ośmioma miliardami parametrów, taki jak Llama 3.1 lub DeepSeek Distill,

2:16 zajmuje około pięciu gigabajtów. Model czternastomiliardowy zajmuje dziesięć gigabajtów. Model trzydziestodwumiliardowy, idealny punkt równowagi dla agentów kodujących, wymaga dwudziestu gigabajtów. A model czołowy siedemdziesięciomiliardowy wymaga czterdziestu gigabajtów, zanim w ogóle przydzielisz kontekst. Co prowadzi nas do rzeczywistych konfiguracji sprzętowych. Poziom 1 to konfiguracja startowa, od tysiąca dwustu do tysiąca pięciuset dolarów. Na PC, Twoim punktem odniesienia jest RTX 4060 Ti 16-gigabajtowy.

2:39 Krytyczne ostrzeżenie: nigdy nie kupuj ośmiogigabajtowej wersji, aby zaoszczędzić siedemdziesiąt dolarów. Osiem gigabajtów pamięci VRAM w 2026 roku to natychmiastowy wyrok śmierci z powodu braku pamięci w każdym realnym przepływie pracy agenta. Połącz ją z sześciordzeniowym Ryzenem 5, sześćdziesięcioma czterema gigabajtami DDR5, i dwuterabajtowym dyskiem NVMe. W świecie Apple, odpowiednikiem jest Mac Mini lub MacBook Pro z szesnastoma gigabajtami ujednoliconej pamięci.

3:02 Osiągniesz od czterdziestu do pięćdziesięciu tokenów na sekundę na modelach ośmiomiliardowych. Poziom 2 to idealne rozwiązanie dla zaawansowanych użytkowników: budowanie specjalnie pod kątem uruchamiania modeli z 32 miliardami parametrów, takich jak Qwen 2.5 32B. Opcja A to nowa RTX 4070 Ti Super z szesnastoma gigabajtami za osiemset dolarów. Ale Opcja B to moja zdecydowana rekomendacja: kup używaną kartę Nvidia RTX 3090 dwadzieścia cztery gigabajty. Czyste 3090 można znaleźć na eBayu za sześćset pięćdziesiąt do siedmiuset pięćdziesięciu dolarów. To daje dwadzieścia cztery gigabajty pamięci VRAM na ogromnej 384-bitowej magistrali, przepychającej

3:33 936 gigabajtów na sekundę. Dolar za dolara, to najlepsza oferta VRAM w informatyce. W systemie macOS, odpowiednikiem Poziomu 2 jest Mac Mini M4 Pro z sześćdziesięcioma czterema gigabajtami ujednoliconej pamięci. Produkuje jedenaście do dwunastu tokenów na sekundę na modelu 32 miliardów: wolniej niż Nvidia, ale zupełnie cicho przy trzydziestu watach z miejscem na gigantyczne okno kontekstowe. Poziom 3 to kategoria dla entuzjastów roju multi-agentów. Na PC oznacza to RTX 4090 z dwudziestoma czterema gigabajtami,

3:57 Ryzen 9 i sto dwadzieścia osiem gigabajtów RAM, lub dwie karty RTX 3090, zapewniające łącznie czterdzieści osiem gigabajtów VRAM. W ofercie Apple to Mac Studio Ultra z dziewięćdziesięcioma sześcioma do stu dwudziestu ośmioma gigabajtami ujednoliconej pamięci. Supermocą jest rezydencja pamięci: możesz jednocześnie przechowywać model osadzania, szybki router i 32-miliardowy model kodowania załadowane jednocześnie bez opóźnienia wymiany. Teraz o szczerej porażce naszego testu terenowego: pułapka przetwarzania brzegowego.

4:24 Co tydzień w postach społecznościowych pojawiają się twierdzenia, że można uruchamiać autonomicznych agentów kodujących na osiemdziesięciodolarowym Raspberry Pi 5. Przetestowałem to. Uruchomienie maleńkiego modelu z 1,5 miliarda parametrów daje ledwie trzy tokeny na sekundę, podczas gdy płyta dławi się przy osiemdziesięciu pięciu stopniach Celsjusza. To fajna zabawka na weekend, ale jako codzienne narzędzie deweloperskie, to czysta kara. Do oprogramowania użyj Ollama, jeśli chcesz czysty demon wiersza poleceń, który łączy się

4:47 bezpośrednio z Cursor, Cline lub VS Code. Jeśli chcesz graficzne środowisko z pobieraniem modeli i suwakami warstw GPU, użyj LM Studio. I dopasuj format do swojego krzemu. Na Apple Silicon zawsze pobieraj modele GGUF zoptymalizowane pod Metal. Na Windowsie lub Linuksie z Nvidia pobieraj modele AWQ lub EXL2, które wykorzystują rdzenie Tensor Nvidia do 20–30 procent szybszego wnioskowania. Więc jak to wdrożyć, nie zbankrutując?

5:11 Pomyśl o lokalnym sprzęcie jak o domowej siłowni kontra komercyjnej siłowni. Posiadanie stojaka do przysiadów w domu oznacza, że trenujesz codziennie bez dojazdów, bez opłat abonamentowych i z pełną prywatnością. Twoja lokalna maszyna obsługuje osiemdziesiąt procent Twojego codziennego kodowania, testowania jednostkowego i przetwarzania prywatnych dokumentów za zero dolarów za token. A kiedy musisz podnieść pięćset funtów — jak masowy, obejmujący całe repozytorium refaktoryzacja architektury w pięćdziesięciu plikach — odwiedzasz komercyjną siłownię: płacisz za API chmury dla Claude 3.5 Sonnet lub OpenAI o3 na piętnaście minut

5:38 i idziesz dalej. Oto rachunek: konfiguracja Poziomu 2 z używanym 3090 kosztuje szesnaście sto dolarów łącznie. Jeśli wydasz pięćdziesiąt do stu dolarów miesięcznie na tokeny API, zwróci się w osiemnaście miesięcy, jednocześnie utrzymując Twoją własnościową bazę kodu poza serwerami stron trzecich. Werdykt dzisiejszego testu terenowego: SHIP IT. VRAM i przepustowość pamięci zawsze wygrywają z prędkością zegara. Przestań kupować procesory 5 GHz do AI i znajdź używanego 3090.

6:04 Napisz w komentarzach, jaką konfigurację sprzętową używasz do modeli lokalnych. A jeśli wolisz przeczytać to zestawienie, pobierz newsletter na the daily diff dot dev, link poniżej. I to wszystko na dziś. Jestem Niko z Axrisi. Scalaj odpowiedzialnie.

Źródła

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

Powiązane filmy