O Guia de Hardware de IA Local (2026)
Ao construir uma máquina para agentes de IA locais e LLMs de código aberto, os desenvolvedores cometem o erro de comprar especificações de PCs gamer: CPUs de 5,8 GHz, sistemas de refrigeração líquida personalizados e GPUs gamer rápidas com apenas 8GB de VRAM.
Ao construir uma máquina para agentes de IA locais e LLMs de código aberto, os desenvolvedores cometem o erro de comprar especificações de PCs gamer: CPUs de 5,8 GHz, sistemas de refrigeração líquida personalizados e GPUs gamer rápidas com apenas 8GB de VRAM. Mas a geração de tokens autorregressiva é limitada pela largura de banda da memória, não pela capacidade de processamento: para emitir um único token, cada peso no modelo deve fluir através do barramento de memória. Quando seus pesos ou o contexto do cache KV excedem a VRAM física, o tempo de execução descarrega camadas para a memória DDR5 do sistema via PCIe, e você atinge um "abismo" de largura de banda de memória de 20x: a velocidade despenca de 40 tokens por segundo para 1,5. Neste teste de campo, Niko detalha a mecânica do hardware, as regras de dimensionamento de modelos de quantização de 4 bits, três níveis de orçamento reais de US$ 1.200 a US$ 5.000, por que uma RTX 3090 24GB usada é o melhor custo-benefício de VRAM por dólar em computação, a armadilha de borda do Raspberry Pi e a estratégia de "academia em casa" para inferência local versus em nuvem. Veredito: SHIP IT.
Leia a edição escrita (Inglês) ↗
O que este vídeo aborda
- O abismo de largura de banda de memória de 20x: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
- Dimensionamento de modelos @ 4-bit: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- Nível 1 (US$ 1.200–US$ 1.500): RTX 4060 Ti 16GB (nunca 8GB) ou Mac Mini 16GB
- Nível 2 (US$ 1.500–US$ 2.000): Ponto ideal da RTX 3090 24GB usada ou Mac Mini M4 Pro 64GB
- Nível 3 (US$ 3.500+): RTX 4090 24GB / duas 3090s ou Mac Studio Ultra
Transcrição traduzida
Traduzido da narração original em inglês. Áudio e legendas disponíveis são controlados pelo YouTube.
0:00 Se você está planejando montar um PC para rodar agentes de IA locais, pare de montar um computador gamer. Você não precisa de um Core i9 de cinco ponto oito gigahertz, um sistema de refrigeração líquida, ou uma placa de vídeo de oito gigabytes coberta de RGB. Na inferência de IA local, as especificações de jogos são praticamente inúteis. A única métrica que dita se seu agente roda ou engatinha é a capacidade de VRAM e a largura de banda do barramento de memória. Regras do teste de hardware: esqueça os clocks da CPU e os benchmarks de rasterização.
0:24 Nós nos importamos com três números: largura do barramento de memória, largura de banda em gigabytes por segundo, e folga de VRAM bruta para o inchaço do cache KV. Neste teste de campo, vou detalhar o abismo de largura de banda de memória de vinte vezes, mapear as regras de dimensionamento de modelos, testar três níveis reais de mil e duzentos dólares a cinco mil, e explicar por que uma 3090 usada ainda é o maior macete da computação. Este é The Daily Diff, teste de campo. Para entender por que os computadores gamer falham, veja como a geração de tokens realmente executa. Em jogos, sua CPU alimenta as chamadas de desenho e sua GPU renderiza os frames.
0:54 Mas a decodificação de LLMs autorregressivos é quase puramente limitada pela largura de banda da memória. Para gerar um único token, a GPU deve transmitir todos os parâmetros de peso do modelo da memória através de seus núcleos de computação. Se seu modelo tem dez gigabytes, produzir um token significa ler dez gigabytes de dados. Em uma Nvidia RTX 3090 com um barramento de memória de 384 bits, você obtém 936 gigabytes por segundo de largura de banda GDDR6X, produzindo oitenta tokens por segundo. Mas observe o que acontece no milissegundo em que seu modelo excede a VRAM física.
1:22 Quando a VRAM enche, os tempos de execução descarregam as camadas restantes através do barramento PCIe para a memória DDR5 do sistema. Seus núcleos de GPU esperam mil gigabytes por segundo. Em vez disso, a DDR5 de canal duplo os alimenta com cinquenta, e o PCIe 4 engasga em trinta e um. Isso é um colapso de largura de banda de vinte vezes. O pipeline de geração de tokens paralisa instantaneamente esperando no barramento, e a velocidade despenca de quarenta tokens por segundo para um ponto cinco. Você transformou um computador de dois mil dólares em um aquecedor.
1:47 E piora durante as execuções de agentes com várias voltas, porque os pesos são apenas metade da batalha. Cada prompt, chamada de ferramenta e pedaço de arquivo é armazenado no cache de Chave-Valor. Uma janela de contexto de trinta e dois K pode consumir de quatro a oito gigabytes de VRAM além dos pesos. Se sua placa tem apenas dezesseis gigabytes, seu agente faz dois loops, atinge o limite de contexto e trava com um erro de falta de memória ou transborda para a DDR5. Aqui está a folha de dicas de dimensionamento de quatro bits. Um modelo de sete ou oito bilhões de parâmetros como o Llama 3.1 ou o DeepSeek Distill
2:16 ocupa cerca de cinco gigabytes. Um modelo de quatorze bilhões ocupa dez gigabytes. Um modelo de trinta e dois bilhões, o ponto ideal de inteligência para agentes de codificação, requer vinte gigabytes. E um modelo de ponta de setenta bilhões exige quarenta gigabytes antes mesmo de você alocar contexto. O que nos leva às construções de hardware reais. O Nível 1 é o computador inicial, de mil e duzentos a mil e quinhentos dólares. No PC, sua âncora é uma RTX 4060 Ti de 16 gigabytes.
2:39 Aviso crítico: nunca compre a versão de oito gigabytes para economizar setenta dólares. Oito gigabytes de VRAM em 2026 é uma sentença de morte imediata por falta de memória em qualquer fluxo de trabalho de agente real. Emparelhe-a com um Ryzen 5 de seis núcleos, sessenta e quatro gigabytes de DDR5, e um disco NVMe de dois terabytes. No mundo Apple, o equivalente é um Mac Mini ou MacBook Pro com dezesseis gigabytes de memória unificada.
3:02 Você verá quarenta a cinquenta tokens por segundo em modelos de oito bilhões. O Nível 2 é o ponto ideal para usuários avançados: construir especificamente para rodar modelos de trinta e dois bilhões de parâmetros como o Qwen 2.5 32B. O Caminho A é uma nova RTX 4070 Ti Super com dezesseis gigabytes por oitocentos dólares. Mas o Caminho B é minha forte recomendação: compre uma Nvidia RTX 3090 de vinte e quatro gigabytes usada. Você pode encontrar 3090s em bom estado no eBay por seiscentos e cinquenta a setecentos e cinquenta dólares. Isso lhe dá vinte e quatro gigabytes de VRAM em um enorme barramento de 384 bits empurrando
3:33 936 gigabytes por segundo. Dólar por dólar, é o melhor custo-benefício de VRAM na computação. No macOS, a contraparte do Nível 2 é um Mac Mini M4 Pro com sessenta e quatro gigabytes de memória unificada. Ele produz de onze a doze tokens por segundo em um modelo de trinta e dois bilhões: mais lento que a Nvidia, mas totalmente silencioso a trinta watts com espaço para uma enorme janela de contexto. O Nível 3 é a categoria para entusiastas de enxames multi-agente. No PC, isso significa uma RTX 4090 com vinte e quatro gigabytes,
3:57 um Ryzen 9 e cento e vinte e oito gigabytes de RAM, ou duas RTX 3090s fornecendo quarenta e oito gigabytes de VRAM total. Na linha da Apple, este é um Mac Studio Ultra com noventa e seis a cento e vinte e oito gigabytes de memória unificada. O superpoder é a residência de memória: você pode manter um modelo de embedding, um roteador rápido e um modelo de codificação de 32 bilhões carregados simultaneamente com atraso zero de swap. Agora, a falha honesta do nosso teste de campo: a armadilha da computação de borda.
4:24 Toda semana, uma postagem social afirma que você pode executar agentes de codificação autônomos em um Raspberry Pi 5 de oitenta dólares. Eu testei. Executar um pequeno modelo de um ponto cinco bilhão de parâmetros lhe dá apenas três tokens por segundo enquanto a placa acelera a oitenta e cinco graus Celsius. É um brinquedo legal para o fim de semana, mas como um driver de desenvolvimento diário, é pura punição. Para software, use Ollama se quiser um daemon de linha de comando limpo que se conecte
4:47 direto ao Cursor, Cline ou VS Code. Se você quiser um playground gráfico com downloads de modelos e controles deslizantes de camada de GPU, use o LM Studio. E combine seu formato com seu silício. No Apple Silicon, sempre baixe modelos GGUF otimizados para Metal. No Windows ou Linux com Nvidia, baixe modelos AWQ ou EXL2, que utilizam os Nvidia Tensor Cores para uma inferência vinte a trinta por cento mais rápida. Então, como você implanta isso sem ir à falência?
5:11 Pense no hardware local como uma academia em casa versus uma academia comercial. Ter um rack de agachamento em casa significa que você treina todos os dias sem deslocamento, sem taxas de assinatura e com total privacidade. Sua máquina local lida com oitenta por cento de sua codificação diária, teste de unidade e processamento de documentos privados por zero dólares por token. E quando você precisa levantar duzentos e vinte e seis quilos — como uma refatoração arquitetônica enorme em todo o repositório em cinquenta arquivos — você visita a academia comercial: pague a API da nuvem para Claude 3.5 Sonnet ou OpenAI o3 por quinze minutos
5:38 e siga em frente. Aqui está a conta: uma construção de Nível 2 com uma 3090 usada custa mil e seiscentos dólares no total. Se você gastar de cinquenta a cem dólares por mês em tokens de API, ele se paga em dezoito meses, mantendo seu código proprietário fora de servidores de terceiros. Veredito do teste de campo de hoje: SHIP IT. VRAM e largura de banda de memória superam as velocidades de clock sempre. Pare de comprar CPUs de cinco gigahertz para IA e vá procurar uma 3090 usada.
6:04 Diga-me qual hardware você está usando para modelos locais nos comentários. E se você preferir ler esta análise, pegue a newsletter em the daily diff dot dev, link abaixo. E essa é a diferença de hoje. Eu sou Niko da Axrisi. Faça merges com responsabilidade.
Fontes
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



