స్థానిక AI హార్డ్వేర్ గైడ్ (2026)
స్థానిక AI ఏజెంట్లు మరియు ఓపెన్-వెయిట్ LLMల కోసం యంత్రాన్ని నిర్మించేటప్పుడు, డెవలపర్లు గేమింగ్ PC స్పెక్స్ను కొనుగోలు చేసే తప్పు చేస్తారు: 5.8 GHz CPUలు, కస్టమ్ లిక్విడ్ కూలింగ్ లూప్లు మరియు కేవలం 8GB VRAMతో వేగవంతమైన గేమింగ్ GPUలు.
స్థానిక AI ఏజెంట్లు మరియు ఓపెన్-వెయిట్ LLMల కోసం యంత్రాన్ని నిర్మించేటప్పుడు, డెవలపర్లు గేమింగ్ PC స్పెక్స్ను కొనుగోలు చేసే తప్పు చేస్తారు: 5.8 GHz CPUలు, కస్టమ్ లిక్విడ్ కూలింగ్ లూప్లు మరియు కేవలం 8GB VRAMతో వేగవంతమైన గేమింగ్ GPUలు. అయితే ఆటోరెగ్రెసివ్ టోకెన్ జనరేషన్ మెమరీ-బ్యాండ్విడ్త్ బౌండ్, కంప్యూట్ బౌండ్ కాదు: ఒకే టోకెన్ను ఉత్పత్తి చేయడానికి, మోడల్లోని ప్రతి వెయిట్ మెమరీ బస్ ద్వారా ప్రసారం చేయబడాలి. మీ వెయిట్స్ లేదా KV కాష్ కంటెక్స్ట్ ఫిజికల్ VRAMను మించిపోయినప్పుడు, రన్టైమ్ PCIe ద్వారా సిస్టమ్ DDR5కి లేయర్లను ఆఫ్లోడ్ చేస్తుంది, మరియు మీరు 20x మెమరీ బ్యాండ్విడ్త్ క్లిఫ్ను చేరుకుంటారు: వేగం సెకనుకు 40 టోకెన్ల నుండి 1.5కి పడిపోతుంది. ఈ ఫీల్డ్ టెస్ట్లో, నికో హార్డ్వేర్ మెకానిక్స్, 4-బిట్ క్వాంటైజేషన్ మోడల్ సైజింగ్ రూల్స్, $1,200 నుండి $5,000 వరకు మూడు నిజమైన బడ్జెట్ శ్రేణులు, ఉపయోగించిన RTX 3090 24GB కంప్యూటింగ్లో ఉత్తమ VRAM-పర్-డాలర్ డీల్ ఎందుకు, రాస్బెర్రీ పై ఎడ్జ్ ట్రాప్, మరియు స్థానిక వర్సెస్ క్లౌడ్ ఇన్ఫరెన్స్ కోసం హోమ్ జిమ్ వ్యూహం గురించి వివరిస్తాడు. తీర్పు: SHIP IT.
వ్రాతపూర్వక సంచికను చదవండి (ఇంగ్లీష్) ↗
ఈ వీడియో ఏమి కవర్ చేస్తుంది
- 20x మెమరీ బ్యాండ్విడ్త్ క్లిఫ్: 936 GB/s GDDR6X vs 50 GB/s DDR5 & 31.5 GB/s PCIe
- మోడల్ సైజింగ్ @ 4-బిట్: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- శ్రేణి 1 ($1,200–$1,500): RTX 4060 Ti 16GB (ఎప్పుడూ 8GB కాదు) లేదా Mac Mini 16GB
- శ్రేణి 2 ($1,500–$2,000): ఉపయోగించిన RTX 3090 24GB స్వీట్ స్పాట్ లేదా Mac Mini M4 Pro 64GB
- శ్రేణి 3 ($3,500+): RTX 4090 24GB / డ్యుయల్ 3090లు లేదా Mac Studio Ultra
అనువదించబడిన ట్రాన్స్క్రిప్ట్
అసలైన ఆంగ్ల కథనం నుండి అనువదించబడింది. అందుబాటులో ఉన్న ఆడియో మరియు క్యాప్షన్లు YouTube ద్వారా నియంత్రించబడతాయి.
0:00 మీరు స్థానిక AI ఏజెంట్లను నడపడానికి PCని నిర్మించాలని ప్లాన్ చేస్తుంటే, గేమింగ్ రిగ్ను నిర్మించడం ఆపండి. మీకు 5.8 గిగాహెర్ట్జ్ కోర్ i9, లిక్విడ్ కూలింగ్ లూప్, లేదా RGB కవర్ చేయబడిన ఎనిమిది గిగాబైట్ గ్రాఫిక్స్ కార్డ్ అవసరం లేదు. స్థానిక AI ఇన్ఫరెన్స్లో, గేమింగ్ స్పెక్స్ దాదాపు పనికిరానివి. మీ ఏజెంట్ నడుస్తుందా లేదా నెమ్మదిగా నడుస్తుందా అని నిర్ణయించే ఏకైక మెట్రిక్ VRAM సామర్థ్యం మరియు మెమరీ బస్ బ్యాండ్విడ్త్. హార్డ్వేర్ పరీక్ష నియమాలు: CPU క్లాక్లు మరియు రాస్టరైజేషన్ బెంచ్మార్క్లను మర్చిపోండి.
0:24 మేము మూడు సంఖ్యల గురించి శ్రద్ధ వహిస్తాము: మెమరీ బస్ వెడల్పు, గిగాబైట్లలో బ్యాండ్విడ్త్ సెకనుకు, మరియు KV కాష్ బ్లోట్ కోసం రా VRAM హెడ్రూమ్. ఈ ఫీల్డ్ టెస్ట్లో, నేను ఇరవై-x మెమరీ బ్యాండ్విడ్త్ క్లిఫ్ను వివరిస్తాను, మోడల్ సైజింగ్ రూల్స్ను మ్యాప్ చేస్తాను, పన్నెండు వందల నుండి ఐదు వేల డాలర్ల వరకు మూడు నిజమైన శ్రేణులను బెంచ్మార్క్ చేస్తాను, మరియు ఉపయోగించిన 3090 ఇప్పటికీ కంప్యూటింగ్ యొక్క గొప్ప చీట్ కోడ్ ఎందుకు అని వివరిస్తాను. ఇది The Daily Diff, ఫీల్డ్ టెస్ట్. గేమింగ్ రిగ్లు ఎందుకు విఫలమవుతాయో అర్థం చేసుకోవడానికి, టోకెన్ జనరేషన్ వాస్తవానికి ఎలా ఎగ్జిక్యూట్ అవుతుందో చూడండి. ఆటలలో, మీ CPU డ్రా కాల్స్ను అందిస్తుంది మరియు మీ GPU ఫ్రేమ్లను రెండర్ చేస్తుంది.
0:54 కానీ ఆటోరెగ్రెసివ్ LLM డీకోడింగ్ దాదాపు పూర్తిగా మెమరీ బ్యాండ్విడ్త్ బౌండ్. ఒకే టోకెన్ను రూపొందించడానికి, GPU మోడల్ యొక్క ప్రతి వెయిట్ పరామితిని మెమరీ నుండి దాని కంప్యూట్ కోర్స్ ద్వారా స్ట్రీమ్ చేయాలి. మీ మోడల్ పది గిగాబైట్లు అయితే, ఒక టోకెన్ను ఉత్పత్తి చేయడం అంటే పది గిగాబైట్ల డేటాను చదవడం. 384-బిట్ మెమరీ బస్తో కూడిన Nvidia RTX 3090లో, మీరు సెకనుకు 936 గిగాబైట్ల GDDR6X బ్యాండ్విడ్త్ను పొందుతారు, సెకనుకు ఎనభై టోకెన్లను ఉత్పత్తి చేస్తారు. కానీ మీ మోడల్ ఫిజికల్ VRAMను మించిపోయిన తక్షణమే ఏమి జరుగుతుందో చూడండి.
1:22 VRAM నిండినప్పుడు, రన్టైమ్లు మిగిలిన లేయర్లను PCIe బస్ ద్వారా సిస్టమ్ DDR5 మెమరీకి ఆఫ్లోడ్ చేస్తాయి. మీ GPU కోర్లు సెకనుకు వెయ్యి గిగాబైట్లను ఆశిస్తాయి. బదులుగా, డ్యుయల్-ఛానల్ DDR5 వాటికి యాభైని అందిస్తుంది, మరియు PCIe 4 ముప్పై-ఒకటి వద్ద ఆగిపోతుంది. అది ఇరవై-x బ్యాండ్విడ్త్ పతనం. టోకెన్ జనరేషన్ పైప్లైన్ బస్ కోసం వేచి ఉండి తక్షణమే ఆగిపోతుంది, మరియు వేగం సెకనుకు నలభై టోకెన్ల నుండి ఒకటి పాయింట్ ఐదుకి పడిపోతుంది. మీరు రెండు వేల డాలర్ల రిగ్ను స్పేస్ హీటర్గా మార్చారు.
1:47 మరియు బహుళ-టర్న్ ఏజెంట్ రన్ల సమయంలో ఇది మరింత దిగజారుతుంది, ఎందుకంటే వెయిట్స్ సగం మాత్రమే యుద్ధం. ప్రతి ప్రాంప్ట్, టూల్ కాల్, మరియు ఫైల్ చంక్ కీ-వాల్యూలో నిల్వ చేయబడతాయి కాష్. ముప్పై-రెండు-k కంటెక్స్ట్ విండో వెయిట్స్ పైన నాలుగు నుండి ఎనిమిది గిగాబైట్ల VRAMను తినగలదు. మీ కార్డ్ కేవలం పదహారు గిగాబైట్లను కలిగి ఉంటే, మీ ఏజెంట్ రెండుసార్లు లూప్ అవుతుంది, కంటెక్స్ట్ వాల్ను తాకుతుంది, మరియు అవుట్-ఆఫ్-మెమరీ ఎర్రర్తో క్రాష్ అవుతుంది లేదా DDR5లోకి పొంగిపోతుంది. ఇక్కడ నాలుగు-బిట్ సైజింగ్ చీట్ షీట్ ఉంది. లామా 3.1 లేదా డీప్సీక్ డిస్టిల్ వంటి ఏడు లేదా ఎనిమిది-బిలియన్ పారామీటర్ మోడల్
2:16 సుమారు ఐదు గిగాబైట్లను తీసుకుంటుంది. పద్నాలుగు-బిలియన్ మోడల్ పది గిగాబైట్లను తీసుకుంటుంది. ముప్పై-రెండు-బిలియన్ మోడల్, కోడింగ్ ఏజెంట్ల కోసం ఇంటెలిజెన్స్ స్వీట్ స్పాట్, ఇరవై గిగాబైట్లను కోరుతుంది. మరియు డెభై-బిలియన్ ఫ్రాంటియర్ మోడల్ మీరు కంటెక్స్ట్ను కేటాయించకముందే నలభై గిగాబైట్లను డిమాండ్ చేస్తుంది. ఇది మనల్ని వాస్తవ హార్డ్వేర్ బిల్డ్లకు తీసుకువస్తుంది. శ్రేణి 1 అనేది స్టార్టర్ రిగ్, పన్నెండు వందల నుండి పదిహేను వందల డాలర్లు. PCలో, మీ యాంకర్ RTX 4060 Ti 16-గిగాబైట్.
2:39 ముఖ్యమైన హెచ్చరిక: డెభై డాలర్లు ఆదా చేయడానికి ఎప్పుడూ ఎనిమిది-గిగాబైట్ వెర్షన్ను కొనుగోలు చేయవద్దు. 2026లో ఎనిమిది గిగాబైట్ల VRAM ఏదైనా నిజమైన ఏజెంట్ వర్క్ఫ్లోలో తక్షణ అవుట్-ఆఫ్-మెమరీ మరణశిక్ష. దీన్ని ఆరు-కోర్ రైజెన్ 5, అరవై-నాలుగు గిగాబైట్ల DDR5, మరియు రెండు-టెరాబైట్ NVMe డ్రైవ్తో జత చేయండి. ఆపిల్ ల్యాండ్లో, దీనికి సమానమైనది మాక్ మినీ లేదా మాక్బుక్ ప్రో పదహారు గిగాబైట్ల యూనిఫైడ్ మెమరీతో.
3:02 మీరు ఎనిమిది-బిలియన్ మోడళ్లలో సెకనుకు నలభై నుండి యాభై టోకెన్లను చూస్తారు. శ్రేణి 2 అనేది పవర్ యూజర్ స్వీట్ స్పాట్: ప్రత్యేకంగా Qwen 2.5 32B వంటి ముప్పై-రెండు-బిలియన్ పారామీటర్ మోడల్లను అమలు చేయడానికి నిర్మించబడింది. పాత్ A అనేది కొత్త RTX 4070 Ti సూపర్ పదహారు గిగాబైట్లతో ఎనిమిది వందల డాలర్లకు. కానీ పాత్ B నా బలమైన సిఫార్సు: ఉపయోగించిన Nvidia RTX 3090 ఇరవై-నాలుగు గిగాబైట్ను కొనండి. మీరు eBayలో ఆరు వందల యాభై నుండి ఏడు వందల యాభై డాలర్లకు క్లీన్ 3090లను కనుగొనవచ్చు. అది మీకు భారీ 384-బిట్ బస్లో ఇరవై-నాలుగు గిగాబైట్ల VRAMను అందిస్తుంది,
3:33 సెకనుకు 936 గిగాబైట్లను నెడుతుంది. డాలర్ కోసం డాలర్, ఇది కంప్యూటింగ్లో ఉత్తమ VRAM డీల్. macOSలో, శ్రేణి 2 ప్రత్యర్థి Mac Mini M4 Pro అరవై-నాలుగు గిగాబైట్ల యూనిఫైడ్ మెమరీతో. ఇది ముప్పై-రెండు-బిలియన్ మోడల్లో సెకనుకు పదకొండు నుండి పన్నెండు టోకెన్లను ఉత్పత్తి చేస్తుంది: Nvidia కంటే నెమ్మదిగా, కానీ ముప్పై వాట్ల వద్ద నిశ్శబ్దంగా ఒక పెద్ద కంటెక్స్ట్ విండో కోసం స్థలంతో. శ్రేణి 3 అనేది బహుళ-ఏజెంట్ స్వార్మ్స్ కోసం ఔత్సాహిక బ్రాకెట్. PCలో, అది ఇరవై-నాలుగు గిగాబైట్లతో కూడిన RTX 4090,
3:57 రైజెన్ 9, మరియు నూట ఇరవై-ఎనిమిది గిగాబైట్ల RAM, లేదా డ్యుయల్ RTX 3090లు మొత్తం నలభై-ఎనిమిది గిగాబైట్ల VRAMను అందిస్తాయి. ఆపిల్ లైనప్లో, ఇది నూట నలభై ఆరు నుండి వంద ఇరవై-ఎనిమిది గిగాబైట్ల యూనిఫైడ్ మెమరీతో కూడిన Mac Studio Ultra. సూపర్పవర్ మెమరీ రెసిడెన్సీ: మీరు ఎంబెడ్డింగ్ మోడల్ను, వేగవంతమైన రూటర్ను, మరియు 32-బిలియన్ కోడింగ్ మోడల్ను ఒకేసారి లోడ్ చేయవచ్చు సున్నా స్వాప్ ఆలస్యంతో. ఇప్పుడు మన ఫీల్డ్ టెస్ట్ యొక్క నిజమైన వైఫల్యం కోసం: ఎడ్జ్ కంప్యూటింగ్ ట్రాప్.
4:24 ప్రతి వారం ఒక సోషల్ పోస్ట్ మీరు ఎనభై డాలర్ల రాస్బెర్రీ పై 5లో స్వయంప్రతిపత్త కోడింగ్ ఏజెంట్లను నడపవచ్చని పేర్కొంటుంది. నేను దానిని పరీక్షించాను. ఒక చిన్న ఒకటి పాయింట్ ఐదు బిలియన్ పారామీటర్ మోడల్ను నడపడం మీకు సెకనుకు కేవలం మూడు టోకెన్లను ఇస్తుంది, బోర్డు ఎనభై-ఐదు డిగ్రీల సెల్సియస్ వద్ద థ్రాటిల్ అవుతుంది. ఇది ఒక మంచి వీకెండ్ బొమ్మ, కానీ రోజువారీ డెవలప్మెంట్ డ్రైవర్గా, ఇది కేవలం శిక్ష. సాఫ్ట్వేర్ కోసం, మీరు కర్సర్, క్లైన్, లేదా VS కోడ్కు నేరుగా కనెక్ట్ అయ్యే క్లీన్ కమాండ్-లైన్ డేమోన్ కావాలంటే Ollamaను ఉపయోగించండి.
4:47 లేదా VS కోడ్కు నేరుగా కనెక్ట్ అయ్యే క్లీన్ కమాండ్-లైన్ డేమోన్ కావాలంటే Ollamaను ఉపయోగించండి. మోడల్ డౌన్లోడ్లు మరియు GPU లేయర్ స్లైడర్లతో కూడిన గ్రాఫికల్ ప్లేగ్రౌండ్ కావాలంటే, LM స్టూడియోను ఉపయోగించండి. మరియు మీ ఫార్మాట్ను మీ సిలికాన్కు సరిపోల్చండి. Apple Siliconలో, ఎల్లప్పుడూ మెటల్ కోసం ఆప్టిమైజ్ చేయబడిన GGUF మోడల్లను డౌన్లోడ్ చేయండి. Nvidiaతో Windows లేదా Linuxలో, AWQ లేదా EXL2 మోడల్లను డౌన్లోడ్ చేయండి, ఇవి ఇరవై నుండి ముప్పై శాతం వేగవంతమైన ఇన్ఫరెన్స్ కోసం Nvidia Tensor Coresను ఉపయోగిస్తాయి. కాబట్టి మీరు దీన్ని విచ్ఛిన్నం చేయకుండా ఎలా డిప్లాయ్ చేస్తారు?
5:11 స్థానిక హార్డ్వేర్ను హోమ్ జిమ్ వర్సెస్ కమర్షియల్ జిమ్ లాగా ఆలోచించండి. ఇంటి వద్ద స్క్వాట్ ర్యాక్ కలిగి ఉండటం అంటే మీరు సున్నా ప్రయాణంతో ప్రతిరోజూ శిక్షణ పొందుతారు, సున్నా సబ్స్క్రిప్షన్ ఫీజులు, మరియు పూర్తి గోప్యత. మీ స్థానిక యంత్రం మీ రోజువారీ కోడింగ్, యూనిట్ టెస్టింగ్, మరియు ప్రైవేట్ డాక్యుమెంట్ ప్రాసెసింగ్లో ఎనభై శాతం సున్నా డాలర్లకు ప్రతి టోకెన్కు నిర్వహిస్తుంది. మరియు మీరు ఐదు వందల పౌండ్లు డెడ్లిఫ్ట్ చేయవలసి వచ్చినప్పుడు — యాభై ఫైల్స్లో భారీ రెపో-వైడ్ ఆర్కిటెక్చరల్ రీఫ్యాక్టర్ వంటిది — మీరు కమర్షియల్ జిమ్ను సందర్శించండి: క్లాడ్ 3.5 సోనెట్ లేదా OpenAI o3 కోసం పదిహేను నిమిషాలు క్లౌడ్ APIకి చెల్లించండి
5:38 మరియు ముందుకు సాగండి. ఇక్కడ బిల్లు ఉంది: ఉపయోగించిన 3090తో కూడిన శ్రేణి 2 బిల్డ్ మొత్తం పదహారు వందల డాలర్లు. మీరు API టోకెన్ల కోసం నెలకు యాభై నుండి వంద డాలర్లు ఖర్చు చేస్తే, ఇది పద్దెనిమిది నెలల్లో దానికదే చెల్లిస్తుంది, మీ యాజమాన్య కోడ్బేస్ను థర్డ్-పార్టీ సర్వర్ల నుండి దూరంగా ఉంచుతుంది. నేటి ఫీల్డ్ టెస్ట్ తీర్పు: SHIP IT. VRAM మరియు మెమరీ బ్యాండ్విడ్త్ ప్రతిసారీ క్లాక్ స్పీడ్లను అధిగమిస్తాయి. AI కోసం ఐదు-గిగాహెర్ట్జ్ CPUలను కొనడం ఆపండి, మరియు ఉపయోగించిన 3090ను కనుగొనండి.
6:04 మీరు స్థానిక మోడల్ల కోసం ఏ హార్డ్వేర్ బిల్డ్ను నడుపుతున్నారో వ్యాఖ్యలలో నాకు చెప్పండి. మరియు మీరు ఈ వివరణను చదవాలనుకుంటే, ది డైలీ డిఫ్ డాట్ దేవ్ వద్ద వార్తాలేఖను పొందండి, లింక్ కింద ఉంది. మరియు నేటి వ్యత్యాసం అంతే. నేను ఆక్స్రిసి నుండి నికో. బాధ్యతాయుతంగా విలీనం చేయండి.
మూలాలు
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



