लोकल एआई हार्डवेयर गाइड (2026)
लोकल एआई एजेंटों और ओपन-वेट LLM के लिए मशीन बनाते समय, डेवलपर गेमिंग पीसी स्पेसिफिकेशंस खरीदने की गलती करते हैं: 5.8 गीगाहर्ट्ज़ सीपीयू, कस्टम लिक्विड कूलिंग लूप, और केवल 8GB VRAM वाले तेज़ गेमिंग जीपीयू।
लोकल एआई एजेंटों और ओपन-वेट LLM के लिए मशीन बनाते समय, डेवलपर गेमिंग पीसी स्पेसिफिकेशंस खरीदने की गलती करते हैं: 5.8 गीगाहर्ट्ज़ सीपीयू, कस्टम लिक्विड कूलिंग लूप, और केवल 8GB VRAM वाले तेज़ गेमिंग जीपीयू। लेकिन ऑटोरेग्रेसिव टोकन जनरेशन मेमोरी-बैंडविड्थ-बाउंड है, न कि कंप्यूट-बाउंड: एक सिंगल टोकन उत्सर्जित करने के लिए, मॉडल में प्रत्येक वेट को मेमोरी बस में स्ट्रीम करना होगा। जब आपके वेट या KV कैश संदर्भ भौतिक VRAM से अधिक हो जाते हैं, तो रनटाइम PCIe पर सिस्टम DDR5 में लेयरों को ऑफलोड करता है, और आप 20x मेमोरी बैंडविड्थ क्लिफ से टकराते हैं: गति 40 टोकन प्रति सेकंड से 1.5 तक गिर जाती है। इस फील्ड टेस्ट में, निको हार्डवेयर मैकेनिक्स, 4-बिट क्वांटाइजेशन मॉडल साइजिंग नियमों, $1,200 से $5,000 तक के तीन वास्तविक बजट स्तरों, क्यों एक पुराना RTX 3090 24GB कंप्यूटिंग में सबसे अच्छा VRAM-प्रति-डॉलर सौदा है, रास्पबेरी पाई एज ट्रैप, और लोकल बनाम क्लाउड इन्फरेंस के लिए होम जिम रणनीति को तोड़ता है। फैसला: SHIP IT.
लिखित संस्करण पढ़ें (अंग्रेजी) ↗
इस वीडियो में क्या शामिल है
- 20x मेमोरी बैंडविड्थ क्लिफ: 936 GB/s GDDR6X बनाम 50 GB/s DDR5 और 31.5 GB/s PCIe
- मॉडल साइजिंग @ 4-बिट: 8B (5GB), 14B (10GB), 32B (20GB), 70B (40GB)
- टियर 1 ($1,200–$1,500): RTX 4060 Ti 16GB (कभी 8GB नहीं) या मैक मिनी 16GB
- टियर 2 ($1,500–$2,000): इस्तेमाल किया गया RTX 3090 24GB सबसे अच्छा विकल्प या मैक मिनी M4 प्रो 64GB
- टियर 3 ($3,500+): RTX 4090 24GB / ड्यूल 3090s या मैक स्टूडियो अल्ट्रा
अनुवादित प्रतिलेख
मूल अंग्रेजी कथन से अनुवादित। उपलब्ध ऑडियो और कैप्शन YouTube द्वारा नियंत्रित होते हैं।
0:00 अगर आप लोकल एआई एजेंट चलाने के लिए पीसी बनाने की योजना बना रहे हैं, गेमिंग रिग बनाना बंद करें। आपको 5.8 गीगाहर्ट्ज़ कोर i9, लिक्विड कूलिंग लूप, या RGB से ढका 8-गीगाबाइट ग्राफिक्स कार्ड की ज़रूरत नहीं है। लोकल एआई इन्फरेंस में, गेमिंग स्पेसिफिकेशंस वस्तुतः बेकार हैं। एकमात्र मीट्रिक जो यह तय करती है कि आपका एजेंट चलता है या रेंगता है, वह VRAM क्षमता है और मेमोरी बस बैंडविड्थ। हार्डवेयर परीक्षण के नियम: सीपीयू घड़ियों और रैस्टराइज़ेशन बेंचमार्क को भूल जाओ।
0:24 हमें तीन संख्याओं की परवाह है: मेमोरी बस की चौड़ाई, गीगाबाइट प्रति सेकंड में बैंडविड्थ, और KV कैश ब्लोट के लिए रॉ VRAM हेडरुम। इस फील्ड टेस्ट में, मैं 20x मेमोरी बैंडविड्थ क्लिफ को तोड़ूंगा, मॉडल साइजिंग नियमों का मानचित्रण करूंगा, बारह सौ डॉलर से पांच हज़ार तक के तीन वास्तविक स्तरों का बेंचमार्क करूंगा, और समझाऊंगा कि क्यों एक इस्तेमाल किया गया 3090 अभी भी कंप्यूटिंग का सबसे बड़ा चीट कोड है। यह The Daily Diff, फील्ड टेस्ट है। यह समझने के लिए कि गेमिंग रिग्स क्यों विफल होते हैं, देखें कि टोकन जनरेशन वास्तव में कैसे निष्पादित होता है। गेम में, आपका सीपीयू ड्रॉ कॉल फीड करता है और आपका जीपीयू फ्रेम रेंडर करता है।
0:54 लेकिन ऑटोरेग्रेसिव LLM डीकोडिंग लगभग पूरी तरह से मेमोरी बैंडविड्थ बाउंड है। एक सिंगल टोकन जेनरेट करने के लिए, जीपीयू को मॉडल के प्रत्येक वेट पैरामीटर को मेमोरी से उसके कंप्यूट कोर में स्ट्रीम करना होगा। यदि आपका मॉडल दस गीगाबाइट का है, तो एक टोकन बनाने का मतलब दस गीगाबाइट डेटा पढ़ना है। 384-बिट मेमोरी बस वाले Nvidia RTX 3090 पर, आपको 936 गीगाबाइट प्रति सेकंड GDDR6X बैंडविड्थ मिलती है, जो प्रति सेकंड अस्सी टोकन उत्पन्न करती है। लेकिन देखें कि आपके मॉडल के भौतिक VRAM से अधिक होने पर क्या होता है।
1:22 जब VRAM भर जाता है, तो रनटाइम बचे हुए लेयरों को PCIe बस के माध्यम से सिस्टम DDR5 मेमोरी में ऑफलोड करता है। आपके जीपीयू कोर प्रति सेकंड एक हज़ार गीगाबाइट की उम्मीद करते हैं। इसके बजाय, ड्यूल-चैनल DDR5 उन्हें पचास फीड करता है, और PCIe 4 इकतीस पर रुक जाता है। यह 20x बैंडविड्थ का पतन है। टोकन जनरेशन पाइपलाइन बस का इंतजार करते हुए तुरंत रुक जाती है, और गति 40 टोकन प्रति सेकंड से घटकर 1.5 हो जाती है। आपने दो हज़ार डॉलर के रिग को स्पेस हीटर में बदल दिया है।
1:47 और मल्टी-टर्न एजेंट रन के दौरान यह और भी बुरा हो जाता है, क्योंकि वेट केवल आधी लड़ाई है। प्रत्येक प्रॉम्प्ट, टूल कॉल, और फाइल चंक Key-Value कैश में संग्रहीत होता है। बत्तीस-के संदर्भ विंडो वेट के ऊपर चार से आठ गीगाबाइट VRAM को खा सकती है। यदि आपके कार्ड में केवल सोलह गीगाबाइट है, तो आपका एजेंट दो बार लूप करता है, संदर्भ की दीवार से टकराता है, और या तो आउट-ऑफ-मेमोरी त्रुटि के साथ क्रैश हो जाता है या DDR5 में फैल जाता है। यहां चार-बिट साइजिंग चीट शीट है। Llama 3.1 या DeepSeek Distill जैसे सात या आठ-बिलियन पैरामीटर मॉडल को
2:16 लगभग पांच गीगाबाइट लगते हैं। चौदह-बिलियन मॉडल को दस गीगाबाइट लगते हैं। एक बत्तीस-बिलियन मॉडल, कोडिंग एजेंटों के लिए बुद्धिमत्ता का सबसे अच्छा विकल्प, को बीस गीगाबाइट की आवश्यकता होती है। और एक सत्तर-बिलियन फ्रंटियर मॉडल को संदर्भ आवंटित करने से पहले ही चालीस गीगाबाइट की आवश्यकता होती है। जो हमें वास्तविक हार्डवेयर बिल्ड पर लाता है। टियर 1 स्टार्टर रिग है, बारह सौ से पंद्रह सौ डॉलर। पीसी पर, आपका मुख्य घटक एक RTX 4060 Ti 16-गीगाबाइट है।
2:39 महत्वपूर्ण चेतावनी: कभी भी सत्तर डॉलर बचाने के लिए आठ-गीगाबाइट संस्करण न खरीदें। 2026 में आठ गीगाबाइट VRAM किसी भी वास्तविक एजेंट वर्कफ़्लो पर एक तत्काल आउट-ऑफ-मेमोरी मौत की सजा है। इसे छह-कोर रायज़ेन 5, चौंसठ गीगाबाइट DDR5, और दो-टेराबाइट NVMe ड्राइव के साथ जोड़ें। एप्पल की दुनिया में, इसके बराबर एक मैक मिनी या मैकबुक प्रो है जिसमें सोलह गीगाबाइट एकीकृत मेमोरी है।
3:02 आपको आठ-बिलियन मॉडल पर प्रति सेकंड चालीस से पचास टोकन मिलेंगे। टियर 2 पावर यूजर के लिए सबसे अच्छा विकल्प है: विशेष रूप से Qwen 2.5 32B जैसे बत्तीस-बिलियन पैरामीटर मॉडल चलाने के लिए बनाया गया। पाथ A एक नया RTX 4070 Ti सुपर है जिसमें आठ सौ डॉलर में सोलह गीगाबाइट हैं। लेकिन पाथ B मेरी मजबूत सिफारिश है: एक इस्तेमाल किया हुआ Nvidia RTX 3090 चौबीस गीगाबाइट खरीदें। आपको eBay पर छह सौ पचास से सात सौ पचास डॉलर में साफ 3090s मिल सकते हैं। वह आपको एक विशाल 384-बिट बस पर चौबीस गीगाबाइट VRAM देता है जो
3:33 प्रति सेकंड 936 गीगाबाइट धकेलता है। डॉलर के हिसाब से, यह कंप्यूटिंग में सबसे अच्छा VRAM सौदा है। macOS पर, टियर 2 के बराबर एक मैक मिनी M4 प्रो है जिसमें चौंसठ गीगाबाइट एकीकृत मेमोरी है। यह बत्तीस-बिलियन मॉडल पर प्रति सेकंड ग्यारह से बारह टोकन उत्पन्न करता है: Nvidia से धीमा, लेकिन तीस वाट पर पूरी तरह से शांत और एक विशाल संदर्भ विंडो के लिए जगह के साथ। टियर 3 मल्टी-एजेंट झुंडों के लिए उत्साही ब्रैकेट है। पीसी पर, इसका मतलब है चौबीस गीगाबाइट के साथ एक RTX 4090,
3:57 एक रायज़ेन 9, और एक सौ अट्ठाईस गीगाबाइट रैम, या दोहरी RTX 3090s जो अड़तालीस गीगाबाइट कुल VRAM प्रदान करते हैं। एप्पल के लाइनअप में, यह एक मैक स्टूडियो अल्ट्रा है जिसमें छियानवे से एक सौ अट्ठाईस गीगाबाइट एकीकृत मेमोरी है। सुपरपावर मेमोरी रेजिडेंसी है: आप एक एम्बेडिंग मॉडल, एक तेज़ राउटर, और एक 32-बिलियन कोडिंग मॉडल को शून्य स्वैप देरी के साथ एक साथ लोड रख सकते हैं। अब हमारे फील्ड टेस्ट की ईमानदार विफलता के लिए: एज कंप्यूटिंग ट्रैप।
4:24 हर हफ्ते एक सोशल पोस्ट दावा करता है कि आप एक अस्सी-डॉलर के रास्पबेरी पाई 5 पर स्वायत्त कोडिंग एजेंट चला सकते हैं। मैंने इसे आज़माया। एक छोटे से 1.5 बिलियन पैरामीटर मॉडल को चलाने से आपको मुश्किल से प्रति सेकंड तीन टोकन मिलते हैं जबकि बोर्ड पचासी डिग्री सेल्सियस पर थ्रॉटल होता है। यह एक अच्छा सप्ताहांत का खिलौना है, लेकिन दैनिक विकास ड्राइवर के रूप में, यह शुद्ध दंड है। सॉफ्टवेयर के लिए, अगर आप एक साफ कमांड-लाइन डेमॉन चाहते हैं जो
4:47 सीधे कर्सर, क्लाइन, या वीएस कोड से जुड़ता है, तो Ollama का उपयोग करें। अगर आप मॉडल डाउनलोड और जीपीयू लेयर स्लाइडर के साथ एक ग्राफिकल प्लेग्राउंड चाहते हैं, LM Studio का उपयोग करें। और अपने फॉर्मेट को अपने सिलिकॉन से मैच करें। एप्पल सिलिकॉन पर, हमेशा मेटल के लिए अनुकूलित GGUF मॉडल डाउनलोड करें। Nvidia के साथ विंडोज या लिनक्स पर, AWQ या EXL2 मॉडल डाउनलोड करें, जो बीस से तीस प्रतिशत तेज इन्फरेंस के लिए Nvidia टेंसर कोर का उपयोग करते हैं। तो आप इसे बिना दिवालिया हुए कैसे तैनात करते हैं?
5:11 लोकल हार्डवेयर को एक होम जिम बनाम एक कमर्शियल जिम की तरह सोचें। घर पर स्क्वॉट रैक होने का मतलब है कि आप शून्य आवागमन, शून्य सदस्यता शुल्क, और पूर्ण गोपनीयता के साथ हर दिन ट्रेन करते हैं। आपकी लोकल मशीन आपके दैनिक कोडिंग के अस्सी प्रतिशत, यूनिट टेस्टिंग, और निजी दस्तावेज़ प्रोसेसिंग को शून्य डॉलर प्रति टोकन पर संभालती है। और जब आपको पांच सौ पाउंड डेडलिफ्ट करने की आवश्यकता होती है — जैसे पचास फाइलों में एक विशाल रेपो-वाइड आर्किटेक्चरल रिफैक्टर — आप कमर्शियल जिम जाते हैं: क्लाउड एपीआई को क्लाउड 3.5 सॉनेट या OpenAI o3 के लिए पंद्रह मिनट के लिए भुगतान करें
5:38 और आगे बढ़ें। यहां बिल है: एक इस्तेमाल किए गए 3090 के साथ एक टियर 2 बिल्ड कुल सोलह सौ डॉलर का है। यदि आप एपीआई टोकन पर प्रति माह पचास से सौ डॉलर खर्च करते हैं, यह अठारह महीनों में खुद का भुगतान करता है जबकि आपके मालिकाना कोडबेस को तीसरे पक्ष के सर्वर से दूर रखता है। आज के फील्ड टेस्ट का फैसला: SHIP IT. VRAM और मेमोरी बैंडविड्थ हर बार घड़ी की गति को मात देते हैं। एआई के लिए पांच-गीगाहर्ट्ज़ सीपीयू खरीदना बंद करें, और एक इस्तेमाल किया हुआ 3090 ढूंढें।
6:04 मुझे बताएं कि आप टिप्पणियों में लोकल मॉडल के लिए कौन सा हार्डवेयर बिल्ड चला रहे हैं। और यदि आप इस ब्रेकडाउन को पढ़ना पसंद करते हैं, तो daily diff dot dev पर न्यूज़लेटर प्राप्त करें, लिंक नीचे है। और आज के लिए यही अंतर है। मैं Axrisi से निको हूं। जिम्मेदारी से विलय करें।
स्रोत
- Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
- NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
- llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
- Ollama Model Library & Benchmarksollama.com
- vLLM PagedAttention & KV Cache Memory Managementgithub.com
- JEDEC DDR5 Memory Standard Specificationswww.jedec.org



