+− THE DAILY DIFFdev & AI news
SHIP IT

دليل الأجهزة المحلية للذكاء الاصطناعي (2026)

عند بناء جهاز لوكلاء الذكاء الاصطناعي المحليين ونماذج LLM ذات الوزن المفتوح، يرتكب المطورون خطأ شراء مواصفات أجهزة الكمبيوتر المخصصة للألعاب: معالجات مركزية بسرعة 5.8 جيجاهرتز، وحلقات تبريد سائلة مخصصة، ووحدات معالجة رسوميات سريعة للألعاب بذاكرة VRAM تبلغ 8 جيجابايت فقط.

عند بناء جهاز لوكلاء الذكاء الاصطناعي المحليين ونماذج LLM ذات الوزن المفتوح، يرتكب المطورون خطأ شراء مواصفات أجهزة الكمبيوتر المخصصة للألعاب: معالجات مركزية بسرعة 5.8 جيجاهرتز، وحلقات تبريد سائلة مخصصة، ووحدات معالجة رسوميات سريعة للألعاب بذاكرة VRAM تبلغ 8 جيجابايت فقط. لكن توليد الرموز التلقائي هو مقيد بنطاق الذاكرة، وليس مقيدًا بالحساب: لإصدار رمز واحد، يجب أن يتدفق كل وزن في النموذج عبر ناقل الذاكرة. عندما تتجاوز أوزانك أو سياق ذاكرة التخزين المؤقت KV ذاكرة VRAM الفعلية، يقوم وقت التشغيل بإلغاء تحميل الطبقات إلى نظام DDR5 عبر PCIe، وتواجه انخفاضًا في نطاق الذاكرة بمقدار 20 مرة: تنخفض السرعة من 40 رمزًا في الثانية إلى 1.5. في هذا الاختبار الميداني، يحلل نيكو ميكانيكا الأجهزة، وقواعد تحديد حجم النموذج للكمية 4 بت، وثلاث مستويات ميزانية حقيقية تتراوح من 1200 دولار إلى 5000 دولار، ولماذا يعتبر RTX 3090 24GB المستخدم أفضل صفقة من حيث VRAM لكل دولار في الحوسبة، وفخ Raspberry Pi، واستراتيجية "صالة الألعاب الرياضية المنزلية" للاستدلال المحلي مقابل السحابي. الحكم: SHIP IT.

اقرأ النسخة المكتوبة (الإنجليزية) ↗

ما يغطيه هذا الفيديو

  • انخفاض نطاق الذاكرة بمقدار 20 مرة: 936 جيجابايت/ثانية GDDR6X مقابل 50 جيجابايت/ثانية DDR5 و 31.5 جيجابايت/ثانية PCIe
  • تحديد حجم النموذج @ 4-بت: 8B (5 جيجابايت)، 14B (10 جيجابايت)، 32B (20 جيجابايت)، 70B (40 جيجابايت)
  • الفئة 1 (1200-1500 دولار): RTX 4060 Ti 16GB (ليس 8GB أبدًا) أو Mac Mini 16GB
  • الفئة 2 (1500-2000 دولار): نقطة التوازن المثلى RTX 3090 24GB مستخدم أو Mac Mini M4 Pro 64GB
  • الفئة 3 (3500 دولار+): RTX 4090 24GB / بطاقتي 3090 أو Mac Studio Ultra

النص المترجم

مترجم من السرد الإنجليزي الأصلي. يتم التحكم في الصوت والتعليقات التوضيحية المتاحة بواسطة YouTube.

0:00 إذا كنت تخطط لبناء جهاز كمبيوتر لتشغيل وكلاء الذكاء الاصطناعي المحليين، توقف عن بناء جهاز ألعاب. لا تحتاج إلى معالج Core i9 بسرعة خمسة فاصل ثمانية جيجاهرتز، أو حلقة تبريد سائلة، أو بطاقة رسومات بثمانية جيجابايت مغطاة بأضواء RGB. في استدلال الذكاء الاصطناعي المحلي، مواصفات الألعاب عديمة الفائدة عمليًا. المقياس الوحيد الذي يحدد ما إذا كان وكيلك يعمل بسرعة أم ببطء هو سعة VRAM ونطاق ناقل الذاكرة. قواعد اختبار الأجهزة: انسَ سرعات المعالج المركزي ومعايير الرسوميات.

0:24 نحن نهتم بثلاثة أرقام: عرض ناقل الذاكرة، والنطاق الترددي بالجيجابايت لكل ثانية، والمساحة الخام لذاكرة VRAM لتضخم ذاكرة التخزين المؤقت KV. في هذا الاختبار الميداني، سأحلل انخفاض نطاق الذاكرة بمقدار عشرين مرة، وأحدد قواعد تحديد حجم النموذج، وأختبر ثلاث مستويات حقيقية تتراوح من ألف ومائتي دولار إلى خمسة آلاف دولار، وأشرح لماذا لا يزال RTX 3090 المستخدم هو أعظم رمز غش في الحوسبة. هذا هو The Daily Diff، اختبار ميداني. لفهم سبب فشل أجهزة الألعاب، انظر إلى كيفية تنفيذ توليد الرموز فعليًا. في الألعاب، يغذي المعالج المركزي استدعاءات الرسم وتقوم وحدة معالجة الرسوميات بعرض الإطارات.

0:54 لكن فك تشفير LLM التلقائي مقيد بشكل شبه كامل بنطاق الذاكرة الترددي. لتوليد رمز واحد، يجب أن تقوم وحدة معالجة الرسوميات ببث كل معلمة وزن للنموذج من الذاكرة عبر نوى المعالجة الخاصة بها. إذا كان نموذجك بحجم عشرة جيجابايت، فإن إنتاج رمز واحد يعني قراءة عشرة جيجابايت من البيانات. على بطاقة Nvidia RTX 3090 مع ناقل ذاكرة 384 بت، تحصل على 936 جيجابايت في الثانية من نطاق GDDR6X الترددي، مما ينتج ثمانين رمزًا في الثانية. لكن انظر ماذا يحدث في اللحظة التي يتجاوز فيها نموذجك ذاكرة VRAM الفعلية.

1:22 عندما تمتلئ ذاكرة VRAM، تقوم أوقات التشغيل بإلغاء تحميل الطبقات المتبقية عبر ناقل PCIe إلى ذاكرة DDR5 للنظام. تتوقع نوى وحدة معالجة الرسوميات ألف جيجابايت في الثانية. بدلاً من ذلك، يغذيها DDR5 ثنائي القناة بخمسين، ويختنق PCIe 4 عند واحد وثلاثين. هذا هو انهيار نطاق ترددي بمقدار عشرين مرة. تتوقف خطوة توليد الرموز فورًا في انتظار الناقل، وتنخفض السرعة من أربعين رمزًا في الثانية إلى واحد ونصف. لقد حولت جهازًا بقيمة ألفي دولار إلى سخان فضاء.

1:47 ويزداد الأمر سوءًا خلال تشغيل وكلاء متعدد الأدوار، لأن الأوزان ليست سوى نصف المعركة. يتم تخزين كل طلب، واستدعاء أداة، وجزء ملف في ذاكرة التخزين المؤقت للقيم الرئيسية (Key-Value) نافذة سياق بحجم اثنتين وثلاثين ألفًا يمكن أن تستهلك من أربعة إلى ثمانية جيجابايت من ذاكرة VRAM بالإضافة إلى الأوزان. إذا كانت بطاقتك تحتوي على ستة عشر جيجابايت فقط، فإن وكيلك يدور مرتين، يصل إلى جدار السياق، وإما أن يتعطل بخطأ نفاد الذاكرة أو يفيض إلى DDR5. إليك ورقة غش تحديد الحجم 4 بت. نموذج بمعلمة سبعة أو ثمانية مليارات مثل Llama 3.1 أو DeepSeek Distill

2:16 يستغرق حوالي خمسة جيجابايت. نموذج بأربعة عشر مليارًا يستغرق عشرة جيجابايت. نموذج باثنتين وثلاثين مليارًا، نقطة التوازن المثلى للذكاء لوكلاء البرمجة، يتطلب عشرين جيجابايت. ويتطلب نموذج متطور بسبعين مليارًا أربعين جيجابايت قبل أن تخصص السياق. وهذا يقودنا إلى بناء الأجهزة الفعلي. الفئة 1 هي الجهاز المبتدئ، ألف ومائتي إلى ألف وخمسمائة دولار. على الكمبيوتر الشخصي، بطاقتك الأساسية هي RTX 4060 Ti 16 جيجابايت.

2:39 تحذير حاسم: لا تشتري أبدًا نسخة الثمانية جيجابايت لتوفير سبعين دولارًا. ثمانية جيجابايت من ذاكرة VRAM في عام 2026 هي حكم إعدام فوري بسبب نفاد الذاكرة على أي سير عمل وكيل حقيقي. قم بإقرانها بمعالج Ryzen 5 سداسي النوى، وأربعة وستين جيجابايت من DDR5، وقرص NVMe بسعة اثنين تيرابايت. في عالم Apple، المكافئ هو Mac Mini أو MacBook Pro بذاكرة موحدة بسعة ستة عشر جيجابايت.

3:02 سترى من أربعين إلى خمسين رمزًا في الثانية على نماذج الثمانية مليارات. الفئة 2 هي نقطة التوازن المثلى للمستخدم القوي: البناء خصيصًا لتشغيل نماذج بمعلمة اثنتين وثلاثين مليارًا مثل Qwen 2.5 32B. المسار أ هو RTX 4070 Ti Super جديد بذاكرة ستة عشر جيجابايت مقابل ثمانمائة دولار. لكن المسار ب هو توصيتي القوية: اشترِ Nvidia RTX 3090 مستخدمة بأربعة وعشرين جيجابايت. يمكنك العثور على بطاقات 3090 نظيفة على eBay مقابل ستمائة وخمسين إلى سبعمائة وخمسين دولارًا. يمنحك ذلك أربعة وعشرين جيجابايت من ذاكرة VRAM على ناقل ضخم 384 بت يدفع

3:33 936 جيجابايت في الثانية. دولارًا مقابل دولار، إنها أفضل صفقة VRAM في الحوسبة. على نظام macOS، المكافئ للفئة 2 هو Mac Mini M4 Pro بذاكرة موحدة بسعة ستة وستين جيجابايت جيجابايت. ينتج من أحد عشر إلى اثني عشر رمزًا في الثانية على نموذج باثنتين وثلاثين مليارًا: أبطأ من Nvidia، لكنه صامت تمامًا عند ثلاثين واط مع مساحة لنافذة سياق عملاقة. الفئة 3 هي فئة المتحمسين لأسراب الوكلاء المتعددة. على الكمبيوتر الشخصي، يعني ذلك RTX 4090 بأربعة وعشرين جيجابايت،

3:57 ومعالج Ryzen 9، ومائة وثمانية وعشرين جيجابايت من ذاكرة الوصول العشوائي، أو بطاقتي RTX 3090 توفران ثمانية وأربعين جيجابايت من ذاكرة VRAM الإجمالية. في تشكيلة Apple، هذا هو Mac Studio Ultra بذاكرة موحدة من ستة وتسعين إلى مائة و ثمانية وعشرين جيجابايت. القوة الخارقة هي الإقامة في الذاكرة: يمكنك الاحتفاظ بنموذج تضمين، وموجه سريع، ونموذج برمجة 32 مليار محمل في وقت واحد مع تأخير تبديل صفري. الآن للفشل الصريح لاختبارنا الميداني: فخ الحوسبة الطرفية.

4:24 كل أسبوع، يدعي منشور اجتماعي أنه يمكنك تشغيل وكلاء برمجة مستقلين على Raspberry Pi 5 بقيمة ثمانين دولارًا. لقد اختبرته. تشغيل نموذج صغير بمعلمة واحد فاصل خمسة مليار يمنحك بالكاد ثلاثة رموز في الثانية بينما ترتفع درجة حرارة اللوحة إلى خمسة وثمانين درجة مئوية. إنها لعبة نهاية أسبوع لطيفة، ولكن كسائق تطوير يومي، إنها عقاب محض. بالنسبة للبرمجيات، استخدم Ollama إذا كنت تريد خدمة خلفية نظيفة لسطر الأوامر تتصل

4:47 مباشرة بـ Cursor، Cline، أو VS Code. إذا كنت تريد بيئة رسومية مع تنزيلات النماذج ومقابض طبقة وحدة معالجة الرسوميات، استخدم LM Studio. وطابق تنسيقك مع معالجك. على Apple Silicon، قم دائمًا بتنزيل نماذج GGUF المحسّنة لـ Metal. على Windows أو Linux مع Nvidia، قم بتنزيل نماذج AWQ أو EXL2، التي تستخدم Nvidia Tensor Cores لاستدلال أسرع بنسبة عشرين إلى ثلاثين بالمائة. إذن كيف يمكنك نشر هذا دون إفلاس؟

5:11 فكر في الأجهزة المحلية كصالة ألعاب رياضية منزلية مقابل صالة ألعاب رياضية تجارية. امتلاك رف لتمارين القرفصاء في المنزل يعني أنك تتدرب كل يوم بدون تنقل، وبدون رسوم اشتراك، وبخصوصية تامة. يتعامل جهازك المحلي مع ثمانين بالمائة من مهام البرمجة اليومية، واختبار الوحدات، ومعالجة المستندات الخاصة بدون تكلفة لكل رمز. وعندما تحتاج إلى رفع خمسمائة رطل – مثل إعادة هيكلة معمارية ضخمة على مستوى المستودع عبر خمسين ملفًا – فإنك تزور صالة الألعاب الرياضية التجارية: ادفع لواجهة برمجة التطبيقات السحابية لـ Claude 3.5 Sonnet أو OpenAI o3 لمدة خمسة عشر دقيقة

5:38 وانتقل. إليك الفاتورة: بناء الفئة 2 مع RTX 3090 مستخدم يكلف ألف وستمائة دولار إجماليًا. إذا أنفقت من خمسين إلى مائة دولار شهريًا على رموز API، فإنها تدفع تكاليفها في غضون ثمانية عشر شهرًا مع الحفاظ على قاعدة بياناتك الخاصة بعيدًا عن خوادم الطرف الثالث. حكم الاختبار الميداني اليوم: SHIP IT. ذاكرة VRAM ونطاق الذاكرة تتفوقان على سرعات المعالج في كل مرة. توقف عن شراء معالجات مركزية بسرعة خمسة جيجاهرتز للذكاء الاصطناعي، واذهب وابحث عن RTX 3090 مستخدم.

6:04 أخبرني عن بناء الأجهزة الذي تستخدمه للنماذج المحلية في التعليقات. وإذا كنت تفضل قراءة هذا التحليل، فاحصل على الرسالة الإخبارية على the daily diff dot dev، الرابط أدناه. وهذا هو الاختلاف لهذا اليوم. أنا نيكو من Axrisi. ادمج بمسؤولية.

المصادر

  1. Niko from Axrisi: Local AI Hardware — Stop Building a Gaming PCaxrisi.com
  2. NVIDIA RTX 3090 Specifications (384-bit bus, 936 GB/s GDDR6X)www.nvidia.com
  3. llama.cpp Memory Bandwidth & Offloading Architecturegithub.com
  4. Ollama Model Library & Benchmarksollama.com
  5. vLLM PagedAttention & KV Cache Memory Managementgithub.com
  6. JEDEC DDR5 Memory Standard Specificationswww.jedec.org

فيديوهات ذات صلة