اجرای مدل‌های هوش مصنوعی روی کامپیوتر شخصی فقط به قدرت کارت گرافیک وابسته نیست؛ RAM هم می‌تواند تعیین کند چه مدلی را اجرا کنید و با چه محدودیت‌هایی روبه‌رو شوید. اما آیا برای Local AI واقعاً به ۳۲، ۶۴ یا ۱۲۸ گیگابایت رم نیاز دارید؟ پاسخ این سوال مهم به مدل، Quantization ،Context و نحوه اجرای آن بستگی دارد. در این راهنما بررسی می‌کنیم که چطور مقدار RAM موردنیاز را محاسبه کرد و چه مشخصاتی از حافظه رم برای هر نوع کاربری منطقی‌تر است.

مقدمه

اگر بخواهید مدل‌های هوش مصنوعی را به‌صورت محلی و بدون وابستگی به اینترنت اجرا کنید، RAM یکی از مهم‌ترین اجزای سیستم است؛ اما انتخاب آن فقط به این سؤال محدود نمی‌شود که «چند گیگابایت حافظه لازم دارم؟».

در Local AI، مقدار RAM موردنیاز به حجم و Quantization مدل، روش اجرای آن، مقدار VRAM کارت گرافیک، Context Length، KV Cache، Runtime و میزان GPU Offloading بستگی دارد. بسته به این شرایط، ممکن است بخشی از وزن‌های مدل در RAM قرار بگیرد یا تقریباً تمام مدل در VRAM اجرا شود.

بنابراین RAM بیشتر همیشه به معنی عملکرد بهتر نیست. اگر مدل با Quantization موردنظر به‌طور کامل در VRAM جا شود، افزایش RAM معمولاً تأثیر مستقیمی بر سرعت تولید Token ندارد. در مقابل، در CPU Inference، GPU Offloading، Contextهای طولانی و Workloadهای سنگین مانند RAG و پردازش داده، ظرفیت و در برخی موارد پهنای‌باند RAM اهمیت بیشتری پیدا می‌کند.

در این راهنما ابتدا یک جدول سریع برای انتخاب ظرفیت RAM ارائه می‌کنیم و سپس توضیح می‌دهیم که چگونه بر اساس مدل، Quantization، Context و روش اجرای آن، مقدار واقعی حافظه موردنیاز را تخمین بزنید.

Local-AI-RAM-01.jpg

راهنمای سریع خرید RAM برای Local AI

اگر بخواهیم بدون ورود به محاسبات پیچیده یک نقطه شروع برای انتخاب RAM داشته باشیم، جدول زیر می‌تواند مبنای تصمیم‌گیری باشد. این اعدادس توصیه عملی برای سناریوهای مشخص هستند، نه حداقل RAM لازم برای خود مدل.

سناریو

حداقل عملی

پیشنهاد مناسب

پیکربندی پیشنهادی

شرایط اعتبار

LLM سبک تا ۷B روی GPU

۱۶ GB

۳۲ GB

۲×۱۶ GB

INT4، Context تا حدود ۸K و مدل کاملاً در VRAM

LLM متوسط ۸B تا ۱۴B

۳۲ GB

۶۴ GB

۲×۳۲ GB

INT4، Context تا حدود ۱۶K و VRAM کافی یا Offloading محدود

مدل‌های ۳۰B تا ۳۵B

۴۸ GB

۶۴ GB

۲×۳۲ GB

INT4/INT5، Context تا حدود ۱۶K و VRAM حدود ۱۶ تا ۲۴ GB

مدل‌های حدود ۷۰B

۹۶ GB

۱۲۸ GB

۲×۶۴ GB

INT4، Context کوتاه تا متوسط و GPU Offloading سنگین یا CPU Inference

Multi-Model یا مدل‌های بسیار بزرگ

۱۲۸ GB

۲۵۶ GB یا بیشتر

متناسب با پلتفرم

اجرای چند مدل، Context بالا یا KV Cache سنگین

CPU Inference سنگین

۹۶ GB

۱۲۸ GB یا بیشتر

متناسب با پلتفرم و کانال‌های حافظه

INT4/INT8 و قرار گرفتن بخش عمده یا کل مدل در RAM

RAG و پردازش داده سنگین

۶۴ GB

۱۲۸ GB

۲×۳۲ یا ۴×۳۲ GB

Dataset بزرگ، Embedding و پردازش داده در RAM

تست و توسعه اولیه

۱۶ GB

۳۲ GB

۲×۱۶ GB

مدل‌های تا حدود ۷B، Context کوتاه و Workload سبک

برای Local AI به چند گیگابایت RAM نیاز داریم؟

جدول بالا یک نقطه شروع برای انتخاب ظرفیت RAM است، نه حداقل یا حداکثر قطعی برای همه مدل‌ها. مقدار واقعی حافظه به Quantization، Context Length، محل اجرای مدل، میزان Offloading و مصرف Runtime و برنامه‌های دیگر بستگی دارد.

به همین دلیل، ظرفیت‌های ۳۲، ۶۴ و ۱۲۸ گیگابایت را باید بیشتر به‌عنوان سطوح مختلف کاربری در نظر گرفت تا الزامات ثابت برای مدل‌های مشخص.

۳۲ گیگابایت؛ نقطه شروع منطقی

برای ورود به Local AI، ۳۲ گیگابایت RAM در قالب ۲×۱۶GB برای بسیاری از Workloadهای سبک مناسب است. این ظرفیت به‌خصوص زمانی کافی است که مدل Quantized باشد، به‌طور کامل در VRAM قرار بگیرد و برنامه‌های سنگین دیگری هم‌زمان اجرا نشوند.
محدودیت ۳۲ گیگابایت زمانی زودتر ظاهر می‌شود که سراغ Contextهای طولانی، GPU Offloading، RAG، پردازش داده یا اجرای هم‌زمان چند برنامه سنگین بروید. بنابراین ۳۲GB را بهتر است ظرفیت شروع بدانیم، نه استاندارد همه سیستم‌های Local AI.

Local-AI-RAM-02.jpg

۶۴ گیگابایت؛ نقطه تعادل برای کاربر جدی

برای کاربری که Local AI را جدی‌تر دنبال می‌کند، ۶۴ گیگابایت در قالب ۲×۳۲GB معمولاً انتخاب متعادل‌تری است. این ظرفیت فضای بیشتری برای مدل‌های متوسط، Offloading محدود، RAG سبک، Contextهای بزرگ‌تر و اجرای هم‌زمان برنامه‌ها فراهم می‌کند.

این میزان رم برای طیف وسیعی از مدل‌های حدود ۷B تا ۳۵B، بسته به Quantization، VRAM، Context و میزان Offloading، می‌تواند فضای عملی مناسبی فراهم کند.

۱۲۸ گیگابایت؛ برای Workloadهای سنگین‌تر

برای ساخت سیستم Local AI با 128GB RAM، در حالت ایده‌آل بهتر است به‌جای پر کردن چهار اسلات، از دو ماژول 64GB استفاده کنید. در پلتفرم‌های دسکتاپ معمولی، نصب چهار رم به معنی Quad Channel نیست و سیستم همچنان Dual Channel است؛ در عوض، قرار گرفتن دو DIMM روی هر کانال می‌تواند حداکثر فرکانس قابل استفاده و پایداری حافظه را کاهش دهد. تست‌های Puget Systems نیز نشان می‌دهد این کاهش سرعت در اجرای LLM روی CPU می‌تواند محسوس باشد و در Llama.cpp تا حدود 25 درصد اختلاف عملکرد ایجاد کند.

با این حال، 4×32GB را نباید گزینه بدی دانست. اگر قیمت دو ماژول 64GB به‌قدری بالاتر باشد که صرفه‌جویی حاصل از 4×32GB قابل توجه شود، خرید چهار ماژول و اجرای آنها در سرعت رسمی پایین‌تر می‌تواند برای Local AI تصمیم منطقی‌تری باشد؛ چراکه در این کاربرد، ظرفیت کافی RAM اولویت بالاتری از حداکثر کردن فرکانس حافظه دارد. بنابراین قاعده ساده برای خرید 128GB این است: اگر بودجه اجازه می‌دهد، 2×64GB؛ اگر اختلاف قیمت زیاد است، 4×32GB با فرکانس و تایمینگ مناسب و تأیید سازگاری مادربرد/CPU.

۲۵۶ گیگابایت و بیشتر؛ برای نیازهای تخصصی

ظرفیت‌های ۲۵۶GB و بالاتر عمدتاً برای Workstationها و سناریوهایی مانند اجرای چند مدل، مدل‌های بسیار بزرگ، Contextهای بسیار طولانی، Datasetهای حجیم و پردازش‌های سنگین هم‌زمان کاربرد دارند.

در این سطح، مواردی مانند ECC، تعداد کانال‌های حافظه و در سیستم‌های چندپردازنده‌ای NUMA نیز اهمیت پیدا می‌کنند. اگر Workload شما واقعاً به این ظرفیت نیاز نداشته باشد، افزایش RAM از ۱۲۸ به ۲۵۶ گیگابایت به‌خودی‌خود سرعت تولید Token را افزایش نمی‌دهد.

Local-AI-RAM-03.jpg


پیشنهاد بهترین رم های DDR5 برای AI 

پس از مطالعه توضیحات فوق می‌توانید مدل‌های زیر را برای هر رم مناسب هوش مصنوعی در چهار دسته اشاره شده فوق ببینید:

بهترین رم مناسب هوش مصنوعی با پیکربندی 32 گیگابایت یا 2x16GB

 دو ماژول KINGMAX Horizon 16GB DDR5-5600 CL38

قیمت حدود 48 میلیون و 500 هزار تومان با گارانتی معتبر

Kingmax HORIZON 16GB 5600mhz CL38.jpg

مشخصات فنی پیکربندی پیشنهادی برای Local AI
ظرفیت و پیکربندی 32GB (2×16GB)، Dual Channel
نوع حافظه DDR5 UDIMM، 288-Pin
سرعت / تأخیر 5600MT/s، CL38
پروفایل حافظه AMD EXPO / Intel XMP 3.0
ولتاژ کاری 1.25V
پهنای‌باند تئوری حدود 89.6GB/s در حالت Dual Channel
کاربری پیشنهادی Local AI سبک تا متوسط، اجرای LLMهای محلی و توسعه/آزمایش مدل‌ها
پیشنهاد خرید 2 ماژول 16GB از همین مدل

رم KINGMAX Horizon 16GB DDR5-5600 CL38 با سرعت 5600MT/s و تایمینگ CL38، گزینه‌ای اقتصادی برای ساخت یک سیستم 32 گیگابایتی Local AI است. پیشنهاد می‌شود دو ماژول از این مدل تهیه شود تا ضمن برخورداری از 32GB حافظه، سیستم از پهنای‌باند حدود 89.6GB/s در حالت Dual Channel بهره ببرد. پشتیبانی از AMD EXPO و Intel XMP 3.0 نیز استفاده از این ماژول را روی هر دو پلتفرم اصلی ساده می‌کند.

نکته: در صورتی که بودجه محدودتر باشد، ADATA 16GB DDR5-5600 CL46 با قیمت 43 میلیون تومان برای هر ماژول نیز می‌تواند با خرید دو ماژول، همین پیکربندی 32GB را با هزینه کمتر فراهم کند؛ هرچند تایمینگ بالاتری دارد.


بهترین رم مناسب هوش مصنوعی با پیکربندی 64 گیگابایت یا 2x32GB

دو ماژول Crucial 32GB DDR5-5600 CL46

قیمت حدود 48 میلیون و 500 هزار تومان با گارانتی معتبر

Crucial 32GB 5600MHz CL46.jpg

مشخصات فنی پیکربندی پیشنهادی برای Local AI
ظرفیت و پیکربندی 64GB (2×32GB)، Dual Channel
نوع حافظه DDR5 UDIMM
سرعت / تأخیر 5600MT/s، CL46 (46-45-45)
پروفایل حافظه AMD EXPO / Intel XMP 3.0
ولتاژ کاری 1.1V
پهنای‌باند تئوری حدود 89.6GB/s در حالت Dual Channel
کاربری پیشنهادی Local AI متوسط تا سنگین، LLMهای بزرگ‌تر و اجرای هم‌زمان مدل‌ها
پیشنهاد خرید 2 ماژول 32GB از همین مدل

رم Crucial 32GB DDR5-5600 CL46 یک ماژول DDR5 با ظرفیت بالای 32 گیگابایت است که برای ساخت پیکربندی 64GB (2×32GB) گزینه‌ای اقتصادی و کاربردی محسوب می‌شود. این ماژول با سرعت 5600MT/s و تایمینگ 46-45-45 عرضه می‌شود و نسخه دسکتاپ آن از نوع UDIMM است. همچنین پشتیبانی از AMD EXPO و Intel XMP 3.0 امکان استفاده از آن روی پلتفرم‌های مختلف را فراهم می‌کند. 

برای سیستم‌های Local AI، ترکیب دو ماژول از این مدل و دستیابی به 64GB RAM فضای بسیار مناسب‌تری برای اجرای مدل‌های بزرگ‌تر، مدل‌های کوانتایز شده با پارامترهای بیشتر و کار هم‌زمان با چند ابزار AI فراهم می‌کند. سرعت 5600MT/s نیز پهنای‌باند مناسبی در اختیار سیستم قرار می‌دهد و ظرفیت 64GB مهم‌ترین مزیت این پیکربندی در مقایسه با گزینه‌های 32GB است. در نتیجه، اگر هدف ساخت یک سیستم Local AI با بودجه کنترل‌شده و امکان اجرای مدل‌های سنگین‌تر است، دو ماژول Crucial 32GB انتخابی منطقی برای شروع رده 64 گیگابایتی محسوب می‌شود.

نکته: به‌عنوان جایگزین اقتصادی‌تر، Neo Forza Trinity RGB 32GB DDR5-5200 CL40 نیز می‌تواند برای همین پیکربندی مورد توجه قرار گیرد. این مدل یک ماژول 32 گیگابایتی است و بنابراین با تهیه دو ماژول می‌توان سیستم را به 64GB حافظه در حالت Dual Channel رساند.

در مقایسه با Crucial، سرعت آن کمی پایین‌تر است، اما CL40 نیز دارد و برای یک سیستم Local AI که اولویت اصلی آن افزایش ظرفیت حافظه است، می‌تواند انتخاب مقرون‌به‌صرفه‌ای باشد. بنابراین اگر اختلاف قیمت این مدل با Crucial 32GB DDR5-5600 CL46 قابل توجه باشد، ترکیب 2×32GB Neo Forza همچنان برای اجرای مدل‌های بزرگ‌تر و سناریوهای سنگین‌تر Local AI گزینه مناسبی خواهد بود؛ ضمن اینکه نورپردازی RGB آن برای کاربرانی که ظاهر سیستم نیز برایشان اهمیت دارد، یک مزیت جانبی محسوب می‌شود.


بهترین رم مناسب هوش مصنوعی با پیکربندی 128GB

دو ماژول G.SKILL Trident Z5 RGB 128GB DDR5-6000 CL34

قیمت حدود 480 میلیون تومان با گارانتی معتبر

G.SKILL Trident Z5 RGB BLACK 128GB 6000MHZ CL34.jpg

مشخصات فنی پیکربندی پیشنهادی برای Local AI
ظرفیت و پیکربندی 128GB (2×64GB)، Dual Channel
نوع حافظه DDR5 UDIMM
سرعت / تأخیر 6000MT/s، CL34-44-44-96
پروفایل حافظه Intel XMP 3.0
ولتاژ 1.35V
پهنای‌باند تئوری حدود 96GB/s در حالت Dual Channel
کاربری پیشنهادی Local AI سنگین، LLMهای بزرگ و مدل‌های حافظه‌محور
پیشنهاد خرید یک کیت 128GB شامل 2×64GB

در این بخش به دلیل قیمت بسیار بالای ماژول‌ها باید نهایت دقت را داشت. کیت G.SKILL Trident Z5 RGB 128GB DDR5-6000 CL34 با پیکربندی 2×64GB، انتخاب اصلی این راهنما برای کاربرانی است که به 128 گیگابایت حافظه برای Local AI نیاز دارند. این کیت با سرعت 6000MT/s، تایمینگ CL34-44-44-96 و پشتیبانی از Intel XMP 3.0، علاوه بر ظرفیت بالا، مشخصات مناسبی برای یک سیستم قدرتمند و حافظه‌محور ارائه می‌دهد. G.SKILL نیز تأکید کرده که این کیت به مادربردی با پشتیبانی از ماژول‌های 64GB و در برخی موارد BIOS جدید نیاز دارد.

مزیت مهم این انتخاب برای Local AI، دستیابی به 128GB حافظه با تنها دو ماژول است؛ بنابراین در مقایسه با پیکربندی چهارماژوله، فشار کمتری به کنترلر حافظه وارد می‌شود و شانس دستیابی به سرعت‌های بالاتر و پایداری بهتر افزایش می‌یابد. برای اجرای مدل‌های بزرگ‌تر، مدل‌های کوانتایز شده حجیم و سناریوهایی که به حافظه سیستم زیادی نیاز دارند، این ترکیب انتخاب مناسب‌تری است؛ البته برای بهره‌گیری از سرعت 6000MT/s باید سازگاری CPU و مادربرد با این کیت بررسی شود.

G.SKILL Ripjaws M5 RGB 64GB DDR5-5200 CL40؛ گزینه اقتصادی برای 128GB

اگر قیمت کیت 128GB دوماژوله برایتان بسیار بالاست، G.SKILL Ripjaws M5 RGB 64GB DDR5-5200 CL40 می‌تواند راهکار اندک ارزان‌تر نیز باشد. این محصول در واقع یک کیت 64GB شامل 2×32GB با سرعت 5200MT/s و تایمینگ CL40-40-40-83 است؛ بنابراین برای رسیدن به 128GB باید دو کیت یکسان تهیه و هر چهار اسلات حافظه مادربرد استفاده شود. این مدل از Intel XMP 3.0 و AMD EXPO پشتیبانی می‌کند.

در این پیکربندی، سیستم همچنان Dual Channel خواهد بود و استفاده از چهار ماژول به معنی Quad Channel نیست. مزیت اصلی این راهکار، کاهش هزینه نهایی رسیدن به 128GB است؛ بنابراین اگر مادربرد و پردازنده از ظرفیت 128GB با چهار DIMM پشتیبانی کنند و اختلاف قیمت با کیت 2×64GB قابل توجه باشد، این گزینه برای ساخت یک سیستم Local AI پرظرفیت کاملاً قابل توجه است. البته به دلیل استفاده از چهار ماژول، ممکن است برای دستیابی به پایداری کامل، سیستم به سرعت پایین‌تری از 5200MT/s تنظیم شود.

در نظر داشته باشید که حتماً تست‌های قبل از خرید به صورت کامل انجام شود چرا که خود شرکت G.SKILL نیز توصیه می‌کند کیت‌های حافظه با یکدیگر مخلوط نشوند؛ بنابراین استفاده از دو کیت کاملاً یکسان همچنان به معنی تضمین سازگاری یک کیت 4×32GB کارخانه‌ای نیست.


یک مدل AI چطور روی سیستم شما اجرا می‌شود؟

برای اینکه بدانید چقدر RAM لازم دارید، ابتدا باید روشن شود یک مدل زبانی بزرگ هنگام اجرا دقیقاً از چه منابعی استفاده می‌کند. چه Llama اجرا کنید، چه DeepSeek یا Qwen، فرایند کلی یکسان است: مدل مجموعه‌ای از پارامترهای عددی (وزن‌ها) است که برای محاسبه باید در حافظه قرار بگیرد و یک پردازنده آن‌ها را بخواند و پردازش کند.

Local-AI-RAM-05.jpg

وقتی در ابزاری مانند Ollama یا llama.cpp دستور اجرای مدل را می‌دهید، سه اتفاق اصلی می‌افتد:

مرحله اول: بارگذاری وزن‌ها در حافظه

فایل مدل از SSD خوانده می‌شود و وزن‌ها در حافظه قرار می‌گیرند. مقدار حافظه‌ای که این وزن‌ها اشغال می‌کنند به دو چیز بستگی دارد: تعداد پارامترها و دقت ذخیره‌سازی.

برای مثال، یک مدل ۷ میلیارد پارامتری در FP16 از نظر تئوری حدود ۱۴ گیگابایت فضا نیاز دارد. اگر همین مدل با INT4 کوانتیزه شود، حجم وزن‌ها به حدود ۳.۵ تا ۴ گیگابایت کاهش پیدا می‌کند. این دقیقاً همان کاری است که Quantization انجام می‌دهد: با کاهش دقت نمایش وزن‌ها، اجرای مدل‌های بزرگ‌تر روی سخت‌افزار محدودتر ممکن می‌شود.

البته حجم واقعی فایل مدل الزاماً با محاسبه تئوری یکسان نیست؛ روش Quantization، Metadata و داده‌های جانبی می‌توانند کمی به حجم اضافه کنند.

مرحله دوم: چه کسی محاسبه می‌کند؛ CPU یا GPU؟

وزن‌ها در حافظه قرار گرفته‌اند؛ حالا باید مشخص شود محاسبات را چه کسی انجام می‌دهد.

اگر CPU اجرا کننده محاسبات باشد

در این فرایند که به آن CPU Inference هم می‌گویند، وزن‌ها در RAM باقی می‌مانند و پردازنده برای هر محاسبه باید آن‌ها را از حافظه بخواند. در این حالت، RAM هم محل نگهداری بخش اصلی وزن‌های مدل است و هم منبع تأمین داده برای پردازنده؛ بنابراین علاوه بر ظرفیت، پهنای‌باند RAM نیز می‌تواند روی سرعت تولید توکن اثر قابل‌توجهی داشته باشد.

اگر GPU اجرا کننده محاسبات باشد

مدل یا بخشی از آن در VRAM کارت گرافیک قرار می‌گیرد و GPU با هزاران هسته موازی خود محاسبات را انجام می‌دهد. در این سناریو، RAM نقش کم‌رنگ‌تری در خود اجرای مدل دارد و VRAM گلوگاه اصلی است.

اگر مدل بزرگ‌تر از VRAM باشد (GPU Offloading)

اجرا لزوماً غیرممکن نیست. Runtime می‌تواند بخشی از وزن‌ها را در VRAM و بخش باقی‌مانده را در RAM نگه دارد. اما هرچه سهم RAM از مدل بیشتر شود، سرعت معمولاً از اجرای کامل در VRAM کمتر خواهد بود؛ چون دسترسی GPU به داده‌های موجود در RAM و انتقال آنها از حافظه سیستم معمولاً بسیار پرهزینه‌تر از استفاده مستقیم از VRAM است.

بنابراین CPU یا GPU بودن Inference فقط به خود مدل بستگی ندارد؛ سخت‌افزار شما، Runtime انتخابی و نحوه تنظیم Offloading تعیین می‌کنند مدل کجا و چطور اجرا شود.

Local-AI-RAM-06.jpg

مرحله سوم: Context و هزینه پنهان KV Cache

مدل بارگذاری شده و آماده پاسخ‌گویی است. حالا هر پیامی که می‌نویسید و هر پاسخی که دریافت می‌کنید، در Context Window مدل ثبت می‌شود.

نکته مهم این است که وزن‌های مدل ثابت‌اند؛ چه یک سؤال کوتاه بپرسید چه یک مکالمه صد هزار توکنی. اما Context که بزرگ می‌شود، مدل باید اطلاعات میانی توکن‌های قبلی را جایی نگه دارد تا برای تولید هر توکن جدید مجبور نباشد همه‌چیز را از صفر محاسبه کند. این اطلاعات میانی در KV Cache ذخیره می‌شوند.

در نتیجه، حتی اگر مدل تغییر نکند، افزایش Context Length مصرف حافظه را بالا می‌برد. در کاربردهایی مانند RAG هم که حجم زیادی سند وارد Context می‌شود، همین اثر تشدید می‌شود.

فرایند اجرای مدل هوش مصنوعی در یک نگاه

وزن‌های مدل از SSD خوانده می‌شوند و در RAM، VRAM یا هر دو قرار می‌گیرند؛ سپس CPU یا GPU محاسبات را انجام می‌دهد. در صورت نیاز، Offloading مدل را بین RAM و VRAM تقسیم می‌کند و با افزایش Context، KV Cache نیز حافظه بیشتری مصرف می‌کند.

RAM یا VRAM؛ کدام را برای Local AI ارتقا دهیم؟

یکی از مهم‌ترین تصمیم‌ها هنگام ساخت یا ارتقای سیستم Local AI این است که بودجه را صرف RAM بیشتر کنیم یا GPU با VRAM بیشتر. پاسخ به این سؤال به گلوگاه واقعی سیستم بستگی دارد.

RAM بیشتر می‌تواند اجرای مدل‌های بزرگ‌تر را ممکن کند، اما جایگزین VRAM نیست.

وقتی مدل کاملاً در VRAM جا می‌شود

اگر مدل با Quantization و Context موردنظر به‌طور کامل در VRAM جا شود، افزایش RAM معمولاً تأثیر مستقیمی بر سرعت تولید Token ندارد. در این حالت، RAM برای سیستم‌عامل، Runtime و سایر برنامه‌ها لازم است، اما گلوگاه اصلی اجرای مدل نیست.

بنابراین اگر RAM کافی دارید و محدودیت اصلی ظرفیت VRAM است، ارتقای GPU یا انتخاب کارت گرافیکی با VRAM بیشتر معمولاً تأثیر بیشتری بر عملکرد خواهد داشت.

وقتی مدل به RAM Offloading نیاز دارد

اگر حجم مدل از VRAM بیشتر باشد، Runtime می‌تواند بخشی از مدل را در RAM نگه دارد و بخش دیگر را روی GPU اجرا کند. این روش امکان اجرای مدل‌های بزرگ‌تر را فراهم می‌کند، اما هرچه وابستگی به RAM بیشتر شود، فاصله عملکرد با اجرای کامل مدل در VRAM نیز معمولاً بیشتر خواهد شد.

در این شرایط، ظرفیت RAM برای امکان اجرای مدل اهمیت دارد و پهنای‌باند آن نیز می‌تواند بر عملکرد اثر بگذارد.

وقتی مدل روی CPU اجرا می‌شود

در CPU Inference، وزن‌های مدل عمدتاً در RAM قرار دارند و پردازنده برای اجرای محاسبات به حافظه سیستم وابسته است. بنابراین در این سناریو، علاوه بر ظرفیت، پهنای‌باند RAM نیز اهمیت بیشتری پیدا می‌کند.

Local-AI-RAM-08.jpg

چرا RAM جای VRAM را نمی‌گیرد؟

RAM و VRAM هر دو برای نگهداری داده‌های موردنیاز پردازش استفاده می‌شوند، اما برای کاربردهای متفاوتی طراحی شده‌اند. VRAM معمولاً پهنای‌باند بسیار بیشتری دارد و مستقیماً برای تأمین داده موردنیاز GPU بهینه شده است.

برای نمونه، یک کیت DDR5-6000 دوکاناله در شرایط ایده‌آل حدود ۹۶GB/s پهنای‌باند تئوری دارد، در حالی که GPUهای قدرتمند می‌توانند از حافظه‌ای با پهنای‌باند بسیار بالاتر استفاده کنند. البته این اعداد مستقیماً به سرعت تولید Token تبدیل نمی‌شوند و عملکرد واقعی به GPU، مدل، Runtime، Quantization و نحوه دسترسی به حافظه بستگی دارد.

RAM بیشتر می‌تواند اجرای مدل‌های بزرگ‌تر را ممکن کند، اما جایگزین VRAM نیست.

در نهایت کدام را ارتقا دهیم؟

اگر مدل کاملاً در VRAM جا می‌شود و RAM کافی دارید، GPU و VRAM اولویت دارند. اگر مدل کمی بزرگ‌تر از VRAM است، افزایش RAM می‌تواند با Offloading امکان اجرای آن را فراهم کند. در CPU Inference، ظرفیت و پهنای‌باند RAM هر دو مهم‌اند و در Workloadهایی مانند RAG یا پردازش داده، ممکن است افزایش RAM انتخاب منطقی‌تری باشد.

ملاک اصلی باید گلوگاه واقعی سیستم باشد، نه صرفاً مقدار RAM یا VRAM روی کاغذ.

محاسبه RAM مورد نیاز برای اجرای LLM

حجم فایل مدل فقط نقطه شروع محاسبه است. هنگام اجرای یک LLM، علاوه بر وزن‌های مدل، KV Cache، حافظه Runtime، سیستم‌عامل، برنامه‌های دیگر و حاشیه امن نیز باید در نظر گرفته شوند.

برای یک تخمین اولیه می‌توان نوشت:

حافظه موردنیاز اجرای مدل ≈ وزن مدل + KV Cache + حافظه Runtime + سایر مصرف‌های سیستم + حاشیه امن

این عدد لزوماً برابر با RAM موردنیاز نیست؛ چون بسته به Runtime و نحوه اجرای مدل، بخشی از آن می‌تواند در VRAM قرار بگیرد.ب

وزن مدل چقدر حافظه می‌خواهد؟

ساده‌ترین بخش محاسبه، حجم تئوری وزن‌های مدل است:

حجم وزن‌ها ≈ تعداد پارامترها × حافظه موردنیاز برای هر پارامتر

برای درک بهتر، جدول زیر حجم تئوری وزن چند مدل را در دقت‌های مختلف نشان می‌دهد. این اعداد فقط مربوط به وزن‌ها هستند و با مصرف واقعی حافظه در زمان اجرا یکسان نیستند.

دقت

حافظه تئوری هر پارامتر

مدل 7B

مدل 14B

مدل 32B

مدل 70B

FP32

~4 بایت

~28 GB

~56 GB

~128 GB

~280 GB

FP16 / BF16

~2 بایت

~14 GB

~28 GB

~64 GB

~140 GB

INT8

~1 بایت

~7 GB

~14 GB

~32 GB

~70 GB

INT4

~0.5 بایت*

~3.5 GB*

~7 GB*

~16 GB*

~35 GB*

این اعداد فقط حجم تئوری وزن‌ها هستند. در اجرای واقعی باید KV Cache، Runtime، سیستم‌عامل، برنامه‌های دیگر و حاشیه امن را نیز در نظر گرفت. ضمن اینکه محل قرارگیری این داده‌ها به روش اجرای مدل بستگی دارد و ممکن است بخشی از آنها در VRAM قرار بگیرد.

Context طولانی، KV Cache را بزرگ‌تر می‌کند

KV Cache اطلاعات میانی مربوط به توکن‌های قبلی را نگه می‌دارد تا مدل برای تولید توکن‌های جدید مجبور به محاسبه مجدد کل Context نباشد. به همین دلیل، هرچه Context Length بیشتر شود، مصرف KV Cache نیز افزایش پیدا می‌کند.

برای نمونه، در Llama 3 8B با KV Cache از نوع FP16، مقدار خام KV Cache تقریباً به این شکل رشد می‌کند:

Context

KV Cache تقریبی

8K

~1 GB

32K

~4 GB

128K

~16 GB

این اعداد مختص همین معماری و تنظیمات هستند و نباید به همه مدل‌ها تعمیم داده شوند. نکته مهم این است که با چهار برابر شدن Context، مصرف KV Cache نیز تقریباً چهار برابر می‌شود.

همچنین INT4 بودن وزن‌های مدل الزاماً به معنی INT4 بودن KV Cache نیست؛ ممکن است وزن‌ها با دقت پایین‌تری ذخیره شوند اما KV Cache با Precision بالاتری نگهداری شود.

محل قرارگیری KV Cache به Runtime و نحوه اجرای مدل بستگی دارد، بنابراین Context طولانی می‌تواند مصرف RAM یا VRAM را افزایش دهد. در نتیجه، هنگام برآورد حافظه فقط حجم وزن‌های مدل را در نظر نگیرید.

Runtime، برنامه‌های سیستم و حاشیه امن

Runtime نیز برای بارگذاری و مدیریت مدل و اجرای محاسبات به حافظه نیاز دارد و مقدار مصرف آن با توجه به ابزار و تنظیمات متفاوت است. llama.cpp، Ollama و vLLM الزاماً مصرف حافظه یکسانی ندارند.

از طرف دیگر، سیستم‌عامل و برنامه‌های هم‌زمان مانند مرورگر، IDE یا ابزارهای پردازش داده نیز بخشی از RAM را مصرف می‌کنند. بنابراین ظرفیت حافظه نباید طوری انتخاب شود که مصرف واقعی تقریباً به سقف آن برسد.

اگر RAM کافی نباشد، سیستم‌عامل می‌تواند بخشی از داده‌ها را روی SSD قرار دهد؛ این سازوکار در لینوکس Swap و در ویندوز Page File نام دارد. این قابلیت می‌تواند از توقف فوری برنامه جلوگیری کند، اما SSD از نظر تأخیر و پهنای‌باند با RAM قابل مقایسه نیست و استفاده سنگین از آن می‌تواند عملکرد LLM را به‌شدت کاهش دهد.

در نتیجه، Swap و Page File را نباید بخشی از ظرفیت واقعی RAM در نظر گرفت.

برای RAM حاشیه امن در نظر بگیرید

هدف از محاسبه RAM این نیست که مصرف دقیقاً به ظرفیت خریداری‌شده برسد. اگر وزن مدل، KV Cache، Runtime و برنامه‌های هم‌زمان در مجموع مثلاً حدود ۵۵GB مصرف کنند، ۶۴GB فضای کمی برای سیستم‌عامل و سایر فعالیت‌ها باقی می‌گذارد و ظرفیت بالاتر انتخاب منطقی‌تری خواهد بود.

در مقابل، اگر مصرف واقعی سیستم حدود ۲۵ تا ۳۰GB باشد، افزایش RAM به ۱۲۸GB لزوماً مزیت محسوسی ایجاد نمی‌کند.

دقیق‌ترین روش، اندازه‌گیری مصرف واقعی است

بهترین راه برای اطمینان از انتخاب ظرفیت RAM، اجرای همان مدل با Quantization و Context موردنظر و بررسی مصرف واقعی RAM و VRAM در Task Manager ویندوز یا ابزارهای مانیتورینگ لینوکس است.

این روش از تخمین‌های عمومی دقیق‌تر است، چون مصرف واقعی به مدل، Runtime، Context، Offloading و برنامه‌های هم‌زمان بستگی دارد.

Local-AI-RAM-07.jpg

محاسبه RAM موردنیاز با چند مدل واقعی

برای ملموس‌تر شدن روش محاسبه، چهار مدل را در یک سناریوی مشخص بررسی می‌کنیم. اعداد زیر توصیه عملی برای همان سناریو هستند، نه حداقل RAM لازم برای اجرای خود مدل. توجه داشته باشید که مقدار واقعی حافظه به Quantization، Context، Runtime، VRAM و میزان Offloading بستگی دارد؛ بنابراین یک مدل مشخص می‌تواند روی دو سیستم، نیاز حافظه کاملاً متفاوتی داشته باشد.

مدل

حجم تقریبی نسخه ۴ بیتی

وضعیت با 16GB VRAM

RAM پیشنهادی

OpenAI gpt-oss-20B

12.8GiB

عمدتاً قابل جای‌گیری

32GB

DeepSeek-R1-Distill-Qwen-32B

~20GB

نیازمند Offloading

64GB

Google Gemma 3 27B

~16–17GB

احتمالاً نیازمند Offloading جزئی

64GB

Qwen3-32B

~20GB

نیازمند Offloading

64GB

مهم‌ترین نکته این مثال‌ها این است که تعداد پارامترها به‌تنهایی معیار RAM موردنیاز نیست. باید مشخص شود چه مقدار از وزن مدل و KV Cache در VRAM قرار می‌گیرد و چه مقدار به RAM منتقل می‌شود.

برای تخمین عملی، ابتدا حافظه موردنیاز مدل با Quantization و Context مشخص را در نظر بگیرید، سپس مقدار Offloading، مصرف Runtime و برنامه‌های دیگر را اضافه کنید و در نهایت حاشیه امن در نظر بگیرید.

مدل متنی OpenAI gpt-oss-20B

gpt-oss-20B یک مدل نسبتاً بزرگ و مناسب برای کارهایی مثل چت، تولید متن و اجرای محلی است که نشان می‌دهد تعداد پارامتر بالا لزوماً به RAM بسیار زیاد نیاز ندارد؛ اگر مدل عمدتاً در VRAM جا شود، فشار روی RAM می‌تواند محدود بماند.gpt-oss-20B یک مدل Mixture-of-Experts با حدود ۲۰.۹ میلیارد پارامتر است که OpenAI آن را با MXFP4 ارائه می‌کند. حجم Checkpoint رسمی مدل حدود ۱۲.۸GiB است.

Local-AI-RAM-09.jpg

در سیستمی که مدل عمدتاً در VRAM قرار می‌گیرد و Context و Workload جانبی سنگین نیست، ۳۲GB RAM می‌تواند برای یک سیستم عمومی کافی باشد و افزایش RAM لزوماً سرعت مدل را بیشتر نمی‌کند. Contextهای طولانی، RAG یا اجرای هم‌زمان برنامه‌های سنگین می‌توانند نیاز حافظه را افزایش دهند.

مدل استدلال متنی DeepSeek-R1-Distill-Qwen-32B

DeepSeek-R1-Distill-Qwen-32B برای استدلال، حل مسائل پیچیده و کارهای فنی گزینه‌ای قدرتمند برای اجرای محلی است؛ اما حجم نسخه Quantized آن باعث می‌شود در کارت‌های 16GB، RAM به بخشی از حافظه موردنیاز مدل تبدیل شود. این مدل ترکیبی حدود ۳۲ میلیارد پارامتر دارد و نسخه‌های ۴ بیتی آن تقریباً ۲۰GB حجم دارند. روی GPU با 16GB VRAM، بخشی از مدل باید در RAM قرار گیرد.

Local-AI-RAM-10.jpg

در این شرایط، ۶۴GB RAM نسبت به ۳۲GB حاشیه امن بیشتری برای Offloading، Context و برنامه‌های جانبی فراهم می‌کند.

مدل متنی Google Gemma 3 27B

Gemma 3 27B برای چت، تولید و تحلیل متن و برخی کاربردهای چندوجهی طراحی شده و از نظر نیاز حافظه در محدوده‌ای قرار می‌گیرد که با GPUهای 16GB، تنظیمات اجرا می‌تواند تفاوت محسوسی در میزان RAM موردنیاز ایجاد کند. Gemma 3 27B حدود ۲۷ میلیارد پارامتر دارد و نسخه‌های ۴ بیتی آن تقریباً ۱۶ تا ۱۷GB حجم دارند. بنابراین روی GPU با 16GB VRAM، بسته به تنظیمات اجرا، ممکن است به Offloading جزئی نیاز باشد.

Local-AI-RAM-11.jpg

۳۲GB RAM برای اجرای معمولی قابل استفاده است، اما برای Context بزرگ‌تر، Offloading بیشتر یا اجرای برنامه‌های جانبی، ۶۴GB حاشیه امن مناسب‌تری فراهم می‌کند.

مدل متنی و برنامه نویسی Qwen3-32B

Qwen3-32B برای چت، استدلال، برنامه‌نویسی و کارهای فنی گزینه‌ای توانمند برای Local AI است؛ اما نسخه Quantized آن روی GPUهای 16GB معمولاً به Offloading نیاز دارد و همین موضوع RAM بیشتری را وارد فرایند اجرا می‌کند. Qwen3-32B حدود ۳۲.۸ میلیارد پارامتر دارد و نسخه‌های ۴ بیتی آن تقریباً ۲۰GB حجم دارند. در GPU با 16GB VRAM، اجرای مدل به Offloading نیاز خواهد داشت.

Local-AI-RAM-12.jpg

در این سناریو، ۶۴GB RAM انتخاب منطقی‌تری از ۳۲GB است؛ به‌خصوص در Contextهای طولانی یا زمانی که برنامه‌های دیگری نیز هم‌زمان اجرا می‌شوند.

مدل تولید تصویر Black Forest Labs FLUX.1-dev

FLUX.1-dev یک مدل قدرتمند Text-to-Image برای تولید تصاویر باکیفیت است و مثال خوبی است از اینکه در Local AI، حتی وقتی حجم خود مدل مشخص است، رزولوشن، Pipeline و Offloading می‌توانند مقدار RAM موردنیاز را تغییر دهند. این مدل حدود ۱۲ میلیارد پارامتر دارد و برای اجرای محلی از طریق ابزارهایی مانند Diffusers و ComfyUI قابل استفاده است.

Local-AI-RAM-13.jpg

در اجرای معمول FLUX.1-dev، حافظه فقط صرف وزن‌های مدل نمی‌شود و اجزای مختلف Pipeline نیز درگیر هستند. مستندات Diffusers برای FLUX اشاره می‌کنند که بارگذاری کامل اجزای مدل می‌تواند حدود ۵۰GB حافظه RAM/VRAM نیاز داشته باشد و Offloading برای کاهش فشار روی VRAM قابل استفاده است.

برای همین، اگر هدف اجرای محلی FLUX.1-dev روی یک GPU با 16GB VRAM باشد، داشتن حدود ۴۰GB RAM به‌عنوان حداقل عملی و ۶۴GB به‌عنوان ظرفیت مناسب‌تر منطقی است؛ البته این اعداد به Pipeline، Precision، Resolution و روش Offloading وابسته‌اند. برای نمونه، NVIDIA در پیکربندی TensorRT خود 40GB RAM و 16GB VRAM را حداقل و 64GB RAM و 32GB VRAM را پیکربندی پیشنهادی اعلام کرده است.

نکته مهم این است که در تولید تصویر، افزایش RAM لزوماً به معنی تولید سریع‌تر تصویر نیست؛ اگر گلوگاه اصلی VRAM یا توان محاسباتی GPU باشد، ارتقای RAM به‌تنهایی عملکرد را به شکل محسوسی افزایش نمی‌دهد.

مدل تولید ویدئو Wan 2.1

Wan 2.1 یک خانواده مدل برای تولید و ویرایش ویدئو است و مثال بسیار خوبی برای نشان دادن اثر رزولوشن، تعداد فریم و Offloading بر مصرف حافظه در Local AI محسوب می‌شود. این خانواده برای تولید ویدئو از عکس، تولید ویدئو از متن و ویرایش ویدئو است که مدل‌هایی با اندازه‌های 1.3B و 14B ارائه می‌کند.

Local-AI-RAM-14.jpg

در Wan 2.1، تفاوت بین مدل‌ها بسیار مهم است. نسخه T2V-1.3B طبق مستندات رسمی به حدود 8.19GB VRAM نیاز دارد و حتی روی GPUهای مصرفی قابل اجراست؛ در مقابل، نسخه T2V-14B بسیار سنگین‌تر است و برای اجرای تک‌GPU، مستندات رسمی استفاده از Model Offloading را پیشنهاد می‌کنند.

برای نمونه، اگر هدف اجرای Wan 2.1 T2V-1.3B با تولید ویدئوی 480p باشد، 16 یا 32GB RAM می‌تواند برای یک سیستم GPUمحور مناسب باشد؛ اما در نسخه 14B یا هنگام افزایش Resolution و استفاده از Offloading، ظرفیت‌های بالاتر مانند 64GB RAM حاشیه امن بیشتری ایجاد می‌کنند. اینجا برخلاف LLMها، فقط حجم مدل را نباید معیار قرار داد؛ رزولوشن و تنظیمات تولید ویدئو نیز می‌توانند مصرف حافظه را تغییر دهند. مستندات رسمی Wan 2.1 نیز برای کاهش مصرف VRAM، استفاده از offload_model و انتقال T5 به CPU را پیشنهاد می‌کنند.

تأثیر سرعت و پهنای‌باند RAM روی Local AI

بعد از ظرفیت، نوبت به سرعت و پهنای‌باند RAM می‌رسد. اهمیت این موضوع به نحوه اجرای مدل بستگی دارد. در CPU Inference و برخی سناریوهای GPU Offloading، پردازنده یا GPU برای دسترسی به بخشی از داده‌های مدل به RAM وابسته است؛ بنابراین پهنای‌باند بالاتر می‌تواند عملکرد را بهتر کند. اما اگر مدل کاملاً در VRAM اجرا شود، سرعت RAM معمولاً تأثیر بسیار کمتری بر سرعت تولید Token دارد.

در نتیجه، برای Local AI لازم نیست به دنبال سریع‌ترین RAM موجود باشید. ظرفیت کافی، پیکربندی درست و پایداری سیستم معمولاً اولویت بالاتری از چند صد MT/s سرعت بیشتر دارند.

پهنای‌باند RAM یعنی چه؟

پهنای‌باند حافظه به زبان ساده یعنی RAM در هر ثانیه چه مقدار داده می‌تواند جابه‌جا کند. برای مثال، DDR5-6000 در حالت Dual Channel از نظر تئوری حدود 96GB/s پهنای‌باند دارد.

این عدد سقف تئوری است و مستقیماً به سرعت اجرای LLM تبدیل نمی‌شود. اگر RAM گلوگاه سیستم نباشد، افزایش پهنای‌باند ممکن است تأثیر بسیار کمی بر عملکرد واقعی داشته باشد.

Dual Channel را جدی بگیرید

در سیستم‌های دسکتاپ معمولی، استفاده از دو کانال حافظه باعث افزایش پهنای‌باند می‌شود. بنابراین اگر ۶۴GB RAM نیاز دارید، ۲×۳۲GB معمولاً انتخاب مناسب‌تری از یک ماژول ۶۴GB است؛ البته به شرط پشتیبانی CPU و مادربرد.

تعداد ماژول‌ها با تعداد کانال‌ها یکی نیست. نصب چهار DIMM روی یک پلتفرم Dual Channel، آن را Quad Channel نمی‌کند.

DDR5-6000 یا DDR5-6400؟

DDR5-6000 و DDR5-6400 در حالت Dual Channel به‌ترتیب حدود 96 و 102.4GB/s پهنای‌باند تئوری دارند، اما این اختلاف لزوماً در اجرای LLM به همان اندازه محسوس نیست.

ضمن اینکه با افزایش ظرفیت یا تعداد DIMMها، دستیابی به سرعت‌های بالاتر ممکن است دشوارتر شود. بنابراین یک کیت پایدار با سرعت مناسب، انتخاب بهتری از حافظه‌ای است که فقط روی کاغذ سریع‌تر است اما سیستم را ناپایدار می‌کند.

CL و تأخیر حافظه چقدر مهم است؟

CL یکی از معیارهای تأخیر RAM است، اما نباید حافظه را فقط بر اساس عددی مانند CL30 یا CL36 مقایسه کرد. برای Local AI، تفاوت‌های جزئی در Latency معمولاً اهمیت کمتری از ظرفیت، Dual Channel، سازگاری و پایداری دارند.

اولویت‌های انتخاب RAM

برای بیشتر سیستم‌های Local AI این مسیر را دنبال کنید:

  1. ظرفیت کافی
  2. تعداد کانال حافظه (Dual Channel)
  3. سازگاری و پایداری رم با قطعات دیگر سیستم
  4. سرعت مناسب
  5. تاخیر یا Latency

اگر Workload شما CPU Inference یا GPU Offloading است، پهنای‌باند RAM اهمیت بیشتری پیدا می‌کند. اما اگر مدل کاملاً در VRAM اجرا می‌شود، ارتقا از یک کیت مناسب به RAM بسیار سریع‌تر لزوماً افزایش محسوسی در سرعت Token ایجاد نمی‌کند.

برای Local AI، رم سریع مفید است، اما سریع‌ترین RAM لزوماً بهترین انتخاب نیست. ابتدا ظرفیت موردنیاز و پیکربندی صحیح را تأمین کنید و بعد سراغ سرعت و Latency بروید؛ مگر اینکه RAM واقعاً گلوگاه اجرای مدل شما باشد.

Local-AI-RAM-15.jpg

قبل از خرید رم چه مواردی را بررسی کنیم؟

سرعت و ظرفیت درج‌شده روی جعبه RAM لزوماً به این معنی نیست که سیستم شما نیز می‌تواند حافظه را با همان مشخصات اجرا کند. در ظرفیت‌های ۶۴، ۱۲۸ یا 256 گیگابایت و بالاتر، CPU، Memory Controller، مادربرد، تعداد DIMMها و BIOS همگی روی نتیجه نهایی اثر دارند.

CPU و Memory Controller

Memory Controller داخل پردازنده قرار دارد و همراه با مادربرد روی ظرفیت و سرعت قابل استفاده RAM تأثیر می‌گذارد. بنابراین DDR5-6000 بودن یک کیت به این معنی نیست که هر CPU و مادربردی می‌توانند چند ماژول از آن را با همین سرعت و کاملاً پایدار اجرا کنند.

با افزایش ظرفیت و تعداد ماژول‌ها نیز فشار بیشتری به کنترلر حافظه وارد می‌شود و ممکن است برای پایداری، سرعت پایین‌تری لازم باشد.

دو ماژول یا چهار ماژول؟

اگر مادربرد و ظرفیت موردنیاز اجازه دهند، دو ماژول معمولاً مسیر ساده‌تری برای دستیابی به سرعت و پایداری مناسب هستند. برای مثال، ۲×۳۲GB یا ۲×۶۴GB در بسیاری از سیستم‌ها انتخاب مناسبی است.

اما چهار ماژول روی یک پلتفرم Dual Channel، آن را Quad Channel نمی‌کند. در عین حال، افزایش تعداد DIMMها می‌تواند دستیابی به سرعت‌های بالاتر را دشوارتر کند.

XMP و EXPO

ممکن است یک کیت DDR5-6000 در تنظیمات پیش‌فرض BIOS با سرعت پایین‌تری اجرا شود. XMP در پلتفرم‌های اینتل و EXPO در پلتفرم‌های AMD پروفایل‌های آماده‌ای هستند که سرعت، تایمینگ و ولتاژ موردنظر سازنده را تنظیم می‌کنند.

فعال کردن XMP/EXPO می‌تواند باعث شود RAM با مشخصات عملکردی موردنظر کار کند، اما نباید آن را روشی قطعی برای افزایش چشمگیر سرعت LLM دانست.

ماژول‌های تحت پشتیبانی مادربرد یا QVL

QVL فهرست کیت‌های حافظه آزمایش‌شده توسط سازنده مادربرد است. قرار داشتن یک RAM در QVL تضمین مطلق سازگاری نیست، اما برای خرید کیت‌های ۶۴، ۱۲۸GB یا بالاتر می‌تواند انتخاب را کم‌ریسک‌تر کند.

برای ۱۲۸GB فقط به عدد ظرفیت نگاه نکنید

برای رسیدن به ۱۲۸GB باید بررسی کنید مادربرد چه ترکیبی را پشتیبانی می‌کند؛ مثلاً ۲×۶۴GB یا ۴×۳۲GB. حداکثر ظرفیت هر DIMM، تعداد اسلات‌ها و محدودیت‌های CPU و مادربرد نیز باید بررسی شوند.

در سیستم‌های پرظرفیت، RAM پایدار با سرعت واقعی قابل استفاده ارزش بیشتری از یک کیت بسیار سریع دارد که سیستم نتواند آن را به‌صورت پایدار اجرا کند.

Local-AI-RAM-16.jpg

DDR4 یا DDR5 برای سیستم Local AI

اگر قرار است یک سیستم جدید برای Local AI بسازید، DDR5 انتخاب منطقی‌تری است؛ هم پهنای‌باند بیشتری دارد و هم معمولاً شما را به پلتفرم‌های جدیدتر می‌برد. این مزیت در Workloadهای وابسته به حافظه، به‌خصوص CPU Inference، اهمیت بیشتری پیدا می‌کند.

با این حال، صرف رفتن از DDR4 به DDR5 الزاماً باعث افزایش محسوس سرعت همه مدل‌های AI نمی‌شود. وقتی مدل کاملاً روی GPU و داخل VRAM اجرا می‌شود، RAM معمولاً گلوگاه اصلی نیست.

اگر سیستم DDR4 فعلی شما از نظر CPU و GPU برای Workload مناسب است، صرفاً به‌خاطر Local AI نیازی به تعویض کل پلتفرم ندارید. اگر مشکل شما کمبود ظرفیت RAM است، ممکن است ارتقای همان سیستم تصمیم منطقی‌تری باشد.

برای سیستم جدید DDR5 را انتخاب کنید؛ برای سیستم DDR4 موجود، ابتدا گلوگاه واقعی را پیدا کنید.

ECC و Workstation چه زمانی لازم می‌شوند؟

برای بیشتر کاربران Local AI، یک سیستم دسکتاپ معمولی با RAM استاندارد کافی است. ECC سرعت اجرای LLM را افزایش نمی‌دهد و برای اجرای معمولی مدل‌ها نیز الزامی نیست.

ECC و پلتفرم‌های Workstation زمانی اهمیت بیشتری پیدا می‌کنند که سیستم به ۱۲۸ یا ۲۵۶GB RAM و بیشتر، چند GPU، پردازش‌های سنگین و طولانی یا قابلیت اطمینان بالاتر نیاز داشته باشد. در این سطح، مواردی مانند تعداد کانال‌های حافظه، ECC، خطوط PCIe و در سیستم‌های چندپردازنده‌ای NUMA نیز اهمیت پیدا می‌کنند.

اگر نیاز Local AI شما با یک دسکتاپ معمولی و ۳۲ تا ۱۲۸GB رم برطرف می‌شود، معمولاً بهتر است تمرکز را روی ظرفیت، سازگاری و پایداری بگذارید.

RAG  و Datasetهای بزرگ؛ RAM بالاتر

RAG (تولید پاسخ با بازیابی اطلاعات) به مدل اجازه می‌دهد هنگام پاسخ‌گویی، اطلاعات مرتبط را از مجموعه‌ای از اسناد یا یک پایگاه داده پیدا و در اختیار مدل قرار دهد. RAG به‌خودی‌خود به RAM بسیار زیاد نیاز ندارد. مقدار حافظه بیشتر به حجم اسناد، تعداد Chunkها، Embeddingها، Vector Database، Index و میزان پردازش هم‌زمان بستگی دارد.

در یک سامانه RAG، اسناد به بخش‌های کوچک‌تر تقسیم و به Embedding تبدیل می‌شوند و این بردارها در Vector Database ذخیره می‌شوند. با افزایش تعداد اسناد، حجم Embeddingها و Index نیز می‌تواند افزایش پیدا کند. در عین حال، حجم Dataset با RAM موردنیاز یکی نیست. مثلاً یک مجموعه اسناد ۱۰۰GB لزوماً به ۱۰۰GB RAM نیاز ندارد؛ داده‌ها می‌توانند روی SSD باقی بمانند و فقط بخش‌های موردنیاز در حافظه قرار بگیرند.

از طرف دیگر، اگر Vector Database بخش بزرگی از Index را در RAM نگه دارد یا عملیات Indexing هم‌زمان با اجرای LLM انجام شود، مصرف حافظه می‌تواند قابل‌توجه شود.

برای یک RAG سبک، ۳۲ یا ۶۴GB RAM بسته به Workload می‌تواند کافی باشد. ظرفیت‌های ۱۲۸GB و بالاتر زمانی منطقی‌تر می‌شوند که Dataset، Embedding، Index، Vector Database و LLM هم‌زمان روی یک سیستم اجرا شوند.

Local-AI-RAM-17.jpg

9 اشتباه رایج هنگام انتخاب RAM برای Local AI

در انتخاب RAM برای Local AI، بیشتر از اینکه دنبال یک عدد ثابت باشید، باید ببینید سیستم شما دقیقاً کجا کم می‌آورد. این موارد اشتباهاتی هستند که بدون آگاهی ممکن است مرتکب شویم:

۱. تصور کنیم RAM بیشتر همیشه سرعت را بیشتر می‌کند

اگر Workload با ظرفیت فعلی RAM به‌راحتی اجرا شود، افزایش ظرفیت لزوماً سرعت تولید Token را افزایش نمی‌دهد.

۲. فقط تعداد پارامترها را ملاک قرار دهیم

تعداد پارامترها نقطه شروع است؛ Quantization، Context، KV Cache، VRAM و Offloading نیز تعیین‌کننده‌اند.

۳. RAM و VRAM را معادل بدانیم

RAM می‌تواند اجرای مدل بزرگ‌تر از ظرفیت VRAM را با Offloading ممکن کند، اما از نظر پهنای‌باند و سرعت جای VRAM را نمی‌گیرد.

۴. یک سرعت مشخص را برای همه بهترین بدانیم

DDR5-6000 یا DDR5-6400 زمانی مفید است که CPU، مادربرد و Workload واقعاً از پهنای‌باند آن استفاده کنند.

۵. چهار DIMM را Quad Channel بدانیم

تعداد ماژول‌ها با تعداد کانال‌ها یکی نیست؛ یک پلتفرم Dual Channel با چهار DIMM همچنان دوکاناله است.

۶. XMP و EXPO را نادیده بگیریم

ممکن است RAM خریداری‌شده در تنظیمات پیش‌فرض با سرعت پایین‌تری اجرا شود؛ وضعیت XMP/EXPO را بررسی کنید.

۷. سازگاری RAM را بررسی نکنیم

CPU، Memory Controller، مادربرد، تعداد DIMMها و در ظرفیت‌های بالا QVL را بررسی کنید.

۸. Swap یا Page File را جایگزین RAM واقعی بدانیم

Swap و Page File می‌توانند از توقف فوری برنامه جلوگیری کنند، اما استفاده سنگین از آنها برای LLM باعث افت محسوس عملکرد می‌شود.

۹. ظرفیت بسیار بالا را بدون نیاز واقعی بخریم

۲۵۶GB و بیشتر زمانی ارزش دارد که Workload واقعاً بتواند از آن استفاده کند؛ نه صرفاً برای اینکه «شاید روزی به آن نیاز شود».

Local-AI-RAM-18.jpg

چک‌لیست نهایی خرید رم برای Local AI

در ادامه یک دستورالعمل ساده و دقیق را به شما می‌گوییم که متناسب با آن می‌توانید مهمترین فاکتورها در انتخاب رم مناسب سیستم هوش مصنوعی را به صورت واحد در نظر بگیرید.

۱. روش اجرای مدل را مشخص کنید
ببینید مدل کاملاً روی GPU اجرا می‌شود، بخشی از آن Offload می‌شود یا عمدتاً روی CPU اجرا خواهد شد و کارت گرافیک چه مقدار VRAM در اختیار دارد.

۲. Quantization و Context را مشخص کنید
حجم واقعی وزن‌های مدل را با Quantization موردنظر در نظر بگیرید و Context Length را نیز در محاسبه لحاظ کنید.

۳. RAM را با حاشیه امن انتخاب کنید
KV Cache، Runtime، سیستم‌عامل و برنامه‌های هم‌زمان را فراموش نکنید و RAM را لب مرز مصرف انتخاب نکنید.

۴. پیکربندی حافظه را درست انتخاب کنید
در سیستم‌های Dual Channel، پیکربندی‌هایی مانند ۲×۳۲GB یا ۲×۶۴GB معمولاً مناسب‌اند؛ البته ظرفیت قابل پشتیبانی CPU و مادربرد باید بررسی شود.

۵. سازگاری و پایداری را بررسی کنید
CPU، مادربرد، Memory Controller، تعداد DIMMها، QVL و پشتیبانی XMP/EXPO را بررسی کنید.

۶. سرعت را بعد از ظرفیت انتخاب کنید
وقتی ظرفیت کافی و پیکربندی مناسب مشخص شد، سراغ سرعت و Latency بروید. در CPU Inference و GPU Offloading، پهنای‌باند اهمیت بیشتری پیدا می‌کند.

در عمل، مسیر انتخاب RAM بهتر است از روش اجرای مدل و ظرفیت موردنیاز شروع شود و بعد به پیکربندی، سازگاری و سرعت حافظه برسد. این رویکرد مانع از آن می‌شود که صرفاً بر اساس عددی مثل DDR5-6000 یا ۶۴GB تصمیم بگیرید، بدون اینکه مشخص باشد سیستم واقعاً به چه مقدار و چه نوع حافظه‌ای نیاز دارد.

Local-AI-RAM-19.jpg

جمع‌بندی؛ بهترین RAM برای Local AI

برای Local AI یک ظرفیت ثابت را نمی‌توان بهترین انتخاب برای همه کاربران دانست. RAM موردنیاز به مدل، Quantization، Context Length، روش اجرای مدل، مقدار VRAM و Workloadهای هم‌زمان بستگی دارد.

ظرفیت RAM

مناسب برای

۳۲GB

شروع Local AI، مدل‌های سبک و سیستم‌های GPUمحور

۶۴GB

انتخاب متعادل برای کاربران جدی و Workloadهای متنوع

۱۲۸GB

مدل‌های بزرگ‌تر، Offloading، Context طولانی و پردازش سنگین

۲۵۶GB+

Workstation، اجرای چند مدل و Datasetهای حجیم

در CPU Inference، پهنای‌باند و پیکربندی حافظه اهمیت بیشتری پیدا می‌کند؛ در اجرای کامل GPUمحور، ممکن است VRAM گلوگاه اصلی باشد و در Contextهای طولانی، KV Cache می‌تواند بخش قابل‌توجهی از حافظه را مصرف کند.

بنابراین انتخاب RAM را از عددی مانند «۶۴GB» یا «DDR5-6000» شروع نکنید. ابتدا مشخص کنید مدل کجا اجرا می‌شود، چه مقدار از آن در RAM قرار می‌گیرد، Context چقدر است و چه Workloadهای دیگری هم‌زمان فعال هستند. سپس ظرفیت، پیکربندی و در نهایت سرعت RAM را انتخاب کنید.

RAM بیشتر لزوماً Local AI را سریع‌تر نمی‌کند؛ RAM کافی و متناسب با Workload است که یک سیستم را کاربردی و پایدار نگه می‌دارد.

سوالات متداول

آیا برای اجرای Local AI، رم ۳۲ گیگابایت کافی است؟

برای مدل‌های سبک و سیستم‌های GPUمحور، ۳۲GB می‌تواند کافی باشد؛ به‌خصوص اگر مدل کاملاً در VRAM جا شود و برنامه‌های سنگین دیگری هم‌زمان اجرا نشوند.

آیا ۶۴ گیگابایت بهترین مقدار RAM برای هوش مصنوعی است؟

برای بسیاری از کاربران جدی Local AI، ۶۴GB نقطه تعادل خوبی است؛ اما بهترین مقدار به Workload، مدل، Context، VRAM و روش اجرای آن بستگی دارد.

برای اجرای مدل‌های ۷B، ۱۴B یا ۳۲B چقدر RAM لازم است؟

تعداد پارامترها به‌تنهایی کافی نیست. Quantization، محل اجرای مدل، Context Length، KV Cache و میزان Offloading نیز باید در نظر گرفته شوند.

برای اجرای مدل هوش مصنوعی RAM مهم‌تر است یا VRAM؟

در اجرای GPUمحور، VRAM معمولاً اهمیت بیشتری برای خود مدل دارد؛ اما در CPU Inference یا زمانی که مدل از VRAM بزرگ‌تر است، RAM نقش مهم‌تری پیدا می‌کند.

آیا DDR5 برای Local AI بهتر از DDR4 است؟

برای ساخت یک سیستم جدید، DDR5 انتخاب منطقی‌تری است؛ اما برای یک سیستم DDR4 موجود، صرفاً به‌خاطر Local AI تعویض کل پلتفرم ضروری نیست.

برای هوش مصنوعی دو ماژول ۳۲ گیگابایت بهتر است یا یک ماژول ۶۴ گیگابایتی؟

در یک سیستم Dual Channel، معمولاً ۲×۳۲GB انتخاب مناسب‌تری است، زیرا امکان استفاده از دو کانال حافظه را فراهم می‌کند؛ البته سازگاری CPU و مادربرد باید بررسی شود.

آیا RAG به ۱۲۸ گیگابایت RAM نیاز دارد؟

خیر. برای RAG سبک، ۳۲ یا ۶۴GB می‌تواند کافی باشد. RAM بیشتر زمانی توجیه پیدا می‌کند که Dataset، Embedding، Vector Database، Indexing و LLM هم‌زمان روی یک سیستم اجرا شوند.

آیا Context طولانی باعث افزایش مصرف RAM می‌شود؟

می‌تواند باعث افزایش مصرف حافظه شود، چون KV Cache با افزایش Context بزرگ‌تر می‌شود. با این حال، محل قرارگیری این حافظه به Runtime و نحوه اجرای مدل بستگی دارد و ممکن است در RAM، VRAM یا ترکیبی از آنها قرار بگیرد.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید