گزارش‌ها از شروع دوباره توسعه شتاب‌دهنده هوش مصنوعی Rubin CPX توسط انویدیا خبر می‌دهند. این محصول اکنون با یک تغییر مهم در معماری حافظه به میدان بازمی‌گردد و به جای ۱۲۸  گیگابایت حافظه GDDR7، به ۱۶۸ گیگابایت حافظه HBM4 مجهز می‌شود.

انویدیا اواخر سال گذشته از برنامه خود برای توسعه یک شتاب‌دهنده اختصاصی برای استنتاج هوش مصنوعی بر پایه معماری Rubin خبر داده بود. هدف اصلی این محصول پردازش بارهای کاری سنگین هوش مصنوعی عامل‌محور (Agentic AI) عنوان شده بود. با این حال، پروژه Rubin CPX پس از معرفی اولیه متوقف شد و اکنون به نظر می‌رسد انویدیا با بازطراحی معماری حافظه، توسعه آن را از سر گرفته است.

در طراحی قبلی، Rubin CPX قرار بود 128 گیگابایت حافظه GDDR7 داشته باشد، اما نسخه جدید به 168 گیگابایت HBM4 مجهز خواهد شد. این شتاب‌دهنده همچنین در رک‌های اختصاصی عرضه می‌شود و هر رک می‌تواند بسته به پیکربندی، بین 64 تا 256 پردازنده گرافیکی مستقل CPX را در خود جای دهد.

جداسازی پردازش Prefill و Decode

مهم‌ترین کاربرد Rubin CPX، پردازش مرحله Prefill در مدل‌های زبانی بزرگ (LLM) است. در این مرحله ورودی و context مدل پردازش می‌شود و KV Cache شکل می‌گیرد. انویدیا با این طراحی قصد دارد وظایف Prefill و Decode را از یکدیگر جدا کند.

در این معماری، GPUهای Rubin CPX مسئول Prefill خواهند بود، در حالی که GPUهای معمولی Rubin وظیفه Decode را بر عهده می‌گیرند. به گفته انویدیا، جداسازی این دو مرحله برای مدل‌های زبانی بسیار بزرگ، به‌ویژه مدل‌هایی با تریلیون‌ها پارامتر، سرعت تولید و تحویل توکن‌ها را افزایش دهد.

هر سینی رک مجهز به هشت Rubin CPX می‌تواند تا 1.34 ترابایت داده مربوط به Prefill با context طولانی و KV Cache را مدیریت کند. استفاده از حافظه HBM4 نیز پهنای باند بالاتری را برای این حجم عظیم از داده فراهم می‌کند.

HBM4 در مقابل GDDR7

بازطراحی برای HBM4

مهاجرت از GDDR7 به HBM4 تنها یک تغییر در نوع حافظه نیست و نیازمند بازطراحی بسته‌بندی تراشه نیز خواهد بود. از آنجا که طراحی قبلی Rubin CPX برای استفاده از HBM4 در نظر گرفته نشده بود، احتمال می‌رود انویدیا برای نسخه جدید از فناوری‌های بسته‌بندی پیشرفته TSMC، مانند CoWoS-S یا CoWoS-L، استفاده کند.

Rubin CPX همچنین روی یک تراشه یکپارچه (Monolithic Die) قرار دارد و توان پردازشی آن به 30 پتافلاپس در محاسبات NVFP4 می‌رسد. این تراشه همچنین چهار واحد NVENC برای رمزگذاری و چهار واحد NVDEC برای رمزگشایی ویدئو نیز به‌صورت داخلی دارد.

در همین رابطه بخوانید:

- راز پنهان در پردازنده هوش مصنوعی انویدیا: آیا Rubin CPX همان RTX 6090 است؟
انویدیا از Rubin CPX رونمایی کرد؛ پردازنده‌ ۳۰ پتافلاپسی با ۱۲۸ گیگابایت حافظه GDDR7

معماری جدید انویدیا برای مدل‌های هوش مصنوعی عظیم

با افزایش اندازه مدل‌های زبانی و حرکت صنعت به سمت مدل‌هایی با تریلیون‌ها پارامتر، مدیریت contextهای طولانی و KV Cache به یکی از چالش‌های اصلی زیرساخت‌های هوش مصنوعی تبدیل شده است. Rubin CPX در پاسخ به همین نیاز طراحی شده و قرار است بار پردازشی Prefill را از Decode جدا کند.

انویدیا همچنین پیشنهاد می‌کند در این زیرساخت، نسبت GPUهای CPX به GPUهای معمولی Rubin در رک‌های Decode برابر با یک به یک باشد. در صورت تحقق این معماری، Rubin CPX می‌تواند نقش یک شتاب‌دهنده تخصصی در نسل بعدی زیرساخت‌های استنتاج هوش مصنوعی انویدیا ایفا کند.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید