گزارشها از شروع دوباره توسعه شتابدهنده هوش مصنوعی Rubin CPX توسط انویدیا خبر میدهند. این محصول اکنون با یک تغییر مهم در معماری حافظه به میدان بازمیگردد و به جای ۱۲۸ گیگابایت حافظه GDDR7، به ۱۶۸ گیگابایت حافظه HBM4 مجهز میشود.
انویدیا اواخر سال گذشته از برنامه خود برای توسعه یک شتابدهنده اختصاصی برای استنتاج هوش مصنوعی بر پایه معماری Rubin خبر داده بود. هدف اصلی این محصول پردازش بارهای کاری سنگین هوش مصنوعی عاملمحور (Agentic AI) عنوان شده بود. با این حال، پروژه Rubin CPX پس از معرفی اولیه متوقف شد و اکنون به نظر میرسد انویدیا با بازطراحی معماری حافظه، توسعه آن را از سر گرفته است.
در طراحی قبلی، Rubin CPX قرار بود 128 گیگابایت حافظه GDDR7 داشته باشد، اما نسخه جدید به 168 گیگابایت HBM4 مجهز خواهد شد. این شتابدهنده همچنین در رکهای اختصاصی عرضه میشود و هر رک میتواند بسته به پیکربندی، بین 64 تا 256 پردازنده گرافیکی مستقل CPX را در خود جای دهد.
جداسازی پردازش Prefill و Decode
مهمترین کاربرد Rubin CPX، پردازش مرحله Prefill در مدلهای زبانی بزرگ (LLM) است. در این مرحله ورودی و context مدل پردازش میشود و KV Cache شکل میگیرد. انویدیا با این طراحی قصد دارد وظایف Prefill و Decode را از یکدیگر جدا کند.
در این معماری، GPUهای Rubin CPX مسئول Prefill خواهند بود، در حالی که GPUهای معمولی Rubin وظیفه Decode را بر عهده میگیرند. به گفته انویدیا، جداسازی این دو مرحله برای مدلهای زبانی بسیار بزرگ، بهویژه مدلهایی با تریلیونها پارامتر، سرعت تولید و تحویل توکنها را افزایش دهد.
هر سینی رک مجهز به هشت Rubin CPX میتواند تا 1.34 ترابایت داده مربوط به Prefill با context طولانی و KV Cache را مدیریت کند. استفاده از حافظه HBM4 نیز پهنای باند بالاتری را برای این حجم عظیم از داده فراهم میکند.

بازطراحی برای HBM4
مهاجرت از GDDR7 به HBM4 تنها یک تغییر در نوع حافظه نیست و نیازمند بازطراحی بستهبندی تراشه نیز خواهد بود. از آنجا که طراحی قبلی Rubin CPX برای استفاده از HBM4 در نظر گرفته نشده بود، احتمال میرود انویدیا برای نسخه جدید از فناوریهای بستهبندی پیشرفته TSMC، مانند CoWoS-S یا CoWoS-L، استفاده کند.
Rubin CPX همچنین روی یک تراشه یکپارچه (Monolithic Die) قرار دارد و توان پردازشی آن به 30 پتافلاپس در محاسبات NVFP4 میرسد. این تراشه همچنین چهار واحد NVENC برای رمزگذاری و چهار واحد NVDEC برای رمزگشایی ویدئو نیز بهصورت داخلی دارد.
در همین رابطه بخوانید:
- راز پنهان در پردازنده هوش مصنوعی انویدیا: آیا Rubin CPX همان RTX 6090 است؟
- انویدیا از Rubin CPX رونمایی کرد؛ پردازنده ۳۰ پتافلاپسی با ۱۲۸ گیگابایت حافظه GDDR7
معماری جدید انویدیا برای مدلهای هوش مصنوعی عظیم
با افزایش اندازه مدلهای زبانی و حرکت صنعت به سمت مدلهایی با تریلیونها پارامتر، مدیریت contextهای طولانی و KV Cache به یکی از چالشهای اصلی زیرساختهای هوش مصنوعی تبدیل شده است. Rubin CPX در پاسخ به همین نیاز طراحی شده و قرار است بار پردازشی Prefill را از Decode جدا کند.
انویدیا همچنین پیشنهاد میکند در این زیرساخت، نسبت GPUهای CPX به GPUهای معمولی Rubin در رکهای Decode برابر با یک به یک باشد. در صورت تحقق این معماری، Rubin CPX میتواند نقش یک شتابدهنده تخصصی در نسل بعدی زیرساختهای استنتاج هوش مصنوعی انویدیا ایفا کند.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت