سازنده ChatGPT در جریان رویداد Hot Chips 2026 اولین بنچمارک‌ها از پردازنده اختصاصی خودش برای استتاج AI را به اشتراک گذاشت. این شرکت مدعی است که پردازنده Jalapeno در بعضی سناریوها تا ۱.۹ برابر بهتر از GB300 انویدیا عمل می‌کند.

شرکت OpenAI با تراشه Jalapeno برای نخستین‌بار وارد میدان طراحی تراشه‌های اختصاصی هوش مصنوعی شده است. بر اساس گزارش تحلیلی SemiAnalysis، این تراشه در برخی سناریوهای استنتاج (inference) تا ۱.۹ برابر بازدهی بیشتر به‌ازای هر کیلووات نسبت به تراشه‌های Blackwell انویدیا ارائه می‌دهد.

معماری متفاوت Jalapeno

این پردازنده از یک چپلت پردازشی با ابعاد نزدیک به حداکثر ظرفیت لیتوگرافی روی فرآیند N3P شرکت TSMC تشکیل شده است که توسط یک چیپلت ورودی/خروجی مبتنی بر N3E به حافظه‌های HBM4 متصل متصل می‌شود. این ترکیب پهنای باند حافظه‌ای معادل ۱۵.۴ ترابایت بر ثانیه برای هر تراشه فراهم می‌کند.

معماری Jalapeno

هسته‌ها و بلوک‌های حافظه به بخش‌های متناظر تقسیم شده‌اند تا هر هسته دسترسی سریع و کم‌تأخیر به یک بخش اختصاصی از حافظه HBM داشته باشد. موتور اصلی محاسبات ماتریسی این تراشه، برخلاف روش‌های رایج که از اعداد ۸ یا ۱۶ بیتی استفاده می‌کنند، از فرمت MXFP4 بهره می‌برد که با گروه‌بندی داده‌ها و اشتراک‌گذاری یک ضریب مقیاس مشترک، حجم داده‌های نیازمند جابه‌جایی را به‌شدت کاهش می‌دهد.

طراحی موتور ماتریسی از نوع آرایه سیستولیک با وزن ثابت (weight-stationary systolic array) است. به این معنا که وزن‌های مدل تنها یک‌بار در شبکه پردازشی بارگذاری می‌شوند و داده‌های ورودی بدون توقف مکرر برای خواندن و نوشتن در حافظه، در میان سلول‌های پردازشی جریان می‌یابند. این رویکرد گلوگاه انتقال داده را که در معماری‌های سنتی رایج است، حذف می‌کند.

در کنار موتور محاسبات ماتریسی، Jalapeno از هسته‌های اسکالر ۶۴ بیتی با اجرای خارج از ترتیب (Out-of-Order) برای مدیریت حافظه و کنترل جریان اجرای برنامه، و همچنین هسته‌های برداری FP32/INT32 برای محاسبات نیازمند دقت بالا مانند لایه‌های softmax استفاده می‌کند.

مشخصات کلی Jalapeno

راهکار در سطح رَک

OpenAI تنها به طراحی تراشه بسنده نکرده و یک سیستم کامل در مقیاس رَک سرور نیز عرضه کرده است. این سیستم از دو بخش اصلی تشکیل شده است: یک رَک میزبان (Host) با نام Katsu که هر واحد آن دو پردازنده AMD EPYC نسل Turin، ۱.۵ ترابایت حافظه رم و ذخیره‌سازی NVMe به همراه دارد، و رَک شتاب‌دهنده با نام Vindaloo که هر سینی آن هشت تراشه Jalapeno را در خود جای داده و در مجموع هر رَک به ۱۲۸ تراشه می‌رسد.

هر رَک ۱۲۸ تراشه‌ای می‌تواند تا ۱.۷ اگزافلاپس توان پردازشی در دقت ۴ بیتی MXFP4 ارائه دهد و در مجموع ۲۷.۵ ترابایت حافظه HBM4 در اختیار دارد.

نتایج بنچمارک‌های Jalapeno

طبق داده‌های SemiAnalysis، در مجموعه آزمون InferenceX و با استفاده از مدل‌های GPT-OSS با ۱۲۰ میلیارد پارامتر، DeepSeek R1 با ۶۷۰ میلیارد پارامتر و Kimi K2.5 با یک تریلیون پارامتر، پردازنده OpenAI در بهترین حال بین ۱.۵ تا ۱.۹ برابر محاصبات بیشتر به‌ازای هر وات و تأخیر کلی ۱.۷ تا ۳.۶ برابر کمتر نسبت به بهترین نتایج موجود از تراشه‌های GB200 و GB300 انویدیا ثبت کرده است.

نتایج بنچمارک  Jalapeno

نکته مهم این است که این نتایج بدون تکیه بر ترفندهای معماری مانند پیش‌بینی چندتوکنی (multi-token prediction) یا رمزگشایی تخمینی (speculative decoding) به‌دست آمده که می‌توانند بهبودی نزدیک به سه برابر در هزینه هر توکن ایجاد کنند. البته باید در نظر داشت که Jalapeno از حافظه نسل جدید HBM4 بهره می‌برد در حالی که محصولات نسل فعلی انویدیا هنوز از HBM3E استفاده می‌کنند.

شرکت OpenAI درکنار این تراشه، یک زبان برنامه نویسی اختصاصی به نام Gloun را هم معرفی کرد که عملاً گامی جدی برای عبور از وابستگی به پلتفرم CUDA انویدیا محسوب می‌شود.

توجه داشته باشید که تراشه جدید OpenAI تنها وظیفه اجرای مدل‌ها یا «استنتاج» را برعهده خواهد داشت و آموزش مدل‌های جدید OpenAI هنوز هم با تراشه های انویدیا انجام می‌شود.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید