سازنده ChatGPT در جریان رویداد Hot Chips 2026 اولین بنچمارکها از پردازنده اختصاصی خودش برای استتاج AI را به اشتراک گذاشت. این شرکت مدعی است که پردازنده Jalapeno در بعضی سناریوها تا ۱.۹ برابر بهتر از GB300 انویدیا عمل میکند.
شرکت OpenAI با تراشه Jalapeno برای نخستینبار وارد میدان طراحی تراشههای اختصاصی هوش مصنوعی شده است. بر اساس گزارش تحلیلی SemiAnalysis، این تراشه در برخی سناریوهای استنتاج (inference) تا ۱.۹ برابر بازدهی بیشتر بهازای هر کیلووات نسبت به تراشههای Blackwell انویدیا ارائه میدهد.
معماری متفاوت Jalapeno
این پردازنده از یک چپلت پردازشی با ابعاد نزدیک به حداکثر ظرفیت لیتوگرافی روی فرآیند N3P شرکت TSMC تشکیل شده است که توسط یک چیپلت ورودی/خروجی مبتنی بر N3E به حافظههای HBM4 متصل متصل میشود. این ترکیب پهنای باند حافظهای معادل ۱۵.۴ ترابایت بر ثانیه برای هر تراشه فراهم میکند.

هستهها و بلوکهای حافظه به بخشهای متناظر تقسیم شدهاند تا هر هسته دسترسی سریع و کمتأخیر به یک بخش اختصاصی از حافظه HBM داشته باشد. موتور اصلی محاسبات ماتریسی این تراشه، برخلاف روشهای رایج که از اعداد ۸ یا ۱۶ بیتی استفاده میکنند، از فرمت MXFP4 بهره میبرد که با گروهبندی دادهها و اشتراکگذاری یک ضریب مقیاس مشترک، حجم دادههای نیازمند جابهجایی را بهشدت کاهش میدهد.
طراحی موتور ماتریسی از نوع آرایه سیستولیک با وزن ثابت (weight-stationary systolic array) است. به این معنا که وزنهای مدل تنها یکبار در شبکه پردازشی بارگذاری میشوند و دادههای ورودی بدون توقف مکرر برای خواندن و نوشتن در حافظه، در میان سلولهای پردازشی جریان مییابند. این رویکرد گلوگاه انتقال داده را که در معماریهای سنتی رایج است، حذف میکند.
در کنار موتور محاسبات ماتریسی، Jalapeno از هستههای اسکالر ۶۴ بیتی با اجرای خارج از ترتیب (Out-of-Order) برای مدیریت حافظه و کنترل جریان اجرای برنامه، و همچنین هستههای برداری FP32/INT32 برای محاسبات نیازمند دقت بالا مانند لایههای softmax استفاده میکند.

راهکار در سطح رَک
OpenAI تنها به طراحی تراشه بسنده نکرده و یک سیستم کامل در مقیاس رَک سرور نیز عرضه کرده است. این سیستم از دو بخش اصلی تشکیل شده است: یک رَک میزبان (Host) با نام Katsu که هر واحد آن دو پردازنده AMD EPYC نسل Turin، ۱.۵ ترابایت حافظه رم و ذخیرهسازی NVMe به همراه دارد، و رَک شتابدهنده با نام Vindaloo که هر سینی آن هشت تراشه Jalapeno را در خود جای داده و در مجموع هر رَک به ۱۲۸ تراشه میرسد.
هر رَک ۱۲۸ تراشهای میتواند تا ۱.۷ اگزافلاپس توان پردازشی در دقت ۴ بیتی MXFP4 ارائه دهد و در مجموع ۲۷.۵ ترابایت حافظه HBM4 در اختیار دارد.
نتایج بنچمارکهای Jalapeno
طبق دادههای SemiAnalysis، در مجموعه آزمون InferenceX و با استفاده از مدلهای GPT-OSS با ۱۲۰ میلیارد پارامتر، DeepSeek R1 با ۶۷۰ میلیارد پارامتر و Kimi K2.5 با یک تریلیون پارامتر، پردازنده OpenAI در بهترین حال بین ۱.۵ تا ۱.۹ برابر محاصبات بیشتر بهازای هر وات و تأخیر کلی ۱.۷ تا ۳.۶ برابر کمتر نسبت به بهترین نتایج موجود از تراشههای GB200 و GB300 انویدیا ثبت کرده است.

نکته مهم این است که این نتایج بدون تکیه بر ترفندهای معماری مانند پیشبینی چندتوکنی (multi-token prediction) یا رمزگشایی تخمینی (speculative decoding) بهدست آمده که میتوانند بهبودی نزدیک به سه برابر در هزینه هر توکن ایجاد کنند. البته باید در نظر داشت که Jalapeno از حافظه نسل جدید HBM4 بهره میبرد در حالی که محصولات نسل فعلی انویدیا هنوز از HBM3E استفاده میکنند.
شرکت OpenAI درکنار این تراشه، یک زبان برنامه نویسی اختصاصی به نام Gloun را هم معرفی کرد که عملاً گامی جدی برای عبور از وابستگی به پلتفرم CUDA انویدیا محسوب میشود.
توجه داشته باشید که تراشه جدید OpenAI تنها وظیفه اجرای مدلها یا «استنتاج» را برعهده خواهد داشت و آموزش مدلهای جدید OpenAI هنوز هم با تراشه های انویدیا انجام میشود.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت