کوالکام در حال آمادهسازی نسل جدید پردازندههای پرچمدار خود با تمرکز ویژه بر اجرای هوش مصنوعی به صورت مستقل و بر روی دستگاه است. نسل جدید Hexagon NPU با شتابدهنده اختصاصی برای مدلهای هوش مصنوعی، حافظه اشتراکی بیشتر و پشتیبانی بهتر از مدلهای Mixture-of-Experts یا MoE، قرار است اجرای عاملهای هوش مصنوعی و مدلهای بزرگ را روی گوشیهای هوشمند سریعتر و روانتر کند.
کوالکام قرار است در تاریخ 22 سپتامبر (31 شهریور) و در جریان رویداد Snapdragon Summit از نسل جدید تراشههای پرچمدار خود رونمایی کند. انتظار میرود این خانواده شامل تراشههای اسنپدراگون 8 الیت نسل شش و نسخه قدرتمندتر اسنپدراگون 8 الیت نسل شش پرو باشد. این شرکت در روزهای منتهی به مراسم، به تدریج جزییات بیشتری را قابلیتهای جدید این تراشهها منتشر میکند و اکنون نوبت به بخش پردازش هوش مصنوعی یا NPU آنها رسیده است.

NPU جدید برای عاملهای هوش مصنوعی
یکی از مهمترین تغییرات در نسل جدید از تراشههای کوالکام، ارتقای Hexagon NPU است. این شرکت اعلام کرده است این واحد پردازشی از ابتدا با هدف اجرای مدلهای چندوجهی و بهخصوص Agentic AI طراحی شده است. برخلاف چتباتهای معمولی که عمدتاً به یک پرسش و پاسخ محدود میشوند، عاملهای هوش مصنوعی میتوانند چند مرحله فعالیت را پشت سر هم انجام دهند، از ابزارهای مختلف استفاده کنند و در طول انجام کار Context طولانیتری را به اجرا درآورند.
برای رسیدن به این هدف، NPU جدید این تراشهها به یک شتابدهنده اختصاصی با نام Element Accelerator مجهز شده است. این بخش در کنار واحدهای Scalar، Vector و Tensor قرار میگیرد و به طور ویژه برای پردازش مدلهای مبتنی بر معماری Transformer طراحی شده است.
به گفته کوالکام این معماری میتواند عملیات موردنیاز مدلهای بزرگ را سریعتر انجام دهد و در عین حال مصرف انرژی را در سطح مناسبی نگه دارد. به این ترتیب، گوشیهای مجهز به تراشه جدید میتوانند وظایف پیچیدهتر هوش مصنوعی را بدون وابستگی مداوم به سرورهای ابری اجرا کنند.
حافظه اشتراکی 50 درصد بزرگتر
یکی دیگر از تغییرات مهم در این تراشهها، افزایش 50 درصدی حافظه اشتراکی NPU است. این حافظه بزرگتر به پردازنده اجازه میدهد دادههای پرتکرار مدل را نزدیکتر به واحد پردازش نگه دارد و وابستگی به حافظه اصلی گوشی را کاهش دهد. این موضوع به خصوص هنگام کار با KV-cache و مدلهایی که Context طولانی دارند اهمیت پیدا میکند. در چنین شرایطی، دسترسی سریعتر به دادهها میتواند از ایجاد گلوگاه حافظه جلوگیری کرده و پاسخگویی عاملهای هوش مصنوعی را بهبود دهد.

کوالکام اعلام کرده است معماری جدید برای کاربردهایی مانند اجرای مداوم هوش مصنوعی، استدلال با Context طولانی، مدلهای چندوجهی، اجرای همزمان چند عامل و حلقههای تصمیمگیری با تاخیر زمانی پایین طراحی شده است.
اجرای مدلهای 30 میلیارد پارامتری به صورت محلی و روی گوشیهای هوشمند
کوالکام همچنین در این تراشهها روی پشتیبانی بهتر از مدلهای Mixture-of-Experts یا MoE تمرکز کرده است. در این مدلها تمام پارامترها برای هر درخواست فعال نمیشوند و سیستم تنها بخشهای تخصصی موردنیاز را فعال میکند. این روش باعث کاهش نیاز به توان پردازشی و پهنای باند حافظه میشود.
طبق اعلام کوالکام، معماری جدید NPU میتواند امکان اجرای مدلهایی با حداکثر 30 میلیارد پارامتر را به صورت محلی فراهم کند. البته اندازه مدل به تنهایی معیار کاملی برای سنجش عملکرد نیست و سرعت، نوع معماری و میزان پارامترهای فعال نیز اهمیت دارند.
از سوی دیگر، NPU جدید در مدلهای دارای دقت INT4، تا 50 درصد عملکرد بالاتری ارائه میدهد. کوالکام همچنین از سرعت Decode بالاتر، بهبود Speculative Decoding و افزایش نرخ تولید توکن خبر داده است. بنابراین این عدد 50 درصد را نباید به معنای 50 درصد افزایش کلی عملکرد تمام وظایف هوش مصنوعی در نظر گرفت.
کوالکام با نسل جدید NPUهای خود قصد دارد پردازش هوش مصنوعی را از اجرای ساده مدلهای کوچک به سمت اجرای عاملهای هوشمند و مدلهای بزرگ به صورت محلی ببرد. اگر وعدههای این شرکت در عمل محقق شوند، نسل بعدی گوشیهای پرچمدار میتوانند بخش بیشتری از وظایف پیچیده AI را بدون ارسال اطلاعات به فضای ابری انجام دهند.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت