عامل‌های هوش مصنوعی حالا بیشتر از خود کاربران انسانی از مدل‌های هوش مصنوعی استفاده می‌کنند. داده‌های OpenRouter نشان می‌دهد این عامل‌ها در ماه اوت حدود ۷.۳ تریلیون توکن مصرف کرده‌اند؛ رقمی که بیش از پنج برابر ۱.۴ تریلیون توکن مصرف‌شده توسط کاربران انسانی است.

اگر تا به امروز فکر می‌کردید که هوش مصنوعی ساخته شده تا انسان‌ها اولین استفاده‌کنندگان از آن باشند، شاید باید در برداشت خود از ماهیت این‌روزها دنیای AI تجدید نظر کنید. جدیدترین گزارش‌های تخصصی نشان داده که مصرف‌کننده ظرفیت پردازشی مدل‌های هوش مصنوعی معروف، بیشتر خود عامل‌های هوش مصنوعی هستند تا انسان‌ها!

نکته بسیار ویژه در خصوص این عدم تقارن آن است که این فاصله در حال بیشتر شدن نیز است. مصرف توکن عامل‌ها از ماه‌های فوریه تا اوت سال جاری میلادی (طی 7 ماه) حدود ۱۴ برابر رشد کرده، در حالی که مصرف کاربران انسانی در همین مدت ۲.۸ برابر شده است.

AI-Agents-04.jpg

دنیل نیومن، مدیرعامل گروه Futurum، با توجه به همین روند پستی را در حساب X خود منتظر کرده که می‌گوید، نسبت فعلی می‌تواند در آینده به ۱۰ برابر برسد و حتی از آن هم عبور کند.

چرا عامل‌ها بیشتر از انسان توکن مصرف می‌کنند؟

از دید فنی تفاوت ساختاری نحوه استفاده انسان و عامل از ابزاری به کارآمدی هوش مصنوعی، دلیل اصلی اختلاف در میزان استفاده است. کاربر معمولاً سؤالش را مطرح می‌کند و پاسخ می‌گیرد، اما عامل برای انجام کاری مثل نوشتن کد یا بررسی یک پروژه ممکن است بارها با مدل ارتباط برقرار کند. عامل نتیجه یک مرحله را می‌گیرد، آن را بررسی می‌کند، ابزار دیگری را به کار می‌گیرد و دوباره سراغ مدل می‌رود.

در این رفت‌وبرگشت‌ها، سابقه کار هم مرتب همراه درخواست‌های جدید قرار می‌گیرد و تعداد توکن‌ها خیلی سریع بالا می‌رود. به همین دلیل، مصرف بیشتر توکن لزوماً به معنی انجام پنج برابر کار بیشتر نیست؛ بخشی از این مصرف حاصل همان رفت‌وبرگشت‌های متعدد و حمل دوباره اطلاعات قبلی است.

مسئله عجیب عامل‌ها و توکن‌ها تکراری

داده‌های OpenRouter نشان می‌دهد بیش از ۸۵ درصد توکن‌های ورودی عامل‌ها از Promptهای کش‌شده تشکیل شده‌اند؛ یعنی بخش‌هایی از ورودی که قبلاً استفاده شده‌اند و سیستم می‌تواند برای کاهش زمان و هزینه پردازش، از نسخه ذخیره‌شده آن‌ها استفاده کند.

AI-Agents-01.jpg

اما اگر با ساختار رسیدن به پاسخ در مدل‌های هوش مصنوعی آشنا باشید باید در نظر بگیرید که این موضوع را نباید با KV Cache یکی دانست. Prompt Caching برای استفاده مجدد از بخش‌های تکراری ورودی است، در حالی که KV Cache اطلاعات میانی حاصل از پردازش توکن‌ها را برای ادامه همان فرایند نگه می‌دارد. هر دو به اجرای سریع‌تر مدل کمک می‌کنند، اما سازوکارشان متفاوت است.

همین حجم بالای اطلاعات تکراری، مسئله حافظه را جدی‌تر می‌کند. یک عامل که ساعت‌ها روی یک کار باقی می‌ماند، باید سابقه بیشتری را در طول فرایند در دسترس نگه دارد و این یعنی فشار بیشتر روی حافظه و پهنای‌باند سیستم.

فشار عامل‌ها به HBM هم می‌رسد

این بخش برای سازندگان سخت‌افزار اهمیت زیادی دارد. شتاب‌دهنده‌های دیتاسنتری هوش مصنوعی از HBM، حافظه‌ای بسیار سریع و پرپهنای‌باند، برای نگهداری و دسترسی سریع به داده‌های مورد نیاز مدل‌ها استفاده می‌کنند.

شرکت تحقیقاتی اندریسن هورویتز با استناد به داده‌های OpenRouter اعلام کرده رشد KV Cache می‌تواند از ظرفیت حافظه HBM موجود در شتاب‌دهنده‌های فعلی فراتر برود. به این ترتیب، افزایش بار کاری عامل‌ها فقط به GPUهای بیشتر نیاز ندارد؛ ظرفیت حافظه و سرعت انتقال داده نیز باید همزمان افزایش پیدا کند.

۹۶ درصد ورودی‌های عامل‌ها تکراری است!

نکته جالب توجه دیگر در این زمینه، انبوه ورودی‌های تکراری توسط عامل‌های هوش مصنوعی است که نمونه‌ای از این رفتار در استفاده از عامل‌های برنامه‌نویسی دیده شده است. یک شرکت فعال در حوزه مشاوره مراکز تماس که عامل‌های خود را با مدل DeepSeek روی سرورهای مجهز به NVIDIA H200 آزمایش کرده، گزارش داده که حدود ۹۶ درصد ورودی‌های Claude Code در ماه سپتامبر مربوط به مکالمات و اطلاعات قبلی بوده است.

برای یک عامل، این رفتار طبیعی است. اگر قرار باشد پروژه‌ای را در چند مرحله پیش ببرد، باید بداند قبلاً چه فایل‌هایی را بررسی کرده، چه تصمیم‌هایی گرفته شده و نتیجه مراحل قبلی چه بوده است. بنابراین بخشی از همان اطلاعات دوباره در اختیار مدل قرار می‌گیرد، حتی اگر داده تازه‌ای به آن اضافه نشده باشد.

مسئله فقط GPU بیشتر نیست

رشد عامل‌های هوش مصنوعی می‌تواند معادله سخت‌افزار این صنعت را هم تغییر دهد. عامل‌های بیشتر یعنی درخواست‌های بیشتر، اما در کنار آن حافظه بیشتر برای نگهداری زمینه کار و پهنای‌باند بالاتر برای جابه‌جایی این داده‌ها هم لازم خواهد بود.

بازار HBM همین حالا به دلیل تقاضای مراکز داده هوش مصنوعی تحت فشار است و گسترش عامل‌ها می‌تواند این فشار را بیشتر کند. بنابراین اگر پیش‌بینی دنیل نیومن درباره رشد چندبرابری مصرف عامل‌ها محقق شود، رقابت سخت‌افزاری AI فقط بر سر ساخت GPUهای قدرتمندتر نخواهد بود؛ حافظه سریع و پرظرفیت هم به همان اندازه مهم خواهد شد.

البته رسیدن مصرف عامل‌ها به ۱۰ برابر یا حتی ۲۰ و ۳۰ برابر انسان هنوز یک پیش‌بینی است و داده‌های OpenRouter به تنهایی نمی‌تواند رفتار کل صنعت را نشان دهد. اما روند فعلی روشن است: عامل‌های هوش مصنوعی با سرعت زیادی در حال تبدیل شدن به مصرف‌کنندگان اصلی زیرساخت AI هستند و هرچه کارهای طولانی‌تر و پیچیده‌تری به آن‌ها سپرده شود، نیاز به حافظه و انتقال سریع داده نیز بیشتر خواهد شد.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید