چینی‌ها از مدل جدید DeepSeek-V4.1-Flash رونمایی کردند. این مدل کوچک‌ترین عضو خانواده این شرکت محسوب می‌شود و با تمرکز بر سرعت بالاتر، توان پردازشی بیشتر و هزینه پایین‌تر طراحی شده است. انتشار این مدل هم‌زمان با آماده‌شدن DeepSeek برای ورود احتمالی به بازار سرمایه چین انجام شده است.

DeepSeek می‌گوید V4.1-Flash برای استنتاج سریع‌تر، توان عملیاتی بالاتر و مقیاس‌پذیری بهتر طراحی شده و از قابلیت درک بومی تصویر و پردازش چندوجهی نیز بهره می‌برد. این مدل بر پایه معماری MoE یا ترکیبی از متخصصان ساخته شده و در مجموع 552 میلیارد پارامتر دارد.

با این حال هنگام پردازش ورودی تنها 8 میلیارد پارامتر و هنگام تولید خروجی 16 میلیارد پارامتر فعال می‌شوند. این رویکرد باعث شده مدل با وجود اندازه بزرگ، منابع سخت‌افزاری بسیار کمتری نسبت به مدل‌های مشابه مصرف کند.

بر اساس گزارش reuters یکی از مهم‌ترین تغییرات معماری، کاهش حجم حافظه مورد نیاز برای KV Cache است. DeepSeek می‌گوید V4.1-Flash در مقایسه با نسل قبلی تنها به یک‌چهارم حافظه HBM و یک‌هشتم فضای ذخیره‌سازی SSD نیاز دارد.

deep-2.jpg

عملکرد بهتر از مدل‌های پرچم‌دار مانند GPT و Claude

نتایج اعلام‌شده نشان می‌دهد DeepSeek-V4.1-Flash در برخی آزمون‌ها حتی توانسته مدل‌های بزرگ‌تر این شرکت را پشت سر بگذارد. این مدل در GPQA Diamond امتیاز 90.9 و در آزمون Humanity's Last Exam امتیاز 36.8 را کسب کرده است؛ این رقم در حالت متنی به 39.1 و با استفاده از ابزارها به 63.9 می‌رسد.

در Codeforces نیز V4.1-Flash با امتیاز 3471 بالاتر از V4-Pro با امتیاز 3348 و نسخه قبلی Flash با امتیاز 3289 قرار گرفته است. همچنین امتیاز این مدل در MathArena Apex به 65.6 رسیده است.

در حوزه مهندسی نرم‌افزار نیز امتیاز 74.2 در DeepSWE v1.1 ثبت شده که بالاتر از امتیاز 73.0 برای GPT 5.6-Sol و 74.0 برای Claude Opus 5 است. عملکرد مدل در بنچمارک‌های امنیت سایبری و وظایف ایجنتی نیز نشان‌دهنده تمرکز DeepSeek بر کاربردهای پیچیده‌تر هوش مصنوعی است.

کاهش چشمگیر هزینه استفاده از API

DeepSeek در کنار معرفی مدل جدید، قیمت API آن را نیز کاهش داده است. در ساعات کم‌مصرف، استفاده از هر 1 میلیون توکن ورودی کش‌شده تنها 0.003 دلار هزینه دارد، در حالی که ورودی جدید 0.15 دلار و خروجی 0.6 دلار قیمت‌گذاری شده است. این ارقام در ساعات اوج مصرف به‌ترتیب 0.006، 0.3 و 1.2 دلار هستند.

DeepSeek همچنین قصد دارد مدل V4-Pro را به‌تدریج کنار بگذارد. از 14 سپتامبر درخواست‌های ارسال‌شده به deepseek-v4-pro به‌صورت خودکار به V4.1-Flash هدایت می‌شوند و با تعرفه پایین‌تر مدل جدید محاسبه خواهند شد؛ این وضعیت تا زمان عرضه V4.1-Pro ادامه خواهد داشت.

عرضه V4.1-Flash در حالی انجام شده که DeepSeek روند آماده‌سازی برای عرضه اولیه سهام در بازار فناوری STAR Market شانگهای را آغاز کرده است. رویترز روز گذشته گزارش داده بود که این شرکت برای آماده‌سازی IPO با CITIC Securities همکاری می‌کند و احتمال دارد روند عرضه اولیه را در سال جاری آغاز کند.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید