شرکت فرانسوی Mistral با معرفی Mistral Large 4، یکی از بزرگ‌ترین مدل‌های زبانی خود را وارد رقابت مدل‌های پیشرفته هوش مصنوعی کرده است. این مدل بر اساس ارزیابی‌های مستقل، توانمندترین مدل توسعه داده شده خارج از آمریکا و چین است، اما در بیشتر معیارها از رقبا عقب می‌ماند.

شرک‌های چینی و آمریکایی بازیگران اصلی صنعت هوش مصنوعی هستند که اغلب از دو فلسفه متضاد پیروی می‌کنند. در حالی که قوی‌ترین مدل‌های آمریکایی اغلب از نوع وزن‌بسته هستند و دیگران از نحوه کارکرد آنها اطلاع کمی دارند، بسیاری از مدل‌های چینی، معماری و وزن‌های خود را آشکارا در اختیار عموم قرار می‌دهند.

حال شرکت اروپایی Mistral نیز جدیدترین مدل هوش مصنوعی خود به نام Mistral Large 4 را به صورت کاملاً متن‌باز و وزن‌باز منتشر کرده است.

LE-CHONK-5.jpg

معماری مدل Mistral Large 4

مدل جدید از معماری Sparse Mixture of Experts استفاده می‌کند. بنابراین با وجود داشتن ۱ ۱ تریلیون پارامتر، در پردازش هر توکن فقط ۴۹ میلیارد پارامتر مربوطه به همان توکن فعال می‌شود. بنابراین مدل عمق استدلال یک مدل تریلیون پارامتری را با هزینه محاسباتی بسیار کمتر ارائه می‌دهد.

این مدل هم‌زمان ورودی متنی و تصویری را پردازش می‌کند و می‌تواند مختصات و اشیای مشخص را در تصاویر پیچیده، مانند عکس‌های هوایی و ماهواره‌ای، شناسایی کند. لایه‌های Attention آن برای پشتیبانی بومی از بیش از ۱۶۰ زبان، از جمله همه زبان‌های رسمی اتحادیه اروپا، بهینه شده‌اند.

شرکت Mistral می‌گوید Large 4برای گردش‌کارهای Agentic چندساعته مناسب است و برخلاف مدل‌های بسته‌ای که درخواست‌های مرتبط با امنیت سایبری را در بیشتر موارد رد می‌کنند، این مدل سیاست‌گذاری انعطاف‌پذیرتری دارد و می‌تواند بدافزارها را تحلیل کند، آسیب‌پذیری‌ها را بازتولید کند و وصله امنیتی ارائه دهد.

آموزش روی سرورهای اروپایی

این شرکت اعلام کرده برای آموزش مدل از صفر، ۴ هزار پردازنده گرافیکی Blackwell را دو ماه در سرورهای اروپایی به کار گرفته است. برای تقویت استدلال، کدنویسی، توانایی‌های عاملی و همسویی با انسان نیز از خط لوله‌های یادگیری تقویتی (RL) استفاده شده است.

پنجره زمینه مدل ۵۲۴٬۲۸۸ توکن است، در حالی که بیشتر مدل‌های متن‌باز چینی اکنون از یک میلیون توکن پشتیبانی می‌کنند. حداکثر خروجی آن نیز ۲۶۲٬۱۴۴ توکن است.

LE-CHONK-2.jpg

نتایج بنچمارک‌ها

مدل جدید میسترال از نظر مشخصات فنی از رقبای چینی و آمریکایی عقب‌تر است. پنجره زمینه (Context Window) ورودی این مدل ۵۲۴٬۲۸۸ توکن است در حالی که اکثر مدل‌های پیشرفته امروزی حداقل ۱ میلیون توکن ورودی را برای تولید پاسخ‌ها در نظر می‌گیرند. حداکثر طول خروجی این مدل نیز نیز ۲۶۲٬۱۴۴ توکن گزارش شده است.

LE-CHONK-2.jpg

به گزارش ونچربیت، مدل Mistral Large 4 در بنچمارک «DeepSWE v1.1» که عملکرد در وظایف مهندسی نرم‌افزار بلندمدت را می‌سنجد، امتیاز ۶۲ درصد گرفته و از GLM-5.3 جلو زده است.

مؤسسه Artificial Analysis به  این مدل در شاخص هوشمندی خود امتیاز ۳۸ داده و آن را «هوشمندترین مدل خارج از آمریکا و چین» خوانده است. در شاخص امنیت سایبری این مؤسسه، مدل Mistral Large 4 امتیاز ۵۰ گرفته است که با GLM-5.3-Flash برابر است.

LE-CHONK-2.jpg

تنها بنچمارکی که مدل جدید اروپایی‌ها در آن واقعاً پیشتاز است، «Harvey's Legal Agent» است که عملکرد مدل‌ها را در وظایف قضایی و حقوقی می‌سنجد.

قیمت Mistral Large 4

میسترال Large 4 به هیچ وجه مدل ارزانی نیست. این مدل برای هر یک میلیون توکن ورودی ۱٫۳۶ دلار و برای هر یک میلیون توکن خروجی ۴٫۱۸ دلار قیمت دارد. توکن‌های ورودی کش شده نیز ۰٫۱۴ دلار به ازای هر یک میلیون توکن هزینه دارند.

نظر خود را اضافه کنید.

ارسال نظر بدون عضویت در سایت

0
نظر شما پس از تایید مدیر منتشر خواهد شد.
  • هیچ نظری یافت نشد

ورود به شهرسخت‌افزار

ثبت نام در شهر سخت افزار
ورود به شهر سخت افزار

ثبت نام در شهر سخت افزار

نام و نام خانوادگی(*)
لطفا نام خود را وارد کنید

ایمیل(*)
لطفا ایمیل خود را به درستی وارد کنید

رمز عبور(*)
لطفا رمز عبور خود را وارد کنید

شماره موبایل
Invalid Input

جزو کدام دسته از اشخاص هستید؟(*)

لطفا یکی از موارد را انتخاب کنید