شرکت فرانسوی Mistral با معرفی Mistral Large 4، یکی از بزرگترین مدلهای زبانی خود را وارد رقابت مدلهای پیشرفته هوش مصنوعی کرده است. این مدل بر اساس ارزیابیهای مستقل، توانمندترین مدل توسعه داده شده خارج از آمریکا و چین است، اما در بیشتر معیارها از رقبا عقب میماند.
شرکهای چینی و آمریکایی بازیگران اصلی صنعت هوش مصنوعی هستند که اغلب از دو فلسفه متضاد پیروی میکنند. در حالی که قویترین مدلهای آمریکایی اغلب از نوع وزنبسته هستند و دیگران از نحوه کارکرد آنها اطلاع کمی دارند، بسیاری از مدلهای چینی، معماری و وزنهای خود را آشکارا در اختیار عموم قرار میدهند.
حال شرکت اروپایی Mistral نیز جدیدترین مدل هوش مصنوعی خود به نام Mistral Large 4 را به صورت کاملاً متنباز و وزنباز منتشر کرده است.

معماری مدل Mistral Large 4
مدل جدید از معماری Sparse Mixture of Experts استفاده میکند. بنابراین با وجود داشتن ۱ ۱ تریلیون پارامتر، در پردازش هر توکن فقط ۴۹ میلیارد پارامتر مربوطه به همان توکن فعال میشود. بنابراین مدل عمق استدلال یک مدل تریلیون پارامتری را با هزینه محاسباتی بسیار کمتر ارائه میدهد.
این مدل همزمان ورودی متنی و تصویری را پردازش میکند و میتواند مختصات و اشیای مشخص را در تصاویر پیچیده، مانند عکسهای هوایی و ماهوارهای، شناسایی کند. لایههای Attention آن برای پشتیبانی بومی از بیش از ۱۶۰ زبان، از جمله همه زبانهای رسمی اتحادیه اروپا، بهینه شدهاند.
شرکت Mistral میگوید Large 4برای گردشکارهای Agentic چندساعته مناسب است و برخلاف مدلهای بستهای که درخواستهای مرتبط با امنیت سایبری را در بیشتر موارد رد میکنند، این مدل سیاستگذاری انعطافپذیرتری دارد و میتواند بدافزارها را تحلیل کند، آسیبپذیریها را بازتولید کند و وصله امنیتی ارائه دهد.
آموزش روی سرورهای اروپایی
این شرکت اعلام کرده برای آموزش مدل از صفر، ۴ هزار پردازنده گرافیکی Blackwell را دو ماه در سرورهای اروپایی به کار گرفته است. برای تقویت استدلال، کدنویسی، تواناییهای عاملی و همسویی با انسان نیز از خط لولههای یادگیری تقویتی (RL) استفاده شده است.
پنجره زمینه مدل ۵۲۴٬۲۸۸ توکن است، در حالی که بیشتر مدلهای متنباز چینی اکنون از یک میلیون توکن پشتیبانی میکنند. حداکثر خروجی آن نیز ۲۶۲٬۱۴۴ توکن است.

نتایج بنچمارکها
مدل جدید میسترال از نظر مشخصات فنی از رقبای چینی و آمریکایی عقبتر است. پنجره زمینه (Context Window) ورودی این مدل ۵۲۴٬۲۸۸ توکن است در حالی که اکثر مدلهای پیشرفته امروزی حداقل ۱ میلیون توکن ورودی را برای تولید پاسخها در نظر میگیرند. حداکثر طول خروجی این مدل نیز نیز ۲۶۲٬۱۴۴ توکن گزارش شده است.

به گزارش ونچربیت، مدل Mistral Large 4 در بنچمارک «DeepSWE v1.1» که عملکرد در وظایف مهندسی نرمافزار بلندمدت را میسنجد، امتیاز ۶۲ درصد گرفته و از GLM-5.3 جلو زده است.
مؤسسه Artificial Analysis به این مدل در شاخص هوشمندی خود امتیاز ۳۸ داده و آن را «هوشمندترین مدل خارج از آمریکا و چین» خوانده است. در شاخص امنیت سایبری این مؤسسه، مدل Mistral Large 4 امتیاز ۵۰ گرفته است که با GLM-5.3-Flash برابر است.

تنها بنچمارکی که مدل جدید اروپاییها در آن واقعاً پیشتاز است، «Harvey's Legal Agent» است که عملکرد مدلها را در وظایف قضایی و حقوقی میسنجد.
قیمت Mistral Large 4
میسترال Large 4 به هیچ وجه مدل ارزانی نیست. این مدل برای هر یک میلیون توکن ورودی ۱٫۳۶ دلار و برای هر یک میلیون توکن خروجی ۴٫۱۸ دلار قیمت دارد. توکنهای ورودی کش شده نیز ۰٫۱۴ دلار به ازای هر یک میلیون توکن هزینه دارند.













نظر خود را اضافه کنید.
برای ارسال نظر وارد شوید
ارسال نظر بدون عضویت در سایت