Компания Mistral AI, базирующаяся в Париже, представила свою новейшую языковую модель Mistral Large 2, которая призвана конкурировать с ведущими моделями искусственного интеллекта от таких гигантов, как OpenAI и Meta. Эта модель, содержащая 123 миллиарда параметров, демонстрирует впечатляющие возможности в области рассуждений, обработки знаний и программирования.
Ключевые особенности Mistral Large 2
Размер и производительность
Mistral Large 2 имеет 123 миллиарда параметров, что делает ее значительно меньше по сравнению с некоторыми конкурентами, такими как Llama 3 405B от Meta. Несмотря на это, модель показывает сопоставимую или даже превосходящую производительность в ряде задач.
Многоязычность
Модель поддерживает десятки языков, включая английский, французский, немецкий, испанский, итальянский, китайский, японский, корейский, португальский, арабский, хинди и русский.
Программирование
Mistral Large 2 обучена работе с более чем 80 языками программирования, включая Python, Java, C, C++, JavaScript и Bash.
Контекстное окно
Модель имеет контекстное окно размером 128 000 токенов, что позволяет ей обрабатывать очень длинные входные данные (эквивалент примерно 300-страничной книги).
Производительность и сравнение с конкурентами
Mistral AI утверждает, что Large 2 превосходит модели, такие как GPT-4o, Claude 3 Opus и Llama 3 405B, в ряде задач:
- Генерация кода: На бенчмарках HumanEval и MultiPL-E модель показывает результаты, превосходящие Llama 3.1 405B и лишь немного уступающие GPT-4.
- Математика: На бенчмарке MATH (без использования цепочки рассуждений) Mistral Large 2 занимает второе место после GPT-4o.
- Многоязычность: На бенчмарке Multilingual MMLU модель превосходит Llama 3.1 70B в среднем на 6,3% по девяти языкам и показывает результаты на уровне Llama 3 405B.
Особенности обучения и применения
Mistral AI уделила особое внимание нескольким аспектам при разработке Large 2:
- Минимизация галлюцинаций: Модель обучена быть более осторожной и точной в своих ответах, признавая, когда она чего-то не знает, вместо того чтобы выдумывать правдоподобные, но неверные ответы.
- Эффективность вычислений: Несмотря на большой размер, модель разработана для вывода на одном узле, что оптимизирует пропускную способность для приложений с длинным контекстом.
- Инструкции и диалоги: Large 2 обучена эффективно следовать инструкциям и вести длительные многоходовые разговоры.
- Открытость: Mistral AI выпустила веса инструктированной модели на платформе HuggingFace для исследовательских целей.
Доступность и применение
Mistral Large 2 доступна через несколько платформ:
- La Plateforme от Mistral AI
- Google Vertex AI
- Amazon Bedrock
- Azure AI Studio
- IBM watsonx.ai
Модель также можно протестировать бесплатно на le Chat, конкуренте ChatGPT от Mistral AI.
Заключение
Выпуск Mistral Large 2 знаменует собой значительный шаг вперед в развитии открытых языковых моделей. Сочетание высокой производительности, многоязычности и эффективности делает эту модель серьезным конкурентом для ведущих проприетарных решений. По мере того как конкуренция в сфере ИИ продолжает усиливаться, инновации Mistral AI в области эффективности и инференса на одном узле могут оказать существенное влияние на будущее развитие и применение крупномасштабных языковых моделей.




