Давай поговорим о разных БЯМ
Этот текст — пожалуй, краткая памятка или сводка личных впечатлений от использования разных БЯМ (Больших Языковых Моделей, уж очень мне нравится эта аббревиатура). С какими-то из перечисленных я работал больше, с какими-то — только попробовал несколькими запросами. Но если брать любую SOTA (State Of The Art) опцию на сегодняшний день, то решающим фактором будут мультимодальность (способность обрабатывать не только текст) и субъективный опыт использования. Я не претендую ни на каплю объективности — просто делюсь наблюдениями. По уровню интеллекта на ежедневных задачах вы, скорее всего, не заметите большой разницы — все они «достаточно» хороши.
Вопрос цен упущен намеренно.
Локальные модели
Начать, как ни странно, я хочу с моделей, которые уже сейчас можно запустить на личном ПК, ноутбуке или даже телефоне. И сразу сделаю оговорку: на данный момент это скорее развлечение, чем действительно практически полезный инструмент. Лично я ничего сложнее базового перевода и составления кратких выжимок таким моделям не смог поручить, а если действительно нужна приватность — лучше поискать облачного провайдера с соответствующей политикой обработки данных. Пользы от этого будет больше.
Нет, не подумайте, они отнюдь не глупые, но… Они недостаточно умные.
Qwen 3.6 (Alibaba, Китай)
Серия моделей Qwen 3.6 — лидер рейтингов на сегодняшний день среди конкурентов. И мои общие впечатления это скорее подтверждают: умнее на данный момент среди моделей такого размера ничего не найти. Единственная особенность: имеет тенденцию слишком много думать, если включить этот режим. В остальном — отличная серия. Заточена на техническую часть чуть больше, чем на гуманитарную.
Gemma 4 (Google, США)
Серия Gemma 4 — хорошая альтернатива Qwen, если нужны не сырые технические знания, а креатив и в целом работа с текстом. Здесь особенно выделяются различные модификации от сообщества, которые специально заточены писать стилистически хорошо. Gemma4 26B A4B — пожалуй, лучшее из того, что имеет смысл запускать локально, в то время как Gemma4 31B — просто невероятна для своего размера, но уже «на грани» по требованиям к железу.
Облачные модели
Или то, что ты не запустишь у себя ну никак.
GPT (OpenAI, США)
Мне не нравится пятая серия. Нет, это безусловно умные модели, но они… Они ведут себя странно. Мне не нравится с ними работать. И если в чате это будто бы заметно меньше, то при работе с кодом всё становится просто отвратительно. Эта модель как будто имеет лёгкий аутизм — ты не понимаешь, как с ней адекватно взаимодействовать. Это чувствуется как постоянная борьба. Если с другими моделями всё просто: ты либо плохо описал задачу, либо модель недостаточно умная, то здесь всё иначе. Ты знаешь, что модель МОЖЕТ решить задачу — она достаточно способна для этого, но её просто «ведёт» по какой-то ей одной понятной траектории. И это дико раздражает. Даже не типичные GPT-змы из серии абсурдных галлюцинаций, бесконечных извинений или поддакиваний, а полное непонимание того, как заставить её делать то, что я хочу, и так, как я хочу, а не то, что ей самой взбредёт в голову чип.
Последний случай, после которого я плюнул и принял решение не пользоваться GPT до выхода новой серии, — на мой вопрос «Как мне это исправить?» модель тихо взяла и пошла самовольно вносить правки. Не «Конечно, вот мой план…» и автоматически начала изменения. Не «Вот что я предлагаю, хотите, чтобы я это реализовал?». А просто тупо пошла переписывать файлы без какого-либо согласования, потому что ей так захотелось, и даже не предупредила об этом.
Можно сказать, что это я плохо управлял контекстом. Что не сменил режим с «build» на «plan». Но мне сложно представить хоть одну конкурирующую модель, которая бы так себя повела. Ведь если бы я хотел правок на месте, я бы вместо вопроса сказал просто «Исправь», не так ли?
Claude (Anthropic, США)
Пожалуй, главный их козырь в том, что они магическим образом «угадывают», чего я от них хочу. Это те модели, в которых я могу меньше всего стараться при составлении запроса. Даже если промпт сырой, Claude как минимум даст мне хорошую стартовую точку.
Отличные модели.
Kimi K2.6 (Moonshot AI, Китай)
Claude от мира моделей с открытыми весами. Если бы мне предложили выбрать одну открытую модель для всего, я бы выбрал Kimi. Отличный all-rounder с поддержкой распознавания изображений, что есть отнюдь не во всех SOTA моделях с открытыми весами. Из минусов: для конкретных задач есть более эффективные модели и 262k токенов контекста. На практике для меня это не было ограничением, но стоит иметь в виду. Мы постепенно переходим на тот уровень, где 1M контекста — стандарт.
Minimax M3 (Minimax, Китай)
Не впечатлён, хотя заявляется как лидер рынка. Плюс лицензия у этой модели тоже не полностью открытая.
Mistral Small 4 (Mistral, Франция)
Единственный игрок от Евросоюза в подборке. И мне нравится, правда нравится то, что они делают. Хорошие модели, Vibe (в прошлом — Le Chat), стиль общения — как ни у кого другого. Минимум воды. Это та самая БЯМ, которая на прямой вопрос «Можешь ли ты…?» ответит не «Отличный вопрос! Я — большая языковая модель, и в меня заложены многие функции. Вот с чем я могу тебе помочь…», а тупо «Да». Одним словом.
Но… Они отстают. Безбожно отстают от рынка. И если общее мнение сходится на том, что передовые китайские модели отстают от американских где-то на полгода, то Mistral, похоже, на все два. Это, вероятно, оправдывается в разы (если не в десятки раз) более скудными ресурсами по сравнению с лидерами рынка, но оправдывать их использование в условиях настолько высокой конкуренции очень сложно.
Gemini 3.5 Flash-Lite (Google, США)
Мусор. Точнее, не то чтобы всё было прям настолько плохо, но ощущение, что модель слишком маленькая и должна быть скорее в разделе Gemma, а не Gemini.
Gemini 3.5 Flash (Google, США)
Если вы варитесь в экосистеме Google или просто не хотите заводить ещё один аккаунт, то это отличная опция. Мой go-to вариант для брейншторма, поиска, ресёрча и просто запросов. Пожалуй, лучшая на рынке мультимодальность (аудио, видео, картинки, текст — всё пережуёт).
Из особенностей:
- В приложении Gemini явно склонен поддакивать и вообще всячески пестрит GPT-змами ранних лет. Впрочем, в отличие от непосредственно GPT, меня это не сильно бесит, и у меня уже выработалась некоторая slopота, если вы понимаете, о чём я :)
- Хороших отзывов об этой модели при работе с кодом я не видел, хотя, как ни странно, в дизайн и визуал она умеет.
- Чтобы отказаться от тренировки моделей на ваших диалогах, нужно либо отключить историю действий в приложении Gemini (что урезает функционал до дискомфортного), либо купить подписку Google Workspace для бизнеса (не Google One!).
Gemini 3.1 Pro (Google, США)
Всё то же, что я сказал о Gemini 3.5 Flash, применимо и здесь, за тем лишь исключением, что Gemini 3.5 Flash лучше думает, а Gemini 3.1 Pro ЗНАЕТ. Это, видимо, самая насыщенная знаниями модель на сегодняшний день, так что если задача касается именно сопоставления узких фактов — тебе сюда. Отдельный нюанс: жрёт лимиты, так что для серьёзной работы без подписки никак.
DeepSeek V4 Flash / DeepSeek V4 Pro (DeepSeek, Китай)
Gemini от мира моделей с открытыми весами, но без мультимодальности — только работа с текстом. Отличен в чате, вторая модель после Mistral, от которой не веет ИИ при разговоре. Очень нравится именно в чате. Для кода — так себе, хотя статистика показывает, что народу зашло.
Mimo V2.5 / Mimo V2.5 Pro (Xiaomi, Китай)
Внезапно, Xiaomi делает свои модели, и очень хорошие модели — прямые конкуренты DeepSeek. Почти идентичные характеристики, цена, способности… На бумаге. На практике же лично мой опыт следующий: замечательные модели для написания кода низшего/среднего звена и очень так себе в других задачах.
При работе с кодом они ощущаются лучше DeepSeek — меньше думают, более направлены. Но вот при общении (во всяком случае, на неанглийских языках) я уж лучше выберу Qwen — он хотя бы не плюётся иероглифами в случайных местах.
GLM 5.2 (Z.ai, Китай)
Лучшее из открытых моделей для работы с кодом. В остальном — хз.
Nemotron (Nvidia, США)
Не впечатлён.
Qwen (Alibaba, Китай)
Не впечатлён.
Grok (xAI, США)
Версия 4.1 была довольно хороша для работы с креативным текстом, особенно учитывая низкую цензуру. Однако всё, что вышло после, а именно версии 4.2 и 4.3, я воспринял как даунгрейд. Илон явно пытается запрыгнуть в мейнстримный поезд по уровню знаний, мышления и агентских возможностей, но пока не получается.