Лучшие модели для кодинга в сентябре 2026

Лучшие модели для кодинга в сентябре 2026

Содержание

Open source стал глобальным, а не только китайским

Ещё год назад обзор моделей для кодинга сводился к простому вопросу: какая китайская модель ближе всего подобралась к Claude и GPT. В сентябре 2026 года картина сложнее и интереснее. Пять китайских моделей — Kimi K3, Qwen3.8 Max, DeepSeek 4.1 Flash, GLM-5.3 и MiniMax M3 — действительно выдерживают сравнение с закрытыми флагманами, причём у всех есть скачиваемые веса. Но к ним добавились новые западные игроки, которые меняют расстановку: Google выпустила Gemma 4 под Apache 2.0, OpenAI открыла GPT-OSS 120B, Mistral сделала ставку на Devstral 2, а Xiaomi неожиданно ворвалась в топ с MiMo-V2.6.

Artificial Analysis в начале сентября констатировала: open source догнал закрытые модели, и большинство значимых открытых весов теперь носят китайское имя. Однако западные лаборатории не сдались — они перешли от закрытых флагманов к открытым специализированным моделям. Разница по сравнению с прошлым годом не в отдельном бенчмарке, а в том, что сегодня можно установить на свой сервер модель, решающую три четверти задач SWE-bench Verified без подписки. Причём выбрать можно не только из китайских вариантов.

Рейтинг open-weight моделей для кодинга: сентябрь 2026

Вот сводная картина с общим индексом на агентной основе и ключевыми параметрами. Индекс усредняет рассуждение, вызов инструментов и длинные задачи. Для чистого кодинга важнее колонка SWE-bench Verified.

Сравнительный анализ архитектур и лицензионной чистоты современных LLM

Глобальный срез кодинг-моделей по метрике SWE-bench Verified (данные на сентябрь 2026 г.)

Сравнительный анализ архитектур и лицензионной чистоты современных LLM

Глобальный срез кодинг-моделей по метрике SWE-bench Verified (данные на сентябрь 2026 г.)

Модель Лаборатория SWE-bench Verified Лицензия Где сильна
Восточноазиатский регион (Китай)
🇨🇳Kimi K3 Moonshot AI ~76.8–80% 🔒 Проприетарная (Kimi K3 License) Фронтенд, длинные агентные задачи
🇨🇳Qwen3.8 Max Alibaba ~85.6% 🔒 Проприетарная (Qwen3.8-Max License) Огромный контекст, локальное использование
🇨🇳GLM-5.3 Zhipu (Z.ai) ~89.6% (Flash) 🔒 Проприетарная (GLM-5.3 License) Агенты на репозиториях, терминал
🇨🇳DeepSeek 4.1 Flash DeepSeek ~80.6–83.7% (Pro) MIT Соотношение цена-качество
🇨🇳MiniMax M3 MiniMax ~80.5% 🔒 Проприетарная (MiniMax Community) Вызов инструментов, контекст 1M
🇨🇳MiMo-V2.6-Pro Xiaomi ~72.6% (DeepSWE) MIT AA Index 46 — топ открытых
Западный регион (США / Европа)
🇺🇸Gemma 4 26B A4B Google ~61.2% Apache 2.0 Локальный запуск, эффективность
🇺🇸Llama 4 Maverick ___ ~35–70.4%* Llama 4 Community Мультимодальность, экосистема
🇫🇷Mistral Large 3 Mistral AI ~73% Apache 2.0 Европейская юрисдикция, MoE 675B
🇺🇸GPT-OSS 120B OpenAI ~62.4% Apache 2.0 Доступность, цена
🇫🇷Devstral 2 Mistral AI ~72.2% Modified MIT Агентный кодинг, эффективность
🇨🇦North Mini Code Cohere ~67.6% Apache 2.0 Малый размер, терминал

*Оценки Llama 4 Maverick сильно разнятся в зависимости от методики тестирования.

Предупреждение. Разрыв между лидерами составляет более двадцати пунктов, но на конкретном языке или на вашем реальном коде порядок может перевернуться. Модель, сильная на фронтенде React, может застрять на рефакторинге пятнадцати тысяч строк Rust. Топовое место в бенчмарке говорит лишь о потенциале LLM, но не гарантирует, что она решит именно вашу рабочую задачу

Лучшие модели для кодинга в сентябре 2026

Китайские флагманы: что изменилось с прошлого года

Kimi K3: лидер фронтенда с оговорками

Kimi K3 от Moonshot AI остаётся китайской моделью на вершине общих рейтингов. Архитектура MoE на 2,8 триллиона параметров (104 миллиарда активных). Это первая модель с открытыми весами, возглавившая Frontend Code Arena, обойдя даже Claude Fable 5.

Однако ключевое изменение — лицензия. Moonshot отказалась от «modified MIT» и выпустила K3 под собственной проприетарной лицензией, требующей отдельного соглашения для «Model as a Service» бизнесов с выручкой свыше $20 млн. Веса публичны, но лицензия не одобрена OSI. На SWE-bench Verified K3 держится около 76.8%.

Обратная сторона — размеры. Модель требует серьёзного железа или API. Kimi K3 — выбор тех, кто хочет максимум и располагает мощностями.

Qwen3.8 Max: гигант Alibaba и смена лицензионного курса

Alibaba выпустила Qwen3.8 Max с 2,4 триллиона параметров (95 миллиардов активных) и SWE-bench Verified на уровне 85.6%. Но главное изменение — лицензия. Вместо привычной Apache 2.0 Alibaba перешла на собственный Qwen3.8-Max License с ограничениями: компании с выручкой свыше $50 млн в сфере MaaS или AI-ассистентов должны делиться выручкой. Это серьёзный отход от прежней политики.

Для программистов, которым важна свобода лицензии, Alibaba сохранила Qwen3-Coder-Next — MoE на 80 миллиардов (3 миллиарда активных), достигающий 70.6% на SWE-bench Verified и запускающийся на машине с 46 ГБ унифицированной памяти.

GLM-5.3: агент для больших репозиториев

Zhipu (Z.ai) построила GLM-5.3 для агентной работы. На той же базе, что GLM-5.2, модель набрала лишние полпроцента только за счёт post-training. На SWE-bench Verified Flash-вариант достигает 89.6% при стоимости около $0.02 за задачу.

Лицензия изменилась: вместо MIT Zhipu выпустила GLM-5.3 под собственным лицензионным соглашением, требующим безопасности ревью от Z.ai для компаний с выручкой свыше $10 млрд. Для большинства разработчиков это не критично, но крупные облачные провайдеры теперь под особым контролем.

GLM-5.3 хороша для агентной работы на больших кодовых базах — выдерживает долгие сессии и вызывает инструменты с точностью, которая год назад была территорией платных моделей.

DeepSeek 4.1 Flash: цена-качество остаётся оружием

DeepSeek V4.1 Flash — 748 миллиардов параметров, теперь с поддержкой изображений. Общий индекс 63.7, но в чистом кодинге модель играет в другой категории. На DeepSWE v1.1 DeepSeek V4.1 Flash набирает 74.2, обходя Claude Opus 5 (74.0) и GPT-5.6 Sol (73.0).

Лицензия — MIT, цена через API остаётся настоящим оружием: около $0.14 за миллион входных токенов и $0.28 за выходные. DeepSeek также стоит за DeepSeek Harness, инструментом командной строки с более чем 200 тысячами звёзд на GitHub, обойдя Claude Code и Codex.

MiniMax M3: контекст в миллион токенов

MiniMax M3 замыкает пятёрку китайских лидеров, но её козырь — окно контекста в миллион токенов, достаточное для целого микросервиса вместе с документацией. На SWE-bench Verified M3 достигает 80.5%. Лучше всего проявляет себя в вызове инструментов — оркестрации обращений к внешним инструментам, базам данных, API.

Лицензия — MiniMax Community License, не Apache и не MIT, с условиями по коммерческому использованию и атрибуции.

MiMo-V2.6: неожиданный лидер из Сяоми

Xiaomi выпустила MiMo-V2.6-Pro и Flash в сентябре 2026 года, и Pro мгновенно возглавила рейтинг открытых моделей по Artificial Analysis Intelligence Index с 46 баллами, обойдя Kimi K3 (44) и GLM-5.3 (45). На DeepSWE v1.1 Pro набирает 71.9–72.57 балла, приближаясь к DeepSeek V4.1 Flash.

Обе модели выпущены под MIT лицензией без ограничений по выручке. MiMo-V2.6-Pro стоит $0.435 за миллион входных токенов и $0.87 за выходные; Flash — $0.14 и $0.28 соответственно. Это редкий случай, когда новая лаборатория сразу предлагает конкурентоспособную модель с самой свободной лицензией.

Западный ответ: новые open-weight модели

Gemma 4 26B A4B: Google делает правильный ход

Google выпустила Gemma 4 в апреле 2026 года под Apache 2.0 — самое значимое лицензионное решение года. Вместо прежней ограничительной лицензии, заставлявшей юридические отделы проверять каждое развёртывание, Gemma 4 получила стандартные Apache-условия без кастомных оговорок и ограничений на коммерческое использование.

Gemma 4 26B A4B — эффективная MoE-модель: 26 миллиардов общих параметров, 4 миллиарда активных. На LiveCodeBench v6 она набирает 77.1%, на SWE-bench Verified — около 61.2%. Это не топовый результат, но за Apache 2.0 и $0.13 за миллион входных токенов — отличное предложение для тех, кому нужна локальная модель для повседневных задач.

Ключевое преимущество Gemma 4 — запуск на локальной машине. Google спроектировала модель для работы на потребительском железе, и при квантизации до 4 бит она помещается в конфигурации высокого класса.

Llama 4 Maverick: наследие под давлением

Llama 4 Maverick остаётся в игре благодаря экосистеме и мультимодальности, но её позиции ослабли. Оценки SWE-bench Verified разнятся от 35% до 70.4% в зависимости от методики тестирования. Лицензия Llama 4 Community не является OSI-одобренной и ограничивает коммерческое использование компаниями с менее чем 700 миллионами месячных пользователей.

Разарботчики Llama пытались сдвинуть баланс с помощью новых версий, но китайские лаборатории довели эту стратегию до предела — раздают веса под Apache 2.0 и MIT, не накладывая таких ограничений. Llama 4 Maverick всё ещё полезна для мультимодальных задач, но в чистом кодинге она уступает и китайским лидерам, и новым западным специализированным моделям.

Mistral Large 3 и Devstral 2: европейский подход

Mistral AI выпустила целое семейство моделей под Apache 2.0 — шаг, который выделяет её среди западных лабораторий. Mistral Large 3 — MoE на 675 миллиардов параметров (41 миллиард активных), достигает около 73% на SWE-bench Verified. Это не топовый результат, но модель предлагает европейскую юрисдикцию и Apache 2.0 без оговорок.

Более интересна Devstral 2 — специализированная агентная модель на 123 миллиарда параметров с SWE-bench Verified 72.2%. Она требует всего 4 GPU H100 для развёртывания, что делает её одной из самых эффективных агентных моделей. Однако лицензия — modified MIT с ограничением: компании с выручкой свыше $20 млн в месяц не могут использовать её без коммерческого соглашения.

GPT-OSS 120B: OpenAI открывает веса

OpenAI выпустила GPT-OSS 120B под Apache 2.0 — редкий случай, когда лаборатория, известная закрытыми моделями, публикует открытые веса. Модель на 117 миллиардов параметров (5.1 миллиарда активных) набирает 62.4% на SWE-bench Verified.

Это не флагман, но при цене $0.15 за миллион входных токенов и $0.60 за выходные GPT-OSS 120B предлагает конкурентное соотношение цена-качество. Модель доступна через множество провайдеров, включая Cerebras, Together AI и Amazon Bedrock.

North Mini Code: маленькая, но эффективная

Cohere выпустила North Mini Code — 30 миллиардов общих параметров (3 миллиарда активных) под Apache 2.0. На SWE-bench Verified модель набирает 67.6%, на SWE-bench Pro — 40.2%. Это исключительная эффективность: модель с 3 миллиардами активных параметров конкурирует с моделями в 10–20 раз больше.

North Mini Code оптимизирована для терминальных задач и агентного кодинга. Она доступна бесплатно на Hugging Face и через OpenRouter, что делает её привлекательной для локального развёртывания на одной GPU H100.

Как выбрать подходящую модель

Рейтинг мало полезен, если не сопоставлять его с тем, что вам реально нужно делать. Три коротких вопроса — и ответ приходит сам.

Хотите максимум и у вас есть сервер или бюджет на API. Kimi K3 на фронтенде и длинных агентных задачах, Qwen3.8 Max для гигантского контекста и локального использования, GLM-5.3 для агентной работы на репозиториях. Эти модели держат планку против Claude и GPT без оговорок.

Нужно запустить на своём компьютере. Qwen3-Coder-Next на машине с 46 ГБ, Gemma 4 26B A4B при квантизации до 4 бит, либо North Mini Code на одной GPU. Полную картину локального запуска смотрите в отдельном руководстве.

Строите агента, работающего самостоятельно. GLM-5.3 для работы с целыми репозиториями и терминалом, MiniMax M3 когда нужен очень длинный контекст и вызов инструментов, Devstral 2 для эффективного агентного кодинга на 4 GPU.

Важна лицензия без ограничений. DeepSeek 4.1 Flash (MIT), MiMo-V2.6 (MIT), Gemma 4 (Apache 2.0), Mistral Large 3 (Apache 2.0), GPT-OSS 120B (Apache 2.0), North Mini Code (Apache 2.0). Избегайте Kimi K3, Qwen3.8 Max и GLM-5.3, если вы крупная компания — их лицензии содержат revenue gate.

Практический совет. Прежде чем привязываться к модели, возьмите три реальные задачи из своего проекта, из тех, что отнимают целый вечер, и опробуйте их на двух кандидатах. Бенчмарки измеряют среднее, а платите вы за свой конкретный случай. Полчаса ваших собственных тестов стоят больше, чем десять таблиц.

Сколько они стоят: API и локальный запуск

Прелесть open-weight моделей в том, что почти у всех есть два входа. С одной стороны платный API, который стоит недорого. С другой веса, доступные для бесплатного скачивания.

Стоимость API: цена за миллион токенов

Сравнение цен на входные и выходные токены для open-weight моделей (данные на сентябрь 2026 г.)

Модель Вход (за 1M токенов) Выход (за 1M токенов)
Бюджетный сегмент (до $0.20 за вход)
Gemma 4 26B $0.13 $0.40
DeepSeek 4.1 Flash $0.14–0.30 $0.28–1.20
MiMo-V2.6 Flash $0.14 $0.28
GPT-OSS 120B $0.15 $0.60
Средний сегмент ($0.20–$1.00 за вход)
MiniMax M3 $0.30 $1.20
Devstral 2 $0.40 $2.00
Mistral Large 3 $0.50 $1.50
Премиум-сегмент (свыше $1.00 за вход)
GLM-5.3 $1.40 $4.40
Qwen3.8 Max $2.00 $6.00
Kimi K3 $3.00 $15.00

Цены указаны для API-доступа и могут варьироваться в зависимости от провайдера, объёма и региона. Для локального развёртывания стоимость ограничивается только железом.

На локальном пути барьер — железо, а не лицензия. Если у вас достаточно мощная машина, попробовать Qwen, Gemma или North Mini Code локально — дело двух команд с Ollama:

Быстрый старт: локальный запуск через Ollama

bash — ollama

# скачать coder от Alibaba и открыть его в чате
➜ ~ ollama pull qwen3-coder
➜ ~ ollama run qwen3-coder

# или Gemma 4 от Google
➜ ~ ollama pull gemma4:26b

# или North Mini Code от Cohere
➜ ~ ollama pull north-mini-code
▸ Готово. Модель запущена локально, код не покидает вашу машину.

Замените qwen3-coder на любую другую модель из таблицы выше — синтаксис тот же.

Заметка о приватности. Запуск модели локально означает, ваш код никогда не покидает ваш компьютер. Для тех, кто работает над проектами, защищёнными соглашениями о конфиденциальности, одно это оправдывает выбор open source вместо облачного сервиса, независимо от экономии.

Лицензионный сдвиг: open-source модели становятся условно-бесплатными

Тревожный тренд 2026 года: крупные китайские лаборатории отказываются от по-настоящему свободных лицензий. Moonshot, Alibaba и Zhipu перешли на собственные коммерческие соглашения с ограничениями по выручке. Так, для коммерческого использования Kimi K3 в облачной инфраструктуре (MaaS) компаниям с доходом более $20 млн потребуется отдельный контракт. Для Qwen3.8 Max этот порог составляет $50 млн, а для GLM-5.3 — $10 млрд.

Западные же разработчики, напротив, выбирают максимальную открытость. Google перевела линейку Gemma 4 на свободную лицензию Apache 2.0. OpenAI выпустила GPT-OSS 120B под той же Apache 2.0. Mistral сохраняет её для своей Large 3, а Cohere — для North Mini Code. Даже Xiaomi пошла по этому пути, выпустив MiMo-V2.6 под максимально гибкой лицензией MIT.

Что это значит для разработчиков? Если вам важна юридическая безопасность и отсутствие скрытых условий, западные модели сейчас выглядят гораздо привлекательнее. Если же во главе угла стоит чистая производительность и вы готовы возиться с юридическими нюансами коммерческих лицензий, китайские флагманы по-прежнему удерживают лидерство.

Заключение

В сентябре 2026 года вопрос уже не в том, дотягивает ли open source до Claude в коде, а в том, какую модель выбрать из двух десятков достойных вариантов. Kimi K3 ради мощи, Qwen3.8 Max ради контекста, DeepSeek ради цены, GLM ради агентов, MiniMax ради длинного контекста, MiMo-V2.6 ради свободной лицензии. Из западных: Gemma 4 ради Apache 2.0, North Mini Code ради эффективности, Mistral Large 3 ради европейской юрисдикции, Devstral 2 ради агентного кодинга, GPT-OSS 120B ради доступности.

Рекомендуется выбрать модель, соответствующую вашему запросу, и протестировать её на нескольких практических кейсах. Оплачивать зарубежные сервисы стоит только под конкретные производственные нужды. Индустрия развивается лавинообразно, и каждый новый релиз меняет расстановку сил в таблице лидеров. Актуальность рейтингов краткосрочна: нейросеть, лидирующая сегодня, может потерять позиции уже через пару недель после очередного апдейта конкурентов