🏁 Рейтинг LLM: Состояние на Июль 2026

Главный инсайт июля

Рынок разделился на три яруса: (1) сверхдорогие флагманы с агентным reasoning (Fable 5, Opus 4.8, GPT-5.5), (2) open-weight модели, догнавшие облачных середняков, и (3) ультра-компактные MoE/1-bit модели для edge. Главный технологический прорыв квартала — MTP (Multi-Token Prediction), ускоряющий локальный инференс в 2–3 раза.


🥇 Титаны (Проприетарные / Облачные)

Верхушка айсберга. Цены — подписка $20/мес, если не указано иное.

МестоМодельИндекс (AA)Ключевое преимуществоНюанс
1Claude Fable 5 (Anthropic)60Абсолютный лидер по интеллекту. Агентные задачи, сложный код, multi-step reasoning.Отозван 12 июня по экспортному контролю США. Работает только через fallback.
2Claude Opus 4.8 (Anthropic)56Лучший публично доступный: кодинг, творческое письмо, «человечность». Thinking-режим — #2 в Agent Arena.$20/мес (Pro). Thinking даёт +5 п.п. к качеству на сложных задачах.
3GPT-5.5 (OpenAI)55xHigh-режим: рекордсмен по следованию инструкциям. Ultra mode с sub-agents.GPT-5.6 (Sol) анонсирован 26 июня, но только для ~20 government-approved партнёров.
4Claude Sonnet 5 (Anthropic)53Идеальный баланс скорость/качество. Thinking — #6 в Agent Arena.Основная рабочая лошадка для продакшена.
5GLM-5.2 (Z.ai)51Китайский флагман. #9 в Agent Arena. Силён в reasoning и математике.Max-режим конкурирует с GPT-5.5 high.
6Gemini 3.5 Flash (Google)50Контекст 1M+ токенов. Лучшее соотношение цена/качество среди проприетарных.Бесплатный tier через AI Studio.
7Gemini 3.1 Pro Preview (Google)46Мультимодальность (видео, аудио, изображения). Контекст 2M.Промпт >200K — двойной тариф.
8Qwen3.7 Max (Alibaba)46Сильнейшая не-американская облачная модель.Закрытая, через API Alibaba Cloud.
9DeepSeek V4 Pro (DeepSeek)44Почти уровень GPT-5.5, но в 10 раз дешевле. MoE: 37B активных из 671B.Лучший API для бюджета.
10Kimi K2.6 / K2.7 Code (Moonshot)44 / 42Специалист по коду и reasoning. K2.7 — улучшенная код-версия.Бесплатный доступ через kimi.moonshot.cn.

🥈 Атланты (Открытые / Локальные)

Модели с открытыми весами. Можно запустить на своём железе. Главный тренд: MoE-архитектуры с малым числом активных параметров.

Топ-уровень (24 GB VRAM: RTX 3090/4090/5090)

МодельПараметрыКвантVRAMTok/sСпециализация
Qwen 3.6 27B27B denseQ5_K_M~18 GB~27Лучший универсал. Код, reasoning, 119 языков. MTP даёт до 40 tok/s.
Gemma 4 31B31B denseQAT q4_0~18 GB~25Мультимодальность (vision+text), сильный код, Google-экосистема.
DeepSeek V4 Flash284B (13B act. MoE)Q4~20 GB~28Near-frontier reasoning по цене домашнего ПК.
Gemma 4 26B-A4B26B (4B act. MoE)Q4_K_M~17 GB~46Рекордная эффективность: качество 26B при скорости 4B.
Llama 4 Maverick400B (17B act. MoE)Q4~22 GB~20Самая широкая экосистема. Если плагин работает с локальным ИИ — он работает с Llama.

Средний уровень (12–16 GB VRAM: RTX 4070/5070, 4060 Ti 16GB)

МодельПараметрыКвантVRAMСпециализация
Qwen 3.5 14B14B denseQ4_K_M~9 GBСильный reasoning, tool calling.
Gemma 4 12B12B denseQAT 4-bit~6.5 GBСбалансированное качество и скорость.
Ministral 3 14B14B denseQ4_K_M~8 GBMistral-качество, Apache 2.0.
Mellum2-12B-A2.5B12B (2.5B act. MoE)Q4_K_M~8 GBСпециалист по коду от JetBrains.

Лёгкий уровень (8 GB VRAM и меньше)

МодельПараметрыКвантVRAMСпециализация
Qwen 3.5 9B9B denseQ4_K_M~6 GBКомпактный универсал.
Llama 3.1 8B8B denseQ4_K_M~5 GBШирокая совместимость, стабильный.
Gemma 4 E2B~5B (2B act. MoE)Q4~3 GBМультимодальность на edge.
Phi-4 Mini3.8B denseQ4~2.5 GBМатематика, reasoning в минимальном размере.

Apple Silicon (Mac)

МодельVRAMБэкендTok/sОсобенность
Gemma 4 E4B16GB+GGUF Q5_K_P24.5Лучший агент на Mac.
Qwen 3.5 9B16GB+GGUF Q6_K13.5Dense reasoning.
Gemma 4 26B-A4B32GB+GGUF Q4_K_M46MoE-зверь, 4B активных.
Qwen 3.6 27B MTP32GB+AX Engine 6-bit40MTP даёт 2.2× ускорение.
Bonsai-4B8GB+MLX 1-bit60–1360.6 GB, работает на iPhone.

🛠 Специализированный софт (Must-have, июль 2026)

  • Для кода: Claude Opus 4.8 (сложный), Claude Sonnet 5 (повседневный), Qwen 3.6 27B (локально).
  • Для текстов и писем: Claude Opus 4.8 — недосягаем по «литературности» и стилю.
  • Для поиска и фактчекинга: Perplexity + Gemini 3.1 Pro (контекст 2M).
  • Для базы знаний: Ollama + Qwen 3.6 27B или Gemma 4 26B + плагин Smart Connections.
  • Для Apple Silicon: AX Engine с MTP-пакетами (Gemma 4, Qwen 3.6) — прирост скорости 2–3×.
  • Для iPhone / Edge: Bonsai-4B (1-bit, 0.6 GB) — 60 tok/s на iPhone 17 Pro Max.

📉 Тренды квартала (Апрель → Июль 2026)

  1. MoE везде: Mixture of Experts стала стандартом для открытых моделей. DeepSeek V4 (13B/284B), Gemma 4 (4B/26B), Llama 4 (17B/400B) — все используют MoE. Активные параметры важнее тотальных.

  2. MTP-революция: Multi-Token Prediction даёт 2–3× ускорение декодинга на Apple Silicon (AX Engine, MTPLX). Qwen 3.6 27B с MTP обходит «голый» Llama 4 Maverick по скорости.

  3. Регуляция frontier-моделей: GPT-5.6 ограничен government-approved партнёрами. Claude Fable 5 отозван по экспортному контролю. Правительства стали главным гейткипером SOTA.

  4. 1-bit модели: Bonsai-4B (0.6 GB) доказывает: квантование может быть экстремальным. Качество падает, но для простых задач — приемлемо.

  5. Thinking-режимы как стандарт: Opus 4.8 Thinking, Sonnet 5 Thinking, GPT-5.5 xHigh — все флагманы ожидают, что ты включишь «думание». Разрыв reasoning/non-reasoning достиг 5–15 п.п.

  6. J-space (Anthropic, июль 2026): Обнаружено скрытое «пространство мышления» в нейросетях Claude — модель думает о концепциях, не записывая их в chain-of-thought.


🔗 Связанные концепции


📊 Источники