04. 🌐 Ландшафт моделей

Рынок LLM устроен как два параллельных мира. В одном — несколько больших лабораторий, которые делают закрытые модели-флагманы и продают к ним доступ через API. В другом — открытое сообщество и китайские лаборатории, которые публикуют веса моделей, которые можно запустить у себя. Руководителю важно знать обоих, потому что выбор между ними — это прежде всего вопрос данных, денег и юрисдикции, а не «какая умнее».

Дисклеймер о ценах и версиях

Конкретные версии моделей и расценки меняются каждые несколько месяцев. Ниже — структура рынка и порядок величин. Перед закупкой всегда сверяйтесь с актуальным прайсом провайдера и свежими бенчмарками.


Закрытые (проприетарные) модели

Доступ — только через API владельца. Вы не видите «внутренности» и не можете запустить модель на своём сервере. Взамен — лучший на момент выхода уровень качества, простая интеграция и никакого ухода за «железом».

СемействоВладелецПозиционирование
GPTOpenAIДе-факто отраслевой стандарт, огромная экосистема инструментов
ClaudeAnthropicСильное рассуждение, длинный контекст, акцент на безопасность
GeminiGoogleГлубокая интеграция с экосистемой Google, мультимодальность

Иерархия внутри семейства

Каждое семейство — это линейка: флагман (дорого, умно, медленнее), средняя модель (баланс) и компактная/быстрая (дёшево, для массовых операций). Большая часть экономии в проекте рождается тем, что массовые задачи отправляют на компактные модели, а сложные — на флагман. См. 05-vybor-modeli и 06-stoimost-i-ekonomika.

Открытые модели (open-weights)

Веса публикуются — модель можно скачать и запустить в собственном контуре. Качество верхушек открытых моделей уже сопоставимо с закрытыми предыдущего поколения.

СемействоСоздательЗачем смотреть
LlamaMetaСамое известное западное открытое семейство, большая экосистема
QwenAlibabaСильные модели, хорошее следование инструкциям, мультимодальность
DeepSeekDeepSeekСильное рассуждение, экономная архитектура (MoE)
GLM (ChatGLM)ZhipuКитайский флагман, есть русскоязычная адаптация
Mistral / MixtralMistral AIЕвропейские открытые модели, компактные и эффективные

«Открытые» ≠ «бесплатные для коммерции»

Лицензии открытых моделей разные: некоторые разрешают коммерческое использование без ограничений, другие — только до определённого оборота или требуют отдельных условий. Всегда проверяйте лицензию конкретной версии, прежде чем встраивать модель в продукт.

Российский контекст

Для российских компаний актуальны два слоя:

  • Доступ к глобальным моделям через посредников — российские и международные API-агрегаторы, которые проксируют запросы к GPT/Claude/Gemini и принимают оплату в рублях. Удобно, но данные проходят через третьих лиц — см. 15-compliance-i-bezopasnost.
  • Российские модели и платформы — собственные LLM крупных игроков и облачные сервисы inference. Подходят, когда требуется держать данные в юрисдикции РФ или работать с госклиентом.

Типичное enterprise-решение

Чувствительные данные (контракты, персональные данные, коммерческая тайна) обрабатываются открытой моделью в собственном контуре. Нечувствительные массовые задачи (черновики, summaries) — через дешёвый облачный API. Это даёт одновременно экономию и контроль.

Как читать бенчмарки руководителю

Бенчмарк — стандартизированный тест качества модели. Самые часто встречающиеся:

БенчмаркЧто измеряет
MMLU / MMLU-ProШирота академических знаний
GPQAУровень «кандидат наук» в науке
HumanEvalСпособность писать код
MATH / AIMEСложные математические задачи
MUSRМногошаговое рассуждение

Четыре ловушки бенчмарков

  1. Бенчмарк ≠ ваш кейс. Модель, первая на MMLU, не обязательно лучше суммирует ваши договоры. Единственный надёжный тест — ваша собственная eval-выборка.
  2. Переобучение под бенчмарки. Лаборатории целевым образом «подтягивают» модели под известные тесты; цифры могут быть завышены.
  3. Дроби пятыми знаками. Разница между 82.1% и 82.4% на MMLU на практике неразличима. Смотрите на кластеры, а не на десятые доли.
  4. Качество ≠ цена/скорость. Модель может быть умнее, но дороже в 10 раз и медленнее в 3. Решение — это всегда компромисс.
quadrantChart
    title Модели: ум ←→ дёшево, быстро (схематично, не карта точных цен)
    x-axis "Дешевле/быстрее" --> "Дороже/медленнее"
    y-axis "Скромнее" --> "Умнее"
    quadrant-1 "Флагманы (GPT/Claude/Gemini top)"
    quadrant-2 "Открытые флагманы (DeepSeek/Qwen top)"
    quadrant-3 "Компактные открытые (Llama small, Qwen small)"
    quadrant-4 "Компактные закрытые (GPT-mini, Claude Haiku, Gemini Flash)"

Главный вопрос не «какая умнее», а

«какая достаточно умна для моей задачи при приемлемой цене, скорости и допустимом уровне контроля данных». Об этом целиком — 05-vybor-modeli.


📌 Что запомнить

  • Два мира: закрытые модели через API (GPT, Claude, Gemini) и открытые веса (Llama, Qwen, DeepSeek, GLM, Mistral).
  • Внутри семейства всегда линейка: флагман / средняя / компактная — экономика рождается в маршрутизации между ними.
  • Открытые модели можно держать в своём контуре, но проверяйте лицензию и закладывайте затраты на «железо».
  • Бенчмарки — ориентир, а не приговор; реальный критерий — ваша eval-выборка.

Дальше: 🎯 Выбор модели под задачу → — конкретный алгоритм выбора: критерии, trade-off, таблица «когда что».