04. 🌐 Ландшафт моделей
Рынок LLM устроен как два параллельных мира. В одном — несколько больших лабораторий, которые делают закрытые модели-флагманы и продают к ним доступ через API. В другом — открытое сообщество и китайские лаборатории, которые публикуют веса моделей, которые можно запустить у себя. Руководителю важно знать обоих, потому что выбор между ними — это прежде всего вопрос данных, денег и юрисдикции, а не «какая умнее».
Дисклеймер о ценах и версиях
Конкретные версии моделей и расценки меняются каждые несколько месяцев. Ниже — структура рынка и порядок величин. Перед закупкой всегда сверяйтесь с актуальным прайсом провайдера и свежими бенчмарками.
Закрытые (проприетарные) модели
Доступ — только через API владельца. Вы не видите «внутренности» и не можете запустить модель на своём сервере. Взамен — лучший на момент выхода уровень качества, простая интеграция и никакого ухода за «железом».
| Семейство | Владелец | Позиционирование |
|---|---|---|
| GPT | OpenAI | Де-факто отраслевой стандарт, огромная экосистема инструментов |
| Claude | Anthropic | Сильное рассуждение, длинный контекст, акцент на безопасность |
| Gemini | Глубокая интеграция с экосистемой Google, мультимодальность |
Иерархия внутри семейства
Каждое семейство — это линейка: флагман (дорого, умно, медленнее), средняя модель (баланс) и компактная/быстрая (дёшево, для массовых операций). Большая часть экономии в проекте рождается тем, что массовые задачи отправляют на компактные модели, а сложные — на флагман. См. 05-vybor-modeli и 06-stoimost-i-ekonomika.
Открытые модели (open-weights)
Веса публикуются — модель можно скачать и запустить в собственном контуре. Качество верхушек открытых моделей уже сопоставимо с закрытыми предыдущего поколения.
| Семейство | Создатель | Зачем смотреть |
|---|---|---|
| Llama | Meta | Самое известное западное открытое семейство, большая экосистема |
| Qwen | Alibaba | Сильные модели, хорошее следование инструкциям, мультимодальность |
| DeepSeek | DeepSeek | Сильное рассуждение, экономная архитектура (MoE) |
| GLM (ChatGLM) | Zhipu | Китайский флагман, есть русскоязычная адаптация |
| Mistral / Mixtral | Mistral AI | Европейские открытые модели, компактные и эффективные |
«Открытые» ≠ «бесплатные для коммерции»
Лицензии открытых моделей разные: некоторые разрешают коммерческое использование без ограничений, другие — только до определённого оборота или требуют отдельных условий. Всегда проверяйте лицензию конкретной версии, прежде чем встраивать модель в продукт.
Российский контекст
Для российских компаний актуальны два слоя:
- Доступ к глобальным моделям через посредников — российские и международные API-агрегаторы, которые проксируют запросы к GPT/Claude/Gemini и принимают оплату в рублях. Удобно, но данные проходят через третьих лиц — см. 15-compliance-i-bezopasnost.
- Российские модели и платформы — собственные LLM крупных игроков и облачные сервисы inference. Подходят, когда требуется держать данные в юрисдикции РФ или работать с госклиентом.
Типичное enterprise-решение
Чувствительные данные (контракты, персональные данные, коммерческая тайна) обрабатываются открытой моделью в собственном контуре. Нечувствительные массовые задачи (черновики, summaries) — через дешёвый облачный API. Это даёт одновременно экономию и контроль.
Как читать бенчмарки руководителю
Бенчмарк — стандартизированный тест качества модели. Самые часто встречающиеся:
| Бенчмарк | Что измеряет |
|---|---|
| MMLU / MMLU-Pro | Широта академических знаний |
| GPQA | Уровень «кандидат наук» в науке |
| HumanEval | Способность писать код |
| MATH / AIME | Сложные математические задачи |
| MUSR | Многошаговое рассуждение |
Четыре ловушки бенчмарков
- Бенчмарк ≠ ваш кейс. Модель, первая на MMLU, не обязательно лучше суммирует ваши договоры. Единственный надёжный тест — ваша собственная eval-выборка.
- Переобучение под бенчмарки. Лаборатории целевым образом «подтягивают» модели под известные тесты; цифры могут быть завышены.
- Дроби пятыми знаками. Разница между 82.1% и 82.4% на MMLU на практике неразличима. Смотрите на кластеры, а не на десятые доли.
- Качество ≠ цена/скорость. Модель может быть умнее, но дороже в 10 раз и медленнее в 3. Решение — это всегда компромисс.
quadrantChart title Модели: ум ←→ дёшево, быстро (схематично, не карта точных цен) x-axis "Дешевле/быстрее" --> "Дороже/медленнее" y-axis "Скромнее" --> "Умнее" quadrant-1 "Флагманы (GPT/Claude/Gemini top)" quadrant-2 "Открытые флагманы (DeepSeek/Qwen top)" quadrant-3 "Компактные открытые (Llama small, Qwen small)" quadrant-4 "Компактные закрытые (GPT-mini, Claude Haiku, Gemini Flash)"
Главный вопрос не «какая умнее», а
«какая достаточно умна для моей задачи при приемлемой цене, скорости и допустимом уровне контроля данных». Об этом целиком — 05-vybor-modeli.
📌 Что запомнить
- Два мира: закрытые модели через API (GPT, Claude, Gemini) и открытые веса (Llama, Qwen, DeepSeek, GLM, Mistral).
- Внутри семейства всегда линейка: флагман / средняя / компактная — экономика рождается в маршрутизации между ними.
- Открытые модели можно держать в своём контуре, но проверяйте лицензию и закладывайте затраты на «железо».
- Бенчмарки — ориентир, а не приговор; реальный критерий — ваша eval-выборка.
Дальше: 🎯 Выбор модели под задачу → — конкретный алгоритм выбора: критерии, trade-off, таблица «когда что».