Содержание
  1. Что такое LLM и по каким критериям их сравнивают
  2. Сравнительная таблица топовых LLM 2026 года
  3. Сильные стороны каждой модели
  4. Слабые стороны и ограничения каждой модели
  5. Что такое context window и как размер контекста влияет на выбор
  6. Сравнение локальных LLM: что запускается на своём железе
  7. Локальные vs облачные LLM: приватность, стоимость, производительность
  8. Бенчмарки и метрики оценки LLM: MMLU, HumanEval, LMSYS Arena
  9. Стоимость использования: цена за токены, подписки и скрытые расходы
  10. Скорость и latency моделей: токены в секунду и время отклика
  11. Как выбрать LLM под задачу: код, тексты, анализ, мультимодальность
  12. Конец монополии: почему в 2026 нет одной лучшей модели
  13. Частые вопросы
Подборки и сравнения

Сравнение LLM: как выбрать модель в 2026

26 сентября 2026 · 19 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 26 сентября 2026 года; цитаты источников приведены дословно. Обновлено: сентябрь 2026.

Сравнение LLM в 2026 году сводится к четырём осям: параметры и архитектура, размер контекстного окна, скорость и стоимость. Единого победителя нет — под каждую задачу выигрывает своя модель. Ниже — критерии, таблицы, бенчмарки и порядок выбора. Мы скачали топ-10 Яндекса по запросу «сравнение llm»: текст отдали 10 из 10.

Что такое LLM и по каким критериям их сравнивают

LLM — языковая модель, обученная предсказывать следующий токен на огромном корпусе текста. Сравнивать их принято по нескольким независимым измерениям, и путать эти измерения нельзя: модель, выигравшая в одном, часто проигрывает в другом.

Первый критерий — число параметров. В обзоре локальных моделей на AI Arte расшифровывают: «B» означает «миллиард», то есть 7B = 7 миллиардов, 70B = 70 миллиардов параметров. Размеры в актуальных линейках идут «от 0.8B до 2.4T (MoE), есть варианты для программирования». MoE — mixture of experts: активны не все параметры сразу, а лишь часть на каждом шаге.

Второй критерий — контекстное окно. В сводке Cloud.ru приводят ориентир: «32 тысячи токенов хватит для короткого диалога, а для анализа договора или базы знаний понадобится уже 128–256 тысяч». Третий критерий — скорость: токены в секунду и задержка до первого токена (TTFT). Четвёртый — стоимость, и здесь важно различать цену за миллион токенов и цену за решённую задачу.

Пятый критерий — лицензия. В обзоре Arte указывают: «Apache 2.0 / MIT — разрешительные; собственные лицензии могут ограничивать масштаб, использование или требовать указания авторства». Шестой — происхождение и размещение: от него зависит соответствие требованиям 152-ФЗ о локализации персональных данных.

Отдельно стоит архитектурный признак — reasoning. На лидерборде Artificial Analysis отмечено, что Claude Opus 5.5 лидирует «among 151 reasoning models with an Intelligence Index score of 58». Reasoning-модели тратят дополнительные токены на рассуждение, что повышает качество и стоимость одновременно.

Практический вывод: перед сравнением зафиксируйте, какие критерии для вашей задачи критичны, и только потом смотрите на цифры. Модель с лучшим индексом интеллекта может оказаться непригодной по цене или по лицензии.

Сравнительная таблица топовых LLM 2026 года

Ниже — сводка по публичным прайсам и метрикам из обзоров. Цены за миллион токенов входа и выхода приведены по данным vc.ru (проверка на 28.05.2026) и kt-team.ru (проверка на 22.09.2026).

Модель Input $/1M Output $/1M Контекст Источник
GPT-5.5 $5.00 $30.00 1.05M vc.ru
GPT-5.4 $2.50 $15.00 200K (1M beta) vc.ru
Claude Opus 4.7 $5.00 $25.00 1M vc.ru
Claude Sonnet 4.6 $3.00 $15.00 1M vc.ru
Gemini 3 Pro $2.00 / $4.00 $12.00 / $18.00 1M vc.ru
DeepSeek V3.2 $0.28 $0.42 128K vc.ru
Qwen 3.6 Plus $0.325 $1.95 1M vc.ru

По более свежей проверке kt-team.ru от 22.09.2026: «Claude Opus 5.5 (22 сентября) снизила и сам токен: $4 и $20 за миллион входа и выхода против $5 и $25 у Opus 5». Там же: «GPT-6 Astra (3 сентября) стоит те же $10 и $50, даёт контекст 1,05 млн токенов при выходе до 128 тысяч».

Российские модели в таблицу прайсов попадают иначе. GigaChat 3.5 Ultra — «не новый тариф API, а open-weight 432B-модель под MIT: её считать через self-host/TCO, а не через строку ₽650 за 1М токенов». Облачные российские LLM «закрывают 152-ФЗ нативно и принимают оплату в рублях».

По лидерборду Artificial Analysis: «Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) currently ranks #1 on the Artificial Analysis LLM Leaderboard with an Intelligence Index score of 58, out of 172 models ranked». Открытые веса там же: «MiMo-V2.6-Pro is the highest-ranked open weights model with an Intelligence Index score of 46», а всего «There are 70 open weights models out of 172 total on the leaderboard».

Сильные стороны каждой модели

Сильные стороны удобнее разбирать по дисциплинам, потому что универсального лидера нет.

Claude Opus 4.5 — первая модель, пробившая планку на агентных задачах в коде: «первую модель, пробившую планку 80% на SWE-bench Verified (80.9%)». В обзоре на Хабре уточняют масштаб: «Реальные баги из реальных репозиториев — и модель фиксит 4 из 5».

Gemini 3 Pro — научное рассуждение и длинный контекст: «91.9% на GPQA Diamond (научное рассуждение), контекст в миллион токенов». В блоге Karpov.Courses добавляют: «может анализировать документы размером с целую библиотеку».

Kimi-K2-Thinking — открытая модель с рекордным размером: на Хабре её называют «первая open-source модель с триллионом параметров». Её метрики там же: «84.5% на GPQA Diamond, 71.3% на SWE-bench». Для сравнения: «GPT-4o показывает ~53% на GPQA Diamond», и «Kimi-K2 — open-source модель — опережает его на 30+ процентных пунктов».

DeepSeek-R1 — математика: «DeepSeek-R1 с 97.3% на MATH-500 — абсолютный рекорд», при этом «DeepSeek-R1 под MIT-лицензией».

Qwen3-Coder-30B-A3B — экономика: на Хабре её называют «лучшее соотношение цена/качество». GigaChat 3.5 Ultra — российский on-premise: в обзоре AZONE-AI указано «MoE на 432 млрд параметров, из которых на каждом шаге активны лишь 28 млрд».

YandexGPT 5.1 Pro — текст на русском: «одна из наиболее сильных отечественных моделей для задач, связанных с текстом», и «Версия 5.1 Pro заметно снизила частоту галлюцинаций и лучше следует системным промптам».

Слабые стороны и ограничения каждой модели

Ограничения делятся на три класса: качество, лимиты и деньги.

Галлюцинации и интерпретация бенчмарков. В обзоре azoneai.ru предупреждают: «Когда вендор заявляет „превосходит GPT-4.1 в 56% случаев“ — это результат на конкретной выборке». На Хабре ту же мысль показывают на цифре: «модель показывает 86.59% на HumanEval+ — по цифрам класно, но не понятно как интерпретировать».

Лимиты контекста. В Cloud.ru фиксируют ловушку: «При окне в 128 тысяч токенов такая цепочка быстро упирается в лимит и теряет начальные инструкции». Там же: «контекстное окно в 128 тысяч токенов ограничивает работу с длинными документами».

Лимиты запросов. В Cloud.ru для своего API указывают: «Лимит стандартный: 20 запросов в секунду на один API-ключ».

Цена. Премиум-тарифы бьют по бюджету агентских сценариев: у GPT-5.5 в обзоре vc.ru отмечают «Цена выросла до 5$/30$ — это премиум-tier». Для Claude Fable 5.1 прайс в kt-team.ru — «$10 и $50 за миллион токенов входа и выхода».

Рассинхрон ожиданий. Отдельную ловушку у открытых весов отмечают в AZONE-AI: «open-weights 3.5 Ultra и то, что доступно по API, это разные модели». В сложной аналитике там же — «облачная Pro может уступать YandexGPT 5.1 Pro».

Размер для домашнего железа. DeepSeek V4 не влезает в бытовой ПК: «даже самая маленькая модель, V4.1 Flash (сентябрь 2026 года), — это MoE на 552B параметров».

Доступность. В kt-team.ru отмечают по Fable 5: «анонс 09.06.2026 подтверждён, но обновление от 12.06.2026 сообщает об ограничении доступа».

Что такое context window и как размер контекста влияет на выбор

Context window — максимальное число токенов, которое модель удерживает в одном запросе: системный промпт, историю диалога, документы и будущий ответ вместе. Всё, что не влезло, отбрасывается или уходит в отдельный механизм памяти.

Ориентиры по задачам из Cloud.ru: «32 тысячи токенов хватит для короткого диалога, а для анализа договора или базы знаний понадобится уже 128–256 тысяч». Для регулярной работы с длинными файлами «лучше подходят модели с окном от 128 тысяч токенов».

Размер окна влияет на выбор через три механизма. Первый — усечение инструкций: при переполнении модель теряет начало промпта. Второй — стоимость: чем больше контекст, тем больше входных токенов в каждом запросе. Третий — качество поиска внутри контекста: у разных моделей оно разное, и в vc.ru отмечают, что «качество в long-context retrieval (Needle In A Haystack) у Sonnet традиционно стабильнее».

Тиры по контексту в 2026 году выглядят так: 32K — короткие диалоги; 128K — рабочий минимум для документов; 200K — верхняя граница для части моделей; 1M и выше — библиотеки и большие кодовые базы. По лидерборду Artificial Analysis, «Llama 4 Scout and Grok 4.20 0309 support the largest context windows».

Практическое правило: считайте не средний, а пиковый размер запроса. Если раз в день вы подаёте договор на 200 тысяч токенов, окно в 128K не подойдёт, даже если остальные 99% запросов короткие.

Сравнение локальных LLM: что запускается на своём железе

Локальный запуск упирается в VRAM. В обзоре Arte дают три оси выбора: «① Размер (потолок, который влезает в ваш VRAM ) = ограничение круга кандидатов», «② Сценарий (общий, программирование, ваш язык, рассуждения) = какая линейка подходит», «③ Страна происхождения / разработчик».

Семейство Размеры Лицензия Примечание
Qwen3.8 27B Apache 2.0 август 2026
Qwen3.5 0.8B–9B — малые модели
Gemma 4 E2B / E4B / 12B / 26B A4B / 31B Apache 2.0 E2B и E4B — для смартфонов и ноутбуков, от 12B — для видеокарт
Muse Glimmer 30B Apache 2.0 понимает изображения
Ministral 3 3B / 8B / 14B Apache 2.0 локальный запуск
GigaChat Lightning 10B лицензию уточнять у поставщика локальный запуск
DeepSeek V4.1 Flash 552B (MoE) MIT не для домашнего ПК

Про Muse Glimmer от Meta в обзоре Arte пишут: «Версия с 4-битным квантованием занимает около 17 ГБ и, по данным Meta, помещается в видеокарту на 24 ГБ». Для слабого железа там же про Phi: «Легко запускается на слабых ПК/ноутбуках класса 8 ГБ — идеально для старта».

Крупные модели требуют серверных карт. Cloud.ru предлагает «видеокарты Nvidia V100, A100 и H100 — с разным соотношением цены и производительности». Про GigaChat 3.5 Ultra в обзоре AZONE-AI пишут: «MoE на 432 млрд параметров, из которых на каждом шаге активны лишь 28 млрд», и там же — «компактная Lightning на 10 млрд для локального запуска».

Порядок действий при выборе локальной модели: определите доступный VRAM, отбросьте всё, что не влезает в квантизации Q4, выберите линейку под сценарий, проверьте лицензию на коммерческое использование, прогоните 50 своих запросов. Методика из Cloud.ru: «Команда собирает 50 реальных запросов из своего сценария: обращений в поддержку, черновиков документов, задач кодогенерации».

Локальные vs облачные LLM: приватность, стоимость, производительность

Три измерения расходятся между собой, и выбор всегда компромисс.

Приватность. Локальный запуск даёт полный контроль: в Karpov.Courses локальную модель оценивают как «★★★★★ (полный контроль)». Облако оставляет данные у провайдера: там же — «★★ (данные у провайдера)». В Cloud.ru описывают выигрыш от контура: «Так снижается риск утечки и упрощается соответствие 152-ФЗ о хранении данных на территории России».

Стоимость владения. Порог окупаемости назван на Хабре: «Self-hosted имеет смысл при >50K запросов/месяц ИЛИ при жёстких требованиях к приватности». Экономию от локального запуска в Karpov.Courses описывают как возможность «снизить стоимость в 10-100 раз». Но у GigaChat 3.5 Ultra нет опубликованного API-прайса, поэтому в kt-team.ru её «считаем в on-prem/TCO-контуре, а не как $/день API».

Производительность. Облако даёт доступ к флагманам без закупки железа. Локально потолок задаёт VRAM: модель на 552B параметров в бытовую карту не поместится. При этом разрыв в качестве сократился: по сводной таблице Хабра, «Разрыв между closed и open — всего 7%».

Скорость. По лидерборду Artificial Analysis облачные модели показывают высокий throughput: «Celeris-1 is the fastest at 1,628.3 tokens per second». Локальный запуск на слабой карте даёт заметно меньше, зато без сетевой задержки.

Практический вывод: если запросов меньше 50 тысяч в месяц и нет требований к приватности, облако дешевле и проще. Если данные чувствительны или объём запросов большой, локальный контур окупается.

Бенчмарки и метрики оценки LLM: MMLU, HumanEval, LMSYS Arena

Бенчмарк — стандартизированный тест, дающий сопоставимое число. Трактовка важнее самого числа. MMLU-Pro в сводной таблице Хабра стоит отдельной колонкой рядом с GPQA, HumanEval+, SWE-bench и MATH-500: это знания и рассуждение по школьным и университетским дисциплинам.

GPQA Diamond — научное рассуждение уровня аспирантуры. Ориентиры: Gemini 3 Pro — «91.9% на GPQA Diamond», Kimi-K2 — «84.5%», GPT-4o — «~53%».

SWE-bench Verified — исправление реальных багов из репозиториев. В обзоре Хабра у Claude Opus 4.5 указано 80.9%, у Kimi-K2 — 71.3% на SWE-bench. По обзору vc.ru, Claude Sonnet 4.6 показал 79.6%, а Claude Opus 4.7 набирает 87.6% на SWE-Bench Verified.

MATH-500 — математика от школьной алгебры до university-level. DeepSeek-R1 — «97.3% на MATH-500 — абсолютный рекорд».

HumanEval+ — генерация кода с нуля. Результат «86.59% на HumanEval+ означает, что для генерации кода с нуля он превосходит GPT-4o и Claude 3.5 Sonnet образца 2024 года».

LMSYS Arena — слепые парные сравнения людьми. ERNIE 5.0 «за неделю попадает в топ-15 Vision Arena на LMArena, сравниваясь с Claude Sonnet 4 и GPT-5-high».

Intelligence Index от Artificial Analysis — агрегат: первое место у Claude Opus 5.5 со score 58, всего в рейтинге 172 модели.

Как трактовать: смотрите на дату замера. В Cloud.ru прямо предупреждают: «Результат указывается в баллах из 100 с датой замера, поскольку модели обновляются и позиции в рейтинге меняются». В thecode.media добавляют про задержку публикаций: «независимые прогоны cost-per-task выходят с задержкой в один-два релиза относительно анонсов». И главное: «бенчмарк не равен вашему проекту» — 50 своих запросов информативнее любого рейтинга.

Стоимость использования: цена за токены, подписки и скрытые расходы

Цена за миллион токенов — только верхний слой. В kt-team.ru формулируют точно: «Цена за 1 млн токенов — это unit cost, а не стоимость задачи».

Разброс прайсов широк. По thecode.media: «Цена стоимости API начинается от $0,14 за 1M у DeepSeek V4‑Flash и доходит до $10 у Claude Fable 5». Для выходных токенов «разброс шире, от $0,28 до $50 за 1M».

Скрытые расходы делятся на четыре группы.

Reasoning-токены. Модели рассуждения тратят токены на внутренние шаги, и они тарифицируются.

Кэш контекста. У Anthropic «чтение из кэша стоит примерно 0,1 от базовой цены входа, а запись в кэш — 1,25 базовой ставки». У Kimi K3 «кэшированный вход стоит $0,30 вместо $3». Эффект на агента: «разница между $40 и $6 в день».

Повторные попытки. Дешёвая модель может проиграть по итогу: «на многофайловом рефакторинге модель попадает в цель примерно с пятой попытки, поэтому задача обходится в $0,33». А дорогая «закрывает вопрос в среднем с 1,3 попытки, значит, задача стоит $0,78».

Время разработчика. Решающий фактор: «Двадцать минут его времени при ставке $30 в час стоят $10 — в двадцать раз больше, чем вся экономия на токенах».

Формула базового расчёта из kt-team.ru: «база = 1M · P_in + 0,5M · P_out». Колонка «с переделками» = база × (1 + коэффициент): «даже дешёвая модель с высоким процентом переделок может проиграть по стоимости результата».

Отдельно про подписки: в Karpov.Courses в строке Gemini 3 Pro указывают «есть разные тарифы, до $125, а также есть бесплатная версия с ограничениями». Для командного бюджета ориентир из thecode.media: «Десять запросов в день от одного разработчика превращаются в $37,5, а за месяц на пятерых — в $3900».

Скорость и latency моделей: токены в секунду и время отклика

Скорость измеряют двумя метриками: output speed (токены в секунду) и latency (TTFT — время до первого токена). На лидерборде Artificial Analysis обе вынесены в отдельные колонки.

Рекорды по скорости: «Celeris-1 is the fastest at 1,628.3 tokens per second, followed by Mercury 2.5 (843.0 t/s) and Mercury 2 (772.3 t/s)». По списку лидеров: «Celeris-1 and Mercury 2.5 are the fastest models, followed by Mercury 2 and Gemini 2.5 Flash-Lite».

По задержке: «Gemini 2.5 Flash-Lite (Non-reasoning) and North Mini Code are the lowest latency models, followed by Command A+ and Gemini 2.5 Flash (Non-reasoning)».

Что это значит на практике. Для чат-бота важен TTFT: пользователь ждёт первый символ. Для пакетной обработки важнее throughput: сколько токенов модель выдаёт в секунду на длинной генерации. Для агента критичны оба: он делает много коротких вызовов подряд.

Reasoning-модели медленнее по определению: они тратят время на внутренние рассуждения перед ответом. Модели без reasoning из того же семейства отвечают быстрее, и в лидерборде они отмечены отдельно — «Non-reasoning».

Скорость связана с ценой через архитектуру: MoE-модели активируют часть параметров на каждом шаге, что повышает throughput. В kt-team.ru про GigaChat 3.5 Ultra отмечают «меньший KV-cache, прирост throughput под нагрузкой и ускорение greedy decoding за счёт MTP».

Практический порядок: замерьте TTFT и throughput на своём сценарии. Сеть, регион и загрузка провайдера меняют цифры сильнее, чем разница между моделями.

Как выбрать LLM под задачу: код, тексты, анализ, мультимодальность

Выбор идёт от задачи. Ниже — раскладка по сценариям.

Код. Флагманы: Claude Opus 4.5 с 80.9% на SWE-bench Verified и Claude Opus 4.7 с 87.6% там же. Средний сегмент: Sonnet 4.6 — «79.6% на SWE-Bench Verified — это в пределах 8 пунктов от Opus 4.7 (87.6%), но при цене 3$/15$ за миллион input/output токенов против 5$/25$». Бюджетный: DeepSeek V4-Flash — «$0,14/$0,28». Для фронтенда: Kimi K3 — «Фронтенд и UI, лучшая цена в сегменте».

Тексты на русском. YandexGPT 5.1 Pro — «одна из наиболее сильных отечественных моделей для задач, связанных с текстом». GigaChat — «хорошее понимание контекста».

Анализ данных и длинные документы. Gemini 3 Pro с контекстом в миллион токенов; для RAG — модели «с контекстом от 128 тысяч токенов и поддержкой function calling».

Мультимодальность. ERNIE 5.0 — «нативно омни-модальную модель». Qwen3-VL-235B-A22B-Thinking — «VLM с поддержкой визуальных агентов и GUI-автоматизации». GPT-6 Astra прибавила в работе с интерфейсами: «72,6% на офлайн-подмножестве OSWorld 2.0 против 65,7% у предыдущей версии».

Агенты и вызов инструментов. Нужны длинный контекст и function calling. Для агента «сравнивать нужно не строку „цена за 1М токенов“, а стоимость повторного чтения контекста».

Закрытый контур. Российские облачные LLM «закрывают 152-ФЗ нативно и принимают оплату в рублях». Локально — GigaChat 3.5 Ultra под MIT или открытые модели Mistral для контура компании.

Порядок действий: соберите 50 реальных запросов, прогоните через 3–4 кандидата, посчитайте стоимость решённой задачи, проверьте лицензию и размещение, оставьте одну основную модель и одну резервную. Маршрутизация задач между моделями экономит бюджет: дешёвая модель на рутину, дорогая на сложное.

Конец монополии: почему в 2026 нет одной лучшей модели

В ноябре 2025 года произошёл сдвиг, который изменил расклад. На Хабре его описывают так: «Ноябрь 2025 — месяц, когда open-source модели официально догнали проприетарные». До этого «Open-source модели „подавали надежды“, но стабильно отставали на 15-20% по ключевым бенчмаркам».

Хронология релизов из того же обзора: «13 ноября — Baidu анонсирует ERNIE 5.0» и «18 ноября — Google выкатывает Gemini 3 Pro». Затем «19 ноября — Сбер отвечает релизом GigaChat3-702B под MIT-лицензией»: открытые веса GigaChat под свободной лицензией. Замыкает месяц «24 ноября — Anthropic представляет Claude Opus 4.5». Параллельно «Kimi-K2-Thinking от Moonshot AI — первая open-source модель с триллионом параметров», а Alibaba выпускает Qwen3-VL.

Итог по разрыву: «Разрыв между closed и open — всего 7%». На Хабре формулируют вывод прямо: «Если вы до сих пор считаете, что open-source — это „почти как GPT-4, но похуже“ — пора обновить картину мира».

Что это значит для выбора. Во-первых, лидер меняется каждые несколько недель: за один ноябрь вышло четыре значимых релиза. Во-вторых, лидерборд Artificial Analysis показывает 172 модели, из них 70 с открытыми весами. В-третьих, разные модели выигрывают в разных дисциплинах: Claude — в коде, Gemini — в науке и контексте, DeepSeek — в математике и цене, GigaChat — в российском контуре.

Практический вывод: держите абстракцию над моделью. Если ваш код не привязан к одному API, замена флагмана — это смена строки конфигурации. Именно поэтому в 2026 сравнивают не «лучшую модель», а набор моделей под набор задач.

Частые вопросы

Какая LLM модель лучшая в 2026 году?

Единого лидера нет. По Intelligence Index лидерборда Artificial Analysis первое место занимает Claude Opus 5.5 со score 58 из 172 моделей. По научному рассуждению впереди Gemini 3 Pro с 91.9% на GPQA Diamond, по математике — DeepSeek-R1 с 97.3% на MATH-500. Выбор зависит от задачи, бюджета и требований к размещению данных.

Сколько стоит использование LLM в месяц?

Считайте не цену токена, а стоимость решённой задачи. Разброс прайсов — от $0,14 за миллион входных токенов у DeepSeek V4-Flash до $10 у Claude Fable 5. Для команды из пяти разработчиков при десяти запросах в день ориентир из thecode.media — $3900 в месяц. Кэш контекста снижает реальную стоимость в разы.

Какие локальные LLM запускаются на своём железе?

На слабых ПК в классе VRAM 8–12 ГБ работают Qwen3.5 9B, Ministral 3 8B/14B и Gemma 4 12B. Muse Glimmer на 30B в 4-битном квантовании занимает около 17 ГБ и помещается в карту на 24 ГБ. GigaChat Lightning на 10 млрд параметров предназначена для локального запуска. DeepSeek V4.1 Flash с 552B параметров для домашнего ПК не подходит.

Что такое context window и зачем он нужен?

Это максимальное число токенов в одном запросе: промпт, история, документы и ответ. Для короткого диалога хватает 32 тысяч токенов, для анализа договора или базы знаний нужно 128–256 тысяч. При переполнении модель теряет начальные инструкции, поэтому считайте пиковый размер запроса.

Локальная LLM или облачная — что выбрать?

Локальный запуск даёт полный контроль над данными и снижает стоимость в 10–100 раз при больших объёмах. Облако проще в старте и даёт доступ к флагманам без закупки железа. Порог окупаемости self-hosted по данным Хабра — больше 50 тысяч запросов в месяц или жёсткие требования к приватности.

Если вы только начинаете разбираться с инструментами вокруг моделей, посмотрите разбор Unsloth для дообучения и гайд по JSON для работы с API-ответами. Для сравнения приложений вокруг ИИ пригодится подборка аналогов Face App, а для понимания транспорта запросов — разница HTTP и HTTPS.

Читайте также

3 материала