Содержание
  1. Что такое fine tuning и что именно меняется внутри модели
  2. Fine tuning, промпт и RAG: чем они отличаются и что брать первым
  3. Наш замер: короткий промпт, длинный промпт и дообучение на одной задаче
  4. Сколько стоит fine tuning: три счёта с адресами прайсов
  5. Где дообучать модель в сентябре 2026 года: OpenAI закрывает самообслуживание
  6. Какие данные нужны для fine tuning и почему таблица не подойдёт
  7. Методы дообучения: полное, LoRA и QLoRA
  8. Что ломается после дообучения
  9. Как проверить, что дообучение помогло
  10. Чек-лист: нужен ли вам fine tuning
  11. Частые вопросы
Справочник

Fine tuning: что это, когда нужен и сколько стоит

18 сентября 2026 · 14 минут чтения

Материал редакции Зерокодера. Модель дообучена и опрошена 17 сентября 2026 года; каждое число ниже снято этим прогоном или названным документом. Обновлено: сентябрь 2026.

Fine tuning (дообучение, тонкая настройка) — это дополнительное обучение уже готовой нейросети на небольшом наборе своих примеров, при котором меняются её веса. Что это даёт: модель запоминает нужную форму ответа насовсем и держит её без подсказок в запросе. Дообучение ставит поведение и формат; свежие факты в веса так не заводят, для них берут поиск по базе.

Главное:

  • Обучающие примеры складывают в JSONL — по объекту JSON на строку; минимум 10 примеров и у OpenAI, и у Yandex AI Studio.
  • Дорого стоит разметка: наш прогон на 60 заявках занял 13,1 секунды и 0,30 ₽ аренды видеокарты.
  • Прежде чем дообучать, стоит проверить развёрнутый промпт: на нашей задаче он дал такой же результат.
  • Самообслуживание OpenAI закрывается: новых не принимают с 7 мая 2026 года, действующие клиенты теряют право создавать задания 6 января 2027 года.

Что такое fine tuning и что именно меняется внутри модели

Fine tuning продолжает обучение готовой модели на своей выборке и обновляет числовые коэффициенты внутри сети. Обучение с нуля собирает их из терабайтов текста на кластере видеокарт — Cloud4box называет для Llama 3 «24 000 мощных промышленных GPU» — и стоит бюджета корпорации; дообучение берёт готовый набор и сдвигает его на сотне примеров за минуты, у нас на одной игровой карте с пиком 6,12 ГБ видеопамяти. Меняются при этом матрицы линейных слоёв: проекции запроса q_proj, ключа k_proj, значения v_proj и выхода o_proj, плюс три слоя прямого прохода.

Мы дообучили Qwen2.5-1.5B-Instruct методом LoRA: обучаемыми оказались 18 464 768 параметров из 1 562 179 072, то есть 1,182 % модели. Результат лёг отдельным файлом-адаптером на 70,5 МБ (73 911 112 байт), базовые веса остались нетронутыми, адаптер подключается и отключается одной строкой кода.

Мини-вывод: дообучение меняет малую долю весов и живёт отдельным файлом — на одной базе держат несколько адаптеров.

Fine tuning, промпт и RAG: чем они отличаются и что брать первым

Три способа отличаются тем, где живёт инструкция. В промпте она едет с каждым запросом и оплачивается каждый раз. В RAG нужный кусок документа лежит в базе и попадает в запрос перед ответом. При дообучении инструкция уходит в веса и перестаёт занимать место в запросе.

Что нужно Промпт RAG Fine tuning
Жёсткий формат ответа держится через раз не решает закрепляется
Свой тон и лексика держится, пока правила едут в запросе не решает закрепляется в весах
Свежие цены и остатки не подходит подходит не подходит
Короткий запрос при массовом потоке длинный запрос длинный запрос короткий запрос

Документация Yandex AI Studio формулирует границу прямо: «Модели генерации текста не получится дообучить новой информации, например базе знаний службы поддержки» (aistudio.yandex.ru/ru/docs/ai-studio/concepts/tuning/, снято 17.09.2026). Тем же правилом живёт топ выдачи: Хабр-статья компании Raft советует «попробовать инженерию промптов сначала с существующей большой моделью».

Мини-вывод: порядок проверки — промпт, потом RAG, потом дообучение; перескакивать через первые два шага дорого.

Наш замер: короткий промпт, длинный промпт и дообучение на одной задаче

Одну задачу мы прошли тремя способами: превратить свободную заявку клиента («Добрый день! Требуется страница под запись на бесплатный эфир, эфир уже в четверг. Готовы выделить 47 000 ₽») в строку JSON с тремя полями — категория, срочность, бюджет. Редакция написала 60 заявок для обучения и 20 отложенных для проверки. Модель — Qwen2.5-1.5B-Instruct, видеокарта RTX 4080 SUPER, torch 2.5.1+cu121, генерация жадная, seed 1709.

Первый способ — короткий промпт на 74 токена: «Извлеки из заявки клиента JSON с полями категория, срочно, бюджет. Отвечай только JSON». Ответ базовой модели:

КОД7 строк
```json
{
    "category": "Free Emission Booking",
    "urgent": true,
    "budget": 47000
}
```

Ограждение из обратных кавычек и категория «Free Emission Booking» — машинный перевод «бесплатного эфира» из заявки. Так на всех двадцати: формат не сошёлся ни разу.

Второй способ — развёрнутый промпт на 732 токена: правила вывода, допустимые значения, признаки срочности и пять примеров. Все двадцать ответов разобрались как JSON, все три поля совпали с эталоном.

Третий способ — дообучение. LoRA с рангом 16 по семи линейным слоям, learning rate 2e-4, три эпохи, batch 4, 45 шагов. Функция потерь упала с 0,7194 до 0,0014. Дальше модель получила тот же короткий промпт на 74 токена и выдала результат длинного: 20 из 20 по формату и 20 из 20 по полям.

Способ Токенов в запросе Формат сошёлся Все три поля верны
Короткий промпт 74 0 из 20 0 из 20
Развёрнутый промпт 732 20 из 20 20 из 20
Дообученная модель 74 20 из 20 20 из 20

Главное здесь — средняя строка. Качество дала и обычная работа с промптом: 0 из 20 против 20 из 20 — это разница между небрежной инструкцией и подробной. Дообучение выиграло другое, длину запроса: 658 токенов разницы на каждом обращении к модели.

Тот же замер показал и словарь ответа. Полного русского набора ключей короткий промпт не получил ни разу: 17 ответов из 20 вышли целиком английскими (category, urgent, budget), дважды модель сама перешла на срочно и бюджет, один раз выдала urgency. Развёрнутый промпт задал словарь правилом и примерами: 20 русских из 20. Дообученная модель держит тот же словарь на запросе, где правил нет, и вместе со словарём переехала манера: на просьбу написать про дождь базовая модель начинает с «Вот примерное предложение:», дообученная выдаёт фразу сразу.

Правило отсюда: свой тон и лексика берутся промптом, пока вы согласны везти правила в каждом запросе; дообучение переносит их в веса.

Ещё один повод дообучать — дистилляция, перенос поведения на модель поменьше. Учителем стал развёрнутый промпт: инструкцию на 732 токена полуторамиллиардная модель после дообучения держит сама. Приём описан у OpenAI: довести промпт на большой модели, собрать её ответы и обучить на них маленькую (developers.openai.com/api/docs/guides/supervised-fine-tuning, снято 17.09.2026).

Мини-вывод: на такой задаче дообучение покупает экономию на запросах, а качество добывается подробным промптом.

Сколько стоит fine tuning: три счёта с адресами прайсов

Стоимость складывается из вычислений, разметки и проверки. Самая заметная в обзорах статья — вычисления — оказалась самой дешёвой.

Счёт первый, наше железо. Обучение заняло 5,6 секунды в цикле и 13,1 секунды на весь скрипт вместе с загрузкой модели и сохранением адаптера; пик видеопамяти — 6,12 ГБ. Три прогона подряд дали одинаковый лог функции потерь. Час аренды сервера с RTX 4090 у immers.cloud стоит 82,76 ₽ (конфигурация rtx4090-1.8.16.40, immers.cloud/gpu, снято 17.09.2026). Тринадцать секунд такой аренды — 0,30 ₽.

Счёт второй, облако Яндекса. В правилах тарификации AI Studio написано: «На стадии Preview процесс дообучения моделей не тарифицируется. Дообученная модель YandexGPT Lite тарифицируется как базовая модель YandexGPT Lite» (aistudio.yandex.ru/ru/docs/ai-studio/pricing, снято 17.09.2026). То есть обучение бесплатное, а запросы к дообученной модели идут по 0,2 ₽ за 1000 входящих токенов в синхронном режиме.

Счёт третий, OpenAI. В прайсе дообучения осталась одна модель: o4-mini-2025-04-16, обучение — $100.00 / hour (developers.openai.com/api/docs/pricing, снято 17.09.2026).

Теперь окупаемость. Разница в 658 токенов на запрос по цене 0,2 ₽ за 1000 входящих — это 0,13 ₽ экономии на обращении. Прогон стоил 0,30 ₽, значит вычисления возвращаются на третьем запросе, а на потоке 10 000 обращений в месяц экономия составит 1 316 ₽. Счёт порядком величины: токены считал токенизатор Qwen2.5, цена взята у YandexGPT Lite; у другой пары «модель — поставщик» числа будут свои.

Реальная цена дообучения — 60 размеченных заявок и 20 отложенных примеров для проверки. Их написание заняло несравнимо больше времени, чем само обучение, и не сокращается арендой более быстрой видеокарты.

Мини-вывод: считайте разметку и проверку; счёт за видеокарту на маленькой модели измеряется копейками.

Где дообучать модель в сентябре 2026 года: OpenAI закрывает самообслуживание

Совет «дообучите GPT через API» с мая 2026 года работает не для всех. На странице руководства OpenAI висит предупреждение: «OpenAI is winding down the fine-tuning platform. The platform is no longer accessible to new users, but existing users of the fine-tuning platform will be able to create training jobs for the coming months» (developers.openai.com/api/docs/guides/supervised-fine-tuning, снято 17.09.2026).

Даты сведены в таблицу на странице устаревания (developers.openai.com/api/docs/deprecations, снято 17.09.2026):

Дата Что происходит
7 мая 2026 организации, которые раньше не дообучали, создать задание уже не могут
2 июля 2026 право теряют и те, кто 60 дней не обращался к своей дообученной модели
6 января 2027 действующие клиенты перестают создавать новые задания дообучения
23 октября 2026 из API убирают дообученные версии ft-gpt-3.5-turbo и ft-gpt-4

Ни одна из десяти страниц топа Яндекса по запросу «fine tuning что это» об этом не упоминает.

Что остаётся человеку из России. Yandex AI Studio дообучает методом LoRA модель YandexGPT Lite, классификаторы на её основе и эмбеддинги; статус Preview, обучение занимает «от 1 часа до 1 суток в зависимости от объема данных и загруженности системы», датасет — до 5 ГБ, роль ai.editor. Второй путь — открытая модель на своём или арендованном железе, как в нашем прогоне: веса остаются у вас, и тарифы чужого облака на них не влияют.

Мини-вывод: путь через OpenAI закрывается по расписанию, российские варианты — AI Studio с LoRA и своё железо с открытой моделью.

Какие данные нужны для fine tuning и почему таблица не подойдёт

Формат обучающих данных для GPT-подобных моделей — JSONL (JSON Lines): текстовый файл, где каждая строка это законченный объект JSON. Требование OpenAI: «Use JSONL format, with one complete JSON structure on every line of the training data file», формат сообщений — как в chat completions, минимум 10 строк в файле (developers.openai.com/api/docs/guides/supervised-fine-tuning, снято 17.09.2026). Yandex AI Studio требует того же: «Все датасеты создаются на основе файлов в формате JSON Lines в кодировке UTF-8», минимум 10 примеров, длина запроса до 8 000 токенов, эталонного ответа — до 2 000 (aistudio.yandex.ru/ru/docs/ai-studio/concepts/resources/dataset, снято 17.09.2026).

Отсюда ответ на частый вопрос, какой текстовый формат с табличными данными для fine-tuning не подходит. Это CSV и его родня — TSV, выгрузка из Excel в текст. Обучающий пример — вложенная структура: список сообщений с ролями system, user, assistant, внутри которых бывают переносы строк, кавычки, JSON внутри JSON и вызовы функций. Плоская таблица такого не выражает, поэтому CSV конвертируют в JSONL.

Сколько нужно примеров — тут источники расходятся сильнее всего. OpenAI пишет: минимум 10, заметные улучшения на 50–100, начинать рекомендует с 50 хорошо сделанных примеров. Блог Yandex Cloud называет другой порядок: «для полного переобучения обычно требуются десятки тысяч примеров», а для LoRA «иногда хватает пары тысяч примеров». Universus говорит про «датасет из 100–500 примеров в формате JSONL». Наш прогон закрыл задачу на 60 примерах — в коридоре рекомендации OpenAI.

Мини-вывод: формат — JSONL, стартовый объём для узкой задачи — полсотни примеров, таблицу CSV придётся переложить в строки JSON.

Методы дообучения: полное, LoRA и QLoRA

Методы отличаются тем, какую часть весов они трогают. При полном дообучении (full fine-tuning) обновляются все параметры: в памяти приходится держать веса, градиенты и состояние оптимизатора, а на каждую задачу получается своя полная копия модели. Семейство PEFT замораживает базу и учит маленькую добавку. LoRA ставит рядом с каждым линейным слоем две узкие матрицы и учит только их. QLoRA дополнительно сжимает замороженную базу до 4 бит, чтобы большая модель поместилась в память потребительской видеокарты.

Требования к видеопамяти в топе называют по-разному. Блог Yandex Cloud: «для настройки модели с 7 млрд параметров понадобится 80 ГБ видеопамяти в экономичном формате FP16». Cloud4box приводит вилку «80-160 ГБ VRAM» для полного дообучения семимиллиардной модели и «16-24 ГБ» для QLoRA. Наша точка: LoRA на модели в 1,5 млрд параметров в bfloat16 заняла 6,12 ГБ пика видеопамяти.

Стартовых гиперпараметров пять. Ранг LoRA (r) задаёт ширину обучаемых матриц, стартовое значение — 16. Alpha масштабирует вклад адаптера, обычный выбор — вдвое больше ранга, то есть 32. Целевые модули — все линейные слои блока. Learning rate — 2e-4. Эпох от одной до трёх, дальше растёт риск переобучения. Tproger называет тот же набор: «Оптимальная стартовая точка: LoRA rank 16, все линейные слои, learning rate 2e-4, 1–3 эпохи». Ровно эти значения мы и взяли.

Мини-вывод: начинать стоит с LoRA ранга 16 по всем линейным слоям; QLoRA берут, когда модель не влезает в память видеокарты.

Что ломается после дообучения

Первое — модель разучивается говорить «не знаю» за пределами обучения. Мы дали дообученной модели заявку из категории, которой в обучении не было: «Нужен дизайн упаковки для чая, не горит, 30000». Ответ пришёл уверенный и неверный: {"категория": "сайт", "срочно": "нет", "бюджет": 30000}. Форма закрепилась настолько, что модель подгоняет любую заявку под четыре известных ей значения.

Второе — переобучение. Функция потерь 0,0014 на шестидесяти примерах означает, что выборка выучена наизусть. Спасает отложенная: 20 проверочных заявок написаны другими словами, и результат 20 из 20 получен именно на них.

Третье — катастрофическое забывание, потеря общих способностей. На трёх эпохах его не случилось: на посторонние вопросы дообученная модель по-прежнему отвечает обычным текстом, «17 * 4 = 68» и «Лиссабон». Риск растёт с числом эпох, поэтому общие вопросы стоит держать в наборе проверок.

Четвёртое — фактическая точность от дообучения не улучшается. BigDataSchool, единственная в топ-10 с собственным прогоном, пишет об этом прямо: «дообучение поставило форму и не тронуло знания».

Мини-вывод: дообучение закрепляет форму и вместе с ней границы — за пределами обучающих примеров модель уверенно ошибается.

Как проверить, что дообучение помогло

Проверка состоит из трёх измерений. Первое делают до старта: отложите примеры, которых в обучении не будет, и прогоните на них базовую модель. Мы отложили 20 заявок из 80 и получили на базовой модели 0 из 20 по формату.

Второе идёт по ходу обучения: функция потерь должна падать ровно. Наш лог — 0,7194 на первом шаге и 0,0014 на сорок пятом; ровное падение подтверждает исправность обучения и молчит о качестве на новых данных.

Третье — та же выборка на дообученной модели и обязательно на развёрнутом промпте: без этой руки победа дообучения окажется победой подробной инструкции. В нашем случае она дала 20 из 20.

Мини-вывод: три прогона на одной отложенной выборке — база с коротким промптом, база с развёрнутым, дообученная.

Чек-лист: нужен ли вам fine tuning

Вопрос Если да Если нет
Задача повторяется тысячи раз в месяц дообучение окупится экономией на запросах останьтесь на промпте
Нужен жёсткий формат вывода дообучение закрепляет его надёжнее хватит промпта
Нужен свой тон и лексика дообучение закрепит их без правил в запросе хватит развёрнутого промпта
Нужны свежие факты, цены, остатки берите RAG
Есть 50+ размеченных примеров можно пробовать сначала соберите данные
Развёрнутый промпт уже проверен переходите к дообучению проверьте промпт, это дешевле

Практика по шагам — в материалах дообучение ChatGPT на своей базе знаний и обучение на кластере видеокарт. Развилка с поиском по базе разобрана в RAG и дообучении, сравнение с работой над запросами — в файн-тюнинге и промпт-инжиниринге.

Частые вопросы

Что выбрать: дообучение или работу с промптом?
Промпт едет с каждым запросом, дообучение переносит инструкцию в веса. В нашем замере развёрнутый промпт занимал 732 токена, а дообученная модель давала тот же результат на запросе в 74 токена.

Какой формат файла нужен для обучающих данных?
JSONL — по одному объекту JSON на строку. Этого требует и OpenAI, и Yandex AI Studio; минимум у обоих — 10 примеров.

Какой текстовый формат с табличными данными не подходит для fine-tuning?
CSV и другие плоские таблицы. Обучающий пример — вложенная структура с ролями и многострочным текстом, таблица её не выражает, поэтому CSV конвертируют в JSONL.

Сколько стоит дообучить модель?
Вычисления стоят мало: наш прогон на 60 примерах обошёлся в 0,30 ₽ по цене аренды RTX 4090, а в Yandex AI Studio обучение на стадии Preview не тарифицируется. Основная статья расходов — подготовка и проверка размеченного набора.

Можно ли дообучить ChatGPT через API?
Новым организациям OpenAI закрыл эту возможность 7 мая 2026 года, действующие клиенты потеряют право создавать задания 6 января 2027 года. Альтернативы — Yandex AI Studio и открытые модели на своём железе.

Читайте также

3 материала