Обновлено: 11 августа 2026

Fine-tuning (файн-тюнинг) — дообучение готовой модели на своих примерах, чтобы она отвечала в нужном формате, стиле и без длинных инструкций в промпте. Знаний это почти не добавляет. С 7 мая 2026 года OpenAI не выдаёт дообучение новым командам, поэтому обучают на открытых моделях и у других провайдеров.

Коротко о состоянии дел на август 2026:

  • OpenAI сворачивает self-serve платформу fine-tuning: новые организации не принимаются с 7 мая 2026, действующие клиенты теряют право запускать обучение 6 января 2027.
  • Уже дообученные модели продолжают отвечать, пока жива базовая модель. Для семейства ft-gpt-3.5-turbo это 23 октября 2026.
  • Assistants API выключается 26 августа 2026 — интеграции переносят на Responses API и Conversations API.
  • Рабочая замена — LoRA и QLoRA на открытых моделях либо дообучение у облачного провайдера, например в Yandex AI Studio.
  • Fine-tuning ставит форму ответа. За фактами и базой знаний идут в RAG.

Fine tuning: что это такое и что он меняет в модели

Базовая модель уже обучена на большом корпусе текстов. Fine-tuning берёт её и доучивает на ваших примерах «вход → правильный ответ». Меняются веса: те ответы, которые вы показали как верные, становятся вероятнее.

Что это даёт по документации OpenAI: примеров можно дать больше, чем влезает в контекст одного запроса; промпт становится короче, а значит дешевле и быстрее; на своих данных можно обучить модель поменьше вместо дорогой большой.

Чего дообучение почти не даёт — новых знаний. Документация Yandex AI Studio формулирует это прямо: «Модели генерации текста не получится дообучить новой информации, например базе знаний службы поддержки. Однако вы можете обучить модель отдавать ответ в определенном формате или анализировать текст».

Отсюда простое разделение труда: форма и поведение — fine-tuning, факты и документы — генерация с извлечением (RAG). Ошибка выбора здесь стоит недель работы: модель, дообученную на выгрузке из базы знаний, всё равно придётся кормить документами в запросе.

ОНЛАЙН-ПРАКТИКУМ
ЗАПУСК нейросети DEEPSEEK R1 ЛОКАЛЬНО НА СВОЕМ КОМПЬЮТЕРЕ
ЧТО БУДЕТ НА ОБУЧЕНИИ?
  • ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
  • Где и как применять? Потестируем модель после установки на разных задачах
  • Как дообучить модель под себя?

Что случилось с fine tuning у OpenAI в 2026 году

Инструкции вида «дообучите GPT-3.5 через API» устарели. На странице руководства по дообучению OpenAI висит предупреждение: «OpenAI is winding down the fine-tuning platform. The platform is no longer accessible to new users, but existing users of the fine-tuning platform will be able to create training jobs for the coming months. All fine-tuned models will remain available for inference until their base models are deprecated».

Сроки со страницы депрекаций OpenAI:

Дата Что происходит
7 мая 2026 Запуск обучения недоступен организациям, которые раньше не запускали fine-tuning
2 июля 2026 Запуск обучения недоступен тем, кто за последние 60 дней не обращался к дообученной модели
26 августа 2026 Отключается Assistants API, замена — Responses API и Conversations API
28 сентября 2026 Выключаются babbage-002, davinci-002, gpt-3.5-turbo-instruct и gpt-3.5-turbo-1106
23 октября 2026 Выключаются gpt-3.5-turbo-0125 и дообученные ft-gpt-3.5-turbo, ft-gpt-4, ft-gpt-4.1-nano, ft-babbage-002, ft-davinci-002
6 января 2027 Действующие клиенты теряют право создавать новые задания на дообучение

Методы, пока платформа работает для действующих клиентов, остались прежние: supervised fine-tuning на gpt-4.1, gpt-4.1-mini и gpt-4.1-nano, vision fine-tuning на gpt-4o-2024-08-06, direct preference optimization на том же семействе gpt-4.1 и reinforcement fine-tuning на o4-mini. Смысла строить на этом новый продукт нет: часть базовых моделей из списка уходит 23 октября 2026.

Мини-вывод: если вы пришли в тему после мая 2026, дверь в дообучение у OpenAI закрыта. Дальше — про то, что делать владельцам действующих моделей и куда идти всем остальным.

У вас уже есть дообученная модель: что делать

Порядок действий владельца дообученной модели OpenAI
Порядок действий владельца дообученной модели OpenAI

Паниковать рано. OpenAI обещает инференс до тех пор, пока не депрекирована базовая модель: «Inference on fine-tuned models will be disabled only when the underlying base model is deprecated». Порядок действий такой.

  • Узнать базовую модель. Идентификатор дообученной модели начинается с ft: и содержит базу — по ней и смотрите дату отключения в таблице выше.
  • Проверить дату. Всё, что построено на gpt-3.5-turbo, gpt-4 и nano-моделях, живёт до 23 октября 2026. Это не «когда-нибудь», это ближайший квартал.
  • Снять интеграцию с Assistants API. После 26 августа 2026 запросы туда перестанут работать, замена — Responses API и Conversations API.
  • Сохранить датасет и метрики. Обучающие файлы и результаты замеров — единственное, что переносится на новую платформу без потерь. Сама модель не экспортируется.

Список своих заданий и вызов дообученной модели на актуальном SDK выглядят так:

from openai import OpenAI client = OpenAI() # какие дообученные модели у нас есть и на какой базе for job in client.fine_tuning.jobs.list(limit=20).data: print(job.id, job.status, job.model, job.fine_tuned_model) # вызов дообученной модели через Responses API response = client.responses.create( model="ft:gpt-4.1-mini-2025-04-14:acme::abc123", instructions="Отвечай в формате, которому обучен.", input="Клиент просит перенести доставку на четверг.", ) print(response.output_text)

Вызовы вида openai.FineTune.create и openai.ChatCompletion.create из статей 2023 года в текущем SDK не работают: старый namespace убран, работа идёт через клиент OpenAI(). Responses API сейчас основной интерфейс, Chat Completions поддерживается как предыдущий стандарт.

Мини-вывод: срок жизни вашей модели равен сроку жизни её базы. Дату отключения стоит внести в план релизов сейчас: в октябре выбирать будет уже поздно.

Чем заменить fine tuning: лестница методов

Лестница адаптации модели: от дешёвого к дорогому
Лестница адаптации модели: от дешёвого к дорогому

Дообучение — самая дорогая ступень адаптации модели, и берут её последней. Сначала проверяют три более дешёвых способа: они закрывают большую часть задач, ради которых люди идут в fine-tuning.

Метод Что меняет Когда брать
Промпт и примеры в запросе Ничего в модели, только контекст Первая попытка всегда. Документация OpenAI советует сочетать промптинг с дообучением
RAG (поиск по своим документам) Ничего в модели, подкладывает факты Нужны актуальные знания: база продуктов, регламенты, цены
LoRA / QLoRA Обучает небольшие матрицы-адаптеры, базовые веса заморожены Нужен устойчивый формат, тон, разметка ответа. Основной рабочий вариант
Полное дообучение Все веса модели Редко: свой домен, много данных, есть GPU-бюджет

Про LoRA стоит понимать механику, потому что от неё зависит стоимость. Библиотека PEFT описывает её так: обновление весов представляется двумя матрицами меньшего размера, а «The original weight matrix remains frozen and doesn’t receive any further adjustments». Архитектура самой модели при этом не трогается: в трансформерах адаптеры обычно вешают только на attention-блоки. Число обучаемых параметров резко падает, а на выходе получается лёгкий переносимый адаптер вместо копии всей модели.

QLoRA добавляет к этому 4-битную квантизацию базовой модели. В исходной работе авторы формулируют выигрыш так: метод «reduces memory usage enough to finetune a 65B parameter model on a single 48GB GPU while preserving full 16-bit finetuning task performance», а обученная этим способом модель Guanaco достигла 99,3% от уровня ChatGPT на бенчмарке Vicuna за 24 часа обучения на одной видеокарте.

Мини-вывод: в 2026 году «дообучить модель» на практике означает LoRA или QLoRA. Полное дообучение остаётся задачей команд с собственным парком GPU.

Где дообучить модель в 2026 году

Осталось два практичных пути: облачный сервис, который делает дообучение за вас, и открытая модель на своём или арендованном железе.

Yandex AI Studio. Дообучение идёт по методу LoRA для модели генерации текста YandexGPT Lite, классификаторов на её базе и модели эмбеддингов; функциональность помечена как Preview. Данные загружаются датасетом — по умолчанию до 5 ГБ в один датасет. Обучение «займет от 1 часа до 1 суток в зависимости от объема данных и загруженности системы», для запуска нужна роль ai.editor. На выходе даётся идентификатор модели, который передают в поле modelUri; инструкцию, использованную при обучении, документация требует повторять в системном сообщении. Подробности — в документации Yandex AI Studio.

Открытые модели. Qwen, Llama, Mistral, Gemma дообучают локально через библиотеки TRL и PEFT. Плюс — модель и адаптер остаются у вас, никакие даты отключения не действуют. Минус — нужен GPU: аренда карты на несколько часов или собственная машина.

Облачные площадки для обучения открытых моделей. Промежуточный вариант, когда своего железа нет, а зависеть от закрытого провайдера не хочется: обучение запускается в чужом облаке, но веса адаптера скачиваются к себе.

Порядок выбора простой: если задача — формат ответа на русском и нет ML-инженера, начинают с облачного сервиса. Если важна независимость от вендора или нужна специфическая модель — берут открытую и учат LoRA-адаптер. Отдельная статья блога разбирает, что вообще значит «учить ИИ», если вы не программист.

РОССИЙСКИЕ НЕЙРОСЕТИ ДЛЯ ЖИЗНИ И КАРЬЕРЫ В 2025
Присоединяйся к онлайн-вебинару.
В прямом эфире разберем и потестируем лучшие на сегодняшний день отечественные ИИ!
Вы узнаете о том:
  • Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
  • Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
  • Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
Участвовать бесплатно
ОБЗОРНЫЙ ПРАКТИКУМ ПО НАШУМЕВШИМ НЕЙРОСЕТЯМ
Нейросети DEEPSEEK И QWEN
За 2 часа сделаем полный обзор новых мощных ИИ-моделей, которые бросают вызов нейросети ChatGPT
Вы узнаете:
  • Возможность получить Доступ в Нейроклуб на целый месяц
  • Как ИИ ускоряет работу и приносит деньги
  • За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Участвовать бесплатно

Разобраться с дообучением и внедрением моделей в рабочие процессы помогают курсы Зерокодера по нейросетям.

Подготовка данных: формат датасета и его объём

Качество дообучения определяется датасетом. Гиперпараметры добавляют к результату проценты, датасет задаёт его целиком. Формат записи зависит от площадки.

У OpenAI процесс описан четырьмя шагами: собрать примеры, загрузить датасет в формате JSONL, создать задание одним из методов, оценить результат. В Yandex AI Studio данные тоже загружаются отдельным датасетом, лимит по умолчанию — 5 ГБ.

Библиотека TRL принимает четыре формы записи, и выбор влияет на то, по каким токенам считается ошибка:

# обычный текст {"text": "The sky is blue."} # диалог {"messages": [{"role": "user", "content": "What color is the sky?"}, {"role": "assistant", "content": "It is blue."}]} # запрос и ответ {"prompt": "The sky is", "completion": " blue."} # запрос и ответ в диалоговой форме {"prompt": [{"role": "user", "content": "What color is the sky?"}], "completion": [{"role": "assistant", "content": "It is blue."}]}

Для пары prompt-completion ошибка по умолчанию считается только по ответу — модель учится продолжению, текст самого вопроса в ошибку не входит. В диалоговом формате тот же эффект включается флагом assistant_only_loss.

Что делать с данными до загрузки:

  • убрать дубликаты и мусорные примеры — модель заучит и их тоже;
  • привести ответы к одному формату: если в половине примеров JSON, а в половине проза, модель научится колебаться;
  • отложить часть примеров в отдельный проверочный набор до начала обучения;
  • вычистить персональные данные, если датасет собран из переписки с клиентами.

Мини-вывод: небольшой вычищенный однотипный набор даёт более предсказуемый результат, чем крупный разнородный.

Параметры и настройка: learning rate, batch size, эпохи

Гиперпараметры удобно смотреть на дефолтах TRL — их подбирали как разумную отправную точку для supervised fine-tuning.

Параметр Значение по умолчанию в SFTConfig Что делает
learning_rate 2e-5 Скорость адаптации весов. Для LoRA-адаптеров документация TRL советует брать выше — около 1e-4, потому что обучаются только новые параметры
num_train_epochs 3.0 Сколько раз модель пройдёт по датасету
per_device_train_batch_size 8 Примеров за шаг на одном устройстве
max_length 1024 Предел длины последовательности, всё длиннее обрезается
gradient_checkpointing True Экономит память ценой скорости

Порядок подбора: сначала фиксируют датасет и меняют только эпохи, потом трогают learning rate. Одновременная правка обоих делает результат неинтерпретируемым — непонятно, что дало эффект.

Перебор с эпохами даёт заучивание: модель начинает воспроизводить обучающие примеры дословно и хуже отвечает на всё остальное. Признак виден по кривой: ошибка на обучающем наборе падает, на проверочном растёт.

Из техник экономии памяти работают packing (несколько коротких примеров упаковываются в одну последовательность), padding_free и квантизация базовой модели через quantization_config — она же превращает LoRA в QLoRA.

Мини-вывод: начинать стоит с дефолтов и одного изменения за прогон.

Пример: дообучение открытой модели через LoRA

Минимальный рабочий пример на TRL и PEFT. Базовые веса заморожены, обучается только адаптер.

from datasets import load_dataset from peft import LoraConfig from trl import SFTConfig, SFTTrainer dataset = load_dataset("trl-lib/Capybara", split="train") trainer = SFTTrainer( model="Qwen/Qwen3-0.6B", train_dataset=dataset, args=SFTConfig( output_dir="qwen3-06b-lora", learning_rate=1e-4, num_train_epochs=3, ), peft_config=LoraConfig(), ) trainer.train() trainer.save_model("qwen3-06b-lora")

Замена датасета на свой — это подстановка своего файла в load_dataset и приведение записей к формату prompt/completion или messages из раздела выше. Для QLoRA к конструктору добавляется quantization_config с 4-битной конфигурацией BitsAndBytesConfig: базовая модель грузится в 4 битах, адаптер обучается поверх.

Обученный адаптер сохраняется отдельным каталогом и подгружается к базовой модели при инференсе. Его можно держать в репозитории, версионировать и откатывать — в отличие от модели у закрытого провайдера, где есть только идентификатор.

Оценка и настройка модели после обучения

Цикл дообучения: от датасета до сравнения с базовой моделью
Цикл дообучения: от датасета до сравнения с базовой моделью

Проверочный набор собирают до старта обучения, иначе оценивать будет нечем. Во время обучения TRL пишет метрики, по которым видно состояние процесса: loss (средняя ошибка), mean_token_accuracy (доля токенов, где топ-1 предсказание совпало с эталоном), entropy, grad_norm, learning_rate, num_tokens.

Метрики обучения показывают только то, что модель усвоила примеры. Пригодность к работе показывает сравнение на отложенном наборе: тот же запрос отдают базовой модели и дообученной, ответы сверяют по критерию задачи — валидность JSON, попадание в формат, правильный класс. Если дообученная не выигрывает у базовой с хорошим промптом, обучение было лишним.

Типичные дефекты и практические рекомендации по каждому:

  • Заучивание. Модель повторяет примеры дословно — сократить эпохи или добавить данных.
  • Разнобой в формате. Причина почти всегда в датасете: примеры оформлены по-разному.
  • Просадка на соседних задачах. Узкий однобокий датасет сужает поведение модели. Лечится разбавлением примеров общего профиля.
  • Модель придумывает факты. Fine-tuning этого не чинит — нужен поиск по документам. Тема разобрана в материале про реальные ограничения генеративных моделей.

Мини-вывод: единственный честный критерий — сравнение с базовой моделью на данных, которых она не видела.

Когда дообучение не нужно

Проверьте по списку, прежде чем тратить бюджет:

  • задача решается промптом с несколькими примерами прямо в запросе;
  • нужны актуальные факты — это RAG;
  • примеров мало и они разнородные;
  • нет отложенного набора для проверки;
  • нет человека, который сможет повторить обучение через полгода на новой базовой модели.

Дообучение оправдано, когда формат ответа критичен, промпт уже раздут до предела, а объём запросов делает экономию на токенах ощутимой.

Частые вопросы про fine tuning

Что такое fine tuning простыми словами?

Это дообучение уже готовой модели на своих примерах, чтобы она отвечала в нужном формате и стиле. Веса модели меняются, новых знаний при этом почти не появляется.

Можно ли сейчас дообучить GPT через OpenAI?

Новым организациям — нет. С 7 мая 2026 года запуск обучения недоступен тем, кто не запускал fine-tuning раньше, а 6 января 2027 такую возможность теряют и действующие клиенты.

Что будет с моей дообученной моделью OpenAI?

Она продолжит отвечать, пока не отключена её базовая модель. Дообученные ft-gpt-3.5-turbo, ft-gpt-4, ft-babbage-002 и ft-davinci-002 выключаются 23 октября 2026 года.

Чем отличается fine tuning от RAG?

Fine-tuning меняет поведение модели: формат, стиль, следование инструкции. RAG подкладывает в запрос актуальные документы и отвечает за факты. Задачи разные, и они часто работают вместе.

Сколько стоит дообучить модель через LoRA?

Основные расходы — аренда GPU на время обучения. Метод QLoRA позволяет дообучить модель на 65 миллиардов параметров на одной видеокарте с 48 ГБ памяти, а модели поменьше учатся на потребительских картах.

Где дообучить модель на русском языке?

В Yandex AI Studio дообучение по методу LoRA доступно для YandexGPT Lite, классификаторов на её базе и модели эмбеддингов; функциональность в статусе Preview. Второй путь — открытые модели с русским в обучающем корпусе, дообученные локально через TRL и PEFT.

Большой практикум
ЗАМЕНИ ВСЕ НЕЙРОСЕТИ НА ОДНУ — PERPLEXITY
ПОКАЖЕМ НА КОНКРЕТНЫХ КЕЙСАХ
  • Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
  • УЧАСТВОВАТЬ ЗА 0 РУБ.
  • Расскажем, как получить подписку
Участвовать бесплатно
ОНЛАЙН-ПРАКТИКУМ
ЗАПУСК нейросети DEEPSEEK R1 ЛОКАЛЬНО НА СВОЕМ КОМПЬЮТЕРЕ
ЧТО БУДЕТ НА ОБУЧЕНИИ?
  • ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
Участвовать бесплатно