Обновлено: 11 августа 2026
Fine-tuning (файн-тюнинг) — дообучение готовой модели на своих примерах, чтобы она отвечала в нужном формате, стиле и без длинных инструкций в промпте. Знаний это почти не добавляет. С 7 мая 2026 года OpenAI не выдаёт дообучение новым командам, поэтому обучают на открытых моделях и у других провайдеров.
Коротко о состоянии дел на август 2026:
- OpenAI сворачивает self-serve платформу fine-tuning: новые организации не принимаются с 7 мая 2026, действующие клиенты теряют право запускать обучение 6 января 2027.
- Уже дообученные модели продолжают отвечать, пока жива базовая модель. Для семейства ft-gpt-3.5-turbo это 23 октября 2026.
- Assistants API выключается 26 августа 2026 — интеграции переносят на Responses API и Conversations API.
- Рабочая замена — LoRA и QLoRA на открытых моделях либо дообучение у облачного провайдера, например в Yandex AI Studio.
- Fine-tuning ставит форму ответа. За фактами и базой знаний идут в RAG.
Fine tuning: что это такое и что он меняет в модели
Базовая модель уже обучена на большом корпусе текстов. Fine-tuning берёт её и доучивает на ваших примерах «вход → правильный ответ». Меняются веса: те ответы, которые вы показали как верные, становятся вероятнее.
Что это даёт по документации OpenAI: примеров можно дать больше, чем влезает в контекст одного запроса; промпт становится короче, а значит дешевле и быстрее; на своих данных можно обучить модель поменьше вместо дорогой большой.
Чего дообучение почти не даёт — новых знаний. Документация Yandex AI Studio формулирует это прямо: «Модели генерации текста не получится дообучить новой информации, например базе знаний службы поддержки. Однако вы можете обучить модель отдавать ответ в определенном формате или анализировать текст».
Отсюда простое разделение труда: форма и поведение — fine-tuning, факты и документы — генерация с извлечением (RAG). Ошибка выбора здесь стоит недель работы: модель, дообученную на выгрузке из базы знаний, всё равно придётся кормить документами в запросе.

- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросети DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ
- Где и как применять? Потестируем модель после установки на разных задачах
- Как дообучить модель под себя?
Что случилось с fine tuning у OpenAI в 2026 году
Инструкции вида «дообучите GPT-3.5 через API» устарели. На странице руководства по дообучению OpenAI висит предупреждение: «OpenAI is winding down the fine-tuning platform. The platform is no longer accessible to new users, but existing users of the fine-tuning platform will be able to create training jobs for the coming months. All fine-tuned models will remain available for inference until their base models are deprecated».
Сроки со страницы депрекаций OpenAI:
| Дата | Что происходит |
|---|---|
| 7 мая 2026 | Запуск обучения недоступен организациям, которые раньше не запускали fine-tuning |
| 2 июля 2026 | Запуск обучения недоступен тем, кто за последние 60 дней не обращался к дообученной модели |
| 26 августа 2026 | Отключается Assistants API, замена — Responses API и Conversations API |
| 28 сентября 2026 | Выключаются babbage-002, davinci-002, gpt-3.5-turbo-instruct и gpt-3.5-turbo-1106 |
| 23 октября 2026 | Выключаются gpt-3.5-turbo-0125 и дообученные ft-gpt-3.5-turbo, ft-gpt-4, ft-gpt-4.1-nano, ft-babbage-002, ft-davinci-002 |
| 6 января 2027 | Действующие клиенты теряют право создавать новые задания на дообучение |
Методы, пока платформа работает для действующих клиентов, остались прежние: supervised fine-tuning на gpt-4.1, gpt-4.1-mini и gpt-4.1-nano, vision fine-tuning на gpt-4o-2024-08-06, direct preference optimization на том же семействе gpt-4.1 и reinforcement fine-tuning на o4-mini. Смысла строить на этом новый продукт нет: часть базовых моделей из списка уходит 23 октября 2026.
Мини-вывод: если вы пришли в тему после мая 2026, дверь в дообучение у OpenAI закрыта. Дальше — про то, что делать владельцам действующих моделей и куда идти всем остальным.
У вас уже есть дообученная модель: что делать

Паниковать рано. OpenAI обещает инференс до тех пор, пока не депрекирована базовая модель: «Inference on fine-tuned models will be disabled only when the underlying base model is deprecated». Порядок действий такой.
- Узнать базовую модель. Идентификатор дообученной модели начинается с ft: и содержит базу — по ней и смотрите дату отключения в таблице выше.
- Проверить дату. Всё, что построено на gpt-3.5-turbo, gpt-4 и nano-моделях, живёт до 23 октября 2026. Это не «когда-нибудь», это ближайший квартал.
- Снять интеграцию с Assistants API. После 26 августа 2026 запросы туда перестанут работать, замена — Responses API и Conversations API.
- Сохранить датасет и метрики. Обучающие файлы и результаты замеров — единственное, что переносится на новую платформу без потерь. Сама модель не экспортируется.
Список своих заданий и вызов дообученной модели на актуальном SDK выглядят так:
from openai import OpenAI
client = OpenAI()
# какие дообученные модели у нас есть и на какой базе
for job in client.fine_tuning.jobs.list(limit=20).data:
print(job.id, job.status, job.model, job.fine_tuned_model)
# вызов дообученной модели через Responses API
response = client.responses.create(
model="ft:gpt-4.1-mini-2025-04-14:acme::abc123",
instructions="Отвечай в формате, которому обучен.",
input="Клиент просит перенести доставку на четверг.",
)
print(response.output_text)
Вызовы вида openai.FineTune.create и openai.ChatCompletion.create из статей 2023 года в текущем SDK не работают: старый namespace убран, работа идёт через клиент OpenAI(). Responses API сейчас основной интерфейс, Chat Completions поддерживается как предыдущий стандарт.
Мини-вывод: срок жизни вашей модели равен сроку жизни её базы. Дату отключения стоит внести в план релизов сейчас: в октябре выбирать будет уже поздно.
Чем заменить fine tuning: лестница методов

Дообучение — самая дорогая ступень адаптации модели, и берут её последней. Сначала проверяют три более дешёвых способа: они закрывают большую часть задач, ради которых люди идут в fine-tuning.
| Метод | Что меняет | Когда брать |
|---|---|---|
| Промпт и примеры в запросе | Ничего в модели, только контекст | Первая попытка всегда. Документация OpenAI советует сочетать промптинг с дообучением |
| RAG (поиск по своим документам) | Ничего в модели, подкладывает факты | Нужны актуальные знания: база продуктов, регламенты, цены |
| LoRA / QLoRA | Обучает небольшие матрицы-адаптеры, базовые веса заморожены | Нужен устойчивый формат, тон, разметка ответа. Основной рабочий вариант |
| Полное дообучение | Все веса модели | Редко: свой домен, много данных, есть GPU-бюджет |
Про LoRA стоит понимать механику, потому что от неё зависит стоимость. Библиотека PEFT описывает её так: обновление весов представляется двумя матрицами меньшего размера, а «The original weight matrix remains frozen and doesn’t receive any further adjustments». Архитектура самой модели при этом не трогается: в трансформерах адаптеры обычно вешают только на attention-блоки. Число обучаемых параметров резко падает, а на выходе получается лёгкий переносимый адаптер вместо копии всей модели.
QLoRA добавляет к этому 4-битную квантизацию базовой модели. В исходной работе авторы формулируют выигрыш так: метод «reduces memory usage enough to finetune a 65B parameter model on a single 48GB GPU while preserving full 16-bit finetuning task performance», а обученная этим способом модель Guanaco достигла 99,3% от уровня ChatGPT на бенчмарке Vicuna за 24 часа обучения на одной видеокарте.
Мини-вывод: в 2026 году «дообучить модель» на практике означает LoRA или QLoRA. Полное дообучение остаётся задачей команд с собственным парком GPU.
Где дообучить модель в 2026 году
Осталось два практичных пути: облачный сервис, который делает дообучение за вас, и открытая модель на своём или арендованном железе.
Yandex AI Studio. Дообучение идёт по методу LoRA для модели генерации текста YandexGPT Lite, классификаторов на её базе и модели эмбеддингов; функциональность помечена как Preview. Данные загружаются датасетом — по умолчанию до 5 ГБ в один датасет. Обучение «займет от 1 часа до 1 суток в зависимости от объема данных и загруженности системы», для запуска нужна роль ai.editor. На выходе даётся идентификатор модели, который передают в поле modelUri; инструкцию, использованную при обучении, документация требует повторять в системном сообщении. Подробности — в документации Yandex AI Studio.
Открытые модели. Qwen, Llama, Mistral, Gemma дообучают локально через библиотеки TRL и PEFT. Плюс — модель и адаптер остаются у вас, никакие даты отключения не действуют. Минус — нужен GPU: аренда карты на несколько часов или собственная машина.
Облачные площадки для обучения открытых моделей. Промежуточный вариант, когда своего железа нет, а зависеть от закрытого провайдера не хочется: обучение запускается в чужом облаке, но веса адаптера скачиваются к себе.
Порядок выбора простой: если задача — формат ответа на русском и нет ML-инженера, начинают с облачного сервиса. Если важна независимость от вендора или нужна специфическая модель — берут открытую и учат LoRA-адаптер. Отдельная статья блога разбирает, что вообще значит «учить ИИ», если вы не программист.
- Выполним базовые задачи на российских нейросетях и посмотрим на результаты!
- Файл-инструкцию «Как сделать нейро-фотосессию из своего фото бесплатно, без иностранных карт и прочих сложностей»
- Покажем 10+ способов улучшить свою жизнь с ИИ каждому — от ребенка и пенсионера до управленца и предпринимателя
- Возможность получить Доступ в Нейроклуб на целый месяц
- Как ИИ ускоряет работу и приносит деньги
- За 2 часа вы получите четкий план, как начать работать с ИИ прямо сейчас!
Разобраться с дообучением и внедрением моделей в рабочие процессы помогают курсы Зерокодера по нейросетям.
Подготовка данных: формат датасета и его объём
Качество дообучения определяется датасетом. Гиперпараметры добавляют к результату проценты, датасет задаёт его целиком. Формат записи зависит от площадки.
У OpenAI процесс описан четырьмя шагами: собрать примеры, загрузить датасет в формате JSONL, создать задание одним из методов, оценить результат. В Yandex AI Studio данные тоже загружаются отдельным датасетом, лимит по умолчанию — 5 ГБ.
Библиотека TRL принимает четыре формы записи, и выбор влияет на то, по каким токенам считается ошибка:
# обычный текст
{"text": "The sky is blue."}
# диалог
{"messages": [{"role": "user", "content": "What color is the sky?"},
{"role": "assistant", "content": "It is blue."}]}
# запрос и ответ
{"prompt": "The sky is", "completion": " blue."}
# запрос и ответ в диалоговой форме
{"prompt": [{"role": "user", "content": "What color is the sky?"}],
"completion": [{"role": "assistant", "content": "It is blue."}]}
Для пары prompt-completion ошибка по умолчанию считается только по ответу — модель учится продолжению, текст самого вопроса в ошибку не входит. В диалоговом формате тот же эффект включается флагом assistant_only_loss.
Что делать с данными до загрузки:
- убрать дубликаты и мусорные примеры — модель заучит и их тоже;
- привести ответы к одному формату: если в половине примеров JSON, а в половине проза, модель научится колебаться;
- отложить часть примеров в отдельный проверочный набор до начала обучения;
- вычистить персональные данные, если датасет собран из переписки с клиентами.
Мини-вывод: небольшой вычищенный однотипный набор даёт более предсказуемый результат, чем крупный разнородный.
Параметры и настройка: learning rate, batch size, эпохи
Гиперпараметры удобно смотреть на дефолтах TRL — их подбирали как разумную отправную точку для supervised fine-tuning.
| Параметр | Значение по умолчанию в SFTConfig | Что делает |
|---|---|---|
| learning_rate | 2e-5 | Скорость адаптации весов. Для LoRA-адаптеров документация TRL советует брать выше — около 1e-4, потому что обучаются только новые параметры |
| num_train_epochs | 3.0 | Сколько раз модель пройдёт по датасету |
| per_device_train_batch_size | 8 | Примеров за шаг на одном устройстве |
| max_length | 1024 | Предел длины последовательности, всё длиннее обрезается |
| gradient_checkpointing | True | Экономит память ценой скорости |
Порядок подбора: сначала фиксируют датасет и меняют только эпохи, потом трогают learning rate. Одновременная правка обоих делает результат неинтерпретируемым — непонятно, что дало эффект.
Перебор с эпохами даёт заучивание: модель начинает воспроизводить обучающие примеры дословно и хуже отвечает на всё остальное. Признак виден по кривой: ошибка на обучающем наборе падает, на проверочном растёт.
Из техник экономии памяти работают packing (несколько коротких примеров упаковываются в одну последовательность), padding_free и квантизация базовой модели через quantization_config — она же превращает LoRA в QLoRA.
Мини-вывод: начинать стоит с дефолтов и одного изменения за прогон.
Пример: дообучение открытой модели через LoRA
Минимальный рабочий пример на TRL и PEFT. Базовые веса заморожены, обучается только адаптер.
from datasets import load_dataset
from peft import LoraConfig
from trl import SFTConfig, SFTTrainer
dataset = load_dataset("trl-lib/Capybara", split="train")
trainer = SFTTrainer(
model="Qwen/Qwen3-0.6B",
train_dataset=dataset,
args=SFTConfig(
output_dir="qwen3-06b-lora",
learning_rate=1e-4,
num_train_epochs=3,
),
peft_config=LoraConfig(),
)
trainer.train()
trainer.save_model("qwen3-06b-lora")
Замена датасета на свой — это подстановка своего файла в load_dataset и приведение записей к формату prompt/completion или messages из раздела выше. Для QLoRA к конструктору добавляется quantization_config с 4-битной конфигурацией BitsAndBytesConfig: базовая модель грузится в 4 битах, адаптер обучается поверх.
Обученный адаптер сохраняется отдельным каталогом и подгружается к базовой модели при инференсе. Его можно держать в репозитории, версионировать и откатывать — в отличие от модели у закрытого провайдера, где есть только идентификатор.
Оценка и настройка модели после обучения

Проверочный набор собирают до старта обучения, иначе оценивать будет нечем. Во время обучения TRL пишет метрики, по которым видно состояние процесса: loss (средняя ошибка), mean_token_accuracy (доля токенов, где топ-1 предсказание совпало с эталоном), entropy, grad_norm, learning_rate, num_tokens.
Метрики обучения показывают только то, что модель усвоила примеры. Пригодность к работе показывает сравнение на отложенном наборе: тот же запрос отдают базовой модели и дообученной, ответы сверяют по критерию задачи — валидность JSON, попадание в формат, правильный класс. Если дообученная не выигрывает у базовой с хорошим промптом, обучение было лишним.
Типичные дефекты и практические рекомендации по каждому:
- Заучивание. Модель повторяет примеры дословно — сократить эпохи или добавить данных.
- Разнобой в формате. Причина почти всегда в датасете: примеры оформлены по-разному.
- Просадка на соседних задачах. Узкий однобокий датасет сужает поведение модели. Лечится разбавлением примеров общего профиля.
- Модель придумывает факты. Fine-tuning этого не чинит — нужен поиск по документам. Тема разобрана в материале про реальные ограничения генеративных моделей.
Мини-вывод: единственный честный критерий — сравнение с базовой моделью на данных, которых она не видела.
Когда дообучение не нужно
Проверьте по списку, прежде чем тратить бюджет:
- задача решается промптом с несколькими примерами прямо в запросе;
- нужны актуальные факты — это RAG;
- примеров мало и они разнородные;
- нет отложенного набора для проверки;
- нет человека, который сможет повторить обучение через полгода на новой базовой модели.
Дообучение оправдано, когда формат ответа критичен, промпт уже раздут до предела, а объём запросов делает экономию на токенах ощутимой.
Частые вопросы про fine tuning
Что такое fine tuning простыми словами?
Это дообучение уже готовой модели на своих примерах, чтобы она отвечала в нужном формате и стиле. Веса модели меняются, новых знаний при этом почти не появляется.
Можно ли сейчас дообучить GPT через OpenAI?
Новым организациям — нет. С 7 мая 2026 года запуск обучения недоступен тем, кто не запускал fine-tuning раньше, а 6 января 2027 такую возможность теряют и действующие клиенты.
Что будет с моей дообученной моделью OpenAI?
Она продолжит отвечать, пока не отключена её базовая модель. Дообученные ft-gpt-3.5-turbo, ft-gpt-4, ft-babbage-002 и ft-davinci-002 выключаются 23 октября 2026 года.
Чем отличается fine tuning от RAG?
Fine-tuning меняет поведение модели: формат, стиль, следование инструкции. RAG подкладывает в запрос актуальные документы и отвечает за факты. Задачи разные, и они часто работают вместе.
Сколько стоит дообучить модель через LoRA?
Основные расходы — аренда GPU на время обучения. Метод QLoRA позволяет дообучить модель на 65 миллиардов параметров на одной видеокарте с 48 ГБ памяти, а модели поменьше учатся на потребительских картах.
Где дообучить модель на русском языке?
В Yandex AI Studio дообучение по методу LoRA доступно для YandexGPT Lite, классификаторов на её базе и модели эмбеддингов; функциональность в статусе Preview. Второй путь — открытые модели с русским в обучающем корпусе, дообученные локально через TRL и PEFT.
- Освой нейросеть Perplexity и узнай, как пользоваться функционалом остальных ИИ в одном
- УЧАСТВОВАТЬ ЗА 0 РУБ.
- Расскажем, как получить подписку
- ПОКАЖЕМ, КАК РАЗВЕРНУТЬ МОДЕЛЬ нейросеть DEEPSEEK R1 ПРЯМО НА СВОЁМ КОМПЬЮТЕРЕ