Содержание
- Что такое koboldcpp: определение и роль в локальном запуске LLM
- Чем koboldcpp отличается от KoboldAI
- Как koboldcpp работает: архитектура, GGUF и бэкенд llama.cpp
- Где скачать koboldcpp: GitHub, releases и koboldcpp.exe
- Системные требования и поддерживаемые ОС
- Как пользоваться koboldcpp: пошаговый запуск
- Настройка koboldcpp: context size, GPU layers, threads, порт
- Подключение к SillyTavern и другим фронтендам через API
- Text Completion API и тип koboldcpp: почему так работает лучше
- Ускорение на GPU: CUDA, Vulkan, ROCm и число слоёв
- Типичные ошибки при запуске и способы их решения
- Частые вопросы
Koboldcpp: что это и как запустить LLM
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 24 сентября 2026 года; цитаты источников приведены дословно. Обновлено: сентябрь 2026.
Koboldcpp — что это: отдельный проект на базе llama.cpp, который запускает GGUF-модели локально одним исполняемым файлом и поднимает веб-интерфейс Kobold Lite вместе с Kobold- и OpenAI-совместимым API на порту 5001. Мы скачали топ-10 Яндекса по запросу «koboldcpp что это»: текст отдали 9 из 10. Медиана объёма читаемого текста топа — 1694 слова. Метку 2026 года несут 8 из 9 прочитанных страниц.
Что такое koboldcpp: определение и роль в локальном запуске LLM
В материале на DevTrends проект называют «Ваш персональный ИИ-ассистент в одном файле». Это точная характеристика: один бинарник, одна модель, один браузер. В подборке Yudaev School KoboldCpp относят к приложениям, интерфейсам и средам запуска — наряду с LM Studio, Ollama, GPT4All, ComfyUI, AUTOMATIC1111 и LocalAI.
Сценарий использования в обзоре на MAATRIX описывают так: «поставить и поговорить» — это именно сюда. Воспроизводимость окружения, изоляцию и оркестрацию нескольких сервисов там оставляют за Docker. Проект живёт на вашем железе: веса модели загружаются в оперативную память или видеопамять, генерация идёт на вашем процессоре или GPU.
Чем koboldcpp отличается от KoboldAI
KoboldAI — облачный и серверный проект для генерации текста, ориентированный на ролевые сценарии. Koboldcpp — самостоятельная реализация на C++, выросшая из идеи запустить то же самое локально. Это отдельные проекты с разными репозиториями и разными способами установки.
Практическая разница видна в способе доставки. Koboldcpp распространяется как предварительно собранный исполняемый файл: в гайде MiniTavern перечисляют варианты — exe для Windows, nocuda+Vulkan для AMD, koboldcpp-mac-arm64 для Mac. KoboldAI в такой форме не поставляется.
Второе отличие — встроенный веб-интерфейс. После запуска сервер поднимает встроенный веб-интерфейс Kobold Lite прямо на указанном порту — открываете http://ваш-ip:5001 и сразу попадаете в чат, без отдельного шага «теперь разверните ещё и фронтенд». Это цитата из обзора на MAATRIX.
Имя «Kobold» в названии объясняет происхождение: проект вырос из экосистемы KoboldAI и сохранил совместимость с её API. Сегодня это самостоятельный инструмент, который в подборке Yudaev School ставят отдельным пунктом рейтинга локальных нейросетей для ПК.
Как koboldcpp работает: архитектура, GGUF и бэкенд llama.cpp
Основа Koboldcpp — библиотека llama.cpp, написанная на C++. Она отвечает за загрузку весов, вычисления и генерацию токенов. Поверх неё Koboldcpp добавляет веб-сервер, интерфейс Kobold Lite и API-слой.
Цифры для понимания масштаба: в руководстве AiManual считают, что полноценная модель Llama 3.2-7B в формате FP16 весит около 14 GB. Q4_K_M означает «4-битное квантование с медианной группировкой».
Поддержка новых квантований, улучшенная работа с контекстом до 128K токенов, и главное — стабильность: так в руководстве AiManual описывают развитие проекта. В обзоре на Хабре упоминают модель Llama-3.2–8×4B-MoE-Dark-Champion — Mixture-of-Experts архитектура с гигантским контекстом (до 128k токенов).
Где скачать koboldcpp: GitHub, releases и koboldcpp.exe
Официальный источник — репозиторий lostruins/koboldcpp на GitHub. Готовые сборки лежат в разделе releases. Запросы «koboldcpp github releases» и «koboldcpp releases» ведут именно туда.
| Платформа | Файл из releases | Примечание |
|---|---|---|
| Windows | koboldcpp.exe | Работает на Windows 10 и новее в 64-битной версии |
| Linux | koboldcpp-linux-x64 | Предварительно собранный бинарный файл PyInstaller |
| macOS | koboldcpp-mac-arm64 | Сборка под Apple Silicon |
| AMD GPU | nocuda + Vulkan | Вариант сборки без CUDA |
| NVIDIA GPU | сборка с CUDA | Ускорение на видеокартах NVIDIA |
Последняя версия на февраль 2026 — KoboldCPP 2.1.7, указывают в руководстве AiManual. Номер версии стоит сверять на странице релизов: сборки обновляются часто, и в старых могут отсутствовать новые квантования.
Модели скачивают отдельно. Загрузите GGUF с Hugging Face (Qwen2.5 7B, Mistral 7B, Q4_K_M) — это рекомендация из гайда MiniTavern.
Системные требования и поддерживаемые ОС
KoboldCpp работает на Windows 10 и новее в 64-битной версии — это формулировка из статьи на SoftSalad. Linux и macOS поддерживаются отдельными сборками из releases.
| Сценарий | Ориентир по памяти | Источник |
|---|---|---|
| 7B в Q4 | 6-8 ГБ RAM | MAATRIX |
| 7B Q4_K_M + контекст 1024 | 16 ГБ RAM | AiManual |
| 64 ГБ RAM для модели 7–13B | загрузка весов целиком без mmap | Хабр |
| Cydonia-22B | 20+ GB VRAM или квантование | Хабр |
Процессорные требования. В статье на SoftSalad KoboldCpp описывают как платформу, оптимизирующую работу моделей для процессоров и видеокарт разных производителей. Правило памяти из руководства AiManual: размер модели в GGUF плюс 4-6 GB на контекст — это минимальный объём RAM.
Диск. В облачном сценарии на Novita AI упоминают 60 ГБ свободного места на диске контейнера и 30 ГБ свободного места на диске тома. Для локального запуска ориентируйтесь на размер файла модели плюс запас.
Как пользоваться koboldcpp: пошаговый запуск
Порядок действий для Windows.
- Скачайте koboldcpp.exe со страницы релизов на GitHub.
- Скачайте GGUF-модель с Hugging Face. Для первого запуска подойдёт Qwen2.5 7B или Mistral 7B в Q4_K_M.
- Запустите exe. Откроется окно с настройками загрузки.
- Выберите файл модели через кнопку выбора.
- Задайте контекст. Quick Launch → выберите модель → Context 4096–8192 → Save → Launch — такая последовательность описана в гайде MiniTavern.
- Нажмите Launch и дождитесь загрузки весов.
- Откройте браузер.
После запуска нас перебросит на ссылку по умолчанию http://localhost:5001 в браузере (если ни одна из моделей во время запуска не крашится — это будет видно в консоле), — так описывают результат в обзоре на Хабре.
Запуск из командной строки. В обзоре на MAATRIX приводят пример: ./koboldcpp —model qwen2.5-7b-instruct-q4_k_m.gguf —port 5001 —host 0.0.0.0. На DevTrends — ./koboldcpp —model LLaMA2-13B-Tiefighter.Q4_K_S.gguf —gpulayers 20. Для автозапуска в systemd используют строку ExecStart=/opt/koboldcpp/koboldcpp —model /opt/koboldcpp/models/qwen2.5-7b-instruct-q4_k_m.gguf —port 5001 —host 0.0.0.0 —contextsize 8192.
Проверка работы. Если браузер открыл чат и модель отвечает — запуск прошёл. Если консоль показывает ошибку загрузки, проверьте путь к файлу модели и объём свободной памяти.
Настройка koboldcpp: context size, GPU layers, threads, порт
Основные параметры собраны в окне запуска. Разберём каждый.
Context size — длина контекста. По умолчанию 2048; в руководстве AiManual для старых ПК рекомендуют 1024 или даже 512, потому что с ростом контекста растёт расход RAM и падает скорость генерации. В гайде MiniTavern контекст задают до Launch, иначе SillyTavern может упереться в 4K.
GPU layers — число слоёв модели, выгружаемых на видеокарту. Для чисто CPU-запуска ответ — 0. Остальные слои считает процессор. Чем больше слоёв на GPU, тем быстрее генерация, но тем больше видеопамяти занято.
Threads — число потоков процессора. У вас старый Xeon с 16 ядрами? В руководстве AiManual советуют ставить 16. Но есть нюанс: после 8-12 ядер прирост скорости минимален, потому что ограничением становится память. Ставьте по числу физических ядер.
Порт. По умолчанию сервер слушает 5001. Server URL: http://127.0.0.1:5001/ — это адрес для подключения фронтендов. В одной Wi-Fi сети доступен http://192.168.x.x:5001.
Параметры генерации. Temperature — «температура» генерации: 0.7–1.0 — креативно; ниже — строго и предсказуемо. Значения около 0.7–0.9 — сбалансированы. Top-K: например, при Top-K = 40 — модель выбирает только из 40 самых вероятных токенов. Top-P — выбирает динамически то количество токенов, чья общая вероятность превышает P (например, 0.9 = 90%). Repetition penalty: значение 1.07–1.15 помогает убрать зацикливание, но слишком высокое — «ломает» стиль. Максимум токенов ответа: 102–256 — нормальный диапазон для чата, больше — для длинных историй.
Память. Если же оперативки достаточно (например, 64 ГБ для модели 7–13B), выгоднее загрузить веса целиком и запустить без mmap — так вы избежите лишних обращений к диску.
Подключение к SillyTavern и другим фронтендам через API
Koboldcpp поднимает два API: Kobold-совместимый и OpenAI-совместимый. Оба работают на порту 5001.
Для SillyTavern в гайде MiniTavern дают точную последовательность: GGUF на порту 5001, ST: Text Completion → KoboldCpp. Server URL: http://127.0.0.1:5001/. Альтернатива: Chat Completion + http://127.0.0.1:5001/v1.
Для собственных проектов. Для диалоговых сценариев удобнее использовать /v1/chat/completions — из обзора API на precord.ru. Ответ разбирается как $result[‘choices’][0][‘message’][‘content’]. Для генерации без диалоговой обёртки используют нативный эндпоинт и читают $result[‘results’][0][‘text’].
Мобильные клиенты. В гайде MiniTavern телефон в одной Wi-Fi сети подключают по адресу http://192.168.x.x:5001/v1, вне дома — через Remote Tunnel, временный HTTPS-URL для доступа вне LAN.
Text Completion API и тип koboldcpp: почему так работает лучше
Связка «Text Completion + тип koboldcpp» даёт предсказуемый результат, потому что фронтенд и бэкенд говорят на одном языке параметров. В этом режиме SillyTavern отправляет промпт в нативный эндпоинт, а настройки сэмплинга — temperature, Top-K, Top-P, repetition penalty — уходят как есть.
В режиме Chat Completion запрос проходит через OpenAI-совместимый слой. Он удобен для интеграций, где клиент уже умеет работать с OpenAI API. Для диалоговых сценариев удобнее использовать /v1/chat/completions — так формулируют в обзоре API на precord.ru.
Практический порядок для SillyTavern: в настройках подключения выберите Text Completion, затем в списке типов — KoboldCpp, укажите http://127.0.0.1:5001/. Если нужен OpenAI-совместимый путь, переключитесь на Chat Completion и адрес http://127.0.0.1:5001/v1.
KoboldCpp остаётся мощным способом запустить локальный LLM API для карт персонажей в 2026 году — вывод из гайда MiniTavern. Для ролевых сценариев важна именно нативная совместимость: карточки персонажей, World Info и Author’s Note передаются в промпт без потерь.
Ускорение на GPU: CUDA, Vulkan, ROCm и число слоёв
Выбор сборки определяет бэкенд ускорения.
| Бэкенд | Железо | Сборка |
|---|---|---|
| CUDA | NVIDIA | сборка с CUDA |
| Vulkan | AMD, Intel | nocuda + Vulkan |
| ROCm | AMD на Linux | путь ускорения для AMD под Linux |
| CPU | любое | базовая сборка, GPU layers = 0 |
| Metal | Apple Silicon | koboldcpp-mac-arm64 |
Число слоёв. Параметр GPU layers задаёт, сколько слоёв модели уйдёт на видеокарту. Остальные считает процессор. Для чисто CPU-запуска ответ — 0. Если видеопамяти хватает на все слои, генерация идёт полностью на GPU.
Flash Attention. Flash Attention может ускорить работу модели в 2–4 раза за счёт оптимизированного механизма внимания — он снижает нагрузку на память GPU. Опция включается в настройках запуска.
Ограничения по железу. У меня RTX 4070 Ti SUPER 16GB VRAM, поэтому если у вас видеокарта слабее — придётся заменить LLM на одну из тех, что были перечислены выше, — предупреждает автор обзора на Хабре. Модель Cydonia-22B ресурсоёмкая — требует 20+ GB VRAM или эффективной quantization.
Что работает на CPU. Даже на десятилетнем железе можно получить осмысленные ответы от 13B моделей за 10-20 секунд. При 16 GB RAM потолок — 12B модель с Q4_K_M, так считают в руководстве AiManual. Для слабого компьютера — с небольших квантованных моделей в GPT4All, LM Studio или Ollama, — советуют в подборке Yudaev School.
Типичные ошибки при запуске и способы их решения
Ошибка первая: модель не влезает в память. Симптом — процесс падает или система уходит в swap. Решение из руководства AiManual: или брать модель поменьше (3B вместо 7B), или уменьшать контекст до 512, или добавлять RAM.
Ошибка вторая: слишком большой контекст. Каждые 1024 токена контекста требуют дополнительных 0.5-1 GB RAM. Отдельный параметр — Max New Tokens, сколько токенов генерировать: в руководстве AiManual советуют не ставить 2000, когда нужен ответ на вопрос, и держаться 512-768.
Ошибка третья: неверное число потоков. Указывайте число физических ядер.
Ошибка четвёртая: неверный квант. В руководстве AiManual прямо пишут: вот что бесит в современных гайдах: они говорят «используйте Q4_K_M», но не объясняют почему. Q4_K_M — золотая середина между размером и качеством. Для кода берите Q5_K_M или Q6_K.
Ошибка пятая: модель не загрузилась. Проверьте путь к файлу, целостность скачивания и свободное место на диске. Консоль покажет причину.
Ошибка шестая: зацикливание генерации. Поднимите repetition penalty до 1.07–1.15. Слишком высокое значение «ломает» стиль.
Ошибка седьмая: фронтенд не видит сервер. Проверьте порт в адресе. Server URL: http://127.0.0.1:5001/. Для доступа с другого устройства в сети используйте http://192.168.x.x:5001.
Частые вопросы
Под какой лицензией распространяется koboldcpp и можно ли использовать дома?
В обзоре Novita AI KoboldCpp называют инструментом с открытым исходным кодом, доступным на GitHub: официальный репозиторий — lostruins/koboldcpp. Лицензия самой модели скачивается отдельно вместе с весами с Hugging Face и может отличаться от лицензии программы. В подборке Yudaev School предупреждают: бесплатная программа запуска не делает автоматически бесплатной для коммерческого использования каждую модель. Перед коммерческим использованием проверьте условия конкретной модели.
Остаются ли мои данные локальными при работе с koboldcpp?
Веса модели загружаются в память вашего компьютера, генерация идёт на вашем процессоре или GPU. В обзоре на Хабре проект описывают как дающий полную автономность — без облаков, логов и подписок. При этом в подборке Yudaev School уточняют: не всегда 100% offline — поиск и скачивание моделей, веб-поиск, облачные модели и некоторые плагины требуют сети. Скачивание модели и её запуск — разные этапы.
Чем koboldcpp отличается от Ollama и LM Studio?
В подборке Yudaev School все три относят к средам запуска локальных моделей. Ollama в 2026 году сочетает desktop-приложение, CLI и локальный API. LM Studio — приложение с графическим интерфейсом, для него официально рекомендовано 16 ГБ RAM. KoboldCpp выделяется запуском одним файлом и встроенным веб-интерфейсом Kobold Lite. Для слабого компьютера советуют начинать с небольших квантованных моделей в GPT4All, LM Studio или Ollama.
Можно ли запустить koboldcpp без видеокарты?
Да. Для чисто CPU-запуска параметр GPU layers ставят в 0. Пока у вас есть процессор и 16+ ГБ оперативки, вы уже в игре. Например, 7B-модель вполне комфортно работает на ноутбуке 5-летней давности. Даже на десятилетнем железе можно получить осмысленные ответы от 13B моделей за 10-20 секунд. В подборке Yudaev School у KoboldCpp отмечают CPU-only варианты сборки.
Какую модель выбрать для первого запуска в koboldcpp?
Для быстрого старта можем выбрать рекомендованый Tiefighter 13B — совет из обзора на Хабре. Mistral-7B-Instruct — компактная (~7B) и быстрая, отлично подходит для первых экспериментов. Загрузите GGUF с Hugging Face (Qwen2.5 7B, Mistral 7B, Q4_K_M) — рекомендация из гайда MiniTavern. Проверенный рецепт для ПК с 16 GB RAM: модель 7B Q4_K_M, контекст 1024, потоки = количество ядер.
