Содержание
  1. Что такое Nemotron 3 Ultra
  2. Кто производитель и место в линейке
  3. Отличия от Nemotron 3 Nano и Nano 4B
  4. Ключевые характеристики
  5. Какие задачи решает
  6. Nemotron 3 Ultra Free: где бесплатно
  7. Как получить доступ: API, платформы, веса
  8. Сравнение с конкурентами
  9. Параметры запроса
  10. Системные требования и запуск
  11. Ограничения и слабые места
  12. Частые вопросы
Справочник

Nemotron 3 Ultra: что это за модель NVIDIA

25 сентября 2026 · 10 минут чтения

Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 25 сентября 2026 года; цитаты источников приведены дословно. Обновлено: сентябрь 2026.

Nemotron 3 Ultra — что это: флагманская открытая reasoning-модель NVIDIA на архитектуре Mixture-of-Experts, 550 млрд параметров всего и около 55 млрд активных на каждый токен. Веса выложили 4 июня, контекст доходит до 1 млн токенов, а на OpenRouter доступен бесплатный вариант. Ниже — характеристики, доступ, цены и ограничения. Мы скачали топ-10 Яндекса по запросу «nemotron 3 ultra что это»: текст отдали 10 из 10.

Что такое Nemotron 3 Ultra

Ключевое слово здесь — «открытая». В отличие от закрытых флагманов вроде ChatGPT или Claude, Nemotron 3 Ultra можно скачать, дообучить на собственных данных и запустить на своей инфраструктуре — так формулирует разницу обзор на BeInCrypto. Релиз состоялся 4 июня 2026 года: в открытый доступ под свободной лицензией выложили веса модели, обучающие данные и сами методики обучения.

Саму модель Дженсен Хуанг показал 1 июня в Тайбэе, а веса выложили 4 июня — это данные новости на Хабре. По масштабу это верхний сегмент: 550 млрд параметров дают качественную работу с многоступенчатыми задачами, как отмечает блог Hubris.

Кто производитель и место в линейке

Производитель — NVIDIA. Nemotron 3 Ultra — флагман семейства Nemotron 3, в котором три модели: Nano (для лёгких задач), Super (средний корпоративный сегмент) и Ultra (тяжёлые рассуждения). Такое деление приводит обзор на vc.ru.

Ultra занимает верхнюю позицию по объёму и качеству рассуждений. По независимой оценке Artificial Analysis, модель набирает 48 по их Intelligence Index — рекорд для открытой модели американской разработки и заметно выше предшественника Nemotron 3 Super. Это цитата из новости на Хабре.

Отличия от Nemotron 3 Nano и Nano 4B

Разница между тирами — в размере и назначении. Nano — младшая модель для лёгких задач, Super — средний корпоративный сегмент, Ultra — тяжёлые рассуждения. Об этом пишет обзор на vc.ru. Обе модели одного семейства, но Super — более лёгкий тир, а Ultra — более мощная версия с бóльшим числом параметров и активных экспертов на проход, уточняет блог СуперИнтеллекта.

Модель Позиция в линейке Назначение
Nemotron 3 Nano младший тир лёгкие задачи
Nemotron 3 Nano 4B компактный вариант младшего тира точных характеристик в выжимке нет
Nemotron 3 Super средний сегмент корпоративные нагрузки
Nemotron 3 Ultra флагман тяжёлые рассуждения, агенты

Nano 4B — компактная версия младшего тира. Точных характеристик именно этой конфигурации в выжимке нет, поэтому ориентируйтесь на официальную карточку модели. Практический вывод: для простых задач с небольшим контекстом достаточно Nano, для длинных агентных цепочек нужен Ultra. Если задача проще и объёмы контекста небольшие, в блоге Hubris советуют более лёгкую модель — например, Llama 3.3 70B или DeepSeek.

Ключевые характеристики

Сводка параметров по данным нескольких источников. Контекстное окно — до 1 млн токенов, по данным новости на Хабре и обзора на ServerFlow. При этом в каталоге RouterAI указано ограничение 262K токенов на запрос и длина ответа до 183K токенов — это лимиты конкретного провайдера.

Параметр Значение Источник
Всего параметров 550 млрд Хабр, ServerFlow
Активных на токен ~55 млрд Хабр, BeInCrypto
Архитектура Mamba-Transformer + MoE RouterAI, СуперИнтеллект
Контекст до 1 млн токенов Хабр, ServerFlow
Intelligence Index 48 баллов Хабр, BeInCrypto
Скорость свыше 300 токенов/с vc.ru, BeInCrypto

Архитектура — гибрид Mamba-Transformer с Mixture-of-Experts. Слои Mamba-2 обрабатывают длинные тексты быстро и экономно: затраты у них растут линейно с длиной, тогда как у обычного механизма внимания они растут лавинообразно, поясняет BeInCrypto. Именно это делает контекст свыше 500 000 токенов практичным, добавляет СуперИнтеллект.

Общий размер модели даёт широту знаний, а активация лишь части экспертов — скорость отклика, сопоставимую с гораздо меньшей моделью. По данным Artificial Analysis, Nemotron 3 Ultra 550b генерирует ответы в 5 раз быстрее других открытых моделей того же класса. Вместе с весами открыты обучающие данные и рецепты обучения под лицензией OpenMDW — так описывает состав релиза обзор на digital-razor.

Какие задачи решает

Модель спроектирована не как чат-бот для быстрого ответа, а как ядро для агентных систем, работающих автономно на протяжении сотен шагов. Она ориентирована на сценарии, в которых ИИ-агенты выполняют длительные задачи, взаимодействуют друг с другом, вызывают внешние инструменты и сохраняют контекст на протяжении множества циклов работы — так описывает назначение hightech.plus.

Практические направления: сложные рассуждения, работа с кодом и обработка больших объёмов текста. Контекст 1 млн токенов позволяет передавать целые кодовые базы, длинные документы, логи или несколько статей за один запрос без потери контекста, отмечает блог Hubris. На платформе СуперИнтеллект модель работает в текстовом режиме: приём и генерация текста, работа с документами и базами знаний, вызов инструментов и интеграций.

Nemotron 3 Ultra Free: где бесплатно

Бесплатный доступ открыт через OpenRouter: $0 за миллион входных токенов и $0 за выходные, контекст — до 1 млн токенов. Новость на Хабре добавляет: настоящая ценность релиза не в скачивании весов, а именно в бесплатном хостинге — фронтир-ризонинг за $0, пока окно открыто.

У бесплатного варианта есть ограничения. В блоге Hubris указано, что вариант nvidia/nemotron-3-ultra-550b-a55b:free работает с ограничениями по скорости и не рассчитан на высокую нагрузку. В каталоге KeyDealer бесплатная позиция доступна после подтверждённых платных пополнений на сумму от 100 рублей, промо-начисления не считаются.

Бесплатные позиции в каталогах меняются. В том же блоге KeyDealer напоминают историю с DeepSeek V4 Flash — свежий пример обратного: модель была первой бесплатной текстовой позицией каталога, а условия пересматривались. Проверить своё состояние можно через GET /v1/balance — он возвращает признак доступа по каждому маршруту.

Как получить доступ: API, платформы, веса

Для доступа из России есть отдельные маршруты. В блоге Hubris описано подключение через API с оплатой в рублях через СБП или карту, минимальное пополнение — 300 ₽. В каталоге RouterAI — один ключ и единый баланс в рублях для всех моделей каталога, API в формате OpenAI, а при сбое провайдера запрос автоматически уходит к одному из 3 остальных.

Порядок действий для API из России по инструкции блога Hubris: зарегистрироваться и пополнить баланс, получить ключ, отправить первый запрос. Весь каталог из 512 моделей доступен по одному и тому же ключу — переключаться между ними можно на лету, меняя параметр model. Модель nvidia/nemotron-3-ultra-550b-a55b доступна сразу после пополнения.

Сравнение с конкурентами

По качеству рассуждений Ultra уступает китайским открытым лидерам. Kimi K2.6 от Moonshot AI держит 54, DeepSeek V4 Pro тоже идёт впереди — впрочем, это модели куда большего размера, а доступны они только платно. DeepSeek V4 Pro — это вообще 1,6 трлн параметров, крупнейшая открытая модель на рынке.

Модель Intelligence Index Доступ Особенность
Nemotron 3 Ultra 48 открытые веса, есть free скорость, контекст 1 млн
Kimi K2.6 54 платно лидер по качеству
DeepSeek V4 Pro выше 48 платно 1,6 трлн параметров
GPT-5.5, Claude Sonnet 5, Gemini — платно лидеры диалога

В задачах общего диалога, творческого письма и мультимодальных сценариях признанными лидерами остаются модели вроде GPT-5.5, Claude Sonnet 5 или Gemini. Nemotron 3 Ultra — не универсальный лидер по всем сценариям, подчёркивает блог СуперИнтеллекта. Зато по скорости разрыв заметен: на предрелизном эндпоинте Ultra выдаёт больше 300 токенов в секунду, а сопоставимые по размеру китайские модели на коммерческих API отдают 50–100 токенов в секунду. На длинной агентной задаче из десятков шагов разница «300 против 80 токенов/с» превращается в минуты против секунд. Цены разводит сам формат релиза: обзор на vc.ru объясняет, что модель открытая и её стоимость зависит от того, у какого провайдера или на каком своём железе её крутят. Для ориентира в рублях: в каталоге RouterAI вход стоит 55 ₽ за 1 млн токенов, выход — 242 ₽ за 1 млн токенов, а закрытые флагманы вроде GPT-5.5 в том же обзоре на vc.ru идут примерно по $5 за 1 млн входных токенов.

Параметры запроса

API Nemotron 3 Ultra на RouterAI поддерживает три формата: Chat Completions, Responses API и Messages API. В каждом наборе параметров есть стандартные настройки инференса — temperature, top_p, max_tokens. Точные диапазоны значений смотрите в карточке модели у провайдера.

Практические ориентиры для настройки. Temperature управляет разбросом ответов: для кода и извлечения фактов ставьте низкие значения, для генерации идей — выше. top_p ограничивает выборку токенов и работает в паре с temperature: меняйте один параметр за раз. max_tokens задаёт длину ответа — у RouterAI лимит ответа до 183K токенов.

Отдельно про вызов инструментов: в карточке RouterAI сказано, что модель вызывает функции и умеет отвечать по строгой JSON-схеме. Для агентных сценариев это ключевая настройка — без неё многошаговые цепочки не собрать. На платформе СуперИнтеллект доступны вызов инструментов и интеграций, работа с документами и базами знаний.

Системные требования и запуск

Локальный запуск требует серьёзного железа. Чтобы держать модель локально, нужно ориентировочно от ~300 ГБ видеопамяти (NVFP4) до ~1,1 ТБ (BF16), по данным обзора на digital-razor. Формат NVFP4 на Blackwell — ориентировочно 300 ГБ, хватит четырёх-пяти ускорителей. На практике 550 млрд параметров требуют коммерческих ускорителей.

Главная ловушка «смеси экспертов» в том, что в память нужно загрузить все 550 миллиардов параметров, даже если на каждом шаге считается лишь часть. Активные 55 миллиардов определяют скорость, а полный объём — требования к видеопамяти. Доступна как базовая модель, так и квантованные версии NVFP4, FP8 и FP16.

Парк, который уже стоит в стойке, скорее всего, подойдёт; ради лучшей плотности по памяти и формата NVFP4 имеет смысл смотреть на Blackwell, но входной билет — это не обязательно новейшее железо. Для облачного запуска подойдут Amazon SageMaker, Google Cloud и Microsoft Foundry, а также NIM-микросервис.

Ограничения и слабые места

Первое — требования к железу. Локальный запуск упирается в видеопамять: от ~300 ГБ в NVFP4 до ~1,1 ТБ в BF16. Второе — модальность. На платформе СуперИнтеллект модель работает в текстовом режиме: приём и генерация текста. Мультимодальные сценарии закрывают другие модели.

Третье — лицензия и условия. Веса и датасеты распространяются под лицензией OpenMDW-1.1 Linux Foundation. Бесплатный вариант на OpenRouter работает с ограничениями по скорости и не рассчитан на высокую нагрузку. Про галлюцинации конкретных цифр в выжимке нет — оценивайте на своих задачах.

Частые вопросы

Nemotron 3 Ultra что это простыми словами?

Это открытая языковая модель NVIDIA на 550 млрд параметров, из которых на каждый токен работает около 55 млрд. Она создана для сложных рассуждений, кода и длинных агентных цепочек. Контекст доходит до 1 млн токенов. Веса выложили 4 июня 2026 года.

Nemotron 3 Ultra free — действительно бесплатна?

Да, бесплатный доступ открыт через OpenRouter: $0 за миллион входных токенов в обе стороны. Есть и вариант nvidia/nemotron-3-ultra-550b-a55b:free, но он работает с ограничениями по скорости и не рассчитан на высокую нагрузку. В каталоге KeyDealer бесплатная позиция доступна после подтверждённых пополнений от 100 рублей.

Чем Nemotron 3 Ultra отличается от Nemotron 3 Nano?

Nano — младший тир для лёгких задач, Ultra — флагман для тяжёлых рассуждений. Между ними стоит Super, средний корпоративный сегмент. Ultra — самая большая модель семейства: около 550 млрд параметров при 90% разреженности. У Nano объём параметров кратно меньше.

Как получить доступ к Nemotron 3 Ultra из России?

Через API-провайдеры с оплатой в рублях. В блоге Hubris описано подключение через СБП или карту, минимальное пополнение — 300 ₽. В каталоге RouterAI один ключ и единый баланс в рублях, API в формате OpenAI. Веса можно скачать через Hugging Face.

Сколько видеопамяти нужно для локального запуска?

Ориентировочно от ~300 ГБ в формате NVFP4 до ~1,1 ТБ в BF16. В память загружаются все 550 млрд параметров, даже если на каждом шаге считается лишь часть. Формат NVFP4 на Blackwell требует четырёх-пяти ускорителей. Домашний ПК для этого не подойдёт.

Если планируете работать с моделями через сторонние шлюзы, посмотрите разбор OpenRouter: что это, ключ, цены и доступ из России и подборку OpenRouter аналог: чем заменить и сколько стоит. Для локальных инструментов разработки пригодится материал OpenCode бесплатно: что входит и чем вы платите, а для мобильного доступа — Perplexity APK: как установить приложение на Android.

Читайте также

3 материала