Содержание
- Что такое Nemotron 3 Ultra
- Кто производитель и место в линейке
- Отличия от Nemotron 3 Nano и Nano 4B
- Ключевые характеристики
- Какие задачи решает
- Nemotron 3 Ultra Free: где бесплатно
- Как получить доступ: API, платформы, веса
- Сравнение с конкурентами
- Параметры запроса
- Системные требования и запуск
- Ограничения и слабые места
- Частые вопросы
Nemotron 3 Ultra: что это за модель NVIDIA
Черновик готовит редакция с помощью ИИ. За стандарт издания отвечает главный редактор — Валерий Курземнек.
Материал редакции Зерокодера. Счёт по выдаче снят собственным прогоном 25 сентября 2026 года; цитаты источников приведены дословно. Обновлено: сентябрь 2026.
Nemotron 3 Ultra — что это: флагманская открытая reasoning-модель NVIDIA на архитектуре Mixture-of-Experts, 550 млрд параметров всего и около 55 млрд активных на каждый токен. Веса выложили 4 июня, контекст доходит до 1 млн токенов, а на OpenRouter доступен бесплатный вариант. Ниже — характеристики, доступ, цены и ограничения. Мы скачали топ-10 Яндекса по запросу «nemotron 3 ultra что это»: текст отдали 10 из 10.
Что такое Nemotron 3 Ultra
Ключевое слово здесь — «открытая». В отличие от закрытых флагманов вроде ChatGPT или Claude, Nemotron 3 Ultra можно скачать, дообучить на собственных данных и запустить на своей инфраструктуре — так формулирует разницу обзор на BeInCrypto. Релиз состоялся 4 июня 2026 года: в открытый доступ под свободной лицензией выложили веса модели, обучающие данные и сами методики обучения.
Саму модель Дженсен Хуанг показал 1 июня в Тайбэе, а веса выложили 4 июня — это данные новости на Хабре. По масштабу это верхний сегмент: 550 млрд параметров дают качественную работу с многоступенчатыми задачами, как отмечает блог Hubris.
Кто производитель и место в линейке
Производитель — NVIDIA. Nemotron 3 Ultra — флагман семейства Nemotron 3, в котором три модели: Nano (для лёгких задач), Super (средний корпоративный сегмент) и Ultra (тяжёлые рассуждения). Такое деление приводит обзор на vc.ru.
Ultra занимает верхнюю позицию по объёму и качеству рассуждений. По независимой оценке Artificial Analysis, модель набирает 48 по их Intelligence Index — рекорд для открытой модели американской разработки и заметно выше предшественника Nemotron 3 Super. Это цитата из новости на Хабре.
Отличия от Nemotron 3 Nano и Nano 4B
Разница между тирами — в размере и назначении. Nano — младшая модель для лёгких задач, Super — средний корпоративный сегмент, Ultra — тяжёлые рассуждения. Об этом пишет обзор на vc.ru. Обе модели одного семейства, но Super — более лёгкий тир, а Ultra — более мощная версия с бóльшим числом параметров и активных экспертов на проход, уточняет блог СуперИнтеллекта.
| Модель | Позиция в линейке | Назначение |
|---|---|---|
| Nemotron 3 Nano | младший тир | лёгкие задачи |
| Nemotron 3 Nano 4B | компактный вариант младшего тира | точных характеристик в выжимке нет |
| Nemotron 3 Super | средний сегмент | корпоративные нагрузки |
| Nemotron 3 Ultra | флагман | тяжёлые рассуждения, агенты |
Nano 4B — компактная версия младшего тира. Точных характеристик именно этой конфигурации в выжимке нет, поэтому ориентируйтесь на официальную карточку модели. Практический вывод: для простых задач с небольшим контекстом достаточно Nano, для длинных агентных цепочек нужен Ultra. Если задача проще и объёмы контекста небольшие, в блоге Hubris советуют более лёгкую модель — например, Llama 3.3 70B или DeepSeek.
Ключевые характеристики
Сводка параметров по данным нескольких источников. Контекстное окно — до 1 млн токенов, по данным новости на Хабре и обзора на ServerFlow. При этом в каталоге RouterAI указано ограничение 262K токенов на запрос и длина ответа до 183K токенов — это лимиты конкретного провайдера.
| Параметр | Значение | Источник |
|---|---|---|
| Всего параметров | 550 млрд | Хабр, ServerFlow |
| Активных на токен | ~55 млрд | Хабр, BeInCrypto |
| Архитектура | Mamba-Transformer + MoE | RouterAI, СуперИнтеллект |
| Контекст | до 1 млн токенов | Хабр, ServerFlow |
| Intelligence Index | 48 баллов | Хабр, BeInCrypto |
| Скорость | свыше 300 токенов/с | vc.ru, BeInCrypto |
Архитектура — гибрид Mamba-Transformer с Mixture-of-Experts. Слои Mamba-2 обрабатывают длинные тексты быстро и экономно: затраты у них растут линейно с длиной, тогда как у обычного механизма внимания они растут лавинообразно, поясняет BeInCrypto. Именно это делает контекст свыше 500 000 токенов практичным, добавляет СуперИнтеллект.
Общий размер модели даёт широту знаний, а активация лишь части экспертов — скорость отклика, сопоставимую с гораздо меньшей моделью. По данным Artificial Analysis, Nemotron 3 Ultra 550b генерирует ответы в 5 раз быстрее других открытых моделей того же класса. Вместе с весами открыты обучающие данные и рецепты обучения под лицензией OpenMDW — так описывает состав релиза обзор на digital-razor.
Какие задачи решает
Модель спроектирована не как чат-бот для быстрого ответа, а как ядро для агентных систем, работающих автономно на протяжении сотен шагов. Она ориентирована на сценарии, в которых ИИ-агенты выполняют длительные задачи, взаимодействуют друг с другом, вызывают внешние инструменты и сохраняют контекст на протяжении множества циклов работы — так описывает назначение hightech.plus.
Практические направления: сложные рассуждения, работа с кодом и обработка больших объёмов текста. Контекст 1 млн токенов позволяет передавать целые кодовые базы, длинные документы, логи или несколько статей за один запрос без потери контекста, отмечает блог Hubris. На платформе СуперИнтеллект модель работает в текстовом режиме: приём и генерация текста, работа с документами и базами знаний, вызов инструментов и интеграций.
Nemotron 3 Ultra Free: где бесплатно
Бесплатный доступ открыт через OpenRouter: $0 за миллион входных токенов и $0 за выходные, контекст — до 1 млн токенов. Новость на Хабре добавляет: настоящая ценность релиза не в скачивании весов, а именно в бесплатном хостинге — фронтир-ризонинг за $0, пока окно открыто.
У бесплатного варианта есть ограничения. В блоге Hubris указано, что вариант nvidia/nemotron-3-ultra-550b-a55b:free работает с ограничениями по скорости и не рассчитан на высокую нагрузку. В каталоге KeyDealer бесплатная позиция доступна после подтверждённых платных пополнений на сумму от 100 рублей, промо-начисления не считаются.
Бесплатные позиции в каталогах меняются. В том же блоге KeyDealer напоминают историю с DeepSeek V4 Flash — свежий пример обратного: модель была первой бесплатной текстовой позицией каталога, а условия пересматривались. Проверить своё состояние можно через GET /v1/balance — он возвращает признак доступа по каждому маршруту.
Как получить доступ: API, платформы, веса
Для доступа из России есть отдельные маршруты. В блоге Hubris описано подключение через API с оплатой в рублях через СБП или карту, минимальное пополнение — 300 ₽. В каталоге RouterAI — один ключ и единый баланс в рублях для всех моделей каталога, API в формате OpenAI, а при сбое провайдера запрос автоматически уходит к одному из 3 остальных.
Порядок действий для API из России по инструкции блога Hubris: зарегистрироваться и пополнить баланс, получить ключ, отправить первый запрос. Весь каталог из 512 моделей доступен по одному и тому же ключу — переключаться между ними можно на лету, меняя параметр model. Модель nvidia/nemotron-3-ultra-550b-a55b доступна сразу после пополнения.
Сравнение с конкурентами
По качеству рассуждений Ultra уступает китайским открытым лидерам. Kimi K2.6 от Moonshot AI держит 54, DeepSeek V4 Pro тоже идёт впереди — впрочем, это модели куда большего размера, а доступны они только платно. DeepSeek V4 Pro — это вообще 1,6 трлн параметров, крупнейшая открытая модель на рынке.
| Модель | Intelligence Index | Доступ | Особенность |
|---|---|---|---|
| Nemotron 3 Ultra | 48 | открытые веса, есть free | скорость, контекст 1 млн |
| Kimi K2.6 | 54 | платно | лидер по качеству |
| DeepSeek V4 Pro | выше 48 | платно | 1,6 трлн параметров |
| GPT-5.5, Claude Sonnet 5, Gemini | — | платно | лидеры диалога |
В задачах общего диалога, творческого письма и мультимодальных сценариях признанными лидерами остаются модели вроде GPT-5.5, Claude Sonnet 5 или Gemini. Nemotron 3 Ultra — не универсальный лидер по всем сценариям, подчёркивает блог СуперИнтеллекта. Зато по скорости разрыв заметен: на предрелизном эндпоинте Ultra выдаёт больше 300 токенов в секунду, а сопоставимые по размеру китайские модели на коммерческих API отдают 50–100 токенов в секунду. На длинной агентной задаче из десятков шагов разница «300 против 80 токенов/с» превращается в минуты против секунд. Цены разводит сам формат релиза: обзор на vc.ru объясняет, что модель открытая и её стоимость зависит от того, у какого провайдера или на каком своём железе её крутят. Для ориентира в рублях: в каталоге RouterAI вход стоит 55 ₽ за 1 млн токенов, выход — 242 ₽ за 1 млн токенов, а закрытые флагманы вроде GPT-5.5 в том же обзоре на vc.ru идут примерно по $5 за 1 млн входных токенов.
Параметры запроса
API Nemotron 3 Ultra на RouterAI поддерживает три формата: Chat Completions, Responses API и Messages API. В каждом наборе параметров есть стандартные настройки инференса — temperature, top_p, max_tokens. Точные диапазоны значений смотрите в карточке модели у провайдера.
Практические ориентиры для настройки. Temperature управляет разбросом ответов: для кода и извлечения фактов ставьте низкие значения, для генерации идей — выше. top_p ограничивает выборку токенов и работает в паре с temperature: меняйте один параметр за раз. max_tokens задаёт длину ответа — у RouterAI лимит ответа до 183K токенов.
Отдельно про вызов инструментов: в карточке RouterAI сказано, что модель вызывает функции и умеет отвечать по строгой JSON-схеме. Для агентных сценариев это ключевая настройка — без неё многошаговые цепочки не собрать. На платформе СуперИнтеллект доступны вызов инструментов и интеграций, работа с документами и базами знаний.
Системные требования и запуск
Локальный запуск требует серьёзного железа. Чтобы держать модель локально, нужно ориентировочно от ~300 ГБ видеопамяти (NVFP4) до ~1,1 ТБ (BF16), по данным обзора на digital-razor. Формат NVFP4 на Blackwell — ориентировочно 300 ГБ, хватит четырёх-пяти ускорителей. На практике 550 млрд параметров требуют коммерческих ускорителей.
Главная ловушка «смеси экспертов» в том, что в память нужно загрузить все 550 миллиардов параметров, даже если на каждом шаге считается лишь часть. Активные 55 миллиардов определяют скорость, а полный объём — требования к видеопамяти. Доступна как базовая модель, так и квантованные версии NVFP4, FP8 и FP16.
Парк, который уже стоит в стойке, скорее всего, подойдёт; ради лучшей плотности по памяти и формата NVFP4 имеет смысл смотреть на Blackwell, но входной билет — это не обязательно новейшее железо. Для облачного запуска подойдут Amazon SageMaker, Google Cloud и Microsoft Foundry, а также NIM-микросервис.
Ограничения и слабые места
Первое — требования к железу. Локальный запуск упирается в видеопамять: от ~300 ГБ в NVFP4 до ~1,1 ТБ в BF16. Второе — модальность. На платформе СуперИнтеллект модель работает в текстовом режиме: приём и генерация текста. Мультимодальные сценарии закрывают другие модели.
Третье — лицензия и условия. Веса и датасеты распространяются под лицензией OpenMDW-1.1 Linux Foundation. Бесплатный вариант на OpenRouter работает с ограничениями по скорости и не рассчитан на высокую нагрузку. Про галлюцинации конкретных цифр в выжимке нет — оценивайте на своих задачах.
Частые вопросы
Nemotron 3 Ultra что это простыми словами?
Это открытая языковая модель NVIDIA на 550 млрд параметров, из которых на каждый токен работает около 55 млрд. Она создана для сложных рассуждений, кода и длинных агентных цепочек. Контекст доходит до 1 млн токенов. Веса выложили 4 июня 2026 года.
Nemotron 3 Ultra free — действительно бесплатна?
Да, бесплатный доступ открыт через OpenRouter: $0 за миллион входных токенов в обе стороны. Есть и вариант nvidia/nemotron-3-ultra-550b-a55b:free, но он работает с ограничениями по скорости и не рассчитан на высокую нагрузку. В каталоге KeyDealer бесплатная позиция доступна после подтверждённых пополнений от 100 рублей.
Чем Nemotron 3 Ultra отличается от Nemotron 3 Nano?
Nano — младший тир для лёгких задач, Ultra — флагман для тяжёлых рассуждений. Между ними стоит Super, средний корпоративный сегмент. Ultra — самая большая модель семейства: около 550 млрд параметров при 90% разреженности. У Nano объём параметров кратно меньше.
Как получить доступ к Nemotron 3 Ultra из России?
Через API-провайдеры с оплатой в рублях. В блоге Hubris описано подключение через СБП или карту, минимальное пополнение — 300 ₽. В каталоге RouterAI один ключ и единый баланс в рублях, API в формате OpenAI. Веса можно скачать через Hugging Face.
Сколько видеопамяти нужно для локального запуска?
Ориентировочно от ~300 ГБ в формате NVFP4 до ~1,1 ТБ в BF16. В память загружаются все 550 млрд параметров, даже если на каждом шаге считается лишь часть. Формат NVFP4 на Blackwell требует четырёх-пяти ускорителей. Домашний ПК для этого не подойдёт.
Если планируете работать с моделями через сторонние шлюзы, посмотрите разбор OpenRouter: что это, ключ, цены и доступ из России и подборку OpenRouter аналог: чем заменить и сколько стоит. Для локальных инструментов разработки пригодится материал OpenCode бесплатно: что входит и чем вы платите, а для мобильного доступа — Perplexity APK: как установить приложение на Android.
