NVIDIA Molt доучивает агента без смены кода

Иллюстрация: NVIDIA Molt — агент остаётся обычным кодом

Агента уже собрали: ходит к модели как обычный клиент, отвечает, крутит инструменты. А чтобы доучить его наградой из среды, раньше приходилось выкидывать этот код и переписывать всё под тяжёлую учебную систему на десятки тысяч строк.

NVIDIA Molt — другой ход: агент остаётся обычной программой на Python, в том числе на привычном клиенте OpenAI или Anthropic, и его цепляют к такому обучению без смены кода. Только это не «поставь вечером на ноутбук»: нужны кластер и задача именно доучивать модель, а не автоматизировать заявки.

Раньше доучивание съедало тот же код, который уже работал

Сравнение: старый RL-стек против агента на своём Python

Знакомая сцена. Агент на обычном клиенте уже ходит в чат, дергает инструменты, пишет логи. Всё живое. Потом приходит идея: пусть он учится на награде из среды — правильно закрыл задачу, плохо закрыл, не ушёл в сторону. И тут начинается ад.

Классические стеки обучения с подкреплением для агентов часто тянут за собой десятки тысяч строк своей вселенной. Чтобы туда засунуть твоего агента, его приходится переодевать: другой цикл, другие адаптеры, другой способ писать траекторию. Неделя уходит на то, чтобы алгоритм вообще увидел твой код, а не на то, чтобы улучшить поведение.

Это и есть боль: не «как выбрать алгоритм», а «зачем выкидывать нормальный Python ради чужого зоопарка».

Molt держит агента обычной программой, а не адаптером

Схема: как Molt цепляет обычную программу-агента к обучению

NVIDIA NeMo Labs выложила Molt — компактный стек на PyTorch для обучения агентов наградой. Дизайн-центр простой и нахальный: агент — это обычная программа. Не «агент в смысле нашего внутреннего объекта», а модуль, который ты уже умеешь писать.

Учебная часть по разным замерам — порядка девяти тысяч строк. Рядом с тяжёлыми соседями это выглядит почти тонко. Не потому что «короче значит лучше», а потому что меньше кода между твоей логикой и обучением — меньше шансов неделю чинить чужой клей.

Лицензия открытая, код на GitHub у NVIDIA-NeMo, пакет на PyPI называется molt-rl. Ставят через контейнер или через pip. Но если в голове уже щёлкнуло «поставлю и доучу своего бота к утру» — рано. Это лаборатория, не кнопка в сценарии автоматизации.

Обычный клиент OpenAI или Anthropic идёт без переписывания

Чеклист: обычный клиент OpenAI или Anthropic без переписывания

Самое полезное в новости — контракт на агента. Есть путь, где фреймворк сам крутит цикл с моделью, а ты описываешь среду в духе шага и сброса. И есть путь жёстче и ближе к жизни: ты сам владеешь циклом через привычный асинхронный клиент OpenAI или Anthropic.

Molt поднимает локальный сервер с теми же точками входа, что ждут эти клиенты. Агент думает, что ходит «как всегда». На деле каждый токен траектории ловится точно, без пересборки текста задним числом. Слоган из статьи авторов грубый и правильный: не учись на токене, который сам не породил.

Если агент по дороге уплотняет контекст — выкидывает старые реплики, сжимает префикс — сервер не ломается: сегмент закрывают, открывают новый, награда общая, обучение идёт по реально сгенерированным кускам. Без правок самого агента. В документации прямо намекают, что так можно цеплять и внешние обвязки вроде Claude Code — не потому что это «магия NVIDIA», а потому что контракт клиентский, а не самодельный.

Вот здесь и сидит сдвиг: доучивание перестаёт требовать «перепиши агента под нас». Требует другое — железо и задачу «учить политику», а не «прогнать заявку».

Минимализм кода не отменяет кластер из шестнадцати H100

Готовые сценарии из коробки завязаны на схему вроде двух узлов по восемь H100: половина учит, половина крутит прогоны. Внутри — Ray для раскладки и очередей, vLLM для генерации, AutoModel с FSDP2 для обучения. Апстрим не форкают до неузнаваемости: версии приезжают пином контейнера.

Тот же компактный цикл в статье авторов доводят до огромных моделей с экспертной параллелизацией — речь про масштаб сотен миллиардов параметров, если железо позволяет. Минимализм исходников и frontier-масштаб здесь не противоположности: один и тот же контур, другой флаг конфигурации. Только флаг без кластера ничего не значит.

Авторы честно пишут: это исследовательская инфраструктура. Для долгой коммерческой нагрузки смотрят в сторону более толстых боевых стеков. Сравнение пропускной способности с Megatron-системами — их собственный отчёт при согласованном протоколе, не независимый вердикт суда. Кто продаёт Molt как «боевой сервис обучения» — врёт или не читал инструкцию.

Путать с OpenClaw и «агентом в Make» — удобно, но глупо

Имя Molt уже успело пожить в другой истории: ассистент-шлюз, который когда-то звали иначе и который к NVIDIA отношения не имеет. Это другой зверь. Здесь — фреймворк доучивания политики, не шлюз для чатов.

И вторая ловушка ближе к нашей аудитории. Агент в Cursor или сценарий в Make решает рутину: заявки, посты, разбор писем. Molt решает другую задачу: взять программу-агента и подогнать модель наградой из среды. Если у тебя нет кластера и нет метрики «хорошо / плохо» для прогонов — тебе не «не хватает Molt», тебе не хватает постановки задачи.

Поставить контейнер на ноутбук «ради пощупать» — ещё можно поиграть в режиме исследователя. Обещать бизнесу «доучим агента без смены кода за вечер» — пустой звук. Код агента и правда можно не менять. Цену входа в железо и в постановку эксперимента — нельзя.

Кому новость нужна, а кому достаточно понять границу

Нужна тем, кто уже пишет агентов как код и упирается в потолок промптов: поведение в целом ок, но среда знает лучше, когда агент молодец. Тогда компактный стек с обычным клиентом — сигнал, что индустрия наконец перестала требовать ритуального переписывания под каждый учебный зоопарк.

Остальным достаточно запомнить границу. Автоматизация заявок и контента живёт в другом слое. Там по-прежнему здравый смысл, сценарии и нормальный стек вокруг Cursor и Make. Новости лабораторий читать полезно, чтобы не купить сказку «сейчас все агенты доучиваются сами».

Если собираете рабочие связки агентов и автоматизации без лабораторного театра — смотрите канал «Ковчег» и обучение Cursor + Make + AI. Там про то, что едет без шестнадцати H100.