NVIDIA отдала рутину агента open-модели Nemotron Lightning

Иллюстрация: NVIDIA разделила мозг и руки агента через Nemotron Lightning

Многие люди уверены: если агент круглосуточный, ему нужен один самый умный мозг на всё. Им кажется — планирует редко, зато крутится постоянно, значит одна дорогая модель и справится.

Точнее, крутится он не мыслями. Он тянет обновления из репозитория, проверяет ответы инструментов, подправляет формулировки, щёлкает мелкие команды. Мозг для этого не нужен — нужны руки. А счёт и задержки растут там, где вы платите за оркестрацию вместо клика.

NVIDIA как раз это и разделила: рутину отдали отдельной open-модели, а выбор «кто думает, кто делает» — отдельному диспетчеру. Не очередной класс агента в репозитории и не управляемый облачный шлюз чужого вендора — открытые веса, рецепты и свой прокси у вас.

Почему всем сразу нужен один фронтир на обновления и проверку вывода? Почему никто не хочет скучную дешёвую смену под клики? Почему хайп про «самую умную модель», а не про то, кто платит за рутину по полной цене?

Ну … платите вы. Пока «мозг» и «руки» — одно и то же окно, вы кормите оркестратора там, где хватило бы исполнителя.

Два релиза одного дня

Сравнение двух open-релизов NVIDIA от 11 августа 2026

В начале второй недели августа NVIDIA вынесла пару в open: Nemotron 3.5 Lightning — быстрая модель под исполнение шагов — и NeMo Switchyard — open-библиотека маршрутизации, которая отправляет планирование на сильную модель, а рутину — на Lightning. Первичка — блог NVIDIA и Developer Blog (оба одиннадцатого августа 2026).

Независимые сводки той же недели подтверждают дату и угол «исполнительный слой плюс маршрутизация»: CNBC, Artificial Analysis, NVIDIA Build. Зеркало на форуме: NVIDIA Developer Forum.

Lightning — исполнитель, не дирижёр

Схема роли Nemotron Lightning как исполнителя рутины агента

Архитектура — open-модель около тридцати миллиардов параметров в смеси экспертов, из них активны около трёх (у NVIDIA — 30B/3B; у Artificial Analysis замер — 31.6B total / 3.6B active). Преемник линейки Nemotron 3 Nano 30B A3B. Гибрид Mamba-2, смесь экспертов и внимание; в претрейне — предсказание сразу нескольких токенов.

Задача модели — «исполнительный слой»: вызовы инструментов, проверка результатов, делегирование субагентам, рутинные шаги. Планирование и сложные развилки остаются за фронтир-моделями — Nemotron 3 Ultra, GPT-5.6 и аналоги в вашем стеке.

NVIDIA заявляет (с оговоркой «бенчмарк»): до скорости выдачи относительно peers; минус 30% времени на agentic tasks на PinchBench — около 86% точности, 10k задач, примерно на 30% быстрее Qwen3.6 35B при схожей точности.

Artificial Analysis (независимая сводка): Intelligence Index 24 (плюс 9 к Nano 15), около 670 tok/s на pre-release DeepInfra NVFP4 endpoint; контекст до 1M tokens. NVFP4 — near-lossless относительно BF16 (Index 24 vs 24).

Лицензия OpenMDW-1.1: open weights, data, recipes; коммерческое использование без material restrictions — по формулировкам NVIDIA и AA.

Код и веса: репозиторий NVIDIA-NeMo/Nemotron (README обновлён под Lightning); чекпоинты BF16 и NVFP4 на Hugging Face, ModelScope, OpenRouter; NIM microservice на build.nvidia.com.

Локальный деплой (заявлено): один GPU — DGX Spark (GB10), H100, также RTX 5090, Jetson, RTX PRO, data center. Стек: LM Studio, llama.cpp, Ollama, Unsloth, vLLM, SGLang, TensorRT-LLM. Draft-модели для speculative decoding: DSpark (DGX Spark / low concurrency), DFlash, MTP для medium-high concurrency.

Кастомизация: LoRA / full SFT (NeMo Automodel, Megatron Bridge), RL (NeMo RL, NeMo Gym); датасет Nemotron-RL-Agentic-Terminal-Pivot для coding-agent capabilities. Модель заточена под harness вроде OpenClaw, Hermes Agent; в dev blog упоминается стек NemoClaw для security/management always-on агентов.

Контекст open-source: CNBC пишет, что это первый open-source релиз NVIDIA после публичной позиции CEO Jensen Huang (конец июля 2026) за open-weight models; NVIDIA подтвердила distillation от larger Nemotron models для capabilities Lightning. В тот же день Meta выпустила Muse Spark — фон конкуренции open models, не герой этой статьи.

Switchyard — диспетчер смен между моделями

Чеклист внедрения NeMo Switchyard как диспетчера моделей

NeMo Switchyard — open-source библиотека маршрутизации плюс Rust proxy для LLM-трафика агента. Репозиторий: NVIDIA-NeMo/Switchyard.

Паттерн из dev blog: «Plans route up to the frontier, execution routes down to Lightning». Каждый шаг workflow уходит к «самой способной и эффективной» модели из mix open / closed / NVIDIA.

Возможности: protocol translation (OpenAI Chat ↔ Anthropic Messages ↔ OpenAI Responses); multi-backend routing (random, LLM-as-classifier, signal-driven stage-router, custom); Prometheus metrics.

Установка: uv tool install nemo-switchyard[cli]; launcher path для Claude Code / Codex / OpenClaw через proxy; server path — standalone proxy.

Цифры NVIDIA (внутренние / партнёрские, не гарантия для читателя):

  • внутренний бенчмарк: frontier-level accuracy при ~⅓ стоимости task completion vs Opus 4.8 alone;
  • Boomi — 100% domain-routing, 59% traffic на 5× faster FT model;
  • LangChain — −74% cost на 145 multi-turn Deep Agents (7% calls to frontier, −6% accuracy);
  • Ramp — −58% cost, −33% runtime на SWE-Bench;
  • Cognition/Devin Desktop — −28% mean cost;
  • интеграции: Kong AI Gateway, LiteLLM plugin, Nous Research → Hermes.

Главная оговорка: README Switchyard прямо помечает проект pre-alpha, API меняется, формулировка «Experimental software. Not for production use.» При этом в релизном блоге — десятки enterprise-партнёров с процентами экономии.

Спрашивается — какой смысл верить корпоративным процентам, если в README честно написано «не для продакшена»? Разрыв между «демо-маршрутизатор» и «корпоративный роутер» держать в голове.

Anti-dup для читателя: Google вынес выбор модели в API Gateway — managed edge, один хост Vertex — другой вендор и уровень абстракции. NVIDIA сделала агента обычным Python-классом в NOOA — другой слой (harness / репозиторий), не execution-модель и не Switchyard.

Где это стыкуется с вашим стеком

Если агент уже always-on на OpenClaw, Hermes или своём harness — Lightning задуман как «дешёвая смена» под рутину, Switchyard — как прокси между клиентом агента и несколькими бэкендами без переписывания SDK на каждый шаг.

Практический порядок (смысл, не пошаговый гайд):

  1. Оставить фронтир-модель на планирование и редкие сложные ветки.
  2. Поднять Lightning локально на одном GPU (NVFP4, если железо позволяет).
  3. Поставить Switchyard как proxy между агентом и бэкендами; проверить stage-router под ваш workflow.
  4. Замерить не «красивый блоговый −30%», а свой mix: доля шагов на Lightning, latency tool loop, стоимость за сутки always-on.

Все просто: пока один мозг крутит и git pull, и развилки — вы платите за оркестрацию там, где хватило бы исполнителя.

Ограничения — не продавать мечту

  • Switchyard pre-alpha — не обещать enterprise-ready из коробки; partner quotes — pilot/benchmark.
  • 4× speed / −30% task time — vendor/AA benchmarks (PinchBench, internal Switchyard); на Artificial Analysis proprietary Gemini 3.5 Flash-Lite и GPT-5.6 Luna всё ещё выигрывают time-efficiency frontier.
  • Железо и стек NVIDIA-ориентированы: open weights ≠ «бежит везде одинаково».
  • ~30B MoE / ~3B active vs 31.6B/3.6B — расхождение marketing vs measurement; держать «около 30B MoE, около 3B active».

Что сделать дальше

Если always-on агент уже жрёт бюджет на мелочах — имеет смысл разделить «мозг» и «руки»: фронтир планирует, Lightning крутит рутину, Switchyard решает, куда уходит каждый шаг. Начинать с пилота на своём workflow и логов, а не с обещаний −74% из чужого бенчмарка.

Ритм агентов, Make и Cursor — в канале Ковчег, в Telegram Maya и MAX. Практика Cursor + Make + AI: обучение на kv-ai.ru.

Первичка: NVIDIA Blog — Lightning + Switchyard, Developer Blog — specialized task execution. Код: Nemotron, Switchyard.