Оставляешь агента «допиши проект» на ночь — к утру чат уже не помнит, с чего всё началось. Снова брифываешь руками: что сломалось, куда копать, какой следующий шаг.
У Qwen3.8-Max в демо Alibaba десять дней держались не на «умном диалоге», а на очереди задач: агент брал issue, писал код, гонял тесты и кидал ошибки обратно в список. Без такого контура длинный прогон в Cursor или Make сдыхает на второй день — какая бы модель ни стояла в чате.
3 августа 2026 Alibaba выпустила Qwen3.8-Max — флагман линейки с доступом через Model Studio. В пресс-релизе привычный набор цифр: около 2,4 трлн параметров всего, порядка 95 млрд активных на токен, контекст до миллиона. Это фон. Главный жест релиза — не таблица арен, а история про автономный кодинг дольше выходных.
Десять дней кодинга держались на issue, а не на чате

В официальном блоге Alibaba Cloud описан прогон дольше десяти дней: с нуля собрали стенд под названием oh-my-cli. Не «модель сама написала приложение в одном окне», а конвейер. Требования уходили в GitHub Issues. Задача проходила состояния вроде «готова → взята → в работе». Агент брал работу, писал код, прогонял сборку, юнит-тесты, сквозные проверки и жизненный цикл настольного приложения. Сбой не исчезал в истории диалога — он возвращался в issue или запрос на слияние.
На срезе 30 июля, примерно после шестнадцати дней без человека у пульта, публичный трейс показывает 265 коммитов, 127 запросов на слияние и 151 issue. Репозиторий лежит открыто: qwen-code-dev-bot/oh-my-cli. Цифры важны не как рекорд, а как пропорция. Агент больше жил в очереди задач и ревью, чем «просто писал файлы».
Рядом у вендора есть другие длинные кейсы — воспроизведение научной статьи за несколько суток, суточный спринт на соревновании, проектирование чипа на сотнях ходов. Их можно держать в голове как фон. Угол здесь один: длинный горизонт = дисциплина цикла, а не размер модели в заголовке пресс-релиза.
Чат теряет нить, потому что у него нет возврата ошибок

Обычный сценарий знаком каждому, кто гоняет агента в Cursor или собирает сценарий в Make. Вечером формулируешь цель. Ночью модель что-то делает. Утром контекст уже съехал: половина шагов в одном сообщении, баг в другом, «продолжи» — и агент начинает заново угадывать, что считать правдой.
Проблема не в том, что модель «глупая». Проблема в том, что у длинной работы нет внешней памяти с правилами. Нет списка, из которого берётся следующая задача. Нет автоматического возврата падения теста в ту же очередь. Нет сторожа, который остановит бессмысленный круг. Чат — это черновик разговора. Проект на десять дней — это завод с талонами.
Пока талона нет, вы снова становитесь диспетчером: читаете логи, объясняете заново, копируете куски в новый промпт. Это не «почти автономность». Это удалённый джун без трекера.
Очередь задач делает модель сменным рабочим, а не магом

В демо Qwen контур выглядит просто, если смотреть по смыслу, а не по маркетингу. Есть список работ. Есть состояние «взято». Есть проверка после кода. Есть путь обратно в список, если проверка красная. Модель в этом контуре — исполнитель на смене, а не оракул в бесконечном диалоге.
Отсюда практический вывод для Cursor и Make. Сначала решите, где живёт правда о проекте: issue-трекер, таблица статусов, очередь в сценарии, файлы с критериями приёмки. Потом подключайте модель. Если правда живёт только в чате — длинный прогон закончится раньше, чем вы допьёте кофе.
В Cursor это выглядит как жёсткое правило: одна задача из списка, один критерий «готово», тест или проверка до следующего пункта. В Make — как сценарий, где падение шага создаёт новую карточку или возвращает запись в статус «чинить», а не молча умирает на входящем запросе. Без этого даже дорогая модель будет крутить один и тот же косяк, пока не кончатся токены.
Дешёвый Max не отменяет отставание на жёстких бенчах
По разбору на Хабре API заявлен примерно по $2 за миллион входных токенов и $6 за выходные, чтение кэша около $0,25. Это заметно дешевле заявленных цен на Claude Opus 5 и дешевле Kimi K3 по выходу. Совместимость заявлена с привычными оболочками вроде Claude Code и Codex — то есть ключ можно воткнуть в уже знакомый стенд.
Но на срезе Terminal-Bench 2.1 и DeepSWE Qwen3.8-Max уступает лидерам, при том что маркетинг продаёт именно длинный горизонт. Независимая верификация официальных таблиц ещё идёт. Значит, выбор «взять Max, потому что десять дней в пресс-релизе» — плохая логика. Выбор «взять контур очереди, а модель подобрать под цену и совместимость» — нормальная.
Открытые веса класса Max обещали на следующей неделе после анонса; на день релиза их ещё не выложили, лицензию тоже рано считать финальной. API уже есть. Для практики важнее второе: можно проверить цикл на своих задачах, не дожидаясь весов на диске.
Свой длинный прогон начинается с одного талона, а не с гигантской модели
Не нужно копировать шестнадцатидневный завод Alibaba. Нужно перестать врать себе про «агент сам допишет». Возьмите одну реальную задачу на вечер. Запишите её вне чата: что сломано, как проверить, что считать готовым. Запустите агента только на этот талон. Если тест красный — талон не закрывается, а возвращается с формулировкой ошибки. Если зелёный — берёте следующий.
Через пару таких кругов станет видно, чего не хватает: сторожа по времени, запрета трогать чужие файлы, отдельного шага ревью, лимита на повтор одной и той же правки. Это и есть стенд. Модель в нём можно менять. Без него любая «топовая» модель — дорогой собеседник с короткой памятью.
Рынок снова показал то же самое другим ярлыком. Qwen3.8-Max — повод проверить свой контур, а не повод верить, что размер параметра сам удержит проект две недели.
Разборы автоматизации с нейросетями, Make и Cursor — в канале «Ковчег». Если собираете стек под агентов и субагентов с нуля, программа обучения Cursor + Make + AI лежит на kv-ai.ru/obuchenie-po-make.