Команда Cursor показала кейс Basis: автономные агенты помогают бухгалтерам готовить сложную партнёрскую отчётность по форме Form 1065 за шесть-семь часов вместо тридцати-сорока. Это не волшебная кнопка и не сдача бланков в инспекцию без людей. Система берёт рутину, находит первоисточники и готовит черновик для проверки бухгалтером. Разбираемся, как разработчики выстроили рассуждения в Cursor и почему одного верного ответа мало для доверия к нейросети.

Почему длинные агенты сбиваются с пути
Когда вы просите модель написать письмо или функцию, ответ готов сразу. Но в бухгалтерии задачи длятся часами. Агент Basis работает более пяти часов над одним документом. За это время он принимает сотни решений: куда направить поиск, какую норму закона взять и как связать таблицы между собой.

В долгих маршрутах кроется главная ловушка. Мелкая неточность на десятом шаге ломает логику к восьмидесятому. Модель заходит в тупик, выбирает ложный прецедент или теряет нить рассуждений. При этом у сложной отчётности нет простой проверки одной кнопкой.
Совпадение финальной суммы создаёт иллюзию успеха. Модель может выдать правильную цифру по старой памяти из базы обучения, пропустив свежие поправки. Доверять такому результату в реальных делах нельзя.
Правильный итоговый бланк ещё не доказывает надёжность процесса. Агент мог случайно угадать цифру или взять её из старых шаблонов, ни разу не заглянув в официальный налоговый кодекс.
Как в Cursor настраивают поведение системы
Разработчики Basis строили систему в Cursor с первого дня. Принцип прост: контекст модели служит рабочим входом. Небрежная фраза или кривой пример сбивают поведение цепочки. Если инженер создаёт файл правил и не вычитывает его сам, риск ошибки растёт.

Команда ведёт инструкции, навыки и описания инструментов прямо в проекте. Для этого используют спецификации поведения behavior specs в формате Markdown. Предпросмотр в Cursor помогает сразу видеть структуру правил, замечать пробелы и править текст, пока система не станет работать стабильно.
Спецификацию поведения никогда не показывают самому агенту. Её не загружают в контекст и не превращают в гигантский промпт. Это эталон для внешнего аудита, а не подсказка исполнителю.
Спецификацию поведения нельзя отдавать самому агенту в виде системного промпта. Её составляет человек в редакторе Cursor для независимого судьи, который оценивает каждый шаг цепочки со стороны.
Если вы настраиваете связки нейросетей и автоматизируете рабочие процессы, читайте наш Telegram-канал Ковчег, заглядывайте в сообщество в MAX или приходите на практическое обучение по автоматизации в Make и Cursor.
Судья проверяет доказательства, а не только итог
Чтобы оценить качество работы, авторы привлекают независимого оценщика. Судья получает спецификацию и полную запись действий агента:

- Журнал инструментов: какие функции вызывала модель по ходу работы.
- Первичные источники: обратилась ли система к закону или взяла пересказ.
- Артефакты: таблицы, расчёты и записи рассуждений на каждом шаге.
Судья выносит вердикт: подтверждено, провалено или неприменимо. Если агент посчитал налог верно, но взял формулу из статьи в сети вместо официального кодекса, фиксируется провал. Правила не подгоняют под ответ — разработчики возвращаются в Cursor и правят навыки и описания инструментов.
Вместе с Braintrust компания открыла формат на портале agentbehavior.dev и в репозитории на GitHub. Теперь любая команда может задавать правила помощникам, собирать доказательства и проверять надёжность сложных цепочек.


Автоматизация сложных отчётов не заменяет эксперта. Система готовит черновик и прикладывает ссылки на законы, но окончательное решение всегда остаётся за живым специалистом.
Что значат эти цифры на практике
Создатели кейса заявляют яркие цифры: ускорение отчётности до шести раз, а сорок процентов аудиторских фирм из топ-25 в США уже используют их решения. Но важно трезво оценивать границы.

Речь идёт об американской партнёрской форме Form 1065 по правилам налоговой службы США. Партнёрство не платит налог на прибыль само, а распределяет доходы между совладельцами. Переносить ускорение на российские налоги, например на декларацию 3-НДФЛ для физлиц по нормам ФНС России, нельзя. Это разные законы, бланки и расчёты.
Агент не отправляет отчёт в инспекцию сам. На выходе получается черновик со ссылками, который смотрит бухгалтер. Для запуска таких сценариев нужна платная подписка Cursor уровня Teams или корпоративный контур, а не базовый бесплатный тариф с лимитом запросов.

Главный урок кейса: не пытайтесь уложить длинную задачу в один промпт. Описывайте стандарты поведения отдельно, проверяйте шаги независимым оценщиком и держите контроль в руках человека.