Модель вроде недорогая, а на длинной задаче с терминалом и цепочкой инструментов сыпется или болтает вместо дела. Флагман тянет, но за каждый прогон жалко. Нужен исполнитель, не собеседник.
DeepSeek выкатил официальный Flash-0731: имя в вызове то же, архитектуру не меняли — просто переобучили под агентов и код. Поведение другое, код менять не надо. Заодно дали родную поддержку Responses API и Codex — формат, на котором крутятся агентные циклы.
Официальный Flash пришёл под тем же именем в вызове

31 июля 2026 в changelog DeepSeek API появилась запись: публичная бета официального DeepSeek-V4-Flash. В документации и на Hugging Face сборка зовётся DeepSeek-V4-Flash-0731. Превью с апреля этим релизом заменяется.
Вызов остаётся прежним: model=deepseek-v4-flash. На тот же идентификатор теперь отдаётся 0731. Для Chat Completions миграция кода не нужна — меняется то, что приходит с другой стороны провода.
Это не новый гигант. Та же архитектура и размер, что у V4-Flash-Preview: смесь экспертов около 284 миллиардов параметров, активных примерно 13 миллиардов, контекст до миллиона токенов, максимум ответа до 384 тысяч. Веса на Hugging Face под MIT. Прирост — от повторного дообучения, не от новой схемы железа.
Caixin и TechNode в те же сутки пишут про усиление автономных агентов и снижение цены API. Картина совпадает с официальным текстом: акцент на агентах и коде, не на «ещё одном чате».
Лёгкая модель обошла старшую превью на агентных тестах

DeepSeek прямо говорит: агентные возможности заметно усилили. На своих наборах Flash-0731, по их словам, далеко обходит V4-Pro-Preview. Цифры — с их стенда в минимальном режиме, не независимый рейтинг. Но направление понятное.
На Terminal Bench 2.1 у 0731 — 82.7 против 61.8 у превью Flash и 72.1 у Pro-Preview. На DeepSWE — 54.4 против 7.3 и 12.8. Есть ещё NL2Repo 54.2, Cybergym 76.7, Toolathlon verified 70.3, Agent Last Exam 25.2, Automation Bench 25.1. Внутренние DSBench-FullStack и DSBench-Hard — 68.7 и 59.6.
Вот сюрприз релиза: младший Flash на агентных задачах бьёт старшую превью-сестру. Это не обещание, что будущий официальный Pro всегда будет слабее. Это кейс, когда переобучение под терминал и инструменты важнее размера наклейки.
Artificial Analysis в обзоре AI-Stat даёт Intelligence Index около 50 — примерно на пункт ниже GPT-5.6 Luna в том же срезе. Developers Digest отдельно замечает: модель болтлива, около трёх медиан токенов на прогоне. Наклейка цены — одно, фактический расход на словоохотливость — другое.
Responses API и Codex нужны тем, кто гоняет циклы

Родная поддержка Responses API: base_url=https://api.deepseek.com по их гайду. Мотивация в документации короткая — закрыть спрос на Codex. Есть адаптация под Codex в CLI, в десктопе ChatGPT и в VS Code, со скриптами с cdn.deepseek.com.
Пока Responses API только у deepseek-v4-flash. Для deepseek-v4-pro обещают начало августа 2026. Режим без состояния: нет previous_response_id, нет conversation и store — историю шлёте целиком. Контекст больше миллиона — ответ 400, не тихая обрезка. В потоке нет привычного data: [DONE]; конец — на response.completed, incomplete или failed.
Параллельно живы OpenAI Chat Completions и формат Anthropic через /anthropic. Режим рассуждения по умолчанию включён; есть и без него. Уровень — low, high, max. В режиме рассуждения температура и top_p не влияют. Дополнение по середине строки — только без рассуждения.
Цена Flash ниже флагмана, но пиковые часы уже анонсировали
По официальному прайсу на 1 августа 2026 за миллион токенов Flash: попадание в кэш входа — $0.0028, промах — $0.14, выход — $0.28. Лимит параллельных запросов у Flash — 2500, у Pro — 500. У Pro для сравнения вход с кэшем $0.003625, без кэша $0.435, выход $0.87.
В доках уже описана будущая схема пик/вне пика: удвоение в 09:00–12:00 и 14:00–18:00 по Пекину. Дата включения — «когда объявят»; на 1 августа ещё не работает. Планировать бюджет по текущему прайсу можно, закладывать удвоение как факт — рано.
Обновили только Flash API. V4-Pro API, приложение и веб-чат этим релизом не трогали. Официальный V4-Pro — «скоро». С 24 июля старые имена deepseek-chat и deepseek-reasoner сняты. Картинки на вход нет: только текст; input_image в Responses заменяется заглушкой.
Если агент уже крутится на том же имени Flash
Сначала прогоните один и тот же длинный сценарий с терминалом и цепочкой инструментов на новой сборке и сравните с тем, что помните по апрельскому превью. Имя модели то же — отличие увидите в поведении, не в строке вызова.
Если крутите Codex или свой цикл на Responses — смотрите официальный гайд: история целиком, лимит миллиона жёсткий, стрим заканчивается иначе. Не ждите, что приложение DeepSeek или веб уже на 0731 — changelog прямо говорит, что APP и WEB без изменений.
Бенчмарки DeepSeek полезны как направление, не как приговор конкурентам. Свои стенды и внутренние DSBench не равны независимому рейтингу. А если модель раздувает ответы — следите за фактическими токенами, а не только за ценником за миллион.
Для тех, кто собирает агентные циклы вокруг Cursor, Make и нейросетей, разбор таких релизов и связок идёт в канале «Ковчег». Если нужен стек Cursor + Make + AI без хаоса самоучек — есть обучение.