DeepSeek выпустила V4-Flash: лёгкая модель обошла собственный флагман

31 июля 2026 года DeepSeek открыла публичную бету API-модели V4-Flash под сборкой V4-Flash-0731. Главное в релизе — не новая архитектура и не увеличение размера: облегчённая модель обошла собственный флагман V4-Pro-Preview на всех девяти опубликованных агентных и кодовых бенчмарках, при этом стоит в разы дешевле. Для команд, которые уже вызывают deepseek-v4-flash, обновление молчаливое — тот же эндпоинт, тот же ключ, то же имя модели.
Это заметный сигнал в разгорающейся ценовой войне ИИ-моделей: DeepSeek показывает, что дообучение (post-training) без смены архитектуры способно дать флагманский уровень на агентных задачах за дробь стоимости. Если вы внедряете ИИ и ML в продукт или строите автономных агентов поверх LLM через разработку API-интеграций, эта новость напрямую меняет расчёт «цена за задачу».
Что именно выпустила DeepSeek
Обновление затронуло только API — приложение и веб-версия DeepSeek остались на прежней сборке, а официальный релиз старшей V4-Pro компания анонсировала как «скоро». V4-Flash — это Mixture-of-Experts (MoE) модель на 284 млрд параметров, из которых на один инференс активируется лишь около 13 млрд (у V4-Pro активируется порядка 49 млрд). За счёт гибридного внимания — сжатого разрежённого и сильно сжатого — модель остаётся лёгкой в вычислениях.
Ключевая деталь: сборка 0731 отличается от превью-версии не архитектурой, а исключительно этапами дообучения. То есть тот же самый «скелет» модели после дополнительных итераций post-training дал резкий прирост в агентных сценариях — там, где модель должна планировать, вызывать инструменты и доводить многошаговую задачу до конца.
Как лёгкая модель обошла флагман
По опубликованным DeepSeek результатам V4-Flash-0731 превзошла более тяжёлую V4-Pro-Preview на девяти агентных и кодовых бенчмарках. Заметные цифры сборки Flash: Terminal Bench 2.1 — 82,7; DeepSWE — 54,4; DSBench-FullStack — 68,7; Cybergym — 76,7; NL2Repo — 54,2. Это тесты, которые измеряют не «болтовню», а способность модели работать в терминале, чинить реальные репозитории и решать инженерные задачи от начала до конца.
Практический смысл прост: для агентных и кодовых сценариев больший размер флагмана перестал быть автоматическим преимуществом. Компания-разработчик получила флагманское качество на профильных задачах, оставаясь в лёгком и дешёвом классе — и именно этот разрыв между «размером» и «результатом» делает релиз важным для инженерных команд.
Цена: в разы ниже флагмана
Ценник — вторая половина истории. По опубликованным тарифам за миллион токенов V4-Flash заметно дешевле V4-Pro: вход при попадании в кэш — около $0,0028 против $0,003625; вход при промахе кэша — около $0,14 против $0,435; выход — около $0,28 против $0,87. Лимит одновременных запросов у Flash тоже выше — порядка 2500 против 500 у Pro.
DeepSeek давно позиционирует свои тарифы ниже американских конкурентов, и, по данным деловой прессы, компания планирует внедрить пиковое ценообразование. Для продуктовых команд вывод очевиден: агентные пайплайны, которые прогоняют десятки и сотни тысяч токенов на задачу, при таком выходном тарифе становятся ощутимо доступнее — если качество на ваших сценариях подтверждается собственными замерами.
Что это значит для команд разработки
Молчаливое обновление — палка о двух концах. Плюс: те, кто уже интегрировал deepseek-v4-flash, получают прирост агентных способностей без единой строки миграции — тот же эндпоинт и ключ, плюс заявленная совместимость с форматом Responses API и инструментами в стиле Codex. Минус: беззвучная смена поведения модели «под капотом» означает, что ваши промпты, оценки и регрессионные тесты нужно перепрогнать — то, что работало на превью, может вести себя иначе.
Отсюда практическая рамка. Во-первых, относитесь к смене модели как к деплою: зафиксируйте офлайн-набор эталонных задач и прогоните его до и после, а не полагайтесь на «вроде стало лучше». Во-вторых, считайте цену за успешно выполненную задачу, а не за токен — дешёвый выход выгоден только если модель реже сваливается в лишние шаги. В-третьих, для чувствительных к данным сценариев учитывайте, где физически исполняются запросы, и держите обработку персональных данных в рамках ваших требований к комплаенсу.
Почему это важно в контексте ценовой войны
Релиз ложится в общий тренд второй половины 2026 года: фронтир-модели дешевеют, а разрыв между «флагманом» и «лёгкой» версией сокращается за счёт дообучения, а не только масштаба. Для бизнеса это хорошая новость — автономные агенты, ассистенты для разработчиков и обработка больших объёмов текста становятся экономически оправданнее. Но она же повышает требования к инженерной дисциплине: побеждает не тот, кто взял «самую громкую» модель, а тот, кто умеет быстро и объективно проверять её на своих задачах и переключаться без боли.
Часто задаваемые вопросы
Что выпустила DeepSeek 31 июля 2026 года? Публичную бету API-модели V4-Flash (сборка V4-Flash-0731). Обновился только API; приложение и веб-версия остались на прежней сборке, а старшая V4-Pro пока в статусе «скоро».
Правда ли, что лёгкая модель обошла флагман? По опубликованным DeepSeek результатам V4-Flash-0731 превзошла более тяжёлую V4-Pro-Preview на девяти агентных и кодовых бенчмарках, включая Terminal Bench 2.1 и DeepSWE. Прирост достигнут дообучением, без смены архитектуры.
Нужно ли что-то менять в коде при обновлении? Нет. Для тех, кто вызывает deepseek-v4-flash, эндпоинт, ключ и имя модели не меняются. Но поведение модели изменилось, поэтому промпты и оценочные тесты стоит перепрогнать.
Насколько V4-Flash дешевле V4-Pro? По опубликованным тарифам за миллион токенов выход стоит около $0,28 против $0,87 у Pro, а вход при промахе кэша — около $0,14 против $0,435. Точные цены уточняйте в актуальной документации DeepSeek.
Источники
Nikkei Asia — DeepSeek releases beta version of V4 models as AI price war heats up, 31 июля 2026 года.
Bloomberg — DeepSeek Unveils Public Beta API for Flagship AI Model, 31 июля 2026 года.
DeepSeek API Docs / TechTimes — DeepSeek Retrained V4-Flash Beats Its Flagship Pro on Nine Agent Benchmarks, 31 июля 2026 года.