DeepSeek V4 Pro уступила в тестах конкурентам

Но в кибербезопасности модель превзошла всех соперников

2 мин.
DeepSeek V4 Pro уступила в тестах конкурентам

Китайский стартап DeepSeek без громких анонсов представил обновлённую версию флагманской языковой модели – DeepSeek-V4-Pro-0813. Первые независимые оценки оказались достаточно неоднозначными: модель не смогла закрепиться среди лидеров общего рейтинга, вызвала вопросы у разработчиков из-за качества выполнения сложных задач и стоимости использования. При этом в тестах по поиску уязвимостей она показала лучший результат среди всех протестированных систем.

Краткое сообщение о релизе появилось на официальном сайте DeepSeek 12 августа. В нём утверждалось, что новая версия получила «существенно расширенные агентные возможности», однако к следующему дню публикация была удалена. Полноценного технического отчёта о модели компания пока не выпустила.

Результаты бенчмарков

В индексе Artificial Analysis Intelligence Index DeepSeek-V4-Pro-0813 набрала 53 балла. Это соответствует результату GLM-5.2 от Zhipu AI, представленной в июне, но на четыре балла меньше, чем у модели Terra из линейки OpenAI GPT-5.6. От Kimi K3 компании Moonshot AI новая разработка DeepSeek отстала на семь баллов.

В рейтинге Vals Index, который составляет базирующаяся в Сан-Франциско компания Vals AI, модель заняла 12-е место. Она оказалась ниже предыдущего поколения OpenAI GPT-5.5 и заметно уступила передовым системам Kimi K3 и Claude Opus 5 компании Anthropic.

По данным Vals AI, DeepSeek-V4-Pro-0813 особенно плохо справлялась с двумя категориями заданий: работой в изолированной среде терминала и созданием сложных финансовых моделей в Excel. Разработчики и отраслевые наблюдатели также сообщали в социальных сетях, что модель могла преждевременно прекращать выполнение длительных задач по программированию.

Сильная сторона – поиск уязвимостей

Наиболее заметным преимуществом обновлённой модели стала кибербезопасность. Согласно испытаниям бельгийской компании Aikido Security, DeepSeek-V4-Pro-0813 обнаружила больше системных уязвимостей, чем любая другая протестированная модель.

Исследователь Aikido Security отметил, что системе недостаёт точности: часть её срабатываний может не иметь практической ценности. Однако по количеству найденных проблем она опередила Claude Opus 5 от Anthropic и Qwen 3.8 от Alibaba.

Цена и дальнейшие планы

Реакция пользователей затронула и стоимость API. Миллион входных токенов для DeepSeek-V4-Pro-0813 стоит около 44 центов США, а миллион выходных – 87 центов. В Artificial Analysis первую цену назвали несколько выше медианы рынка, составляющей 33 цента, тогда как стоимость выходных токенов сочли умеренной.

Ориентировочная цена одного задания, по данным Artificial Analysis Intelligence Index, составляет 6 центов. Это немного дороже облегчённой модели OpenAI GPT-5.6 Luna, для которой показатель равен 5 центам, но примерно на 93% дешевле Kimi K3: выполнение задания с ней стоило 84 цента.

Ценовая политика особенно заметна на фоне DeepSeek V4 Flash, выпущенной 31 июля. Эта более компактная модель привлекла внимание рынка благодаря низкой стоимости. На прошлой неделе DeepSeek предупредила о «существенном» повышении тарифов из-за растущего спроса и посоветовала клиентам планировать использование сервиса заранее.

Компания также готовит DeepSeek Harness – программную платформу, которая должна позволить языковым моделям работать как автономные ИИ-агенты. По своему назначению продукт сопоставим с Claude Code. В начале августа DeepSeek пригласила разработчиков проектов с открытым исходным кодом к бета-тестированию; учётная запись команды DeepSeek Harness в WeChat была зарегистрирована ещё в июле.

Мнение редакции

Безусловно, отставание в универсальных тестах может стать существенным ограничением для разработчиков, особенно при работе с кодом и финансовыми документами. Но результат в поиске уязвимостей демонстрирует, что специализированные сценарии способны стать для модели более весомым аргументом, чем очередной прирост баллов в бенчмарках. А сможет ли DeepSeek превратить это преимущество в надёжный инструмент с предсказуемой точностью и понятной ценой – ещё не факт.