Компания OpenAI представила GPT‑6 Astra — новую флагманскую модель искусственного интеллекта. Компания называет её наиболее производительной и согласованной с намерениями пользователя системой в своей линейке. Разработчик сообщает, что модель объединяет результаты многолетних исследований в предварительном обучении, обучении с подкреплением и выравнивании поведения ИИ.
По данным OpenAI, GPT‑6 Astra предназначена для работы с компьютером и браузером, программирования, научных исследований, анализа данных, создания документов и выполнения профессиональных многошаговых процессов. Первоначально доступ к ней получит ограниченный круг организаций, затем модель появится у подписчиков ChatGPT Plus, Pro, Business и Enterprise, а также в OpenAI API, Microsoft Azure и Amazon Bedrock.
Заявленные результаты тестов
OpenAI утверждает, что GPT‑6 Astra показывает высокие результаты в ряде внутренних и внешних тестов. На FrontierMath Tier 4 модель получила 97,6%, на ARC-AGI-3 — 99,9%, а на ExploitBench — 100%. Компания также сообщает, что Astra уже участвовала в решении двух математических задач о промежутках между простыми числами.

В тесте Terminal-Bench Science 0.1, оценивающем выполнение научных задач с использованием кода и терминала, Astra набрала 64,6%. Для сравнения, указанный в материале результат Claude Fable 5.1 составил 52,6%. OpenAI оценивает предполагаемую стоимость API-задач у своей модели примерно на 31% ниже при приведённой конфигурации.

Представитель ARC Prize Foundation Грег Камрадт отметил, что Astra превзошла базовый показатель эффективности действий человека на 96% уровней ARC-AGI-3. По его словам, модель достигла сопоставимого с человеком уровня в этом бенчмарке и заметно продвинулась в решении новых сред.
Работа с компьютером и браузером
Одним из ключевых направлений OpenAI называет управление компьютером. Согласно описанию компании, GPT‑6 Astra способна заполнять веб-формы, обновлять записи в CRM-системах, вести календарь, искать сведения в интернете, готовить сводки в электронной почте и текстовых редакторах, анализировать данные, строить графики, создавать сайты и проверять работу их интерфейсов.
Модель также может устанавливать и тестировать программное обеспечение, диагностировать неполадки на экране и работать в специализированных приложениях. В качестве демонстрации OpenAI показала, как Astra создаёт разводку печатной платы в KiCad: система размещает компоненты и прокладывает соединения, превращая электрическую схему в проект платы, пригодный для производства.
В Agents’ Last Exam, где агенты решают профессиональные задачи в реальном ПО, GPT‑6 Astra получила 59,3%. В опубликованном сравнении Claude Opus 5 набрала 55,5%, а GPT‑5.6 Sol — 53,6%. При настройках с максимальным результатом Astra, по оценке OpenAI, использовала примерно на 65% меньше выходных токенов, чем Opus 5.
В симуляциях задержек на OSWorld 2.0 новая модель выполнила задачи с результатом 72,6% примерно за 40 минут на задачу. Для GPT‑5.6 Sol приводится результат 65,7% при времени около 75 минут. OpenAI также обновляет среду Codex: в сочетании с Astra это должно ускорить выполнение задач в бенчмарке Mind2Web в 1,9 раза по сравнению с текущим опытом GPT‑5.6 Sol.
Документы, дизайн и профессиональные процессы
OpenAI позиционирует Astra как модель для подготовки документов, презентаций, таблиц и аналитических материалов. Разработчик заявляет, что она лучше следует существующим шаблонам, сохраняет корпоративный стиль и отбирает только значимый для задачи контекст, не перегружая результат повторяющейся информацией.
На BenchCAD, который проверяет восстановление трёхмерных объектов по изображениям с нескольких ракурсов через генерацию CAD-кода, Astra достигла 95,9% геометрического совпадения. Для GPT‑5.6 Sol в статье указан результат 83,3%, для Claude Fable 5.1 — 84,3%. При показанных настройках OpenAI оценивает стоимость работы Astra примерно на 43% ниже, чем у Sol, и на 86% ниже, чем у Fable 5.1.
Через функцию Sites в ChatGPT модель, как утверждает компания, сможет создавать, размещать и публиковать сайты, веб-приложения и игры по текстовому запросу. В числе демонстраций — создание трёхмерной модели дома в Blender с последующей сборкой прогулочной сцены в Unreal Engine 5, а также разработка браузерной гоночной игры.
OpenAI подчёркивает, что при неоднозначных инструкциях Astra должна самостоятельно закрывать рутинные пробелы контекстом и задавать уточняющие вопросы, если ответ способен изменить итог работы. В Codex модель может направить вопрос асинхронно, продолжая независимые части задачи. Если пользователь не отвечает, система применит разумные допущения там, где это допустимо, но остановится перед значимыми решениями.
Компания также заявляет, что модель лучше удерживает исходную цель при изменении требований. Ранние версии ИИ могли воспринимать уточнения как совершенно новую задачу и терять прежние ограничения; Astra, по описанию OpenAI, должна учитывать новые вводные, отвечать на промежуточные вопросы и не терять общий контекст.
Программирование и длинный контекст
OpenAI называет GPT‑6 Astra своей наиболее сильной моделью для разработки программного обеспечения. В Terminal-Bench 4.0, который включает задачи по инженерии ПО, конфигурации систем и анализу данных в терминале, Astra получила 57,9%. GPT‑5.6 Sol набрала 37,3%, Claude Fable 5.1 – 55,8%. По оценке разработчика, стоимость выполнения задачи у Astra ниже примерно на 9% относительно Sol и на 63% относительно Fable 5.1.
В Codex появится экспериментальный механизм сохранения и поиска контекста. Вместо многократного сжатия длинной сессии в единое резюме Astra сможет вести заметки, а прежние сообщения и результаты работы инструментов останутся доступными для поиска. Функцию можно включить в файле конфигурации Codex; в ближайшие недели она должна стать настройкой по умолчанию для Astra.
При этом компания оговаривает, что отдельные тесты проводились в исследовательской среде или через API, поэтому результаты могут отличаться от поведения модели в потребительской версии ChatGPT из-за системных инструкций и набора доступных инструментов.
Наука и медицина
В сфере науки OpenAI сообщает о результате 96% на GPQA Diamond — тесте на знания и рассуждения уровня аспирантуры в биологии, химии и физике. При более экономичной настройке Astra, по данным компании, набрала 94,9%, превысив лучший результат GPT‑5.6 Sol в 94,6% при примерно на 37% меньшей расчётной стоимости API.
Компания отмечает, что модель способна работать непосредственно в научном программном обеспечении: проверять качество секвенирования, визуализировать генетические варианты, изучать данные и помогать исследователям определить направление дальнейшего анализа. В опубликованной таблице приведены, в частности, результаты 37,8% на GeneBench Pro, 49,3% на внутреннем MedChemBench, 60,3% на LifeSciBench и 63,4% на HealthBench Professional.
Отдельно OpenAI описала две работы о распределении простых чисел. По версии компании, Astra помогла улучшить границу для бесконечного числа пар простых чисел с расстоянием не более 240 до 186. Также модель участвовала в улучшении одного из слагаемых в оценке необычно больших промежутков между простыми числами, которое, как утверждается, оставалось неизменным более 80 лет. OpenAI опубликовала ссылки на доказательства и сопроводительные материалы.
Кибербезопасность и ограничения
OpenAI относит возможности GPT‑6 Astra в кибербезопасности к уровню Critical в собственной системе Preparedness Framework. Компания указывает, что модель может находить уязвимости и помогать проверять код и готовить исправления, однако те же способности требуют дополнительных ограничений.
В тесте ExploitBench, который оценивает создание работающих эксплойтов на основе известных уязвимостей, Astra набрала 100% против 78,5% у GPT‑5.6 Sol. В ExploitGym показатели составили 42,4% и 30,3% соответственно. На внутреннем наборе ExploitBench, включавшем уязвимости V8 за июнь—август 2026 года, OpenAI приводит результат 39% для Astra и 11,5% для Sol.
По утверждению компании, во время оценки Astra обнаружила и использовала две ранее неизвестные уязвимости нулевого дня, о которых разработчик намерен уведомить сопровождающих затронутых продуктов. На SRE-Bench, проверяющем реверс-инжиниринг бинарных файлов без доступа к исходному коду, модель решила 88% задач с первой попытки и 99,2% — за четыре попытки. Для GPT‑5.6 Sol приводятся 55,9% и 68,7%.
В версии, запускаемой для широкой аудитории, Astra должна отказывать в выполнении более продвинутых киберзадач, включая создание proof-of-concept-эксплойтов. Через программу OpenAI Daybreak компания планирует расширять доступ к оборонительным сценариям, в том числе к проверке уязвимостей и PoC, анализу вредоносного ПО и созданию средств обнаружения угроз. Разработчик предупреждает, что дополнительные проверки безопасности могут замедлять, приостанавливать или прекращать и легитимные действия; в ChatGPT и Codex пользователь в таком случае может получить запрос на подтверждение, а в API задача будет остановлена.
Выравнивание поведения
OpenAI утверждает, что GPT‑6 Astra лучше соблюдает установленные пользователем границы и прозрачнее сообщает о своих возможностях. В тесте на небезопасное использование компьютера доля несогласованных результатов для Astra составила 2,4%, тогда как для Claude Fable 5.1 и Claude Opus 5 в приведённом сравнении указаны 9,5% и 11,5%.
Во внутренней проверке на обход отказа Codex Auto-Review Astra не пыталась преодолеть запрет даже при намеренно уязвимой конфигурации и невозможности завершить задачу иным способом. В тесте ExploitGym honeypot модель не выходила за разрешённую цель, тогда как для GPT‑5.6 Sol без производственных защит приводится показатель 48,2%.
При этом OpenAI признаёт, что письменные рассуждения Astra стало сложнее контролировать по сравнению с GPT‑5.6 Sol: это выявили тесты, где модель просили избегать мониторинга. Компания связывает эффект с тем, что Astra способна решать простые задачи с меньшим числом явно изложенных шагов, и называет повышение наблюдаемости поведения одним из приоритетов исследований.
Доступность и цена
GPT‑6 Astra будет доступна через OpenAI API под идентификатором gpt-6-astra, а также через Amazon Bedrock. Стандартная цена API составит $10 за миллион входных токенов и $50 за миллион выходных токенов. Для чтения и записи кэша действуют отдельные тарифы.
В API предусмотрен быстрый режим: OpenAI заявляет скорость до двух раз выше стандартной обработки при цене вдвое выше. Использование Astra включат в действующие лимиты подписок ChatGPT; пользователи и компании смогут приобретать дополнительные кредиты. Владельцам тарифов Pro, Business и Enterprise обещан доступ к GPT‑6 Astra Pro. Для рабочих пространств Enterprise модель будет отключена по умолчанию — её должен активировать администратор.
Подходящие клиенты API смогут использовать режим Zero Data Retention. Кроме того, OpenAI тестирует Private Safety Processing — механизм, который, по заявлению компании, должен совместить мониторинг безопасности с защитой приватности клиентов.
Мнение редакции
Анонс GPT‑6 Astra показывает, что конкуренция моделей всё заметнее смещается от диалога в чате к самостоятельному выполнению рабочих процессов в приложениях, браузерах и средах разработки. Заявленные результаты выглядят масштабно, однако значительная их часть основана на внутренних оценках OpenAI и требует независимой проверки. Особенно важным станет не только прирост производительности, но и то, насколько надёжно ограничения модели будут работать в реальных сценариях, прежде всего в кибербезопасности.