GPT-6 Astra прошла стартовую зону WoW без смертей

ИИ ориентировался по данным, а не изображению

3 мин.
GPT-6 Astra прошла стартовую зону WoW без смертей

Модель GPT-6 Astra от OpenAI выполнила все задания в стартовой локации орков в World of Warcraft за 40 минут, ни разу не допустив гибели персонажа. По словам разработчика проекта agent-wow, она не видела ни одного игрового кадра: вместо изображения использовала сетевые сообщения и сведения из файлов сервера.

Эксперимент проводили на частном сервере, а не в официальной инфраструктуре Blizzard. Разработчик дал модели одно задание через Codex: создать орка и пройти начальную зону. Персонаж начал с первого уровня, завершил задания в Долине Испытаний и добрался до деревни Сен'джин.

Игра без экрана

Основой эксперимента стал agent-wow — открытый клиент для автономных ИИ-агентов. Он не предоставляет готовую логику передвижения, боя или взаимодействия с игровым миром. Вместо этого в нём предусмотрена система модулей, с помощью которой агент должен самостоятельно создавать необходимые инструменты.

Клиент обменивается сообщениями по игровому сетевому протоколу с AzerothCore — открытым серверным программным обеспечением для World of Warcraft версии 3.3.5a, последней версии дополнения Wrath of the Lich King. Такая конфигурация предназначена для экспериментов на локальных частных серверах и не подключается к официальным серверам WoW.

Модель создала модуль, который принимал и сохранял в памяти сообщения сервера — по подсчётам, 28 типов. Написанный на Python скрипт считывал эти данные, формировал представление о происходящем и отправлял обратно сообщения с игровыми действиями. Разработчик ожидал, что агент построит более высокоуровневый интерфейс, но тот справился с работой непосредственно на уровне протокола.

Задания из серверной базы

Чтобы разобраться с заданиями, GPT-6 Astra обратилась к SQL-файлам AzerothCore. Из них она извлекла сведения о персонажах, выдающих и принимающих задания, а также о местах появления игровых объектов и существ. Разработчик сравнил этот подход с тем, как человек изучает справочный сайт Wowhead перед прохождением. Однако есть существенное отличие: агент читал именно те данные, которыми пользовался сервер, а не внешний справочник.

Модель не просто выполняла отдельные действия, но и выстраивала их последовательность. Она проходила связанные задания в нужном порядке, продавала ненужные предметы, надевала более подходящее снаряжение и изучала способности перед походом в последнюю пещеру стартовой зоны. Оба задания для этой пещеры агент взял заранее, чтобы выполнить их за один заход.

В общедоступных инструкциях проекта исходный код AzerothCore также указан среди ресурсов, которыми могут пользоваться агенты. При этом разработчик не уточнил, обращалась ли модель к нему именно во время этого прохождения.

Как агент находил дорогу

Для передвижения GPT-6 Astra написала вспомогательную программу на C++. Она строила маршрут между двумя точками, используя навигационные сетки AzerothCore — файлы mmaps, описывающие доступное для перемещения пространство. Библиотека Detour рассчитывала путь, после чего программа возвращала координаты промежуточных точек либо ошибку, если полного маршрута не существовало.

Разработчик назвал поиск пути одной из основных трудностей при создании игровых ботов и высоко оценил решение модели. Впрочем, агент не всегда двигался так, как предполагали создатели карты: в отдельных местах он использовал ошибки, связанные с обработкой столкновений с препятствиями. Поэтому результат нельзя описывать исключительно как безупречную навигацию — часть возможностей ему дали особенности самой тестовой среды.

Для эксперимента модель запустили с очень высоким уровнем усилий на рассуждение — на одну ступень ниже максимального. World of Warcraft разработчик выбрал из-за сочетания долгосрочного планирования и тактических решений, которые приходится принимать непосредственно во время игры.

От новичка до рейда

Это не первый игровой эксперимент с GPT-6 Astra. В сентябре, вскоре после выхода модели, она прошла Portal примерно за 24 часа. Тогда агент получал скриншоты и сведения о положении персонажа. В World of Warcraft изображения ему не понадобились, но и задача была заметно уже: речь идёт только о стартовой зоне, а не о прохождении всей игры.

Другие разработчики экспериментируют с Pokémon Red: среди описанных подходов — небольшая специализированная модель и система принятия решений Jev, которой помогает Claude. Эти проекты используют разные способы управления и не представляют собой единый тест, по которому можно напрямую сопоставить результаты.

Следующая цель автора agent-wow — проверить, сможет ли один агент самостоятельно достичь 80-го уровня, а несколько агентов — объединиться для совместного прохождения. Более дальний замысел — заполнить сервер ИИ-игроками и выяснить, сумеют ли они пройти «Цитадель Ледяной Короны» на героической сложности. Но пока это лишь план, а не достигнутый результат.

Мнение редакции

В этой истории интереснее не отсутствие смертей, а то, как модель подготовила себе рабочую среду. Она получила цель, написала инструменты для чтения состояния мира и поиска пути, а затем использовала их для прохождения. Но слово «вслепую» здесь требует оговорки: агент не видел экран, зато имел доступ к сетевым сообщениям, серверной базе заданий и навигационным данным. Это другой способ получать информацию, а не её отсутствие.

По-настоящему интересная проверка ещё впереди. Стартовая зона показала, что агент способен организовать собственные действия в ограниченной задаче; заявленный разработчиком рейд должен проверить уже совместную работу нескольких таких систем. Именно переход от самостоятельного выполнения заданий к координации группы может сделать продолжение эксперимента важнее его первого, эффектного результата.