Гонка в сфере искусственного интеллекта постепенно меняет направление: разработчики стремятся научить ИИ не только отвечать на вопросы, но и последовательно выполнять рабочие задачи. Для этого различные компании создают цифровые среды, воспроизводящие повседневную деятельность сотрудников: разработку программного обеспечения, работу с корпоративными сервисами, принятие решений и выполнение многоэтапных процессов.
Такие системы называют средами обучения с подкреплением – reinforcement learning environments, или RL-средами. В них агент получает задачу, пробует разные способы её решить, ошибается, корректирует действия и получает оценку результата. В отличие от обычного чат-бота, которому достаточно сформировать подходящий ответ, ИИ в такой среде должен довести до конца целую последовательность операций.
От текстов к рабочим процессам
Первые большие языковые модели обучались прежде всего на огромных массивах текстов из книг и интернета. Затем их ответы оценивали привлечённые специалисты, отмечая удачные и неудачные варианты. Этот подход сделал ботов заметно сильнее в диалоге, однако не позволил в полной мере решить другую задачу – надёжное автономное выполнение сложной работы, которая может занимать часы или дни.
RL-среды должны закрыть этот разрыв. Они моделируют реальные условия: интерфейсы программ, внутренние правила компаний, рабочие документы и последовательности действий. Важный элемент таких систем –вознаграждение: модель должна понимать, выполнена ли задача верно, и закреплять поведение, которое привело к успеху.
Интерес Google и Meta*
По данным Business Insider, Google обсуждает инвестиции в размере более $1,5 млрд в стартап Mechanize. Компания создаёт виртуальные рабочие среды для подготовки ИИ-агентов. Предполагаемая сделка также может включать переход части специалистов Mechanize в Google и лицензирование технологий стартапа; команда, как сообщается, будет заниматься оценкой и развитием моделей.
Meta*, в свою очередь, пытается собирать сведения о том, как сотрудники взаимодействуют с компьютером: фиксировать нажатия клавиш, движения мыши, клики и контекст на экране в одобренных рабочих приложениях. Согласно внутреннему объявлению компании, эти данные нужны, чтобы ИИ лучше понимал, как люди выполняют повседневные задачи – используют сочетания клавиш, переходят между сервисами и работают с корпоративным программным обеспечением.
Ставка на симуляции
Поставщик данных для обучения ИИ, компания Scale AI, отмечает, что ведущие разработчики всё меньше полагаются исключительно на статичные наборы данных и оценки человеческих предпочтений. Руководитель направления агентов и RL-сред в Scale AI Четан Ране отмечал, что передовым моделям всё чаще необходимо учиться методом проб и ошибок в реалистичных симуляциях. По его словам, почти половина новых проектов компании по обучению ИИ уже связана с такими средами, включая моделирование программирования, работы за компьютером и корпоративных процессов.
Mechanize делает первую ставку на разработку программного обеспечения. Стартап считает, что будущие ИИ-агенты для программирования сначала будут осваивать примеры работы профессиональных инженеров, а затем улучшать навыки во всё более сложных цифровых моделях реальных проектов. В дальнейшем этот подход, по замыслу компании, можно распространить на другие виды интеллектуального труда.
Основатель Mechanize Тамай Бесироглу и его сооснователи заявляли, что цель компании – «полная автоматизация экономики». По их оценке, совокупственные выплаты работникам в США составляют около $18 трлн в год, а в мире – примерно $60 трлн. Эти цифры стартап приводит как оценку потенциального рынка технологий автоматизации труда.
Наблюдение за работой
Похожий подход выбрала и Uber. Компания сообщила, что направляет ведущих инженеров по ИИ в подразделения финансов, юридической поддержки, HR, маркетинга, закупок и работы с клиентами. Их задача – изучить, как устроены процессы, а затем перестроить их с использованием ИИ.
Таким образом, новым предметом конкуренции становятся не только модели, способные лучше поддерживать разговор, но и подробные цифровые представления реальных рабочих мест. Их создатели рассчитывают, что в таких симуляциях ИИ-агенты смогут освоить множество небольших решений и действий, из которых складывается современная работа.