В OpenAI и Google уверены, что разговор с нейросетями через голос вместо привычных текстовых запросов станет новым стандартом в будущем. Компании уже развивают модели, способные напрямую воспринимать человеческую речь и отвечать ей же, без обязательного промежуточного преобразования голоса в текст.
Financial Times сообщает, что подобная технология может стать основой следующего поколения ИИ-агентов, которым предстоит не только отвечать на вопросы, но и самостоятельно заниматься продолжительными задачами.
У первых голосовых ассистентов всё происходило по довольно длинной цепочке. Сначала человеческая речь превращалась в текст, затем полученная фраза отправлялась языковой модели, а готовый ответ снова преобразовывался в аудио. Каждое дополнительное звено добавляло задержку и могло приводить к потере нюансов беседы.
Новые модели стараются убрать лишние промежуточные операции. Они способны работать напрямую с аудиосигналом, воспринимая не только содержание сказанного, но и интонацию, акцент, темп речи и другие особенности голоса. В результате разговор становится ближе к обычному человеческому диалогу, где собеседнику не приходится ждать завершения каждого отдельного этапа обработки.
Если нейросеть должна не просто выдать короткий ответ, а несколько минут обсуждать задачу, уточнять требования, учитывать ограничения и затем выполнять работу, голосовой интерфейс выглядит гораздо естественнее текстового окна.
Интерес к такому формату уже заметен по поведению пользователей. В Google сообщают, что аудитория голосового режима за год увеличилась вдвое. Средняя продолжительность разговора с ИИ оказывается примерно в пять раз выше, чем у текстовых сессий.
Голосовым режимом ChatGPT, по данным OpenAI, еженедельно пользуются более 150 млн человек. Разработчики считают, что преимущество аудиоформата заметно там, где человеку необходимо подробно изложить задачу, объяснить предысторию, ограничения и желаемый результат.
В коротком текстовом запросе разработчик обычно старается сформулировать проблему максимально сжато. В разговоре гораздо проще последовательно объяснить, что пошло не так, где появилась ошибка, зачем вообще создаётся конкретный фрагмент программы и каким должен быть итог.
В OpenAI связывают голосовой формат с развитием Codex. Microsoft также начала применять разговорное управление при работе с задачами программирования на GitHub. В подобном режиме человек может объяснить намерение обычными словами, а ИИ уже разбирается с техническими деталями.
Разработчики одновременно пытаются сделать манеру общения нейросетей менее машинной. В Google отметили, что пользователи быстрее осваиваются с ИИ, когда он разговаривает более естественно и способен поддерживать спонтанный диалог, а не выдаёт ответы с ощущением бесконечного голосового меню.
OpenAI недавно обновила ChatGPT Live. Компания назвала релиз крупнейшим обновлением голосовой модели за два года. Для рынка это ещё один сигнал о том, что голос постепенно превращается из дополнительной функции чат-бота в самостоятельное направление развития ИИ.
Журналисты отмечают, что сейчас стартапы уже экспериментируют с компактными диктофонами, голосовыми кольцами и другими носимыми гаджетами, которые смогут постоянно находиться рядом с человеком, принимать команды, фиксировать информацию и взаимодействовать с цифровым помощником.
По данным PitchBook, вложения в компании, занимающиеся голосовым ИИ, достигли $7 млрд только за первый квартал года. Годом ранее за тот же период объём инвестиций составлял менее $1 млрд.
OpenAI, по сообщениям СМИ, работает над собственным устройством с камерой, микрофоном и динамиком. Если подобные продукты действительно выйдут на рынок, ИИ может постепенно перестать восприниматься исключительно как программа внутри смартфона или браузера.