Google расширяет возможности голосового управления искусственным интеллектом на macOS, позволяя Gemini преобразовывать устные запросы в готовый текст, не отвлекая пользователей от текущего приложения. И, кажется, это важный шаг в интеграции ИИ в повседневные рабочие процессы.
Интеллектуальный режим диктовки Gemini по умолчанию транскрибирует речь в месте расположения курсора и автоматически удаляет слова-паразиты, такие как «эм» и «а». По заявлению Google, эта функция позволяет создавать отполированный текст непосредственно там, где пользователь уже работает, значительно упрощая процесс создания контента.
Пользователи также могут активировать функцию «экранно-ориентированного мышления», которая позволяет Gemini понимать содержимое экрана перед выполнением более сложных запросов. Google утверждает, что Gemini способен превращать выделенные заметки в краткое изложение для руководителей и вставлять переписанный текст непосредственно в документ. Это должно помочь в автоматизации рутинных задач.
Удерживание клавиши Function (Fn) активирует голосовое управление из любого окна рабочего стола. Это позволяет вызывать Gemini без необходимости открывать отдельное окно чата или копировать текст между приложениями, что должно значительно повысить эффективность работы.

Компания Google выпустила нативное приложение Gemini для Mac в апреле 2026 года, предоставив сочетание клавиш для открытия помощника и инструменты на основе разрешений для анализа содержимого экрана. Новые голосовые элементы управления развивают этот подход, позволяя пользователям буквально говорить с компьютером, оставаясь в окне, где они уже работают.
Хотя базовые возможности не являются совершенно новыми для macOS (встроенная функция «Диктовка» от Apple уже преобразует речь в текст в приложениях), подход Google добавляет возможность редактирования с помощью ИИ к тому же взаимодействию. Gemini может удалять слова-паразиты по умолчанию, а затем использовать необязательный контекст экрана для переписывания или обобщения существующего материала после получения голосового запроса.
Apple предлагает аналогичные функции редактирования через «Инструменты для письма» в Apple Intelligence, которые могут проверять, переписывать и обобщать выделенный текст в поддерживаемых приложениях. Главное отличие Gemini заключается в том, что Google объединяет диктовку, редактирование и осведомлённость об экране за одним голосовым ярлыком.

Режим осведомлённости об экране от Google напоминает похожую функцию у Siri AI, которая позволяет помощнику Apple понимать видимый контент и использовать этот контекст при ответах на вопросы или выполнении действий. Однако начальная реализация Gemini для macOS, похоже, больше ориентирована на переписывание и вставку текста в активном окне, в то время как Siri AI разработана для связи содержимого экрана с личным контекстом и действиями в поддерживаемых приложениях.
Новый голосовой рабочий процесс Gemini имеет практический смысл, поскольку эта функция устраняет несколько шагов из обычной задачи ИИ. Вместо того чтобы открывать чат-бот, вводить запрос, копировать ответ и возвращаться к документу, пользователи могут говорить, когда курсор уже находится в том месте, куда должен быть помещён готовый текст.
Google сделала эту возможность необязательной, позволяя пользователям решать, может ли Gemini получать доступ к информации, отображаемой на дисплее. Компания не объяснила, какие разрешения macOS потребуются Gemini, как Google будет обрабатывать содержимое экрана и будет ли эта функция работать во всех приложениях и текстовых полях. Отсутствующие детали конфиденциальности и совместимости важны, поскольку экранно-ориентированная помощь требует доступа к большему объёму информации, чем обычная диктовка. Поэтому полезность Gemini будет зависеть от точной транскрипции, надёжной идентификации активного окна и чёткого контроля над тем, какой материал на экране может изучать помощник.
Это обновление также происходит на фоне того, как Google становится всё теснее связанной с собственными планами Apple в области ИИ. Грядущее контекстно-ориентированное обновление Siri от купертиновцев будет использовать технологию, основанную на Gemini, хотя приложение Google для Mac остаётся отдельным продуктом, который напрямую конкурирует за те же задачи по написанию текста и работе с настольным помощником.
Новая голосовая функция развёртывается по всему миру на английском языке для пользователей приложения Gemini для macOS. Больше языков планируется добавить позднее в 2026 году, хотя в компании не объявили более конкретного графика.
Мнение редакции
Интеграция голосового ИИ, подобного Gemini, в повседневные рабочие процессы на Mac – не просто удобство, это фундаментальное изменение парадигмы взаимодействия человека с компьютером. Мы буквально стоим на пороге эпохи, когда голосовые команды станут таким же естественным способом управления, как прикосновения или жесты.
Раньше только «пьяный батя» с телевизором разговаривал, а скоро и зумеры начнут. Но только с компьютерами.