Представьте: вы даете задание нейросети, и она не просто генерирует текст, а открывает ваш браузер, кликает по кнопкам, заполняет формы и запускает приложения. Звучит как научная фантастика? Со 2 июля 2026 года это стало реальностью. Google DeepMind официально представил функцию computer use в модели Gemini 3.5 Flash. Это не просто очередное обновление — это сдвиг парадигмы в том, как AI взаимодействует с цифровым миром.
Раньше языковые модели были "заперты" в текстовом окне чата. Они могли читать файлы, но не могли выполнять действия. Теперь Gemini 3.5 Flash может буквально "видеть" экран, интерпретировать его и выполнять операции, которые раньше требовали ручного труда человека. Давайте разберемся, что это за зверь, как он работает и почему это важно для бизнеса и разработчиков.
Что такое computer use в Gemini 3.5 Flash?
Computer use — это способность модели управлять графическим интерфейсом пользователя (GUI) так же, как это делает человек. Модель получает скриншот экрана, анализирует его и генерирует последовательность действий: движения мыши, нажатия клавиш, клики. Это не просто эмуляция — это понимание контекста.
Например, если вы попросите Gemini найти в Google Docs документ, отредактировать его и отправить по email, модель:
1. Откроет Google Docs в браузере.
2. Введет запрос в строку поиска.
3. Кликнет на нужный файл.
4. Внесет изменения в текст.
5. Откроет Gmail, создаст письмо и прикрепит файл.
Весь процесс происходит автоматически, без необходимости писать код или настраивать API. Источник
Техническая основа: как это работает?
В основе функции лежит мультимодальная архитектура Gemini 3.5 Flash. Модель обучена на тысячах часов записей взаимодействия человека с компьютером: движения мыши, клики, ввод текста. Она не просто запоминает последовательности — она учится понимать цели и намерения.
Ключевые технические особенности:
- Визуальное восприятие: модель обрабатывает скриншоты в реальном времени, распознавая элементы интерфейса: кнопки, поля ввода, меню.
- Контекстное понимание: Gemini помнит, что было на предыдущем экране, и может адаптировать действия.
- Генерация действий: вместо текстового ответа модель выдает команды для мыши и клавиатуры в формате JSON.
Разработчики могут интегрировать эту функцию через API, используя библиотеку computer-use-tool. Пример кода на Python:
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
response = client.models.generate_content(
model="gemini-3.5-flash",
contents="Открой калькулятор и посчитай 25 * 4",
config={
"tools": [{"computer_use": {}}]
}
)
print(response.text)
Это открывает огромные возможности для автоматизации.
Практические примеры использования
1. Автоматизация рутинных задач в офисе
Представьте, что каждый день вы тратите час на заполнение отчетов в Excel. Gemini 3.5 Flash может открыть файл, скопировать данные из email, вставить их в таблицу и отправить отчет начальнику. Это не гипотетика — это прототип, который уже тестируют компании.
2. Тестирование веб-приложений
QA-инженеры могут поручить модели пройти сценарий пользователя: зарегистрироваться, оформить заказ, проверить ошибки. Gemini будет кликать, вводить данные и фиксировать баги. Это ускоряет тестирование в разы.
3. Помощь людям с ограниченными возможностями
Для тех, кто не может использовать мышь или клавиатуру, компьютер use становится голосовым помощником нового поколения. Вы говорите: "Открой Википедию и найди информацию о квантовых компьютерах" — модель делает все сама.
4. Обучение и онбординг
Новые сотрудники часто тратят дни на освоение корпоративных систем. Gemini может пройти обучение вместе с ними: показать, где нажать, что заполнить, какую кнопку выбрать. Это снижает порог входа.
Как это сравнивается с конкурентами?
Google DeepMind не первый, кто предлагает computer use. Anthropic в 2025 году анонсировал похожую функцию в Claude 3.5 Opus, а Microsoft Copilot умеет управлять Windows. Но у Gemini 3.5 Flash есть преимущества:
| Критерий | Gemini 3.5 Flash | Claude 3.5 Opus | Microsoft Copilot |
|---|---|---|---|
| Скорость реакции | < 200 мс | ~500 мс | ~300 мс |
| Поддержка ОС | Windows, macOS, Linux | Только macOS | Только Windows |
| Стоимость API | $0.50 за 1000 запросов | $1.20 за 1000 запросов | Входит в подписку M365 |
| Мультиоконность | Да | Нет | Частично |
Gemini 3.5 Flash работает быстрее и дешевле конкурентов, а также поддерживает все три основные операционные системы. Источник
Безопасность и ограничения
Способность AI управлять компьютером вызывает вопросы безопасности. Google DeepMind внедрил несколько механизмов защиты:
- Sandbox: модель работает в изолированной среде, не имея доступа к системным файлам.
- Подтверждение действий: перед выполнением критических операций (например, отправка email или удаление файла) модель запрашивает разрешение пользователя.
- Логирование: все действия записываются, и их можно просмотреть в истории.
Тем не менее, есть ограничения. Модель может ошибаться в распознавании сложных интерфейсов (например, кастомных UI-элементов). Также она пока не умеет работать с аудио- и видеоконтентом напрямую.
Как начать использовать?
На момент 2 июля 2026 года функция доступна:
- Через API Google AI Studio (бесплатный лимит — 100 запросов в день).
- В виде бета-версии в Google Colab для разработчиков.
- Для бизнес-клиентов через Vertex AI.
Чтобы попробовать, нужно:
1. Зарегистрироваться в Google AI Studio.
2. Создать API-ключ.
3. Установить библиотеку google-genai.
4. Отправить запрос с параметром computer_use.
Пример готового скрипта для автоматизации отправки сообщения в Telegram (в целях демонстрации):
import time
from google import genai
client = genai.Client(api_key="KEY")
# Инструкция для модели
instruction = """
1. Открой браузер.
2. Перейди на web.telegram.org.
3. Введи логин и пароль (сохранены в файле credentials.txt).
4. Найди чат "Команда".
5. Отправь сообщение: "Встреча переносится на 15:00".
"""
response = client.models.generate_content(
model="gemini-3.5-flash",
contents=instruction,
config={"tools": [{"computer_use": {}}]}
)
print("Статус:", response.text)
ASI Biont поддерживает подключение к Telegram через API — подробнее на asibiont.com/courses.
Влияние на рынок труда и бизнес
Автоматизация GUI-операций — это не просто хайп. По данным аналитиков, до 40% офисной работы включает повторяющиеся действия в интерфейсах: копирование данных, заполнение форм, навигация по меню. Computer use может взять на себя эти задачи.
Для малого бизнеса это означает, что можно автоматизировать процессы без найма разработчиков. Например, владелец интернет-магазина может настроить Gemini так, чтобы он каждое утро проверял заказы, обновлял статусы и отправлял уведомления клиентам.
Для крупных компаний — это возможность сократить время на обучение персонала и снизить количество ошибок, связанных с человеческим фактором.
Заключение
Introducing computer use in Gemini 3.5 Flash — это не просто новость, а сигнал о том, что AI выходит за рамки текста и становится полноценным агентом в цифровом мире. Мы стоим на пороге эры, где нейросети не просто советуют, а делают. И это меняет правила игры для всех: от разработчиков до обычных пользователей.
Если вы еще не пробовали Gemini 3.5 Flash с функцией computer use, сейчас самое время. Зайдите в Google AI Studio, напишите простой запрос и увидите, как AI двигает мышкой по вашему экрану. Это впечатляет даже тех, кто видел много новинок.
Будущее уже здесь. Оно кликает само.
Комментарии