Мультимодальный AI-ассистент: 12 промтов, которые превращают текст, изображения и видео в рабочие результаты

Вступление

Вы когда-нибудь тратили часы на то, чтобы описать словами то, что можно показать на скриншоте? Или пытались извлечь данные из видео, пересматривая его вручную? Мультимодальные AI-модели — те, что понимают не только текст, но и изображения, аудио и видео — решают эту проблему. По данным отчета State of AI Report 2025, количество мультимодальных моделей выросло втрое за год, а их применение в бизнесе стало мейнстримом. Но главный секрет — в правильных промтах. Ниже — 12 проверенных промтов, которые я использую в своей работе, с пояснениями и примерами.

Раздел 1: Анализ изображений

Промт 1: Извлечение данных из скриншота

Задача: Превратить скриншот с данными (дашборд, таблица, график) в структурированный текст.

Промт:

Проанализируй прикрепленное изображение. Извлеки все числовые данные и текстовые метки. Представь результат в виде Markdown-таблицы. Если есть тренды (рост/падение), укажи их в отдельном списке. Не пропускай значения.

Пример: Вы присылаете скриншот Google Analytics, а AI возвращает таблицу с метриками и выводом: «Сессий: 12 340 (+15% к прошлой неделе)». Это экономит 10–15 минут ручного копирования.

Промт 2: Сравнение двух изображений

Задача: Найти различия между двумя версиями дизайна, фото или документов.

Промт:

Сравни два прикрепленных изображения. Перечисли все различия: цвета, расположение элементов, текст, размеры. Для каждого различия укажи, какое изображение отличается и как. Если различий нет, так и напиши.

Пример: Дизайнер отправляет две версии лендинга, AI находит, что на второй версии кнопка «Купить» стала синей, а заголовок изменился с «Скидка 20%» на «Скидка 30%». Это помогает быстро ревьюить правки.

Промт 3: Распознавание рукописного текста

Задача: Перевести рукописные заметки в цифровой текст.

Промт:

На изображении — рукописный текст. Распознай его и преобразуй в чистый текстовый формат. Сохрани структуру: заголовки, списки, абзацы. Если слово нечитаемо, отметь как [неразборчиво].

Пример: Сфотографировали записи с совещания — AI превращает их в аккуратный документ, готовый для рассылки.

Раздел 2: Работа с видео

Промт 4: Создание субтитров и транскрипции

Задача: Получить текстовую расшифровку видео с таймкодами.

Промт:

Транскрибируй видео. Разбей текст на логические абзацы. Для каждого абзаца укажи таймкод начала. Сохрани имена говорящих, если они есть. Ошибки в произношении исправь.

Пример: Вы загружаете запись вебинара, AI возвращает расшифровку с таймкодами, по которой можно быстро найти нужный фрагмент.

Промт 5: Извлечение ключевых кадров и описаний

Задача: Получить краткое содержание видео по ключевым моментам.

Промт:

Проанализируй видео. Выдели 5–10 ключевых моментов, которые лучше всего отражают суть. Для каждого момента дай: описание, таймкод и рекомендуемый заголовок для слайда. Результат — в виде нумерованного списка.

Пример: Для обучающего ролика AI выделяет моменты «Введение», «Основная ошибка», «Практический пример» и т.д., что облегчает создание конспекта.

Промт 6: Создание клипов для соцсетей

Задача: Нарезать видео на короткие вертикальные ролики с текстовыми подписями.

Промт:

Определи в видео сегменты, которые можно использовать как отдельные клипы для TikTok/Reels (длительность 15–60 секунд, есть законченная мысль). Для каждого сегмента предложи: текст для подписи, хэштеги и заголовок.

Пример: Из часового интервью AI выделяет 3 яркие цитаты, которые становятся вирусными роликами.

Раздел 3: Комбинирование модальностей

Промт 7: Создание презентации из текста и изображений

Задача: Сгенерировать структуру презентации на основе документа и картинок.

Промт:

У меня есть текстовый документ и несколько изображений. Создай структуру презентации: для каждого слайда дай заголовок, ключевые тезисы и рекомендацию, какое изображение использовать (по номеру). Учти, что аудитория — топ-менеджмент.

Пример: Вы загружаете годовой отчет и фото продукта, AI предлагает 10-слайдовую презентацию для совета директоров.

Промт 8: Генерация контент-плана по фото с мероприятия

Задача: На основе фотографий с ивента создать план постов для соцсетей.

Промт:

Проанализируй фотографии с мероприятия. Определи, какие моменты запечатлены (выступление, нетворкинг, детали). Создай контент-план на 5 дней: для каждого поста предложи текст, изображение (номер фото) и время публикации.

Пример: После конференции AI генерирует серию постов, которые поддерживают интерес аудитории неделю.

Промт 9: Создание инфографики из данных

Задача: Превратить статистические данные и текст в описание инфографики.

Промт:

На основе предоставленных данных (текст, таблицы, графики) опиши, как должна выглядеть инфографика. Укажи: тип диаграммы, цвета, расположение блоков, ключевые цифры для выделения. Результат — в виде текстового описания.

Пример: AI предлагает «столбчатую диаграмму роста продаж, с выделением квартала Q3, цветовая гамма — синий и оранжевый», и дизайнеру остается только воплотить.

Раздел 4: Специализированные промты для бизнеса

Промт 10: Анализ отзывов с фото

Задача: Оценить фотографии в отзывах клиентов, выявить проблемы с продуктом.

Промт:

Просмотри изображения в отзывах. Классифицируй их: дефекты, упаковка, использование, другое. Для каждой категории опиши, что показано, и дай рекомендацию по улучшению. Выдели повторяющиеся проблемы.

Пример: Интернет-магазин находит, что в 30% фото с отзывами видна поврежденная упаковка, и решает сменить поставщика коробок.

Промт 11: Создание обучающих материалов из видеоуроков

Задача: Превратить запись экрана с объяснениями в текстовую инструкцию.

Промт:

Видео — запись экрана с голосовым объяснением. Создай пошаговую текстовую инструкцию. Для каждого шага укажи действие, ожидаемый результат и скриншот (время из видео). Используй нумерацию.

Пример: AI из 20-минутного туториала по Excel делает памятку на 2 страницы, которую можно раздать коллегам.

Промт 12: Генерация альтернативных текстов для изображений

Задача: Создать alt-тексты для SEO и доступности.

Промт:

Для каждого изображения создай alt-текст (не более 125 символов), который описывает суть и содержит ключевые слова. Используй формат: [описание] — [контекст]. Избегай слов «изображение», «фото».

Пример: Для интернет-магазина AI генерирует: «Красное кожаное кресло с подголовником в скандинавском стиле на белом фоне» — это улучшает SEO и доступность.

Сравнительная таблица подходов

Модальность Инструменты Сложность промтов Типичные ошибки
Текст + изображение GPT-4o, Claude 3.5, Gemini Низкая Слишком общие запросы
Видео Gemini 1.5 Pro, Whisper + Vision Средняя Не указан формат вывода
Комбинированные GPT-4o, Claude 3.5 Высокая Игнорирование контекста

Заключение

Мультимодальные промты — это не просто «посмотри на картинку и опиши». Это инструменты, которые экономят часы рутины: от расшифровки видео до анализа отзывов. Начните с простых промтов, адаптируйте их под свои задачи и не бойтесь экспериментировать. Чем точнее вы описываете желаемый результат, тем полезнее будет ответ. Попробуйте один из этих промтов сегодня — и вы увидите, как AI-ассистент становится вашим незаменимым помощником. Если у вас есть свои наработки — делитесь в комментариях.

← Все статьи

Комментарии