Представьте: вам нужно за час подготовить презентацию, проанализировать инфографику конкурента, нарезать видео для YouTube и сделать субтитры. Раньше на это ушёл бы день. Теперь одна модель — GPT-4V, Claude 3 или Gemini — справится за минуты, если правильно её попросить. Мультимодальный ИИ понимает не только текст, но и изображения, аудио и видео. Но главный секрет — в промтах. Без них даже самая мощная модель выдаёт общие фразы. В этой подборке — 15 готовых шаблонов, которые я использую в реальных проектах: от модерации пользовательского контента до создания контент-планов. Каждый промт можно скопировать и адаптировать под свою задачу.
Почему мультимодальность — это не просто «посмотреть картинку»
Мультимодальные модели, такие как GPT-4V (от OpenAI), Claude 3 (от Anthropic) и Gemini (от Google), обучены на данных разных типов. Они не «видят» изображение как пиксели, а понимают его семантику: объекты, сцены, тексты, эмоции. Это открывает сценарии, которые раньше требовали целого стека инструментов: OCR, распознавание речи, анализ видео, генерация описаний. По данным отчёта OpenAI о GPT-4V, модель демонстрирует "уровень человека" в задачах визуального понимания (источник: OpenAI, GPT-4V(ision) System Card, 2023). Главное — давать модели контекст и чёткую инструкцию, что делать с полученными данными.
15 промтов для мультимодальных задач
1. Автоматическое описание изображений для каталога товаров
Задача: Сгенерировать SEO-описание для интернет-магазина на основе фото товара.
Промт:
Ты — копирайтер для интернет-магазина. Посмотри на изображение товара и создай описание на русском языке (300-400 символов), которое:
- включает ключевые характеристики (цвет, материал, размеры, назначение);
- написано в стиле, привлекающем покупателя;
- заканчивается призывом к действию (например, «Закажите сейчас — доставка за 2 дня»).
Если на фото есть текст, обязательно учти его.
Пример: Загружаете фото чёрного рюкзака с логотипом. Модель вернёт: "Стильный городской рюкзак из водоотталкивающего полиэстера, объём 20 литров. Имеет отделение для ноутбука до 15.6 дюймов, боковые карманы для бутылки. Идеален для работы и путешествий. Лёгкий и прочный — заказывайте сейчас!" Это экономит часы ручной работы над каталогом.
2. Модерация пользовательского контента (UGC)
Задача: Отфильтровать неприемлемые изображения в соцсети или на форуме.
Промт:
Ты — модератор контента. Проанализируй изображение и определи, содержит ли оно:
- насилие, кровь, оружие;
- обнажённую натуру или эротику;
- оскорбительные жесты или символику;
- рекламу запрещённых веществ.
Ответь в формате JSON: {"status": "approve" / "reject", "reason": "краткое пояснение"}.
Если сомневаешься — выбери "reject" и объясни причину.
Пример: Модель получает фото с дракой и возвращает {"status": "reject", "reason": "изображено насилие"}. Это позволяет автоматизировать модерацию, снижая нагрузку на живых модераторов. Многие платформы уже используют ИИ для первичной фильтрации, но промт настраивает модель под конкретные правила.
3. Транскрибация видео с тайм-кодами
Задача: Получить текстовую расшифровку видео с указанием времени каждого фрагмента.
Промт:
Ты — ассистент по обработке видео. Просмотри видео и создай транскрипт на русском языке. Разбей текст на абзацы по смыслу. В начале каждого абзаца укажи тайм-код в формате [MM:SS]. Если в видео есть важные визуальные детали (графики, надписи), добавь пометку [визуально: описание].
Пример: Для лекции длиной 30 минут модель выдаст структурированный конспект с тайм-кодами: "[00:00] Введение в тему... [01:45] Основные понятия...". Это удобно для создания субтитров, конспектов или навигации по видео.
4. Создание субтитров с учётом контекста
Задача: Сгенерировать субтитры для видео, адаптированные под аудиторию.
Промт:
Сгенерируй субтитры на русском языке для этого видео. Учитывай:
- стиль (официальный, разговорный, молодёжный сленг);
- длину строк (не более 42 символов);
- разбивку по репликам.
Если в видео есть музыка, отметь [музыка]. Если речь неразборчива, напиши [неразборчиво].
Пример: Для интервью с экспертом модель создаст субтитры, которые можно сразу загрузить в YouTube или Vimeo. Это особенно полезно для повышения доступности контента и SEO.
5. Анализ инфографики и диаграмм
Задача: Извлечь данные из графиков для отчёта или презентации.
Промт:
Ты — аналитик данных. Изучи инфографику на изображении. Опиши:
- тип графика (линейный, столбчатый, круговая диаграмма);
- оси и единицы измерения;
- ключевые тренды (рост, падение, сезонность);
- максимальные и минимальные значения.
Представь данные в виде таблицы Markdown, если это возможно.
Пример: Загружаете график продаж за год. Модель вернёт: "Столбчатая диаграмма, ось X — месяцы, ось Y — продажи в тыс. руб. Пик в декабре (1 200 тыс.), минимум в феврале (500 тыс.). Тренд — рост на 20% к концу года." Это превращает визуальные данные в машиночитаемый формат.
6. Генерация превью для YouTube
Задача: Создать привлекательную обложку для видео.
Промт:
Ты — дизайнер YouTube-превью. Посмотри на кадр из видео и предложи концепцию обложки:
- композиция (где разместить текст, лицо, объекты);
- цветовая гамма (контрастные цвета для привлечения внимания);
- текст на обложке (до 5 слов, крупный шрифт).
Если на кадре есть человек, опиши его эмоцию.
Пример: Для видео «Как выбрать ноутбук» модель предложит: "Крупный план ноутбука слева, справа яркий текст «5 ЛУЧШИХ», фон — градиент синий-оранжевый, эмоция — удивление." Вы можете использовать этот промт для генерации идей, а затем реализовать в фоторедакторе.
7. Создание контент-плана по видео
Задача: На основе длинного видео сгенерировать идеи для постов в соцсетях.
Промт:
Просмотри видео и создай контент-план для Instagram и Telegram. Для каждого фрагмента (по 2-3 минуты) предложи:
- тему поста;
- формат (карусель, видео, опрос);
- текст поста (до 200 символов);
- хэштеги (5-7 шт.).
Всего должно получиться 5-7 постов.
Пример: Из вебинара на 60 минут модель создаст серию постов: "Пост 1: 3 главных ошибки в инвестициях (карусель). Пост 2: Разбор кейса (видео). ..." Это позволяет переиспользовать контент и экономить время.
8. Распознавание аудио и извлечение ключевых тезисов
Задача: Из аудиозаписи встречи получить краткое резюме.
Промт:
Прослушай аудиофайл и создай краткое резюме (до 500 символов), которое включает:
- основные темы обсуждения;
- принятые решения;
- задачи с указанием ответственных, если они упоминаются.
Используй маркированный список.
Пример: Запись совещания на 40 минут превращается в структурированное резюме: "Темы: бюджет, сроки, маркетинг. Решения: утвердить бюджет на Q3. Задачи: Иванов — подготовить отчёт к пятнице." Это незаменимо для удалённых команд.
9. Сравнение двух изображений
Задача: Найти различия между двумя версиями дизайна или фото.
Промт:
У тебя есть два изображения (прикрепи их). Сравни их и опиши:
- все визуальные различия (цвет, размер, положение объектов, текст);
- какие изменения более значимы;
- в каком виде лучше, по твоему мнению, и почему (если это дизайн).
Ответь в виде таблицы:
| Элемент | Изображение 1 | Изображение 2 | Комментарий |
Пример: Дизайнер загружает два варианта лендинга. Модель находит: "Кнопка: синяя vs зелёная, заголовок: 'Купить' vs 'Заказать', шрифт: Arial vs Roboto. Зелёная кнопка более заметна." Это ускоряет A/B-тестирование.
10. Генерация сценария для видео по серии изображений
Задача: Из набора фото (например, с мероприятия) создать видеоролик-историю.
Промт:
Ты — видеорежиссёр. Посмотри на предоставленные изображения (в порядке загрузки) и напиши сценарий для видео:
- последовательность кадров (какие изображения использовать и в каком порядке);
- текст закадрового голоса (до 100 слов);
- музыкальное настроение (энергичное, спокойное, торжественное);
- хронометраж (секунды на каждый кадр).
Пример: Фото с корпоратива превращаются в сценарий: "Кадры 1-3: участники, закадровый текст 'В этом году мы собрались вместе...', музыка — энергичная, хронометраж 3 сек на кадр." Это основа для монтажа в CapCut или Premiere.
11. Анализ видео для маркетинга
Задача: Оценить эффективность рекламного ролика.
Промт:
Просмотри рекламное видео (прикрепи файл). Оцени:
- эмоциональный посыл (радость, страх, доверие);
- чёткость сообщения (легко ли понять, что рекламируется);
- целевую аудиторию (пол, возраст, интересы);
- сильные и слабые стороны.
Дай рекомендации по улучшению.
Пример: Модель анализирует ролик и пишет: "Эмоция — радость, сообщение — 'скидка 50%', ЦА — молодые мамы. Слабое место — слишком быстрый монтаж, не успеваешь прочитать текст. Рекомендация — замедлить финальный кадр." Это помогает маркетологам без фокус-групп.
12. Извлечение данных из сканов документов
Задача: Оцифровать таблицу или анкету с фото.
Промт:
Ты — OCR-ассистент. Извлеки текст из изображения и представь его в формате Markdown-таблицы. Сохрани структуру колонок и строк. Если есть рукописный текст, отметь его [рукописный]. В конце добавь список возможных ошибок распознавания.
Пример: Скан счёта за коммунальные услуги превращается в таблицу:
| Услуга | Тариф | Сумма |. Модель предупреждает: "Сумма могла быть распознана неточно из-за плохого качества." Это упрощает бухгалтерию.
13. Создание мемов или ироничных подписей
Задача: Сгенерировать юмористическую подпись к картинке для соцсетей.
Промт:
Ты — креативный копирайтер. Посмотри на изображение и придумай 5 подписей для мема в русскоязычном интернете. Используй актуальные мемы и тренды. Подписи должны быть короткими (до 15 слов) и вызывать улыбку. Отметь, какая подпись, по твоему мнению, самая смешная.
Пример: Фото кота за компьютером. Модель выдаст: "Я когда пытаюсь дедлайн сдать," "IT-специалист после обеда," и т.д. Это развлекательный, но полезный сценарий для SMM.
14. Сравнение видео и текста (например, новостной сюжет и статья)
Задача: Проверить соответствие текста видеосюжету.
Промт:
Сравни текст новостной статьи (прикрепи текст) и видеосюжет (прикрепи видео). Выяви:
- совпадения (какие факты упоминаются в обоих);
- расхождения (что есть в тексте, но нет в видео, и наоборот);
- ошибки или искажения фактов.
Составь таблицу:
| Факт | В тексте | В видео | Комментарий |
Пример: Журналист проверяет, не исказил ли монтаж слова эксперта. Модель находит несоответствия, что критично для фактчекинга.
15. Создание мультимодального отчёта
Задача: Собрать воедино данные из нескольких источников (текст, графики, видео) в один отчёт.
Промт:
У тебя есть несколько файлов (текст, изображения, видео). Объедини информацию в единый отчёт по структуре:
- Введение (цель);
- Основные данные (таблицы, графики — опиши их);
- Анализ (выводы);
- Рекомендации.
Используй профессиональный стиль, избегай воды.
Пример: Для инвестора вы загружаете финансовый отчёт (PDF), график цен (PNG) и интервью с директором (MP4). Модель генерирует связный отчёт, который можно отправить партнёрам. Это вершина мультимодального подхода.
Как выбрать модель и не ошибиться
Сегодня три главные мультимодальные модели — GPT-4V (OpenAI), Claude 3 (Anthropic) и Gemini (Google). У каждой свои сильные стороны. GPT-4V отлично справляется с анализом изображений и текстом, Claude 3 — с длинными контекстами и структурированным выводом, Gemini — с видео и аудио, особенно если вы работаете в экосистеме Google. Для наших промтов подойдут все три, но если вам нужно распознавать видео, я бы выбрал Gemini — у него нативная поддержка видео. Для таблиц и логики — Claude 3. Для универсальных задач — GPT-4V. Тестируйте на своих данных и адаптируйте промты под конкретную модель.
Выводы
Мультимодальные промты — это мост между идеей и результатом. С их помощью вы экономите часы рутинной работы и получаете контент, который раньше требовал целой команды. Начните с одного промта из списка, адаптируйте его под свою задачу и увидите, как ИИ становится вашим ассистентом. А если вы хотите системно автоматизировать такие задачи, обратите внимание на платформу ASI Biont — она позволяет создавать AI-агентов, которые используют эти промты в реальных проектах. Попробуйте сегодня и поделитесь результатами!
Комментарии