От сырых данных к инсайтам: 12 промтов, которые заменят часы работы в Pandas

Представьте: вы получили датасет на 2 миллиона строк, и вам нужно его очистить, заполнить пропуски, сгруппировать, построить графики и сформулировать выводы для отчёта. Раньше на это ушёл бы весь день. Теперь с помощью правильно составленных промтов для ИИ — около часа. Я собрал готовые шаблоны, которые использую сам, чтобы автоматизировать рутину анализа данных. Они работают с Python, Pandas и Jupyter Notebooks и подходят как новичкам, так и опытным аналитикам.

Промты — это не магия, а чёткие инструкции для нейросети. Чем конкретнее вы описываете задачу, контекст и ожидаемый результат, тем точнее будет ответ. Ниже — 12 проверенных шаблонов, разбитых по этапам работы с данными: от первой разведки до презентации результатов. Каждый промт я сопровождаю примером использования и пояснением, как его адаптировать под ваши данные.

1. Разведочный анализ: первое знакомство с датасетом

Когда вы открываете незнакомый CSV-файл, хочется быстро понять его структуру, типы данных, пропуски и основные статистики. Вместо того чтобы писать 10 строк кода вручную, попросите ИИ сгенерировать полный отчёт.

Промт:

Вы — опытный аналитик данных. Загрузите датасет из файла 'data.csv' с помощью pandas. Выполните разведочный анализ:
- Покажите первые 5 строк и последние 5 строк.
- Выведите информацию о типах данных и количестве ненулевых значений (df.info()).
- Для всех числовых колонок постройте описательную статистику (df.describe()).
- Посчитайте количество пропусков в каждой колонке и процент пропусков от общего числа строк.
- Определите количество уникальных значений в категориальных колонках.
- Сделайте вывод: какие колонки требуют очистки, какие можно использовать для анализа, какие потенциально бесполезны.
Оформите результат в виде структурированного отчёта с заголовками.

Пример использования:
Вы скачали данные о продажах интернет-магазина. Промт выводит базовую информацию, и ИИ сразу подсвечивает, что в колонке 'price' 15% пропусков, а 'customer_id' содержит дубликаты. Экономия времени — около 15 минут рутины.

2. Очистка данных: автоматическое удаление дубликатов и пропусков

Грязные данные — бич любого анализа. Вместо ручного написания drop_duplicates() и fillna() для каждой колонки, поручите ИИ составить скрипт очистки.

Промт:

У меня есть DataFrame df из файла 'data.csv'. Напишите код на Python с использованием pandas для очистки данных:
- Удалите полностью дублирующиеся строки.
- Для числовых колонок замените пропуски на медиану, для категориальных — на моду.
- Удалите столбцы, где более 50% значений пропущены.
- Приведите все строковые значения к нижнему регистру и уберите лишние пробелы.
- Проверьте, что после очистки не осталось пропусков (используйте df.isnull().sum()).
Выведите итоговое количество строк и колонок до и после очистки.

Пример:
Ваш датасет содержит 1000 строк, из них 200 дубликатов и 30% пропусков в колонке 'age'. ИИ генерирует код, который вы копируете в ячейку Jupyter и запускаете. На выходе — чистый DataFrame с понятным отчётом.

3. Трансформация данных: перекодирование и создание новых признаков

Часто нужно превратить «сырые» колонки в полезные признаки: из строки с датой извлечь год, из текста — категорию. ИИ отлично справляется с такими задачами.

Промт:

В DataFrame df есть колонка 'date' в формате 'YYYY-MM-DD'. Создайте новые признаки:
- 'year', 'month', 'day' на основе этой колонки.
- 'weekday' — название дня недели (понедельник, вторник и т.д.).
- 'is_weekend' — булево значение, True, если это суббота или воскресенье.
Также есть колонка 'amount' (число) и 'category' (строка). Создайте признак 'amount_log' = логарифм от 'amount' (если amount > 0), и 'category_upper' — категория в верхнем регистре.
Напишите код с комментариями и покажите первые 5 строк нового DataFrame.

Пример:
Вы анализируете транзакции банка. Промт создаёт признаки, которые потом используете для прогнозирования мошенничества. Экономия — 10 минут на написание кода.

4. Группировка и агрегация: сводные таблицы за минуту

Группировка по нескольким колонкам с разными агрегатами — стандартная задача. Промт поможет сгенерировать сложный groupby без ошибок.

Промт:

Данные: df с колонками 'region', 'product', 'sales', 'profit', 'date'. Создайте сводную таблицу:
- Сгруппируйте по 'region' и 'product'.
- Для 'sales' — сумма, среднее, количество.
- Для 'profit' — сумма и среднее.
- Отсортируйте по убыванию суммарных продаж.
- Выведите топ-10 строк.
Напишите код с использованием pd.pivot_table или groupby, добавьте комментарии.

Пример:
Вы менеджер по продажам и хотите увидеть, какой продукт в каком регионе приносит больше всего прибыли. ИИ строит таблицу за секунды.

5. Визуализация: автоматическая генерация графиков

Чтобы быстро посмотреть на распределения и зависимости, попросите ИИ создать набор графиков на основе данных.

Промт:

Используя библиотеки matplotlib и seaborn, создайте для DataFrame df:
- Гистограмму для каждой числовой колонки (3-4 колонки) с подписями.
- Boxplot для 'sales' по категориям 'region'.
- Тепловую карту корреляции всех числовых переменных.
- Pairplot для первых 500 строк (если данных много, возьмите выборку).
Настройте стиль графиков (seaborn.set_theme), добавьте заголовки. Выведите все графики в одной ячейке.

Пример:
Вы хотите проверить, есть ли выбросы в данных о зарплатах. ИИ строит boxplot, и вы сразу видите аномалии.

6. Обработка текстовых данных: очистка и токенизация

Текстовые данные требуют особого подхода: удаление стоп-слов, лемматизация, создание мешка слов. ИИ поможет написать пайплайн.

Промт:

У меня есть колонка 'review' с отзывами клиентов. Напишите код для предобработки текста:
- Приведите к нижнему регистру.
- Удалите пунктуацию и цифры.
- Токенизируйте текст (разбейте на слова).
- Удалите стоп-слова (используйте библиотеку nltk или re).
- Примените стемминг (PorterStemmer).
- Создайте новую колонку 'review_processed' с обработанным текстом (соедините токены обратно).
Установите необходимые библиотеки, если их нет (укажите pip install).

Пример:
Вы анализируете отзывы на маркетплейсе. Промт готовит текст для дальнейшего тонального анализа.

7. Работа с датами: парсинг и временные ряды

Работа с датами часто вызывает проблемы: неправильный формат, часовые пояса, ресемплинг. Промт поможет.

Промт:

В DataFrame df есть колонка 'timestamp' в виде строки (например, '2026-08-19 14:30:00'). 
- Преобразуйте её в datetime с помощью pd.to_datetime().
- Установите её как индекс.
- Создайте признаки: год, месяц, день, час, день недели.
- Сгруппируйте данные по неделям и посчитайте среднее значение колонки 'value'.
- Постройте линейный график средних значений по неделям.
Напишите код с комментариями.

Пример:
У вас есть данные о посещаемости сайта за год. ИИ строит недельный тренд.

8. Feature Engineering: генерация новых признаков с помощью ИИ

Иногда нужно придумать, какие признаки могут быть полезны для модели. ИИ может предложить варианты.

Промт:

У меня есть DataFrame df с колонками: 'user_id', 'age', 'gender', 'signup_date', 'last_login', 'purchase_amount', 'purchase_frequency'. 
Предложите 5 новых признаков, которые можно создать из этих данных для задачи прогнозирования оттока клиентов. Для каждого признака объясните, почему он полезен, и напишите код на pandas для его создания.

Пример:
Вы работаете в телеком-компании. ИИ предлагает признаки типа «дней с последнего входа», «средний чек за месяц», «изменение частоты покупок» — и вы создаёте их за пару минут.

9. Автоматизация отчётов: генерация PDF или HTML с результатами

Чтобы поделиться результатами с командой, полезно автоматически формировать отчёт. Промт поможет собрать всё вместе.

Промт:

На основе DataFrame df создайте HTML-отчёт, который включает:
- Заголовок «Отчёт по продажам за [период]».
- Таблицу с основными метриками: общая выручка, средний чек, количество заказов.
- График динамики выручки по месяцам (вставьте как base64-изображение).
- Сводную таблицу по регионам.
- Выводы: 2-3 предложения, сгенерируйте их на основе данных.
Сохраните отчёт как 'report.html' и выведите ссылку на него.

Пример:
Вы еженедельно отправляете отчёт руководству. Теперь это делается одной ячейкой кода.

10. Интеграция с SQL: анализ данных из базы данных

Часто данные лежат в базе, и нужно их выгрузить и обработать. Промт поможет сформировать SQL-запрос и pandas-код.

Промт:

У меня есть база данных PostgreSQL с таблицей 'orders' (поля: id, customer_id, order_date, amount). 
Напишите код на Python с использованием psycopg2 или sqlalchemy:
- Подключитесь к базе (параметры: host='localhost', dbname='shop', user='admin', password='secret').
- Выполните SQL-запрос, который возвращает сумму заказов по месяцам за 2026 год.
- Загрузите результат в DataFrame.
- Постройте столбчатую диаграмму.
Добавьте обработку ошибок подключения.

Пример:
Вы используете данные из CRM. Промт автоматизирует выгрузку и анализ.

11. Генерация выводов и интерпретация результатов

Самое сложное — не посчитать, а объяснить. ИИ поможет сформулировать выводы на основе чисел.

Промт:

У меня есть результаты анализа: средняя выручка по регионам (таблица), динамика за год (график), корреляция между расходами на рекламу и продажами (коэффициент 0.85). 
Напишите связный текст на русском для отчёта: 
- Опишите основные тенденции.
- Объясните, что означает коэффициент корреляции 0.85 (сильная положительная связь), но предупредите, что корреляция не равна причинности.
- Сформулируйте 3 рекомендации для бизнеса на основе данных.
Тон — профессиональный, без воды.

Пример:
Вы подготовили цифры, а ИИ пишет раздел «Выводы» для годового отчёта. Экономия — час работы.

12. Обучение модели машинного обучения: быстрый бейзлайн

Даже если вы не дата-сайентист, с помощью промта можно обучить простую модель для предсказаний.

Промт:

У меня есть DataFrame df с целевой колонкой 'target' (бинарная). Необходимо:
- Разделить данные на train/test (80/20, random_state=42).
- Обучить модель логистической регрессии (sklearn.linear_model.LogisticRegression).
- Оценить качество: accuracy, precision, recall, F1-score.
- Построить ROC-кривую и вычислить AUC.
- Вывести важность признаков (коэффициенты модели).
Напишите код с комментариями и интерпретацией результатов.

Пример:
Вы хотите быстро проверить, можно ли предсказать отток клиентов. ИИ строит бейзлайн, который вы потом улучшаете.

Как адаптировать промты под свои задачи

Универсального промта не существует, но есть принципы. Всегда указывайте:
- Формат данных (CSV, Excel, SQL).
- Названия колонок (или пример данных).
- Желаемый результат (код, график, отчёт, текст).
- Ограничения (например, «используй только pandas, без других библиотек»).

Если ИИ выдаёт неверный код, не бойтесь уточнить: «Исправь ошибку, вот сообщение...» или «Сделай проще, без регулярок». Итеративность — ключ к хорошему результату.

Заключение

Эти 12 промтов покрывают 80% типовых задач аналитика: от очистки до визуализации и выводов. Они не заменяют понимание статистики и Python, но снимают рутину, позволяя сосредоточиться на интерпретации. Скопируйте понравившиеся шаблоны, адаптируйте под свои данные и увидите, как часы работы превращаются в минуты. А если у вас есть свой коронный промт — поделитесь в комментариях, обсудим!

← Все статьи

Комментарии

Читайте также

12 промтов для Python-разработчика: превращаем сырые данные в готовый отчёт без боли

19 августа 2026

HR-отдел финтеха сократил время найма на 40%: 12 AI-промтов, которые мы используем каждый день

19 августа 2026

7 промтов для PostgreSQL, которые превращают ручную выгрузку в автоматический отчёт

19 августа 2026

SQL без боли: 15 промтов, которые превратят ваш код из «работает» в «летает»

19 августа 2026

Docker, K8s, CI/CD: 12 промтов, которые заменят половину рутины DevOps-инженера

19 августа 2026

От сырых данных до инсайтов: 15 промтов, которые превратят нейросеть в вашего DS-ассистента

18 августа 2026

20 DevOps промтов для Kubernetes и Helm: как автоматизировать мониторинг и оптимизацию кластеров в 2026 году

18 августа 2026

От LeetCode до оффера: как ИИ-промты превращают подготовку к FAANG из зубрёжки в инженерию

18 августа 2026

SQL на 70% быстрее: наш арсенал промтов для баз данных

18 августа 2026