Данные — это новый нефть, но, как и нефть, они редко встречаются в чистом виде. Каждый аналитик знает: 80% времени уходит не на построение моделей, а на подготовку данных. А что, если часть этой рутины можно делегировать нейросети? Я собрал 15 промтов, которые реально экономят часы работы: от первой строки pandas до интерактивных дашбордов. Здесь нет абстрактных «помоги мне с анализом» — только конкретные, проверенные формулировки с примерами кода. Сохраняйте в закладки — пригодится уже сегодня.
Как работают эти промты
Каждый промт — это инструкция для языковой модели (ChatGPT, Claude, YandexGPT и др.). Вы копируете текст, подставляете свои данные и получаете готовый код или объяснение. Я специально разделил их на категории: очистка, EDA, модели, визуализация и автоматизация. Для каждого промта есть пример использования, чтобы было понятно, как его адаптировать.
15 промтов для Data Science
1. Универсальный «уборщик» данных
Для чего: Быстрая очистка DataFrame от пропусков, дубликатов и выбросов.
Промт:
У меня есть датафрейм pandas. Напиши код, который: 1) выведет общую информацию о типах и пропусках, 2) заменит пропуски в числовых колонках медианой, в категориальных — модой, 3) удалит дубликаты, 4) найдет выбросы по методу IQR и заменит их границами. Покажи код с комментариями.
Пример использования: Вы загрузили CSV с данными о клиентах, где часть полей пустая, а в возрасте есть значение 999. Промт даст готовый скрипт, который приведет данные в порядок за пару секунд.
2. Генератор признаков
Для чего: Создание новых признаков из дат, текста и категорий.
Промт:
У меня есть колонка 'date' в формате YYYY-MM-DD. Создай признаки: год, месяц, день недели, номер недели, а также признак 'is_weekend'. Если есть колонка 'description', извлеки длину текста и количество слов. Напиши код на pandas.
Пример использования: Вы анализируете продажи по дням и хотите учесть сезонность. Промт создаст нужные признаки, чтобы модель ML увидела закономерности.
3. Экспресс-EDA (разведочный анализ)
Для чего: Быстрый обзор данных: статистики, распределения, корреляции.
Промт:
Проведи разведочный анализ датафрейма: выведи описательные статистики для числовых колонок, частотные таблицы для категориальных, построй гистограммы для всех числовых и boxplot для ключевых. Используй matplotlib/seaborn. Сделай выводы о наличии выбросов и перекосов.
Пример использования: Вы получили новый датасет и хотите понять, что в нем. Промт сгенерирует код, который выведет все графики и текстовые выводы.
4. Автоподбор модели машинного обучения
Для чего: Определение лучшей модели для ваших данных без перебора вручную.
Промт:
Для классификации (или регрессии) с признаками X и целевой y, напиши код, который: 1) разделит данные на train/test, 2) обучит несколько моделей из sklearn (LogisticRegression, RandomForest, GradientBoosting), 3) сравнит метрики accuracy (или RMSE), 4) выведет лучшую модель. Используй cross_val_score.
Пример использования: Вы не знаете, какая модель лучше для вашего датасета. Промт даст код с сравнением, и вы выберете победителя.
5. Интерпретация модели с SHAP
Для чего: Понимание, как модель принимает решения.
Промт:
Я обучил модель RandomForest. Используй библиотеку SHAP, чтобы: 1) вычислить SHAP values, 2) построить summary plot, 3) объяснить топ-5 признаков. Напиши код и интерпретируй график.
Пример использования: Бизнес спрашивает, почему модель отказала в кредите. SHAP-график покажет, какие факторы повлияли.
6. Генерация кода для визуализации
Для чего: Создание сложных графиков без зубрежки синтаксиса.
Промт:
Построй столбчатую диаграмму продаж по месяцам, с подписями значений, заголовком и цветовой палитрой. Используй seaborn или matplotlib. Сохрани в файл PNG с dpi=300.
Пример использования: Вам нужен график для отчета. Промт генерирует код, который вы запускаете и получаете картинку.
7. Автоматизация отчетов в Jupyter
Для чего: Создание автоматического PDF-отчета из ноутбука.
Промт:
Напиши код, который конвертирует мой Jupyter notebook в PDF с помощью nbconvert, с настройками: включить код, скрыть входные ячейки, добавить колонтитул. Используй командную строку.
Пример использования: Вы подготовили анализ и хотите отправить его коллегам в PDF. Промт даст команду, которая сделает это одной строкой.
8. Обработка временных рядов
Для чего: Декомпозиция ряда, проверка стационарности, автокорреляция.
Промт:
У меня есть временной ряд продаж. Выполни: 1) декомпозицию на тренд, сезонность, остатки (seasonal_decompose), 2) тест Дики-Фуллера на стационарность, 3) построй ACF/PACF графики. Объясни результаты.
Пример использования: Вы прогнозируете спрос. Промт поможет понять структуру ряда.
9. SQL-запросы для аналитика
Для чего: Генерация SQL-запросов по описанию задачи.
Промт:
Напиши SQL-запрос для PostgreSQL: вывести топ-10 клиентов по сумме покупок за последний месяц, с JOIN на таблицу заказов. Используй CTE и оконную функцию ROW_NUMBER.
Пример использования: Вы работаете с базой данных и не помните синтаксис. Промт выдаст готовый запрос.
10. Создание дашборда в Plotly Dash
Для чего: Быстрый прототип интерактивного дашборда.
Промт:
Создай приложение Dash с двумя графиками: линейный (тренд продаж) и столбчатый (по категориям), с фильтром по дате. Используй pandas для чтения CSV. Покажи полный код.
Пример использования: Вы хотите показать руководству интерактивный дашборд. Промт создаст основу, которую вы расширите.
11. Оптимизация pandas-кода
Для чего: Ускорение работы с большими данными.
Промт:
У меня есть код, который обрабатывает DataFrame с 10 млн строк. Предложи оптимизации: использование vectorized operations, категориальных типов, обработки чанками. Покажи примеры кода до/после.
Пример использования: Ваш код выполняется слишком долго. Промт подскажет, как ускорить.
12. Обработка текстов для NLP
Для чего: Токенизация, стоп-слова, TF-IDF.
Промт:
Напиши код для предобработки текста: удаление пунктуации, стемминг, удаление стоп-слов, создание TF-IDF матрицы. Используй nltk и sklearn.
Пример использования: Вы анализируете отзывы клиентов. Промт подготовит данные для модели.
13. Работа с выбросами
Для чего: Методы обнаружения и обработки выбросов.
Промт:
Сравни методы обнаружения выбросов: Z-score, IQR, Isolation Forest. Напиши код для каждого, примени к колонке 'price'. Покажи, сколько выбросов найдено каждым методом, и визуализируй.
Пример использования: Вы сомневаетесь, какие выбросы удалить. Промт даст объективное сравнение.
14. Генерация синтетических данных
Для чего: Создание тестовых данных, когда реальных мало.
Промт:
Создай синтетический датасет с 1000 строк и колонками: id, age (18-70), salary (нормальное распределение), city (5 городов), target (бинарный). Используй numpy и pandas, задай seed для воспроизводимости.
Пример использования: Вы тестируете скрипты, но нет данных. Промт сгенерирует правдоподобные.
15. Автодокументирование кода
Для чего: Написание docstring и комментариев.
Промт:
Добавь docstring и комментарии к этому коду: [вставьте код]. Стиль — Google Python Style Guide. Опиши параметры, возвращаемые значения и примеры.
Пример использования: Вы пишете библиотеку и хотите, чтобы код был читаемым.
Как использовать эти промты максимально эффективно
Во-первых, всегда уточняйте контекст: добавляйте названия ваших колонок, типы данных, версии библиотек. Во-вторых, не стесняйтесь задавать уточняющие вопросы модели — например, «а как добавить еще одну колонку?». В-третьих, проверяйте код на небольшом подмножестве данных перед запуском на полном датасете. И помните: промты — это отправная точка, а не конечный результат.
Заключение
Эти 15 промтов — ваш рабочий инструмент на каждый день. Они не заменят глубоких знаний, но избавят от рутины и позволят сосредоточиться на сути анализа. Попробуйте применить их прямо сейчас к своим данным — и увидите, как AI ускоряет вашу работу. А если у вас есть свои любимые промты — делитесь в комментариях, обсудим!
Комментарии