Вы когда-нибудь тратили часы на очистку данных, чтобы потом обнаружить, что в столбце с датами перемешаны форматы? Или писали длинный код для визуализации, хотя нейросеть могла бы сделать это за минуту? Я — да, и именно поэтому я собрал коллекцию из 14 промтов, которые покрывают весь цикл Data Science: от первичного анализа до интерпретации моделей. Эти шаблоны я проверил на реальных задачах — от обработки логов веб-сервера до прогнозирования оттока клиентов. Они экономят часы работы и помогают избегать типичных ошибок. Ниже — готовая шпаргалка, которую можно копировать и адаптировать под свои данные.
1. Универсальный исследовательский анализ (EDA) за один промт
Когда использовать: Вы получили новый датасет и хотите быстро понять его структуру, пропуски, распределения и корреляции, не написав ни строчки кода.
Промт:
Проведи исследовательский анализ данных (EDA) для датасета {название}. Опиши:
- Размер и типы данных (числовые, категориальные, временные ряды).
- Долю пропущенных значений в каждом столбце.
- Основные статистики (среднее, медиана, стандартное отклонение) для числовых признаков.
- Гистограммы распределения для каждого числового признака.
- Матрицу корреляции Пирсона.
- Выбросы (методом IQR или Z-score).
- Инсайты: какие признаки выглядят наиболее важными, есть ли аномалии.
Используй Python (pandas, seaborn, matplotlib). Код должен быть готов к запуску.
Пример использования: Вы загрузили данные о продажах интернет-магазина. Промт выдаст код, который построит все графики, и текстовое резюме: «Признаки "количество товаров" и "сумма заказа" сильно коррелируют (r=0.85), что ожидаемо. Пропусков почти нет, но в столбце "возраст" есть выбросы — возможно, ошибки ввода».
Почему это работает: Модель выполняет роль аналитика, который знает стандартные шаги EDA. Вы получаете не просто код, а интерпретацию — это ключевое отличие от простого скрипта.
2. Очистка данных от дубликатов и пропусков
Когда использовать: Перед построением модели нужно привести данные в порядок: убрать дубли, заполнить пропуски, нормализовать.
Промт:
Помоги очистить датасет {название}. Напиши Python-код, который:
- Удалит дубликаты на основе всех столбцов.
- Заполнит пропуски в числовых признаках медианой, в категориальных — модой.
- Нормализует числовые признаки методом MinMaxScaler.
- Закодирует категориальные переменные с помощью OneHotEncoder.
- Выведет количество строк и столбцов до и после очистки.
Объясни каждый шаг комментариями в коде.
Пример: После выполнения вы увидите: «Было 10 000 строк, удалено 150 дубликатов, заполнено 300 пропусков». Это стандартная предобработка, которую нейросеть делает без ошибок.
3. Генерация синтетических данных для тестов
Когда использовать: Нужно проверить алгоритм на больших данных, но реальных данных мало или они конфиденциальны.
Промт:
Сгенерируй синтетический датасет для задачи регрессии: 10 000 строк, 5 признаков (2 числовых, 2 категориальных, 1 бинарный). Целевая переменная должна быть связана с признаками линейно с добавлением шума. Используй numpy и pandas. Выведи первые 5 строк и описание.
Пример: Вы разрабатываете пайплайн и не хотите использовать реальные данные. Промт создаст датасет с реалистичными распределениями — например, возраст от 18 до 80, доход от 20k до 200k.
4. Построение модели классификации с оценкой метрик
Когда использовать: Нужно обучить модель и получить метрики: accuracy, precision, recall, F1, ROC-AUC.
Промт:
Обучи модель классификации на датасете {название}. Целевая переменная — {target}. Выполни:
- Раздели данные на train/test (80/20) со стратификацией.
- Обучи логистическую регрессию и RandomForest.
- Выведи classification_report для обеих моделей.
- Построй ROC-кривые и посчитай AUC.
- Сравни модели и сделай вывод, какая лучше и почему.
Пример: Для задачи определения мошеннических транзакций вы получите отчет с precision/recall для каждого класса. Важно: промт просит сравнение, а не просто код — это помогает принять решение.
5. Автоматический подбор гиперпараметров
Когда использовать: Модель обучена, но вы хотите улучшить метрики, перебирая гиперпараметры.
Промт:
Подбери гиперпараметры для RandomForest на датасете {название}. Используй GridSearchCV или RandomizedSearchCV. Диапазоны: n_estimators от 50 до 300, max_depth от 5 до 20, min_samples_split от 2 до 10. Метрика — accuracy. Выведи лучшие параметры и score на валидации. Покажи время выполнения.
Пример: Вы узнаете, что оптимальные параметры — n_estimators=200, max_depth=15, точность выросла с 0.82 до 0.87. Это избавляет от ручного перебора.
6. Интерпретация модели с помощью SHAP
Когда использовать: Нужно объяснить, почему модель приняла то или иное решение. Это критично для банков, медицины и других регуляторных областей.
Промт:
Объясни предсказания модели {модель} на тестовых данных с помощью библиотеки SHAP. Построй:
- summary plot (глобальная важность признаков).
- waterfall plot для конкретного наблюдения (например, для клиента с наибольшим предсказанным значением).
- Интерпретируй графики: какие признаки сильнее всего влияют на результат.
Пример: Для модели кредитного скоринга SHAP покажет, что «количество просрочек» — главный фактор отказа. Это позволяет обосновать решение перед клиентом.
7. Визуализация данных для презентации
Когда использовать: Нужно создать профессиональные графики для отчета или презентации.
Промт:
Создай визуализацию для датасета {название}: 2-3 графика, которые лучше всего показывают ключевые тренды. Используй seaborn или plotly. Для каждого графика добавь заголовок, подписи осей, легенду. Выбери цветовую палитру, подходящую для людей с дальтонизмом. Выведи код и опиши, что показывает каждый график.
Пример: Вы получите код для heatmap корреляций и barplot по категориям. Графики будут готовы для вставки в слайды.
8. Прогнозирование временных рядов
Когда использовать: У вас есть данные с датами (продажи, трафик) и нужно предсказать будущее.
Промт:
Построй прогноз временного ряда {данные} на 30 шагов вперед. Используй модель ARIMA или Prophet. Выведи:
- График исторических данных и прогноза с доверительным интервалом.
- Метрики ошибки: MAE, RMSE на тестовой выборке.
- Интерпретацию: есть ли сезонность, тренд.
Пример: Для данных о продажах вы увидите прогноз на месяц вперед с доверительными границами. Это помогает планировать закупки.
9. Кластеризация клиентов для сегментации
Когда использовать: Нужно разделить клиентов на группы для маркетинговых кампаний.
Промт:
Проведи кластеризацию клиентов на основе признаков {features}. Используй K-means. Определи оптимальное число кластеров методом локтя (elbow method). Визуализируй кластеры на PCA-проекции. Опиши профиль каждого кластера (средние значения признаков).
Пример: Вы получите 3 кластера: «молодые с низким доходом», «средний возраст со средним доходом», «обеспеченные». Это основа для таргетинга.
10. Обработка несбалансированных классов
Когда использовать: Целевая переменная сильно смещена (например, 1% положительных случаев).
Промт:
В датасете {название} целевая переменная несбалансирована (доля положительного класса = {доля}). Предложи и реализуй методы борьбы: SMOTE, class_weight, ансамбли. Сравни метрики (precision, recall, F1) до и после применения. Выведи classification_report.
Пример: Для детекции мошенничества recall вырастет с 0.2 до 0.7 без сильной потери precision. Это критически важно для бизнеса.
11. Генерация кода для дата-пайплайнов
Когда использовать: Нужно регулярно пересобирать данные из нескольких источников.
Промт:
Напиши Python-скрипт для ETL-процесса: читай данные из CSV, SQL-базы и API (например, {ссылка}), объединяй их, очищай, сохраняй в Parquet. Добавь логирование и обработку ошибок. Скрипт должен быть модульным и с docstring.
Пример: Вы получите готовый скрипт, который можно запускать по расписанию через cron. Это экономит часы ручной работы.
12. Проверка гипотез с помощью статистических тестов
Когда использовать: Нужно понять, значимо ли различаются группы (например, A/B-тест).
Промт:
Проведи статистический тест для сравнения двух групп: {группа A} и {группа B}. Выбери подходящий тест (t-test, Манна-Уитни, хи-квадрат) в зависимости от типа данных. Выведи p-value и интерпретацию: отвергается ли нулевая гипотеза на уровне 0.05. Добавь эффект размера (Cohen's d).
Пример: Для A/B-теста конверсии вы получите p-value = 0.03 — результат значим, можно запускать изменение.
13. Создание дашборда в Plotly Dash
Когда использовать: Нужно визуализировать данные для коллег или клиентов в интерактивном формате.
Промт:
Создай интерактивный дашборд на Plotly Dash для датасета {название}. Включи:
- Фильтры по категориальным признакам.
- Основные метрики (карточки).
- Графики: временной ряд, barplot, scatter plot.
- Оформи в современном стиле (тёмная тема).
Пример: Вы получите код приложения, которое можно запустить локально и поделиться ссылкой. Это впечатляет на демо.
14. Объяснение сложных концепций простыми словами
Когда использовать: Нужно объяснить модель или алгоритм стейкхолдерам без технического бэкграунда.
Промт:
Объясни, как работает {алгоритм, например, градиентный бустинг}, простыми словами, используя аналогии из жизни. Приведи пример из бизнеса. Избегай формул. Цель — чтобы человек без технического образования понял.
Пример: «Градиентный бустинг похож на команду слабых учеников, которые вместе сдают экзамен: каждый исправляет ошибки предыдущего». Это помогает в коммуникации.
15. Генерация отчета по результатам анализа
Когда использовать: Нужно оформить результаты анализа в структурированный документ.
Промт:
Составь отчет по результатам анализа датасета {название}. Включи: цель, данные, методы, основные результаты (с цифрами), ограничения, рекомендации для бизнеса. Используй профессиональный стиль и Markdown-форматирование. Раздели на секции.
Пример: Вы получите готовый текст для внутренней вики или письма заказчику. Экономит время на написание.
16. Обучение модели с автоматическим логированием
Когда использовать: Нужно отслеживать эксперименты (метрики, параметры) — особенно в команде.
Промт:
Обучи модель с использованием MLflow: логируй параметры, метрики, model artifact. Выведи команды для запуска MLflow UI. Сделай код устойчивым к ошибкам.
Пример: Вы сможете сравнивать эксперименты в веб-интерфейсе, что важно для воспроизводимости.
17. Деплой модели как REST API
Когда использовать: Модель готова, и нужно сделать её доступной для других сервисов.
Промт:
Напиши FastAPI-приложение для модели {модель}: загрузи модель из файла, создай endpoint /predict, который принимает JSON с признаками и возвращает предсказание. Добавь валидацию входных данных и обработку ошибок. Укажи команду для запуска uvicorn.
Пример: Вы получите работающий API, который можно протестировать через Swagger UI.
Практический пример: полный цикл
Представьте, что вы работаете с датасетом об оттоке клиентов телеком-компании. С помощью промтов №1, 2, 4, 6, 15 вы: проводите EDA, очищаете данные, строите модель, интерпретируете с SHAP и генерируете отчет. Весь процесс занимает около часа вместо дня. Именно так нейросети ускоряют работу дата-сайентиста.
Что дальше?
Эти промты — не догма, а отправная точка. Адаптируйте их под свои данные и задачи: добавляйте детали, меняйте модели, уточняйте форматы. Главное — всегда проверяйте результаты: нейросеть может ошибаться, особенно в новых библиотеках. Используйте эти шаблоны как ассистента, а не как замену экспертизе. И помните: лучший промт — тот, который уточняет контекст. Удачи в экспериментах!
Комментарии